Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4365 материалов
01 Дистиллированные модели Qwen 3.8: первые впечатления и риски внедрения Дистиллированные Qwen 3.8: заявленные 288k токенов/с на NVIDIA GB300 NVL72, реальность локального запуска на 0,25 токена/с и план оценки перед внедрением. Честн 6 мин чтения 02 Кризис доверия к ИИ: почему предупреждения CEO Anthropic не решают проблему CEO Anthropic Дарио Амодеи объясняет кризис доверия к ИИ невыполненными обещаниями индустрии, а не риторикой о рисках. Разбираем спор с инвестором Гэвином Бейке 6 мин чтения 03 Гибридные AI-агенты: объединяем облачные и локальные модели для эффективного программирования Как использовать локальные модели 2B-7B на GPU с 8 ГБ VRAM вместе с облачными API для программирования. Решаем проблемы деградации скорости и сбоев форматирован 6 мин чтения 04 Koboldcpp v1.119: что нового в обновлении для локального инференса LLM Koboldcpp v1.119 ускоряет локальный инференс LLM на CPU до 14%, снижает задержку первого токена на 15% и добавляет поддержку GGUF 3.2. Разбираем тесты, совмести 7 мин чтения 05 Qwen3-8 2.4T на NVIDIA GB300 NVL72: рекордные 288k токенов/с и что это значит для инференса гигантских моделей NVIDIA GB300 NVL72 выдаёт 288k токенов/с на Qwen3-8 2.4T в FP8. Разбираем цифры, сравнение с GB200 и H100, экономику инференса и потенциал NVFP4. 5 мин чтения 06 Экосистема открытых LLM в 2026 году: от выбора модели до практического развертывания Системный гид по открытым LLM в 2026 году: сравнение Llama, Qwen, Mistral и DeepSeek, бенчмарки, лицензии, запуск через Text Generation Inference и адаптация с 9 мин чтения 07 Эффективный деплой открытых LLM: практическое руководство по Hugging Face Inference Endpoints в 2026 году Пошаговый деплой Falcon 40B Instruct на GPU A100 через Hugging Face Inference Endpoints: настройка масштабирования, scale-to-zero, безопасность VPC/SOC2, тестир 8 мин чтения 08 Практическое руководство: создание генератора веб-приложений с открытыми ML-моделями в 2026 Соберите генератор веб-приложений на NodeJS и Express с WizardCoder-15B: стриминг HTML, генерация изображений через Stable Diffusion, стилизация Tailwind CSS и 9 мин чтения 09 Fine-tuning Stable Diffusion на CPU Intel: практическое руководство Fine-tuning Stable Diffusion на CPU Intel: настройка IPEX, oneCCL и gperftools, распределённое обучение на 224 ядрах за 5 минут и инференс менее 5 секунд через 5 мин чтения 10 Как создать ML-игру для браузера с Transformers.js: от обучения модели до геймдизайна Пошаговый гайд по созданию браузерной ML-игры Doodle Dash: дообучение MobileViT на Quick, Draw!, конвертация в ONNX через Optimum, инференс в браузере с Transfo 7 мин чтения 11 От пользователя до контрибьютора: как Writer строит генеративный AI с Hugging Face Как Writer прошёл путь от пользователя Hugging Face до контрибьютора open source: разбор заблуждений о генеративном AI, стратегия инференса LLM на CPU и GPU, пр 7 мин чтения 12 Почему MMLU-оценки различаются: разбор реализаций Open LLM Leaderboard Одна модель, разные баллы MMLU. Разбираем три реализации бенчмарка, показываем, как промпты и методы оценки меняют рейтинг LLaMA, Falcon и GPT-NeoX, и объясняем 6 мин чтения