Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4365
материалов
01
Дистиллированные модели Qwen 3.8: первые впечатления и риски внедрения
Дистиллированные Qwen 3.8: заявленные 288k токенов/с на NVIDIA GB300 NVL72, реальность локального запуска на 0,25 токена/с и план оценки перед внедрением. Честн
02
Кризис доверия к ИИ: почему предупреждения CEO Anthropic не решают проблему
CEO Anthropic Дарио Амодеи объясняет кризис доверия к ИИ невыполненными обещаниями индустрии, а не риторикой о рисках. Разбираем спор с инвестором Гэвином Бейке
03
Гибридные AI-агенты: объединяем облачные и локальные модели для эффективного программирования
Как использовать локальные модели 2B-7B на GPU с 8 ГБ VRAM вместе с облачными API для программирования. Решаем проблемы деградации скорости и сбоев форматирован
04
Koboldcpp v1.119: что нового в обновлении для локального инференса LLM
Koboldcpp v1.119 ускоряет локальный инференс LLM на CPU до 14%, снижает задержку первого токена на 15% и добавляет поддержку GGUF 3.2. Разбираем тесты, совмести
05
Qwen3-8 2.4T на NVIDIA GB300 NVL72: рекордные 288k токенов/с и что это значит для инференса гигантских моделей
NVIDIA GB300 NVL72 выдаёт 288k токенов/с на Qwen3-8 2.4T в FP8. Разбираем цифры, сравнение с GB200 и H100, экономику инференса и потенциал NVFP4.
06
Экосистема открытых LLM в 2026 году: от выбора модели до практического развертывания
Системный гид по открытым LLM в 2026 году: сравнение Llama, Qwen, Mistral и DeepSeek, бенчмарки, лицензии, запуск через Text Generation Inference и адаптация с
07
Эффективный деплой открытых LLM: практическое руководство по Hugging Face Inference Endpoints в 2026 году
Пошаговый деплой Falcon 40B Instruct на GPU A100 через Hugging Face Inference Endpoints: настройка масштабирования, scale-to-zero, безопасность VPC/SOC2, тестир
08
Практическое руководство: создание генератора веб-приложений с открытыми ML-моделями в 2026
Соберите генератор веб-приложений на NodeJS и Express с WizardCoder-15B: стриминг HTML, генерация изображений через Stable Diffusion, стилизация Tailwind CSS и
09
Fine-tuning Stable Diffusion на CPU Intel: практическое руководство
Fine-tuning Stable Diffusion на CPU Intel: настройка IPEX, oneCCL и gperftools, распределённое обучение на 224 ядрах за 5 минут и инференс менее 5 секунд через
10
Как создать ML-игру для браузера с Transformers.js: от обучения модели до геймдизайна
Пошаговый гайд по созданию браузерной ML-игры Doodle Dash: дообучение MobileViT на Quick, Draw!, конвертация в ONNX через Optimum, инференс в браузере с Transfo
11
От пользователя до контрибьютора: как Writer строит генеративный AI с Hugging Face
Как Writer прошёл путь от пользователя Hugging Face до контрибьютора open source: разбор заблуждений о генеративном AI, стратегия инференса LLM на CPU и GPU, пр
12
Почему MMLU-оценки различаются: разбор реализаций Open LLM Leaderboard
Одна модель, разные баллы MMLU. Разбираем три реализации бенчмарка, показываем, как промпты и методы оценки меняют рейтинг LLaMA, Falcon и GPT-NeoX, и объясняем