Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
121
Как AI-бот на Java за вечер привлек 2000 пользователей и потерял их из-за ошибки в алгоритме: разбор кейса
Реальный кейс: AI-бот на Java 21 и Spring Boot 3 за вечер привлек 2000 пользователей, а через две недели потерял их из-за перевеса системных источников над поль
122
Почему ИИ-поисковики не видят ваш город: разбор локализации в свежих моделях
Gemini 3.6 Flash находит 8 из 13 местных сайтов Иркутска, а DeepSeek V4 Flash и GLM 5.2 — ни одного, причём DeepSeek цитирует ресурсы из Одессы, Киева и Минска.
123
Дистиллированные модели Qwen 3.8: первые впечатления и риски внедрения
Дистиллированные Qwen 3.8: заявленные 288k токенов/с на NVIDIA GB300 NVL72, реальность локального запуска на 0,25 токена/с и план оценки перед внедрением. Честн
124
Кризис доверия к ИИ: почему предупреждения CEO Anthropic не решают проблему
CEO Anthropic Дарио Амодеи объясняет кризис доверия к ИИ невыполненными обещаниями индустрии, а не риторикой о рисках. Разбираем спор с инвестором Гэвином Бейке
125
Гибридные AI-агенты: объединяем облачные и локальные модели для эффективного программирования
Как использовать локальные модели 2B-7B на GPU с 8 ГБ VRAM вместе с облачными API для программирования. Решаем проблемы деградации скорости и сбоев форматирован
126
Koboldcpp v1.119: что нового в обновлении для локального инференса LLM
Koboldcpp v1.119 ускоряет локальный инференс LLM на CPU до 14%, снижает задержку первого токена на 15% и добавляет поддержку GGUF 3.2. Разбираем тесты, совмести
127
Qwen3-8 2.4T на NVIDIA GB300 NVL72: рекордные 288k токенов/с и что это значит для инференса гигантских моделей
NVIDIA GB300 NVL72 выдаёт 288k токенов/с на Qwen3-8 2.4T в FP8. Разбираем цифры, сравнение с GB200 и H100, экономику инференса и потенциал NVFP4.
128
Экосистема открытых LLM в 2026 году: от выбора модели до практического развертывания
Системный гид по открытым LLM в 2026 году: сравнение Llama, Qwen, Mistral и DeepSeek, бенчмарки, лицензии, запуск через Text Generation Inference и адаптация с
129
Эффективный деплой открытых LLM: практическое руководство по Hugging Face Inference Endpoints в 2026 году
Пошаговый деплой Falcon 40B Instruct на GPU A100 через Hugging Face Inference Endpoints: настройка масштабирования, scale-to-zero, безопасность VPC/SOC2, тестир
130
Практическое руководство: создание генератора веб-приложений с открытыми ML-моделями в 2026
Соберите генератор веб-приложений на NodeJS и Express с WizardCoder-15B: стриминг HTML, генерация изображений через Stable Diffusion, стилизация Tailwind CSS и
131
Fine-tuning Stable Diffusion на CPU Intel: практическое руководство
Fine-tuning Stable Diffusion на CPU Intel: настройка IPEX, oneCCL и gperftools, распределённое обучение на 224 ядрах за 5 минут и инференс менее 5 секунд через
132
Как создать ML-игру для браузера с Transformers.js: от обучения модели до геймдизайна
Пошаговый гайд по созданию браузерной ML-игры Doodle Dash: дообучение MobileViT на Quick, Draw!, конвертация в ONNX через Optimum, инференс в браузере с Transfo