Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

121 Как AI-бот на Java за вечер привлек 2000 пользователей и потерял их из-за ошибки в алгоритме: разбор кейса Реальный кейс: AI-бот на Java 21 и Spring Boot 3 за вечер привлек 2000 пользователей, а через две недели потерял их из-за перевеса системных источников над поль 6 мин чтения 122 Почему ИИ-поисковики не видят ваш город: разбор локализации в свежих моделях Gemini 3.6 Flash находит 8 из 13 местных сайтов Иркутска, а DeepSeek V4 Flash и GLM 5.2 — ни одного, причём DeepSeek цитирует ресурсы из Одессы, Киева и Минска. 6 мин чтения 123 Дистиллированные модели Qwen 3.8: первые впечатления и риски внедрения Дистиллированные Qwen 3.8: заявленные 288k токенов/с на NVIDIA GB300 NVL72, реальность локального запуска на 0,25 токена/с и план оценки перед внедрением. Честн 6 мин чтения 124 Кризис доверия к ИИ: почему предупреждения CEO Anthropic не решают проблему CEO Anthropic Дарио Амодеи объясняет кризис доверия к ИИ невыполненными обещаниями индустрии, а не риторикой о рисках. Разбираем спор с инвестором Гэвином Бейке 6 мин чтения 125 Гибридные AI-агенты: объединяем облачные и локальные модели для эффективного программирования Как использовать локальные модели 2B-7B на GPU с 8 ГБ VRAM вместе с облачными API для программирования. Решаем проблемы деградации скорости и сбоев форматирован 6 мин чтения 126 Koboldcpp v1.119: что нового в обновлении для локального инференса LLM Koboldcpp v1.119 ускоряет локальный инференс LLM на CPU до 14%, снижает задержку первого токена на 15% и добавляет поддержку GGUF 3.2. Разбираем тесты, совмести 7 мин чтения 127 Qwen3-8 2.4T на NVIDIA GB300 NVL72: рекордные 288k токенов/с и что это значит для инференса гигантских моделей NVIDIA GB300 NVL72 выдаёт 288k токенов/с на Qwen3-8 2.4T в FP8. Разбираем цифры, сравнение с GB200 и H100, экономику инференса и потенциал NVFP4. 5 мин чтения 128 Экосистема открытых LLM в 2026 году: от выбора модели до практического развертывания Системный гид по открытым LLM в 2026 году: сравнение Llama, Qwen, Mistral и DeepSeek, бенчмарки, лицензии, запуск через Text Generation Inference и адаптация с 9 мин чтения 129 Эффективный деплой открытых LLM: практическое руководство по Hugging Face Inference Endpoints в 2026 году Пошаговый деплой Falcon 40B Instruct на GPU A100 через Hugging Face Inference Endpoints: настройка масштабирования, scale-to-zero, безопасность VPC/SOC2, тестир 8 мин чтения 130 Практическое руководство: создание генератора веб-приложений с открытыми ML-моделями в 2026 Соберите генератор веб-приложений на NodeJS и Express с WizardCoder-15B: стриминг HTML, генерация изображений через Stable Diffusion, стилизация Tailwind CSS и 9 мин чтения 131 Fine-tuning Stable Diffusion на CPU Intel: практическое руководство Fine-tuning Stable Diffusion на CPU Intel: настройка IPEX, oneCCL и gperftools, распределённое обучение на 224 ядрах за 5 минут и инференс менее 5 секунд через 5 мин чтения 132 Как создать ML-игру для браузера с Transformers.js: от обучения модели до геймдизайна Пошаговый гайд по созданию браузерной ML-игры Doodle Dash: дообучение MobileViT на Quick, Draw!, конвертация в ONNX через Optimum, инференс в браузере с Transfo 7 мин чтения