Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

1765 llama.cpp server: долгожданное исправление краша mmproj + MTP (speculative decoding) Узнайте, как в llama.cpp server наконец починили краш при использовании mmproj с многотокенной спекуляцией. Практические советы и прогнозы. 4 мин чтения 1766 Запуск модели с 500k контекстом на 48GB VRAM: Nemotron-3-Super 64B-A12B и скорость 21 tok/s Обзор модели Nemotron-3-Super 64B-A12B: 500k токенов контекста на 48GB VRAM, 21 токен/с. MoE, GGUF квантование, агентное кодирование. Сравнение с альтернативами 4 мин чтения 1767 Как локальные модели ломают JSON: каталог ошибок и библиотека для восстановления Разбираем типичные сбои JSON-вывода у локальных моделей (Llama, Qwen, Mistral) и показываем, как библиотека Loot-JSN их чинит. Примеры, код, сравнение. 6 мин чтения 1768 Claude Platform on AWS: Полный гайд по настройке, IAM и биллингу Как подключить Claude через AWS Marketplace, настроить IAM-аутентификацию, управлять агентами и отслеживать затраты. Полное руководство с примерами. 6 мин чтения 1769 Gemma 4 в браузере: запуск офлайн с WebGPU и управление роботом через WebSerial — пошаговое руководство Пошаговое руководство: запустите Gemma 4 полностью в браузере на WebGPU, без интернета. Управляйте роботом через WebSerial. Код, нюансы, примеры. 6 мин чтения 1770 MiniCPM-V 4.6: карманный осьминог, который видит больше, чем вы думаете OpenBMB выпустила MiniCPM-V 4.6 — компактную мультимодальную модель с улучшенным OCR и пониманием сцен. Сравниваем с предшественником и конкурентами. 5 мин чтения 1771 Автоматическое извлечение параметров из 2D-чертежей: пайплайн с YOLO, кастомным OCR и логикой на правилах Детальный технический гайд: как объединить детекцию YOLOv12, кастомный TrOCR и грамматику для автоматического снятия размеров с PDF и DWG чертежей. Реальные кей 7 мин чтения 1772 Агрегатор LLM с авто-выбором: как не остаться с пустыми руками, когда провайдер упал Постройте отказоустойчивый агрегатор LLM, который сам находит живые free-модели и переключается при сбоях. Решение для MVP и production с примерами кода. 7 мин чтения 1773 Как гоблины захватили ChatGPT: история о неожиданных эффектах обучения с подкреплением Как обучение с подкреплением породило странное поведение ChatGPT — гоблинов, гремлинов и абсурдные ответы. Разбор кейса и его значение для AI. 3 мин чтения 1774 Интеграция GigaChat с LangChainGo: создание AI-агента на Go Пошаговый гайд по интеграции GigaChat с LangChainGo: создание AI-агента на Go с инструментами, цепочками и русским LLM. Код, архитектура, ошибки. 7 мин чтения 1775 Qwen-3.6 для локального кодинга: чего ждать от дистиллированных версий 9B и 14B Разбираем слухи и утечки о Qwen-3.6 дистиллированных 9B и 14B. Бенчмарки, совместимость с pi-терминалом, работа на 6GB VRAM — все ответы здесь. 5 мин чтения 1776 Сборка AI-кластера из Mac Mini: пошаговое руководство по распределенным вычислениям для LLM Пошаговое руководство по сборке кластера из Mac Mini для распределенных вычислений LLM. Используем Thunderbolt 5, MLX и Exo для запуска моделей до 70B+ параметр 10 мин чтения