Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
3709
SLAY-ASR: практическое руководство по добавлению аудиомодальности в LLM с минимальными затратами (рецепт на полгода)
Пошаговое руководство по кодированию аудио в латентные представления для LLM. Альтернатива Whisper, кросс-аттеншн, практические советы на 2026 год.
3710
Ловушка Langfuse: как SDK по умолчанию перехватывает чужие трейсы и накручивает счёт — инструкция по отключению
Подробное руководство по отключению скрытого перехвата всех трейсов в Langfuse SDK. Узнайте, как избежать неожиданных расходов и настроить фильтрацию.
3711
Правда о скорости MLX на Mac: почему бенчмарки в UI врут и как измерить реальную производительность
Разоблачаем мифы о производительности MLX. Как измерить реальные tokens/s на Apple Silicon. Сравнение prefill и generation time на M1 Max и M5.
3712
MTIA v4: как Meta перехватывает инициативу у Nvidia в инференсе больших моделей
Разбор новейшего чипа MTIA v4 от Meta: чиплетная архитектура с HBM3e, поддержка 8-битного инференса в PyTorch 2.4 и плагин для vLLM. Сравнение с Nvidia H200.
3713
EVR-1 Maano: революционное 3-битное сжатие для Llama 3.1 8B — практическое применение и сравнение с GGUF
Обзор EVR-1 Maano — метода 3-битного квантования для Llama 3.1 8B, который решает проблему дегенерации. Сравнение с GGUF, примеры использования и рекомендации н
3714
Автоматизируем аналитику без дашбордов: как построить MCP-сервер для вашего AI-агента
Практический гайд по созданию MCP-сервера для доступа AI-агента к данным аналитики. Автоматизируйте запросы к Mixpanel/GA4 без дашбордов. Работает с Claude, Cur
3715
Как настроить агентное кодирование на слабой видеокарте: практический гайд по Qwen3.5-9B
Полная инструкция по запуску Qwen3.5-9B для автономного кодирования на RTX 3060 12GB. Квантование через Unsloth, настройка tool calls и оптимизация памяти.
3716
Nemotron-3 120B на RTX Pro 6000 Blackwell: полный бенчмарк скорости при длинном контексте до 512K
Тест производительности флагманской модели NVIDIA на новейшем GPU Blackwell. Цифры по TTFT, многопользовательской нагрузке и fp8 KV cache для контекста в 512 ты
3717
Как дообучить NVIDIA Nemotron Speech ASR на Amazon EC2: полный гайд по адаптации под домен
Пошаговое руководство по тонкой настройке NVIDIA Nemotron Speech ASR на Amazon EC2 p4d с DeepSpeed. Адаптация модели под доменные данные.
3718
pygbnf: грамматики для llama.cpp без головной боли с зависимостями
Как использовать pygbnf для создания грамматик без версионных конфликтов в llama.cpp. Примеры кода, сравнение с альтернативами и рекомендации.
3719
Взлом и абляция Nemotron 120B Super: что происходит с безопасностью гибридных SSM-моделей
Гибридную SSM-модель NVIDIA Nemotron 120B Super «аблировали» через сутки после релиза. Как сняли защиту и что это значит для будущего больших языковых моделей —
3720
Практическое руководство по multi-label классификации изображений для встраиваемых устройств
Пошаговое руководство по созданию multi-label классификатора изображений для встраиваемых устройств. Сбор датасета, разметка, выбор модели, оптимизация и деплой