Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

3709 SLAY-ASR: практическое руководство по добавлению аудиомодальности в LLM с минимальными затратами (рецепт на полгода) Пошаговое руководство по кодированию аудио в латентные представления для LLM. Альтернатива Whisper, кросс-аттеншн, практические советы на 2026 год. 8 мин чтения 3710 Ловушка Langfuse: как SDK по умолчанию перехватывает чужие трейсы и накручивает счёт — инструкция по отключению Подробное руководство по отключению скрытого перехвата всех трейсов в Langfuse SDK. Узнайте, как избежать неожиданных расходов и настроить фильтрацию. 6 мин чтения 3711 Правда о скорости MLX на Mac: почему бенчмарки в UI врут и как измерить реальную производительность Разоблачаем мифы о производительности MLX. Как измерить реальные tokens/s на Apple Silicon. Сравнение prefill и generation time на M1 Max и M5. 7 мин чтения 3712 MTIA v4: как Meta перехватывает инициативу у Nvidia в инференсе больших моделей Разбор новейшего чипа MTIA v4 от Meta: чиплетная архитектура с HBM3e, поддержка 8-битного инференса в PyTorch 2.4 и плагин для vLLM. Сравнение с Nvidia H200. 5 мин чтения 3713 EVR-1 Maano: революционное 3-битное сжатие для Llama 3.1 8B — практическое применение и сравнение с GGUF Обзор EVR-1 Maano — метода 3-битного квантования для Llama 3.1 8B, который решает проблему дегенерации. Сравнение с GGUF, примеры использования и рекомендации н 4 мин чтения 3714 Автоматизируем аналитику без дашбордов: как построить MCP-сервер для вашего AI-агента Практический гайд по созданию MCP-сервера для доступа AI-агента к данным аналитики. Автоматизируйте запросы к Mixpanel/GA4 без дашбордов. Работает с Claude, Cur 10 мин чтения 3715 Как настроить агентное кодирование на слабой видеокарте: практический гайд по Qwen3.5-9B Полная инструкция по запуску Qwen3.5-9B для автономного кодирования на RTX 3060 12GB. Квантование через Unsloth, настройка tool calls и оптимизация памяти. 7 мин чтения 3716 Nemotron-3 120B на RTX Pro 6000 Blackwell: полный бенчмарк скорости при длинном контексте до 512K Тест производительности флагманской модели NVIDIA на новейшем GPU Blackwell. Цифры по TTFT, многопользовательской нагрузке и fp8 KV cache для контекста в 512 ты 5 мин чтения 3717 Как дообучить NVIDIA Nemotron Speech ASR на Amazon EC2: полный гайд по адаптации под домен Пошаговое руководство по тонкой настройке NVIDIA Nemotron Speech ASR на Amazon EC2 p4d с DeepSpeed. Адаптация модели под доменные данные. 7 мин чтения 3718 pygbnf: грамматики для llama.cpp без головной боли с зависимостями Как использовать pygbnf для создания грамматик без версионных конфликтов в llama.cpp. Примеры кода, сравнение с альтернативами и рекомендации. 6 мин чтения 3719 Взлом и абляция Nemotron 120B Super: что происходит с безопасностью гибридных SSM-моделей Гибридную SSM-модель NVIDIA Nemotron 120B Super «аблировали» через сутки после релиза. Как сняли защиту и что это значит для будущего больших языковых моделей — 4 мин чтения 3720 Практическое руководство по multi-label классификации изображений для встраиваемых устройств Пошаговое руководство по созданию multi-label классификатора изображений для встраиваемых устройств. Сбор датасета, разметка, выбор модели, оптимизация и деплой 7 мин чтения