Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

4813 Izwi: локальный монстр для аудио, который понимает кто говорит и как Полный разбор Izwi — Rust-движка для аудио на Qwen3. Транскрипция, разделение спикеров, синтез речи на одной машине. Сравнение с Whisper, Ollama. 7 мин чтения 4814 Q8 vs Q6: полный гайд по выбору квантования для локальных LLM в 2024 Полный гайд по выбору между Q8 и Q6 квантованием для локальных LLM. Сравнение VRAM, скорости, perplexity и практические рекомендации для 2024 года. 9 мин чтения 4815 Как убить задержку в голосовом AI для нескольких пользователей: WebRTC, Fishjam и серверный VAD Гайд по созданию голосового AI с задержкой <1с для нескольких пользователей: WebRTC, Fishjam SFU и серверный VAD. Архитектура и код на 2026 год. 12 мин чтения 4816 Локальный голосовой агент с задержкой 375 мс: Nemotron-4 + Kokoro-82M на bare metal Полный гайд по сборке локального голосового AI-агента с задержкой 375 мс. Nemotron-4 340B с квантованием 4-bit, Kokoro-82M TTS, bare metal сервер. Пошаговая инс 10 мин чтения 4817 Поиск полностью нецензурированных моделей: цифровая утопия или опасная реальность? Ищем правду о полностью нецензурированных LLM для спорных тем. Актуальные модели, методы обхода цензуры и этические дилеммы 2026 года. 3 мин чтения 4818 Когда токены вздуваются: как бороться с раздуванием в неанглийских языках Практическое руководство по оптимизации локальных LLM для русского и других языков. Сравнение моделей, токенизаторов и промптов для ускорения работы. 7 мин чтения 4819 AI coding в 2026: 6 правил, которые спасут ваш код от ИИ-хаоса Тимур Хахалев и Денис Киселев о том, как работать с AI-ассистентами в 2026 без потери контроля над кодом. Практические правила для код-ревью и автоматизации. 8 мин чтения 4820 Физический закон приватности: как запустить AI-агент Physiclaw без единого облачного запроса Пошаговая инструкция по развертыванию форка Physiclaw в air-gapped среде. Удаляем телеметрию, подключаем локальные vLLM и llama.cpp эндпоинты. 6 мин чтения 4821 Алтай-3 против B200: российский нейроморфный чип, который не греет планету Архитектура, энергопотребление и реальные перспективы российского нейроморфного процессора Алтай-3 против GPU NVIDIA. Актуально на февраль 2026. 4 мин чтения 4822 Как выжать +50% скорости из vLLM на 4x RTX 3090: патч драйвера, BIOS и проверка PCIe Полное руководство по ускорению vLLM на 4 картах RTX 3090. Патч P2P драйвера, настройка Resizable BAR, проверка PCIe lanes. +50% скорости инференса. 9 мин чтения 4823 Архитектура базовой модели Netflix: как перестать плодить ML-монстров и начать жить Глубокий разбор архитектуры единой базовой модели Netflix. Как централизованное обучение, извлечение признаков и ML-платформа ускоряют разработку в 5 раз. 9 мин чтения 4824 TiDAR от Nvidia: как архитектура 'Think in Diffusion, Talk in Autoregression' ускорит LLM в разы Анализ архитектуры TiDAR от Nvidia: как сочетание диффузии и авторегрессии решает проблему простоя GPU и ускоряет инференс LLM в 2.5-4 раза. Технический разбор 4 мин чтения