Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

49 Локальные voice-to-voice модели в 2026 году: что реально запустить на 12-24 ГБ VRAM Что действительно работает на 12, 16 и 24 ГБ VRAM для локального голосового AI в 2026 году. Разбираем ASR, LLM, TTS, voice conversion, latency, квантизацию и гр 13 мин чтения 50 Как форк NInfer на C++20/CUDA довёл Qwen3.8-27B до контекста в 1 млн токенов на двух RTX 5090 без NVLink Разбираем заявление о запуске Qwen3.8-27B с окном 1 048 576 токенов на двух RTX 5090: YaRN x4, tensor parallelism через PCIe, KV-кэш, prefill и speculative deco 11 мин чтения 51 Ox Alpha раскрылся как GLM-5.3-Flash: что показал анонимный релиз Z.ai Что на самом деле известно об Ox Alpha и его предполагаемой связи с GLM-5.3-Flash от Z.ai? Разбираем технические признаки атрибуции, логику анонимных бесплатных 15 мин чтения 52 Как внедрять AI-агентов в разработку без риска для продакшена Практическая схема безопасного внедрения AI-агентов в разработку: как ограничить права, настроить краткосрочные токены, изолировать среду, выстроить CI/CD-гейты 14 мин чтения 53 Где ИИ уже окупается: от Copilot до AI-завода и что разработчику собирать первым Разбираем, где ИИ уже дает бизнесу измеримый эффект: в поддержке, документах, разработке и прогнозировании. Показываем разницу между Copilot, RAG и AI-агентом, 17 мин чтения 54 Как подключить LangGraph-агента к Postgres: локальный запуск, Docker и облачная база Разбираем, как подключить LangGraph-агента к Postgres для сохранения бронирований: локальный Docker, настройка DATABASE_URL, облачная база и проверка persistenc 6 мин чтения 55 Qwen 3.8 Flash Next на 6 ГБ VRAM: какую квантизацию выбрать для баланса скорости и качества Разбираем, как оценить запуск Qwen 3.8 Flash Next через llama.cpp в Ubuntu на 6 ГБ VRAM и 16 ГБ ОЗУ. Показываем, что учитывать при выборе Q4, Q5 или Q6, как свя 11 мин чтения 56 Как связать llama.cpp и Blender через MCP для генерации 3D-сцен Практический разбор связки llama.cpp, llama-server и Blender через MCP: роли компонентов, настройка MCP-прокси, проверка флага --ui-mcp-proxy, конфликт mcp v2 и 10 мин чтения 57 GLM-5.3 в HF Viewer: как устроена архитектура модели и что видно по графу Разбираем GLM-5.3 в HF Viewer по слоям и вычислительным ветвям: MoE routing, sparse attention, shared indexers, MTP и mixed-precision квантование. Показываем, к 12 мин чтения 58 Qwen3.8-Flash-next на RTX 3090: как запустить модель с 12 ГБ VRAM и чем придётся пожертвовать Разбираем, что потребуется для запуска Qwen3.8-Flash-next при доступных 12 ГБ VRAM: квантование, KV-cache, частичный offload в host RAM, vision tower на CPU и M 13 мин чтения 59 DS4 с поддержкой GLM 5.3 Flash: что дает новая ветка и кому она полезна Разбираем, что дает новая ветка ds4 с поддержкой GLM 5.3 Flash для локального запуска: совместимость, RAM и VRAM, KV cache, квантование, скорость, macOS и Apple 9 мин чтения 60 GLM-5.3: как post-training может улучшить open-weights модель для кода и длинных задач Разбираем, что действительно известно о GLM-5.3 и почему заявления о приросте за счет post-training пока требуют первичных подтверждений. Объясняем, как оценива 10 мин чтения