Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
49
Локальные voice-to-voice модели в 2026 году: что реально запустить на 12-24 ГБ VRAM
Что действительно работает на 12, 16 и 24 ГБ VRAM для локального голосового AI в 2026 году. Разбираем ASR, LLM, TTS, voice conversion, latency, квантизацию и гр
50
Как форк NInfer на C++20/CUDA довёл Qwen3.8-27B до контекста в 1 млн токенов на двух RTX 5090 без NVLink
Разбираем заявление о запуске Qwen3.8-27B с окном 1 048 576 токенов на двух RTX 5090: YaRN x4, tensor parallelism через PCIe, KV-кэш, prefill и speculative deco
51
Ox Alpha раскрылся как GLM-5.3-Flash: что показал анонимный релиз Z.ai
Что на самом деле известно об Ox Alpha и его предполагаемой связи с GLM-5.3-Flash от Z.ai? Разбираем технические признаки атрибуции, логику анонимных бесплатных
52
Как внедрять AI-агентов в разработку без риска для продакшена
Практическая схема безопасного внедрения AI-агентов в разработку: как ограничить права, настроить краткосрочные токены, изолировать среду, выстроить CI/CD-гейты
53
Где ИИ уже окупается: от Copilot до AI-завода и что разработчику собирать первым
Разбираем, где ИИ уже дает бизнесу измеримый эффект: в поддержке, документах, разработке и прогнозировании. Показываем разницу между Copilot, RAG и AI-агентом,
54
Как подключить LangGraph-агента к Postgres: локальный запуск, Docker и облачная база
Разбираем, как подключить LangGraph-агента к Postgres для сохранения бронирований: локальный Docker, настройка DATABASE_URL, облачная база и проверка persistenc
55
Qwen 3.8 Flash Next на 6 ГБ VRAM: какую квантизацию выбрать для баланса скорости и качества
Разбираем, как оценить запуск Qwen 3.8 Flash Next через llama.cpp в Ubuntu на 6 ГБ VRAM и 16 ГБ ОЗУ. Показываем, что учитывать при выборе Q4, Q5 или Q6, как свя
56
Как связать llama.cpp и Blender через MCP для генерации 3D-сцен
Практический разбор связки llama.cpp, llama-server и Blender через MCP: роли компонентов, настройка MCP-прокси, проверка флага --ui-mcp-proxy, конфликт mcp v2 и
57
GLM-5.3 в HF Viewer: как устроена архитектура модели и что видно по графу
Разбираем GLM-5.3 в HF Viewer по слоям и вычислительным ветвям: MoE routing, sparse attention, shared indexers, MTP и mixed-precision квантование. Показываем, к
58
Qwen3.8-Flash-next на RTX 3090: как запустить модель с 12 ГБ VRAM и чем придётся пожертвовать
Разбираем, что потребуется для запуска Qwen3.8-Flash-next при доступных 12 ГБ VRAM: квантование, KV-cache, частичный offload в host RAM, vision tower на CPU и M
59
DS4 с поддержкой GLM 5.3 Flash: что дает новая ветка и кому она полезна
Разбираем, что дает новая ветка ds4 с поддержкой GLM 5.3 Flash для локального запуска: совместимость, RAM и VRAM, KV cache, квантование, скорость, macOS и Apple
60
GLM-5.3: как post-training может улучшить open-weights модель для кода и длинных задач
Разбираем, что действительно известно о GLM-5.3 и почему заявления о приросте за счет post-training пока требуют первичных подтверждений. Объясняем, как оценива