Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
01
Как безопасно подключать ИИ-агентов к таск-трекеру: кейс YouGile, Codex и Claude Code
Практический разбор безопасной интеграции ИИ-агента с YouGile через Codex и Claude Code: детерминированный API-слой, минимальные права, подтверждение мутаций, з
02
ShimQuant для Nemotron-3.5-Lightning: как довести 30B-модель до рабочего 16 GB варианта
Разбираем, как ShimQuant может приблизить Nemotron-3.5-Lightning к запуску на GPU с 16 GB VRAM, почему обычные GGUF-кванты оказываются тяжелее ожиданий и где пр
03
Как превратить LLM в полезного помощника для работы с микроконтроллерами
Разбираем, почему LLM генерирует правдоподобный код для микроконтроллера, но ошибается в пинах, периферии и конфигурации конкретной платы. Показываем, как собра
04
Как выстроить корпоративный AI-конвейер: 7 ошибок внедрения ИИ в компании
Разбираем, почему корпоративное внедрение ИИ буксует даже при наличии готовых LLM и no-code-инструментов. Показываем 7 типичных ошибок, устройство AI-конвейера,
05
Terminal Bench 4.0: как оценивать кодинг-агентов без гигантских бенчмарков
Разбираем, что показывает Terminal Bench 4.0 и почему одного места в лидерборде недостаточно для выбора кодинг-агента. Пошагово собираем компактный evaluation-н
06
Как настроить Qwen3.8 в llama.cpp на двух RTX 3090: GGUF, MTP, tensor split и длинный контекст
Практическая инструкция по настройке Qwen3.8 в llama.cpp на двух RTX 3090: как проверить GGUF, распределить модель через tensor split, оценить поддержку MTP, по
07
Qwen3.8-Flash-Next на Strix Halo с MTP: запуск через Vulkan в llama.cpp
Практический разбор запуска Qwen3.8-Flash-Next на Strix Halo через Vulkan в llama.cpp. Разбираем unified memory, AMDGPU, сборку нужного форка, подключение MTP d
08
Почему важно проверять код AI-агента: риски, ревью и цена слепого доверия
AI-агент пишет код быстро, но скорость не гарантирует правильную логику, безопасность и отсутствие технического долга. Разбираем риски слепого доверия и даем пр
09
Разные уровни thinking в Qwen: что меняется в качестве ответов и локальном запуске
Разбираем, как уровни thinking в Qwen меняют качество ответов, задержку, расход токенов и требования к VRAM. Практическая матрица поможет выбрать быстрый, средн
10
Почему ИИ-чатам нельзя доверять вслепую: как документация влияет на ответы Алисы AI и ГигаЧата
Разбираем, почему Алиса AI и ГигаЧат могут по-разному отвечать на один технический запрос, где документация Cloud.ru и неоднозначные термины провоцируют ошибки
11
Qwen3.8-Next на Mac M5 Air: как MoE-модель ведет себя в streaming-стеке
Разбираем, что можно ожидать от Qwen3.8-Next на Mac M5 Air: как MoE и 3-bit-квантизация соотносятся с плотной 27B-моделью в 4-bit, чем отличаются prefill и deco
12
Как speculative decoding и MTP ускоряют генерацию в LLM на предсказуемых фразах
Разбираем, как speculative decoding и MTP сокращают задержку генерации LLM, почему шаблонные фразы и код ускоряются заметнее, чем свободное рассуждение, и где с