Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

01 Как безопасно подключать ИИ-агентов к таск-трекеру: кейс YouGile, Codex и Claude Code Практический разбор безопасной интеграции ИИ-агента с YouGile через Codex и Claude Code: детерминированный API-слой, минимальные права, подтверждение мутаций, з 11 мин чтения 02 ShimQuant для Nemotron-3.5-Lightning: как довести 30B-модель до рабочего 16 GB варианта Разбираем, как ShimQuant может приблизить Nemotron-3.5-Lightning к запуску на GPU с 16 GB VRAM, почему обычные GGUF-кванты оказываются тяжелее ожиданий и где пр 10 мин чтения 03 Как превратить LLM в полезного помощника для работы с микроконтроллерами Разбираем, почему LLM генерирует правдоподобный код для микроконтроллера, но ошибается в пинах, периферии и конфигурации конкретной платы. Показываем, как собра 11 мин чтения 04 Как выстроить корпоративный AI-конвейер: 7 ошибок внедрения ИИ в компании Разбираем, почему корпоративное внедрение ИИ буксует даже при наличии готовых LLM и no-code-инструментов. Показываем 7 типичных ошибок, устройство AI-конвейера, 17 мин чтения 05 Terminal Bench 4.0: как оценивать кодинг-агентов без гигантских бенчмарков Разбираем, что показывает Terminal Bench 4.0 и почему одного места в лидерборде недостаточно для выбора кодинг-агента. Пошагово собираем компактный evaluation-н 14 мин чтения 06 Как настроить Qwen3.8 в llama.cpp на двух RTX 3090: GGUF, MTP, tensor split и длинный контекст Практическая инструкция по настройке Qwen3.8 в llama.cpp на двух RTX 3090: как проверить GGUF, распределить модель через tensor split, оценить поддержку MTP, по 13 мин чтения 07 Qwen3.8-Flash-Next на Strix Halo с MTP: запуск через Vulkan в llama.cpp Практический разбор запуска Qwen3.8-Flash-Next на Strix Halo через Vulkan в llama.cpp. Разбираем unified memory, AMDGPU, сборку нужного форка, подключение MTP d 14 мин чтения 08 Почему важно проверять код AI-агента: риски, ревью и цена слепого доверия AI-агент пишет код быстро, но скорость не гарантирует правильную логику, безопасность и отсутствие технического долга. Разбираем риски слепого доверия и даем пр 11 мин чтения 09 Разные уровни thinking в Qwen: что меняется в качестве ответов и локальном запуске Разбираем, как уровни thinking в Qwen меняют качество ответов, задержку, расход токенов и требования к VRAM. Практическая матрица поможет выбрать быстрый, средн 13 мин чтения 10 Почему ИИ-чатам нельзя доверять вслепую: как документация влияет на ответы Алисы AI и ГигаЧата Разбираем, почему Алиса AI и ГигаЧат могут по-разному отвечать на один технический запрос, где документация Cloud.ru и неоднозначные термины провоцируют ошибки 14 мин чтения 11 Qwen3.8-Next на Mac M5 Air: как MoE-модель ведет себя в streaming-стеке Разбираем, что можно ожидать от Qwen3.8-Next на Mac M5 Air: как MoE и 3-bit-квантизация соотносятся с плотной 27B-моделью в 4-bit, чем отличаются prefill и deco 12 мин чтения 12 Как speculative decoding и MTP ускоряют генерацию в LLM на предсказуемых фразах Разбираем, как speculative decoding и MTP сокращают задержку генерации LLM, почему шаблонные фразы и код ускоряются заметнее, чем свободное рассуждение, и где с 12 мин чтения