Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
5629
Qwen3-Coder-Next-NVFP4: как сжать модель с 149 ГБ до 45 ГБ с минимальной потерей качества
Технический разбор квантования Qwen3-Coder-Next в формат NVFP4. Сжатие с 149 ГБ до 45 ГБ при потере всего 1.63% на MMLU Pro+. Практическое руководство по запуск
5630
Токенов в секунду мало? Разгоняем LLM до предела: от железа до батчинга
Полное руководство по увеличению tokens per second: выбор железа, квантование, бэкенды, настройка контекста. Аппаратное и программное ускорение LLM.
5631
MemoryLLM: как работает интерпретируемая память в трансформерах и можно ли её использовать на практике
Глубокий разбор MemoryLLM — новой архитектуры с интерпретируемой памятью. Как работает TKV-фреймворк, предвычисление FFN и можно ли это использовать в реальных
5632
Практическое руководство: как ускорить локальные модели на RTX 3090 и Intel Arc для реальной работы
Пошаговая инструкция по оптимизации локальных LLM на RTX 3090 и Intel Arc A770. Настройка, квантование, сравнение с облачными API для реальной работы в 2026 год
5633
Как Kimi k2.5 обучает агентов-оркестраторов: разбор техник мультимодального RL и Swarm Training
Технический разбор как Kimi K2.5 обучает агентов-оркестраторов с помощью мультимодального Reinforcement Learning и Swarm Training. Архитектура и пайплайны.
5634
Технический разбор Qwen3-Coder: как модель обходит тесты (reward hacking) и архитектура специализированных субмоделей
Глубокий разбор технического отчета Qwen3-Coder: как модель обходит SWE-bench тесты, reward hacking, специализированные субмодели UI/WebDev. Экспертный анализ н
5635
Alexandria: ваш личный режиссер аудиокниг, который раздает эмоции как конфеты
Полный гайд по установке и настройке Alexandria — локального генератора аудиокниг с эмоциональными метками, QWEN3 TTS и клонированием голоса. Работает без облак
5636
5 инструментов для создания персональной базы знаний из хаоса заметок: сравнение Affine, Logseq и других
Практический обзор 5 лучших инструментов для создания персональной базы знаний из заметок: Affine, Logseq, Obsidian, Notion и Capacities. Плюсы, минусы, AI-фичи
5637
Как собрать Mini PC с 68 ГБ VRAM для локальных LLM: разбор уникальной сборки на Reddit
Детальная инструкция по сборке энергоэффективной AI-станции на Mini PC с 68 ГБ VRAM через Oculink. Компоненты, схемы подключения, тесты производительности.
5638
MiniCPM-o-4.5: Модель размером с кошку, но с мозгами слона
Полный обзор MiniCPM-o-4.5 - 9-миллиардной мультимодальной модели с речью, зрением и полным дуплексом для локального запуска. Сравнение, примеры, установка.
5639
Локальные LLM на дешевом железе: выгодно или мучительно? Цифры против эмоций
Разбираем, стоит ли запускать локальные AI-модели на слабом CPU и малом RAM. Полный анализ окупаемости, скорости генерации и скрытых подводных камней.
5640
Сборка компактного DGX-кластера: уроки по охлаждению, настройке NVMe-oF и энергопотреблению
Подробный гайд по сборке компактного DGX-кластера: решение проблем перегрева до 90°C, настройка NVMe over Fabrics с BlueField 3, оптимизация энергопотребления.