Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
1753
GGUF на стероидах: почему MagicQuant v2.0 сделает ваши модели умнее, не раздувая битность
Обзор MagicQuant v2.0 — инструмента для создания гибридных GGUF квантований с динамическими конфигурациями. Сравнение с Unsloth, примеры, бенчмарки, кому подойд
1754
Как построить AI-директора: отказ от RAG, граф знаний и типизированная память
Пошаговый гайд по созданию AI-агента-директора на FastAPI, Claude Haiku 4.5 и SQLite. Отказ от RAG в пользу графа знаний и типизированной памяти: архитектура, к
1755
Новый инструмент llama-eval в llama.cpp: что это и как использовать
Новый встроенный инструмент для оценки моделей в llama.cpp от ggerganov. Запускайте MMLU, HellaSwag и другие тесты локально. Инструкция и сравнение с альтернати
1756
Gemma 4 MTP vs DFlash: плотные и MoE-архитектуры на одной H100 — кто выигрывает?
Сравниваем Gemma 4 MTP (dense) и DFlash (MoE) на H100: производительность, скорость, качество. Какая архитектура лучше для локального инференса в 2026?
1757
Сжатие контекста в Codex CLI и Claude Code: миф о миллионе токенов и реальная эффективность
Почему Codex CLI эффективнее сжимает контекст, чем Claude Code с его 1M токенов. Технический разбор механизмов, разоблачение маркетинга Anthropic.
1758
Почему автоматические метрики перевода обманчивы: случай TranslateGemma-12b — 71% чистых сегментов оказались плохими
Исследование показало: TranslateGemma-12b получает высокие баллы по BLEU и COMET, но люди бракуют 71% переводов. Разбираем, почему автоматические метрики не раб
1759
Почему короткий промпт может быть дороже длинного: разбор prefix cache в LLM-агентах
Разбираем парадокс: ужимая промпт для агентов, вы теряете преимущества prefix caching. Рассказываю, как логировать кэш, не стрелять себе в ногу и экономить до 9
1760
OpenAI Daybreak: GPT-5.5 и Codex научились самостоятельно искать и чинить уязвимости — три уровня доступа
OpenAI анонсировала Daybreak — связку GPT-5.5-Cyber и Codex для автономного поиска и патчинга уязвимостей. Три уровня доступа, phishing-resistant аутентификация
1761
Вайбкодинг по-взрослому: как я вывел MVP из головы в прод за 3 дня (и что пошло не так)
Пошаговый гайд по вайбкодингу с Claude Code и Codex. Реальные ошибки, оптимизация WebM, деплой на OpenServer. Личный опыт с 26-летним стажем.
1762
Как создать мультиклиентский центр управления для AI-агентов: Planulix на Go и Flutter
Соберите собственный центр управления для Claude Code, Cursor, Codex и Kimi. Go-шлюз, Flutter UI, VPS — решение проблемы блокировок аккаунтов. Полный гайд с код
1763
Как развернуть Ollama и Open WebUI на VPS без GPU: полный гайд с подводными камнями
Пошаговое руководство по запуску самодельного ChatGPT на CPU VPS с Docker, Ollama, Open WebUI, nginx и SSL. Подводные камни, оптимизация памяти и выбор модели.
1764
Как прикрутить веб-поиск к AI-агенту: Strands Agents SDK + Exa — пошаговое пособие для тех, кто устал от галлюцинаций
Полный гайд по интеграции Strands Agents SDK (AWS) и Exa для AI-агентов с веб-доступом. Код, примеры, ошибки и советы для production.