Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

1813 Инженерия качества ИИ-агентов: измеряем Factual Correctness с помощью RAGAS (Часть 2) Глубокий разбор метрики Factual Correctness из RAGAS: claim decomposition, промпты, пошаговый код и подводные камни. Для QA-инженеров AI-агентов. 1 мин чтения 1814 Локальный AI-кодинг на одной видеокарте: настройка автокомплита и агентного режима с Qwen моделями Настройка Qwen2.5-Coder-7B и Qwen3.6-35B-A3B на одной видеокарте для автокомплита и агентного программирования без облачных API. Примеры, квантования, конфигура 3 мин чтения 1815 Выбор локальной LLM для системы мониторинга: интеграция Zabbix с нейросетью Практическое руководство по выбору и внедрению локальной языковой модели для анализа алертов Zabbix. Критерии, архитектура, ошибки, лучшие модели на май 2026. 9 мин чтения 1816 Гибридный поиск и реранжирование в production RAG: почему dense retrieval недостаточно Почему dense retrieval ломает RAG в production. Гайд по гибридному поиску (BM25 + вектор) и реранжированию cross-encoder. Метрики, код, ошибки и production-аспе 9 мин чтения 1817 GGUF на стероидах: почему MagicQuant v2.0 сделает ваши модели умнее, не раздувая битность Обзор MagicQuant v2.0 — инструмента для создания гибридных GGUF квантований с динамическими конфигурациями. Сравнение с Unsloth, примеры, бенчмарки, кому подойд 5 мин чтения 1818 Как построить AI-директора: отказ от RAG, граф знаний и типизированная память Пошаговый гайд по созданию AI-агента-директора на FastAPI, Claude Haiku 4.5 и SQLite. Отказ от RAG в пользу графа знаний и типизированной памяти: архитектура, к 9 мин чтения 1819 Новый инструмент llama-eval в llama.cpp: что это и как использовать Новый встроенный инструмент для оценки моделей в llama.cpp от ggerganov. Запускайте MMLU, HellaSwag и другие тесты локально. Инструкция и сравнение с альтернати 5 мин чтения 1820 Gemma 4 MTP vs DFlash: плотные и MoE-архитектуры на одной H100 — кто выигрывает? Сравниваем Gemma 4 MTP (dense) и DFlash (MoE) на H100: производительность, скорость, качество. Какая архитектура лучше для локального инференса в 2026? 4 мин чтения 1821 Сжатие контекста в Codex CLI и Claude Code: миф о миллионе токенов и реальная эффективность Почему Codex CLI эффективнее сжимает контекст, чем Claude Code с его 1M токенов. Технический разбор механизмов, разоблачение маркетинга Anthropic. 8 мин чтения 1822 Почему автоматические метрики перевода обманчивы: случай TranslateGemma-12b — 71% чистых сегментов оказались плохими Исследование показало: TranslateGemma-12b получает высокие баллы по BLEU и COMET, но люди бракуют 71% переводов. Разбираем, почему автоматические метрики не раб 4 мин чтения 1823 Почему короткий промпт может быть дороже длинного: разбор prefix cache в LLM-агентах Разбираем парадокс: ужимая промпт для агентов, вы теряете преимущества prefix caching. Рассказываю, как логировать кэш, не стрелять себе в ногу и экономить до 9 6 мин чтения 1824 OpenAI Daybreak: GPT-5.5 и Codex научились самостоятельно искать и чинить уязвимости — три уровня доступа OpenAI анонсировала Daybreak — связку GPT-5.5-Cyber и Codex для автономного поиска и патчинга уязвимостей. Три уровня доступа, phishing-resistant аутентификация 5 мин чтения