Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
3661
Как настроить KV-оффлоадинг и Hybrid KV Cache Manager в vLLM для гибридных моделей: разбор на примере MiniMax-M2.5
Полное руководство по настройке KV-оффлоадинга и Hybrid KV Cache Manager в vLLM для экономии VRAM на гибридных моделях. Практические команды, анализ флагов и бе
3662
Почему векторный RAG проваливается на сложных документах и как работает PageIndex без эмбеддингов
Разбираем фундаментальные проблемы векторного RAG на сложных документах и показываем, как PageIndex без эмбеддингов достигает 98.7% точности на FinanceBench.
3663
Manga-Translator: Rust-приложение, которое переводит комиксы офлайн с помощью локальных LLM
Как Rust-приложение с YOLO, LaMa и локальными LLM переводит мангу без интернета. Обзор возможностей, сравнение с аналогами и примеры использования.
3664
Самохостируемый AI для кода вместо Claude: выбор модели, железа и гайд по fine-tuning под Laravel и VueJS
Практическое руководство по замене Claude на самохостируемый AI: выбор модели, подбор железа и fine-tuning под стек Laravel и VueJS для команды из 12 разработчи
3665
CLAUDE.md убивает код: исследование ETH Zurich доказывает, что контекстные файлы ухудшают работу AI-агентов на 3%
Шок от ETH Zurich: популярные файлы CLAUDE.md и AGENTS.md снижают успешность кодирующих агентов на 3% и увеличивают стоимость инференса на 20+%.
3666
SoyLM: Ваш приватный аналитик документов, который работает без интернета
Обзор SoyLM - open-source инструмента для анализа PDF, URL и YouTube с локальной LLM Nemotron-Nano-9B, RAG и веб-поиском. Полная приватность и контроль данных.
3667
Культурный код боли: как Grok-2, GPT-4o и Claude выдают свои предубеждения в ответе на 'I have a headache'
Простой промпт о головной боли раскрывает скрытые индийские и западные смещения в данных обучения LLM на 14.03.2026. Анализ ответов и этические последствия.
3668
Codebook Lossless Compression: новый метод сжатия LLM на 25% без потерь (обзор и инструкция)
Codebook Lossless Compression — прорывной метод сжатия LLM, который экономит 25% памяти без потери качества. Обзор технологии, сравнение с Sparse и QLoRA, инстр
3669
Nemotron-3-Super-120B Uncensored: запуск на MLX с LatentMoE и Mamba attention
Разбор Nemotron-3-Super-120B Uncensored: архитектура LatentMoE и Mamba attention, рекордные бенчмарки, квантование для MLX и практический запуск локально в 2026
3670
Новый метод быстрого удаления механизмов отказа (refusal) из LLM с низкой дивергенцией KL: полный гайд и ожидание релиза
Как за минуты убрать цензуру и отказы из LLM, сохранив качество модели. Полный гайд по новому методу аблитерирования и подготовка к релизу на arXiv.
3671
Почему ИИ проигрывает в простых играх вроде Nim: фундаментальный изъян обучения с подкреплением
Анализ фундаментальной слабости современных ИИ-систем на примере игры Nim. Почему модели вроде AlphaGo проигрывают в задачах с простыми правилами.
3672
Исправление бага с повторной обработкой промптов в Qwen 3.5 для llama.cpp: подробный гайд
Глубокий разбор и пошаговое исправление критического бага с повторной обработкой промптов в Qwen 3.5 при использовании llama.cpp. Узнай, как починить Jinja chat