Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

3661 Как настроить KV-оффлоадинг и Hybrid KV Cache Manager в vLLM для гибридных моделей: разбор на примере MiniMax-M2.5 Полное руководство по настройке KV-оффлоадинга и Hybrid KV Cache Manager в vLLM для экономии VRAM на гибридных моделях. Практические команды, анализ флагов и бе 8 мин чтения 3662 Почему векторный RAG проваливается на сложных документах и как работает PageIndex без эмбеддингов Разбираем фундаментальные проблемы векторного RAG на сложных документах и показываем, как PageIndex без эмбеддингов достигает 98.7% точности на FinanceBench. 8 мин чтения 3663 Manga-Translator: Rust-приложение, которое переводит комиксы офлайн с помощью локальных LLM Как Rust-приложение с YOLO, LaMa и локальными LLM переводит мангу без интернета. Обзор возможностей, сравнение с аналогами и примеры использования. 4 мин чтения 3664 Самохостируемый AI для кода вместо Claude: выбор модели, железа и гайд по fine-tuning под Laravel и VueJS Практическое руководство по замене Claude на самохостируемый AI: выбор модели, подбор железа и fine-tuning под стек Laravel и VueJS для команды из 12 разработчи 8 мин чтения 3665 CLAUDE.md убивает код: исследование ETH Zurich доказывает, что контекстные файлы ухудшают работу AI-агентов на 3% Шок от ETH Zurich: популярные файлы CLAUDE.md и AGENTS.md снижают успешность кодирующих агентов на 3% и увеличивают стоимость инференса на 20+%. 4 мин чтения 3666 SoyLM: Ваш приватный аналитик документов, который работает без интернета Обзор SoyLM - open-source инструмента для анализа PDF, URL и YouTube с локальной LLM Nemotron-Nano-9B, RAG и веб-поиском. Полная приватность и контроль данных. 5 мин чтения 3667 Культурный код боли: как Grok-2, GPT-4o и Claude выдают свои предубеждения в ответе на 'I have a headache' Простой промпт о головной боли раскрывает скрытые индийские и западные смещения в данных обучения LLM на 14.03.2026. Анализ ответов и этические последствия. 5 мин чтения 3668 Codebook Lossless Compression: новый метод сжатия LLM на 25% без потерь (обзор и инструкция) Codebook Lossless Compression — прорывной метод сжатия LLM, который экономит 25% памяти без потери качества. Обзор технологии, сравнение с Sparse и QLoRA, инстр 6 мин чтения 3669 Nemotron-3-Super-120B Uncensored: запуск на MLX с LatentMoE и Mamba attention Разбор Nemotron-3-Super-120B Uncensored: архитектура LatentMoE и Mamba attention, рекордные бенчмарки, квантование для MLX и практический запуск локально в 2026 6 мин чтения 3670 Новый метод быстрого удаления механизмов отказа (refusal) из LLM с низкой дивергенцией KL: полный гайд и ожидание релиза Как за минуты убрать цензуру и отказы из LLM, сохранив качество модели. Полный гайд по новому методу аблитерирования и подготовка к релизу на arXiv. 9 мин чтения 3671 Почему ИИ проигрывает в простых играх вроде Nim: фундаментальный изъян обучения с подкреплением Анализ фундаментальной слабости современных ИИ-систем на примере игры Nim. Почему модели вроде AlphaGo проигрывают в задачах с простыми правилами. 4 мин чтения 3672 Исправление бага с повторной обработкой промптов в Qwen 3.5 для llama.cpp: подробный гайд Глубокий разбор и пошаговое исправление критического бага с повторной обработкой промптов в Qwen 3.5 при использовании llama.cpp. Узнай, как починить Jinja chat 9 мин чтения