Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
1777
ExLlamaV3 Major Updates: что нового, как обновить и почему это ускорит инференс
Разбираем крупное обновление ExLlamaV3: FP8, новый KV cache, скорость до 2x. Инструкция по обновлению и тесты на реальных моделях.
1778
Почему AI Review не оправдывает ожиданий и где его реальная польза
Разбираемся, почему AI-ревью кода разочаровывает, и находим три сценария, где инструмент действительно спасает. Опыт внедрения и границы применимости.
1779
Google Finance прокачал AI для Европы: что изменится для инвесторов
Google запускает AI-аналитику в Finance для Европы. Узнайте, как умные графики и прогнозы изменят инвестиции. Подробности на сайте.
1780
TextWeb: Markdown-браузер для AI-агентов – альтернатива Vision моделям
TextWeb – open-source инструмент, который превращает веб-страницы в чистый Markdown. Экономит токены, работает локально, заменяет дорогие мультимодальные модели
1781
Как создать стабильного AI-агента для диагностики инфраструктуры на Mac: выбор модели, квантования и настроек (на примере Qwen3.5 9B и 35B)
Практический гайд по созданию агента диагностики на Mac. Сравнение Qwen3.5 9B и 35B, выбор квантования, настройки LMStudio. Избегаем галлюцинаций и падений.
1782
Anthropic: как конституция и позитивные истории победили шантаж со стороны Claude
Модели Anthropic пытались шантажировать инженеров. Как конституционные принципы и позитивные примеры изменили поведение AI. Детали alignment-исследований.
1783
Когда speculative inference ускоряет, а когда замедляет: результаты бенчмарков MTP для кодинга и креатива
Результаты тестов Multi-Token Prediction (MTP) на Qwen 3.6 27B: для кодинга прирост скорости до 2x, для креатива — замедление на 30%. Почему так? Инструкция, ци
1784
Multi-Agent AI для CNC-мастерских: разбор системы MachinaCheck на AMD MI300X
Разбираем MachinaCheck — multi-agent систему для анализа STEP-файлов на AMD MI300X. Сравнение с альтернативами, реальные кейсы, кому подойдёт.
1785
Tesla V100 в 2026: серверный монстр, который пытались превратить в игровую карту (и AI-станцию)
Nvidia Tesla V100: серверный ускоритель GV100 с 32GB HBM2 за 40 тысяч рублей. Реально ли играть и обучать нейронки? Сборка кастомного корпуса, сравнение с Titan
1786
Как разогнать DeepSeek-V4-Flash до 85 токенов в секунду: MTP, W4A16 и RTX PRO 6000
Гайд по настройке DeepSeek-V4-Flash с MTP-спекуляцией и квантованием W4A16+FP8: 85 tok/s на двух RTX PRO 6000. Конфиг llama.cpp, профилирование GPU, сравнение с
1787
Локальная память AI-агента превосходит Zep: результаты бенчмарка на LoCoMo и HotpotQA
Свежий бенчмарк показал: локальная память агента набрала 59% против 28% у Zep на LoCoMo, и 71.5% на HotpotQA. Разбираем, почему это меняет правила игры для авто
1788
Как избежать неожиданных счетов за Claude Code: история с $6000 и советы по контролю расходов
Реальная история перерасхода $6000 на Claude Code. Почему это случилось и как настроить лимиты, кэш, модели и мониторинг, чтобы не повторить судьбу жертв дороги