Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
1705
TurboQuant + MTP на AMD ROCm в llama.cpp: как получить 64K контекст на RX 7900 XTX
Разгоняем RX 7900 XTX до 64K токенов контекста с TurboQuant TBQ4 и MTP на ROCm. Инструкция, бенчмарки, сравнение с альтернативами.
1706
Кэширование трекинга YOLO с Redis: готовые сниппеты для экономии GPU
Как сэкономить до 40% GPU при трекинге объектов YOLO? Используем Redis для кэширования треков ByteTrack и DeepSORT. Готовые сниппеты кода и разбор ошибок.
1707
Anthropic научилась читать мысли Claude: обзор метода Natural Language Autoencoders (NLA)
Как Anthropic декодирует внутренние состояния Claude в текст. Разбор технологии NLA, результаты экспериментов и будущее объяснимого ИИ.
1708
Проблемы с MiMo-V2.5 310B: массовые галлюцинации в квантизированной версии
Разбираем массовые галлюцинации у MiMo-V2.5 310B после квантования. Почему MoE-модели Xiaomi ломаются в GGUF и как не попасть в ловушку.
1709
Электростатика бьет диффузию: как физика полей переизобрела генерацию данных
На ICLR 2026 представили Electrostatic Field Matching — генеративную модель на основе электростатики. Быстрее диффузии, без шума. Как это работает и зачем это в
1710
Главный тормоз ИИ-проектов — интеграция: как корпоративные системы блокируют AI-агентов
Почему AI-агенты упираются в унаследованные системы SAP и Oracle, а не в качество моделей. Разбор кейсов и решений на май 2026.
1711
Computer-use MCP: как управлять несколькими компьютерами через Claude, Cursor и Codex (готовое решение)
Обзор MCP-сервера для мульти-машинного управления. Настройка, примеры, сравнение с альтернативами. Кому подходит инструмент.
1712
Что нужно знать о видеогенераторе Kling: архитектура, возможности и история создания (досье)
Узнайте всё о Kling от Kuaishou: архитектура Diffusion Transformer и 3D VAE, эволюция до версии 3.0 со звуком, сравнение с Sora и место на рынке AI-видео.
1713
Как заставить LLM играть в Мафию: многомодельный театр на llama.cpp
Пошаговое руководство по организации ролевой игры Мафия (Werewolf) на нескольких локальных LLM (Gemma4, Qwen3.6) с переключением моделей и отключением chain-of-
1714
Realtime-дистилляция через API: как Thinking Machines ломает стереотипы о локальных моделях
Модель realtime interaction от Thinking Machines пока доступна только через API. Но дистилляция может вытащить её на локальные GPU. Разбираем перспективы.
1715
Почему SFT может ухудшить следование инструкциям на маленьких моделях: разбор эксперимента с 1B, 2B, 3B
Эксперимент показал: SFT на 1B модели ухудшил IFEval на 5.75 пункта, в то время как 2B и 3B улучшили. Разбираем причины и даем рекомендации для выбора размера м
1716
Natural Language Autoencoders от Anthropic: как разобрать нейросеть на кирпичики и запустить это дома через UI на llama.cpp
Обзор инструмента для интерпретации нейросетей с помощью Natural Language Autoencoders от Anthropic. Запускаем локально на llama.cpp с сервером и красивым UI.