Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

5425 MLX 26.2 и RDMA: как распределённые вычисления на Mac с Thunderbolt 5 ускоряют запуск LLM Обзор MLX 26.2 с RDMA для распределённых вычислений на Mac через Thunderbolt 5. Как снизить TTFT для локальных моделей в 3 раза. Тесты MoE-архитектур. 8 мин чтения 5426 Mutsu Studio Lite: когда чат с ИИ превращается в визуальную новеллу на вашем компьютере Настройка Mutsu Studio Lite для приватных ролевых игр с ИИ в стиле Visual Novel. Live2D модели, Emotional Damping, системные промпты - полный гайд на 2026 год. 7 мин чтения 5427 Agentic Debugging: как заставить LLM искать баги в C/C++ коде с помощью OpenCode и term-cli Пошаговый гайд по использованию OpenCode и term-cli для автоматической отладки багов в нативном коде на примере ffmpeg/x264. Сравнение с альтернативами и практи 7 мин чтения 5428 Пошаговый гайд: сборка llama.cpp с SYCL для Intel Arc и тест Qwen3-Coder-Next Полный гайд по сборке llama.cpp с SYCL бэкендом для Intel Arc GPU. Установка oneAPI, настройка Fedora, тест производительности Qwen3-Coder-Next на 07.02.2026. 7 мин чтения 5429 GAE (Geodesic Attention Engine): как запустить точное внимание для 1M токенов на 1 ГБ VRAM Geodesic Attention Engine сокращает использование памяти на 99.6% для длинных контекстов. Узнайте, как запустить 1 млн токенов на 1 ГБ VRAM. 6 мин чтения 5430 OpenClaw vs память-ориентированные агенты: битва архитектур, которая сэкономит вам 75% токенов Техническое сравнение OpenClaw и память-ориентированных агентов: производительность, стоимость токенов, установка Ollama. Как экономить до 75% на AI-агентах. 9 мин чтения 5431 Minimax m2.1 DWQ MLX: почему эта квантованная модель стала скрытым алмазом для Mac и исследовательской работы Обзор Minimax m2.1 DWQ MLX — квантованной 4-bit модели для MLX на Mac. Сравнение с альтернативами, параметры запуска, примеры использования для владельцев M2 Ul 5 мин чтения 5432 Nemo 30B с 1 миллионом токенов на RTX 3090: когда контекст длиннее романа Достоевского Подробный гайд по запуску модели Nemo 30B с контекстом 1 миллион токенов на одной видеокарте RTX 3090. Оптимизация llama.cpp, CPU offloading, сравнение производ 5 мин чтения 5433 Эксперимент Anthropic: как 16 AI-агентов Claude создали компилятор C с нуля Технический разбор эксперимента Anthropic: 16 автономных агентов Claude Opus 4.6 создали работающий компилятор C. Docker, Git, Rust и реальная стоимость API. 7 мин чтения 5434 Fine-tuning в 2026: почему 90% команд тратят ресурсы впустую Практический гайд по выбору между fine-tuning и prompt-tuning в 2026. Когда тратить ресурсы на дообучение, а когда промптов достаточно. 6 мин чтения 5435 Как юрист провалил дело из-за ChatGPT: разбор реального кейса и уроки по ответственному использованию ИИ Разбираем реальный судебный кейс, где юрист проиграл дело из-за галлюцинаций ChatGPT. Санкции, стилистические ошибки и правила ответственного использования ИИ в 6 мин чтения 5436 Serpentine TTS: 90ms задержки и 3.5GB памяти — локальный синтез речи для Mac, который не просит денег Обзор Serpentine TTS — локального TTS для Mac с задержкой 90ms, архитектурой look-ahead и поддержкой MLX. Сравнение с Elevenlabs, установка и примеры. 6 мин чтения