Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
4777
5 техник оптимизации vLLM: бенчмарки Qwen3-32B и практическое руководство
Практическое руководство по оптимизации vLLM для Qwen3-32B. Prefix Caching, FP8 KV-Cache, CPU Offloading - реальные бенчмарки и пошаговые инструкции.
4778
15 000 увольнений и волна багов в Windows: как массовое внедрение ИИ-кодинга в Microsoft привело к кризису
Массовые увольнения 40% программистов и внедрение AI-кода привели к катастрофическим багам в Windows. Разбираем ошибки Microsoft.
4779
Эхо AI-кодинга: исследование показывает, как ассистенты портят код, который они же и создают
Новое исследование на реальных разработчиках показало: AI-ассистенты создают код, который потом сами же не могут поддерживать. Долгосрочные риски.
4780
Как ускорить Mixtral-подобные MoE-модели в 3 раза: практическое сравнение качества 8 vs 4 экспертов
Практическое руководство по ускорению MoE-моделей в 3 раза. Сравнение качества 8 vs 4 экспертов, VRAM оптимизация, квантование Q3_K_XL. Тесты на Mixtral 8x7B, Q
4781
Qwen 3.5: зачем Alibaba выпускает новую архитектуру в канун китайского Нового года и как скачать первым
Все про Qwen 3.5 от Alibaba: новая архитектура на 16.02.2026, как скачать в день релиза, сравнение с Qwen3 и GLM-4.7 Flash. Полный гид по модели.
4782
Почему сборка ПК для локальных LLM может быть ошибкой: разбор неудачного билда и расчёт ROI против API
Разбор реального неудачного билда ПК для локальных LLM. Считаем ROI против облачных API. Почему железо часто проигрывает и когда оно всё же выгодно.
4783
gUrrT: как работает альтернатива LVLM для анализа видео с низкими требованиями к VRAM
gUrrT — open-source инструмент для анализа видео с низкими требованиями к VRAM. Работает на 8-10 ГБ, а не на 24+. Обзор архитектуры и сравнение с LVLM на 2026 г
4784
Step-3.5-Flash от StepFun AI: AMA с разработчиками раскроет архитектурные секреты и планы
Эксклюзивное AMA с создателями Step-3.5-Flash 16 февраля 2026. Узнайте про архитектуру 196B модели, планы развития и ответы на острые вопросы.
4785
Тренировка нейросетей на 40% дешевле: как Karpathy ломает экономику AI с помощью Flash Attention 3, Muon и Sliding Window
Разбираем техники от Karpathy для снижения стоимости тренировки моделей на 40% в год: Flash Attention 3 (9% ускорение), Muon optimizer, Sliding window attention
4786
Полное руководство по сэндбоксингу AI-агентов: методы изоляции и безопасности
Пошаговое руководство по изоляции AI-агентов. Docker, gVisor, Firecracker, AppArmor, SELinux. Защита от prompt injection и jailbreak. Актуально на февраль 2026.
4787
Генетическая эволюция машинного кода: как запустить 80B модель на RTX 4090 и не сжечь карту
Принципы работы системы AbeBot для генетической оптимизации машинного кода. Как запустить 80B модели на RTX 4090 через прямое исполнение и сокращение абстракций
4788
Скандал вокруг OpenClaw: был ли проект фейковой виральностью перед покупкой OpenAI?
Расследование скандала с OpenClaw: как искусственная виральность и накрутка star-history могли повлиять на покупку проекта OpenAI в 2026 году.