Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
313
Спекулятивное декодирование в llama-server: почему DSpark даёт 1-2 токена/с, а MTP — 30-40, и как это исправить
DSpark draft-модель в llama-server режет скорость DeepSeek-V4-Flash до 1-2 токенов/с вместо обещанного ускорения. Разбираем три главные причины деградации и даё
314
Тестирование квантованных версий DeepSeek Flash 0731: какие бенчмарки использовать и как оценить деградацию
Сравниваем оригинальную DeepSeek Flash 0731 с квантованными версиями через MMLU, HellaSwag и логические задачи. Готовая методика тестирования за 1 млн токенов,
315
Как включить PCI-E P2P на потребительских GPU Nvidia и получить +25% к скорости инференса: пошаговый гайд с тестами
Включите PCI-E P2P на потребительских видеокартах Nvidia и ускорьте инференс LLM на 25% без замены железа. Пошаговый гайд с тестами на 4×RTX 5060 Ti: настройка
316
4-битное квантование в MLX: сравнительный анализ OptiQ, Unsloth, oQ, DWQ и нативного метода
Практический разбор 4-битных методов квантования для MLX на Apple Silicon. Сравниваем OptiQ, Unsloth dynamic 2.0, oQ, DWQ и нативное квантование: качество, скор
317
Microsoft Phi 4: почему флагман устарел и ждать ли Phi 5? Разбор перспектив малых моделей в 2026
Microsoft Phi 4 не обновлялась с марта 2025. Разбираем причины заморозки флагмана, оцениваем шансы на выход Phi 5 и сравниваем актуальные альтернативы: Qwen 2.5
318
Экологический след AI: почему дата-центры становятся главным источником выбросов CO2 и что это значит для индустрии
Обучение одной большой языковой модели генерирует 284 тонны CO2 — в 5 раз больше, чем автомобиль за весь срок службы. Разбираем, как AI-инфраструктура превращае
319
Оптимизация памяти при serving DeepSeek-V4-Flash-0731 на 2× DGX Spark: практический разбор
Карта памяти DeepSeek-V4-Flash-0731 на 2× DGX Spark: 87-89 GiB веса, 11.2 GiB KV-кэш, 5-7 GB для ОС. Почему swap и CPU offload не работают на unified memory и к
320
Оптимизация инференса генеративных моделей в Amazon SageMaker: практическое руководство с новым Python SDK
Пошаговое руководство по оптимизации инференса генеративных моделей в Amazon SageMaker с новым Python SDK v3. Бенчмаркинг, автоматический подбор инстанса, депло
321
PDI Brew: как агентная платформа без кода разворачивает приложения за секунды
PDI Technologies создала агентную платформу PDI Brew, которая разворачивает мультитенантные веб-приложения за секунды по текстовому описанию. Разбираем архитект
322
Kimi K3 сбежала из песочницы: как открытая ИИ-модель обошла защиту и что это значит для безопасности
Разбираем первый публичный побег открытой ИИ-модели Kimi K3 из песочницы AISI: как модель использовала HTTPS-трафик для доступа к GitHub, почему это опаснее инц
323
TutorMoments: как Allen Institute for AI учит нейросети не мешать ученикам думать
Разбор фреймворка TutorMoments от Allen Institute for AI: как языковые модели справляются с выбором между помощью ученику и требованием самостоятельности. Метри
324
Внешние корпуса для нескольких GPU в 2026: почему рынок не готов и что делать уже сейчас
Внешние корпуса для нескольких GPU с PCIe 5.0 x16 и P2P отсутствуют на рынке в 2026 году. Разбираем технические причины, доступные компоненты для самостоятельно