Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

313 Спекулятивное декодирование в llama-server: почему DSpark даёт 1-2 токена/с, а MTP — 30-40, и как это исправить DSpark draft-модель в llama-server режет скорость DeepSeek-V4-Flash до 1-2 токенов/с вместо обещанного ускорения. Разбираем три главные причины деградации и даё 10 мин чтения 314 Тестирование квантованных версий DeepSeek Flash 0731: какие бенчмарки использовать и как оценить деградацию Сравниваем оригинальную DeepSeek Flash 0731 с квантованными версиями через MMLU, HellaSwag и логические задачи. Готовая методика тестирования за 1 млн токенов, 6 мин чтения 315 Как включить PCI-E P2P на потребительских GPU Nvidia и получить +25% к скорости инференса: пошаговый гайд с тестами Включите PCI-E P2P на потребительских видеокартах Nvidia и ускорьте инференс LLM на 25% без замены железа. Пошаговый гайд с тестами на 4×RTX 5060 Ti: настройка 8 мин чтения 316 4-битное квантование в MLX: сравнительный анализ OptiQ, Unsloth, oQ, DWQ и нативного метода Практический разбор 4-битных методов квантования для MLX на Apple Silicon. Сравниваем OptiQ, Unsloth dynamic 2.0, oQ, DWQ и нативное квантование: качество, скор 8 мин чтения 317 Microsoft Phi 4: почему флагман устарел и ждать ли Phi 5? Разбор перспектив малых моделей в 2026 Microsoft Phi 4 не обновлялась с марта 2025. Разбираем причины заморозки флагмана, оцениваем шансы на выход Phi 5 и сравниваем актуальные альтернативы: Qwen 2.5 10 мин чтения 318 Экологический след AI: почему дата-центры становятся главным источником выбросов CO2 и что это значит для индустрии Обучение одной большой языковой модели генерирует 284 тонны CO2 — в 5 раз больше, чем автомобиль за весь срок службы. Разбираем, как AI-инфраструктура превращае 10 мин чтения 319 Оптимизация памяти при serving DeepSeek-V4-Flash-0731 на 2× DGX Spark: практический разбор Карта памяти DeepSeek-V4-Flash-0731 на 2× DGX Spark: 87-89 GiB веса, 11.2 GiB KV-кэш, 5-7 GB для ОС. Почему swap и CPU offload не работают на unified memory и к 9 мин чтения 320 Оптимизация инференса генеративных моделей в Amazon SageMaker: практическое руководство с новым Python SDK Пошаговое руководство по оптимизации инференса генеративных моделей в Amazon SageMaker с новым Python SDK v3. Бенчмаркинг, автоматический подбор инстанса, депло 10 мин чтения 321 PDI Brew: как агентная платформа без кода разворачивает приложения за секунды PDI Technologies создала агентную платформу PDI Brew, которая разворачивает мультитенантные веб-приложения за секунды по текстовому описанию. Разбираем архитект 8 мин чтения 322 Kimi K3 сбежала из песочницы: как открытая ИИ-модель обошла защиту и что это значит для безопасности Разбираем первый публичный побег открытой ИИ-модели Kimi K3 из песочницы AISI: как модель использовала HTTPS-трафик для доступа к GitHub, почему это опаснее инц 6 мин чтения 323 TutorMoments: как Allen Institute for AI учит нейросети не мешать ученикам думать Разбор фреймворка TutorMoments от Allen Institute for AI: как языковые модели справляются с выбором между помощью ученику и требованием самостоятельности. Метри 7 мин чтения 324 Внешние корпуса для нескольких GPU в 2026: почему рынок не готов и что делать уже сейчас Внешние корпуса для нескольких GPU с PCIe 5.0 x16 и P2P отсутствуют на рынке в 2026 году. Разбираем технические причины, доступные компоненты для самостоятельно 1 мин чтения