Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4377 материалов
01 Eider: кастомный инференс-рантайм для DGX Spark с NVFP4 и свопинг-памятью для MoE Eider — кастомный инференс-рантайм для DGX Spark, написанный на Rust и CUDA под SM121. Нативная поддержка NVFP4 и экспертная свопинг-память позволяют загружать 7 мин чтения 02 Стриминг-инференс для MoE-моделей: запуск полной точности на машине с недостаточной памятью Можно ли запустить полновесную MoE-модель на машине с недостаточной памятью без квантизации? Разбираем стриминг-инференс через TensorRT-LLM и DeepSpeed: реальна 10 мин чтения 03 Xeon Gold vs EPYC Rome для AI: тесты AVX-512 и пропускной способности памяти в 2026 Практические тесты Xeon Gold (AVX-512, 6 каналов DDR4) против EPYC Rome (8 каналов DDR4) на инференсе и обучении нейросетей. ResNet-50, BERT-base, LLaMA-7B: циф 9 мин чтения 04 Экономика AI-агентов: почему качество не гарантирует выживание в продакшене AI-агент прошёл 12 метрик качества и был отключён через две недели. Причина: стоимость успешного решения тикета $4.79 против $4.20 у человека. Разбираем метрику 11 мин чтения 05 Петиция сообщества: зачем Qwen модель 100B MoE и как она изменит инференс на Apache Spark Сообщество требует от Qwen модель на 100B параметров с архитектурой Mixture of Experts для Apache Spark. Разбираем техническую реализуемость, сравниваем с Mixtr 8 мин чтения 06 Модели 2+ трлн параметров: есть ли смысл запускать их локально? Можно ли запустить модели с 2+ триллионами параметров на топовом железе? Расчеты памяти для Kimi K3 на 4× RTX 6000 и 5× RTX 4090, анализ скорости инференса и пр 5 мин чтения 07 Loop Engineering в RAG: как один уточняющий вопрос повышает точность поиска по документам Разбираем технику Loop Engineering для RAG-пайплайнов: один уточняющий вопрос пользователю, поля section_hint и pages_hint, точный retrieval без лишних LLM-вызо 12 мин чтения 08 Current AI: Открытая альтернатива проприетарным нейросетям — как некоммерческая инфраструктура меняет доступ к AI для developing стран Current AI строит открытую AI-инфраструктуру по модели World Wide Web: офлайн-устройство Suno Sutra на 22 языках, open-source чат-бот Alpha Chat от консорциума 10 мин чтения 09 Qwen 3.x-35B-a3B: архитектура MoE, перспективы и сценарии применения Детальный анализ возможной модели Qwen 3.x-35B-a3B: архитектура MoE с 35B параметров и 3B активных, скорость инференса, ожидаемые бенчмарки и практические сцена 9 мин чтения 10 Квантование KV-кеша в Qwen3.6 35B A3B: когда Q8 — минимум, а когда можно ниже Разбираем квантование KV-кеша для Qwen3.6 35B A3B: почему Q8 — минимальный безопасный уровень, насколько падает качество при Q4 и Q2, и в каких сценариях можно 7 мин чтения 11 Meta упустила лидерство в open-source AI: анализ стратегических ошибок и уроки для рынка Разбираем, как управленческие решения Meta привели к потере лидерства в open-source AI, и почему китайские модели вроде Kimi K3 выходят вперед. Уроки для разраб 7 мин чтения 12 ATSInfer: теневое планирование на уровне тензоров для гибридного CPU-GPU инференса LLM на потребительских устройствах ATSInfer ускоряет инференс LLM на CPU+GPU до 3.29× за счёт тензорного планирования. Разбор архитектуры, бенчмарки на LLaMA-2 и Mixtral, практическое руководство 8 мин чтения