Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4377
материалов
01
Eider: кастомный инференс-рантайм для DGX Spark с NVFP4 и свопинг-памятью для MoE
Eider — кастомный инференс-рантайм для DGX Spark, написанный на Rust и CUDA под SM121. Нативная поддержка NVFP4 и экспертная свопинг-память позволяют загружать
02
Стриминг-инференс для MoE-моделей: запуск полной точности на машине с недостаточной памятью
Можно ли запустить полновесную MoE-модель на машине с недостаточной памятью без квантизации? Разбираем стриминг-инференс через TensorRT-LLM и DeepSpeed: реальна
03
Xeon Gold vs EPYC Rome для AI: тесты AVX-512 и пропускной способности памяти в 2026
Практические тесты Xeon Gold (AVX-512, 6 каналов DDR4) против EPYC Rome (8 каналов DDR4) на инференсе и обучении нейросетей. ResNet-50, BERT-base, LLaMA-7B: циф
04
Экономика AI-агентов: почему качество не гарантирует выживание в продакшене
AI-агент прошёл 12 метрик качества и был отключён через две недели. Причина: стоимость успешного решения тикета $4.79 против $4.20 у человека. Разбираем метрику
05
Петиция сообщества: зачем Qwen модель 100B MoE и как она изменит инференс на Apache Spark
Сообщество требует от Qwen модель на 100B параметров с архитектурой Mixture of Experts для Apache Spark. Разбираем техническую реализуемость, сравниваем с Mixtr
06
Модели 2+ трлн параметров: есть ли смысл запускать их локально?
Можно ли запустить модели с 2+ триллионами параметров на топовом железе? Расчеты памяти для Kimi K3 на 4× RTX 6000 и 5× RTX 4090, анализ скорости инференса и пр
07
Loop Engineering в RAG: как один уточняющий вопрос повышает точность поиска по документам
Разбираем технику Loop Engineering для RAG-пайплайнов: один уточняющий вопрос пользователю, поля section_hint и pages_hint, точный retrieval без лишних LLM-вызо
08
Current AI: Открытая альтернатива проприетарным нейросетям — как некоммерческая инфраструктура меняет доступ к AI для developing стран
Current AI строит открытую AI-инфраструктуру по модели World Wide Web: офлайн-устройство Suno Sutra на 22 языках, open-source чат-бот Alpha Chat от консорциума
09
Qwen 3.x-35B-a3B: архитектура MoE, перспективы и сценарии применения
Детальный анализ возможной модели Qwen 3.x-35B-a3B: архитектура MoE с 35B параметров и 3B активных, скорость инференса, ожидаемые бенчмарки и практические сцена
10
Квантование KV-кеша в Qwen3.6 35B A3B: когда Q8 — минимум, а когда можно ниже
Разбираем квантование KV-кеша для Qwen3.6 35B A3B: почему Q8 — минимальный безопасный уровень, насколько падает качество при Q4 и Q2, и в каких сценариях можно
11
Meta упустила лидерство в open-source AI: анализ стратегических ошибок и уроки для рынка
Разбираем, как управленческие решения Meta привели к потере лидерства в open-source AI, и почему китайские модели вроде Kimi K3 выходят вперед. Уроки для разраб
12
ATSInfer: теневое планирование на уровне тензоров для гибридного CPU-GPU инференса LLM на потребительских устройствах
ATSInfer ускоряет инференс LLM на CPU+GPU до 3.29× за счёт тензорного планирования. Разбор архитектуры, бенчмарки на LLaMA-2 и Mixtral, практическое руководство