Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
1920
материалов
01
vllm-doctor: когда vLLM заболел, вызывайте диагноста с CLI
Обзор vllm-doctor — утилиты для мониторинга и диагностики инференс-серверов vLLM. Команды, метрики, сравнение с альтернативами и примеры использования.
02
PyTorch MoE/MoD Training Framework: кастомные CUDA-ядра, DeepSpeed и ускорение в 7 раз на T4
Обзор открытого фреймворка для обучения MoE/MoD-моделей с кастомными CUDA-кернелами и DeepSpeed. Ускорение до 7x на T4, лицензия Apache 2.0. Кому нужен и как ра
03
Landforge: ваш лендинг за 10 минут — с SEO, A/B-тестами и Claude Code Skills
Обзор open-source инструмента Landforge — лендинги на Claude Code Skills, встроенная SEO-оптимизация, A/B-тесты и автодеплой. Сравнение с альтернативами, пример
04
PLC Smart Splitter: как open-source тупой парсер ТЗ из АСУ ТП обогнал инженеров с Excel
Обзор PLC Smart Splitter — инструмента на Python Flask для автоматического парсинга ТЗ, генерации IOLIST и интеграции с PLC Studio. Сравнение с ручным разбором
05
Строим самоподдерживающуюся Wiki-базу знаний на LLM: реализация MCP-сервера с графовым хранилищем
Пошаговое руководство по созданию production-ready базы знаний на основе MCP-сервера, типизированных связей и гибридного поиска. Забудьте про RAG.
06
EVA-Bench 2.0: что нового в бенчмарке для enterprise voice-агентов и как его использовать
EVA-Bench 2.0 — открытый датасет с 213 реалистичными сценариями для оценки голосовых агентов. Три домена: авиакомпании, IT-поддержка, HR. Код загрузки на Python
07
Holo3.1: Локальные компьютерные агенты с поддержкой квантований FP8 и GGUF — обзор и производительность
Разбираем Holo3.1 — open-source агент для компьютера с квантизациями FP8 и GGUF. Производительность 82% на OSWorld, запуск на 3090. Обзор и сравнение.
08
Mellum2: Обзор новой 12B MoE модели от JetBrains — производительность, квантование и применение для кода
Подробный обзор Mellum2 — 12B MoE модели от JetBrains с открытой лицензией Apache 2.0. Бенчмарки, квантование, запуск на CPU/GPU, примеры для кода и RAG. Реальн
09
MoQ и GSQ: революция в низкобитном квантовании GGUF — как это улучшит запуск моделей на слабом железе
Новые методы квантования MoQ и GSQ в GGUF позволяют запускать модели на 4 ГБ VRAM с минимальной потерей качества. Разбор, сравнение, практика.
10
StepFun 3.7 Flash на Strix Halo: бенчмарки, MTP и настройка производительности
Тесты StepFun 3.7 Flash на AMD Strix Halo: скорость генерации, MTP-ускорение до 111%, настройка квантования UD-IQ4_XS. Команды и результаты.
11
dots.tts 2B: SOTA TTS от RedNote — обзор возможностей и перспективы локального запуска
Обзор dots.tts 2B — новой SOTA модели синтеза речи (TTS) от Xiaohongshu (RedNote). Сравнение с альтернативами, требования к железу, примеры использования и реко
12
OpenLumara: новый модульный AI-агент для локальных LLM с минимальным потреблением токенов
Обзор OpenLumara — фреймворка для локальных LLM-агентов с крошечным системным промптом и модульной архитектурой. Сравнение с альтернативами, примеры, кому подой