Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 vllm-doctor: когда vLLM заболел, вызывайте диагноста с CLI Обзор vllm-doctor — утилиты для мониторинга и диагностики инференс-серверов vLLM. Команды, метрики, сравнение с альтернативами и примеры использования. 4 мин чтения 02 PyTorch MoE/MoD Training Framework: кастомные CUDA-ядра, DeepSpeed и ускорение в 7 раз на T4 Обзор открытого фреймворка для обучения MoE/MoD-моделей с кастомными CUDA-кернелами и DeepSpeed. Ускорение до 7x на T4, лицензия Apache 2.0. Кому нужен и как ра 6 мин чтения 03 Landforge: ваш лендинг за 10 минут — с SEO, A/B-тестами и Claude Code Skills Обзор open-source инструмента Landforge — лендинги на Claude Code Skills, встроенная SEO-оптимизация, A/B-тесты и автодеплой. Сравнение с альтернативами, пример 6 мин чтения 04 PLC Smart Splitter: как open-source тупой парсер ТЗ из АСУ ТП обогнал инженеров с Excel Обзор PLC Smart Splitter — инструмента на Python Flask для автоматического парсинга ТЗ, генерации IOLIST и интеграции с PLC Studio. Сравнение с ручным разбором 7 мин чтения 05 Строим самоподдерживающуюся Wiki-базу знаний на LLM: реализация MCP-сервера с графовым хранилищем Пошаговое руководство по созданию production-ready базы знаний на основе MCP-сервера, типизированных связей и гибридного поиска. Забудьте про RAG. 6 мин чтения 06 EVA-Bench 2.0: что нового в бенчмарке для enterprise voice-агентов и как его использовать EVA-Bench 2.0 — открытый датасет с 213 реалистичными сценариями для оценки голосовых агентов. Три домена: авиакомпании, IT-поддержка, HR. Код загрузки на Python 5 мин чтения 07 Holo3.1: Локальные компьютерные агенты с поддержкой квантований FP8 и GGUF — обзор и производительность Разбираем Holo3.1 — open-source агент для компьютера с квантизациями FP8 и GGUF. Производительность 82% на OSWorld, запуск на 3090. Обзор и сравнение. 4 мин чтения 08 Mellum2: Обзор новой 12B MoE модели от JetBrains — производительность, квантование и применение для кода Подробный обзор Mellum2 — 12B MoE модели от JetBrains с открытой лицензией Apache 2.0. Бенчмарки, квантование, запуск на CPU/GPU, примеры для кода и RAG. Реальн 7 мин чтения 09 MoQ и GSQ: революция в низкобитном квантовании GGUF — как это улучшит запуск моделей на слабом железе Новые методы квантования MoQ и GSQ в GGUF позволяют запускать модели на 4 ГБ VRAM с минимальной потерей качества. Разбор, сравнение, практика. 6 мин чтения 10 StepFun 3.7 Flash на Strix Halo: бенчмарки, MTP и настройка производительности Тесты StepFun 3.7 Flash на AMD Strix Halo: скорость генерации, MTP-ускорение до 111%, настройка квантования UD-IQ4_XS. Команды и результаты. 4 мин чтения 11 dots.tts 2B: SOTA TTS от RedNote — обзор возможностей и перспективы локального запуска Обзор dots.tts 2B — новой SOTA модели синтеза речи (TTS) от Xiaohongshu (RedNote). Сравнение с альтернативами, требования к железу, примеры использования и реко 6 мин чтения 12 OpenLumara: новый модульный AI-агент для локальных LLM с минимальным потреблением токенов Обзор OpenLumara — фреймворка для локальных LLM-агентов с крошечным системным промптом и модульной архитектурой. Сравнение с альтернативами, примеры, кому подой 1 мин чтения