Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4365
материалов
01
Максимальная производительность vLLM на 4x RTX 5060 Ti: настройка NVFP4, устранение OOM и оптимизация скорости инференса
Запускаем unsloth/Qwen3.6-27B-NVFP4 на 4x RTX 5060 Ti с vLLM: готовая конфигурация для 70-80 t/s генерации, решение OOM через MAX_JOBS и gpu_memory_utilization,
02
PromptCTL: Как статический анализатор для промптов предотвращает падение продакшна из-за переименования переменной
Переименовали переменную в шаблоне промпта и обрушили продакшн? PromptCTL ловит ошибки KeyError на этапе CI/CD. Три этапа проверки — PromptDiff, Contract Valida
03
llama.cpp: автоматическая загрузка тензоров MTP увеличивает потребление VRAM — что изменилось и как с этим работать
В новых сборках llama.cpp тензоры MTP/NextN загружаются автоматически, даже без спекулятивного декодирования. Расход VRAM растет на объем слоя MoE. Разбираем за
04
Карусель открытых весов не останавливается: какие новые модели появились в 2026 году
Mistral 3.1, Qwen3 и DeepSeek-V4 Pro: разбор свежих open-weights релизов 2026 года. Бенчмарки, скорость инференса на H100 и RTX 4090, готовые сниппеты для загру
05
Дата-агенты в бизнес-аналитике: как Dora автоматизирует цепочку от алерта до действия
Дата-агент Dora от FanRuan замыкает цикл от алерта до действия за 90 секунд: автоматический анализ первопричин, drill-down по измерениям и доставка отчёта ответ
06
Квантизация Kimi K3 в GGUF Q3_K_S: 1.1 ТБ на диске и инференс на CPU — стоит ли игра свеч?
Kimi K3 (2.8T параметров) квантизирована в GGUF Q3_K_S: 1114 ГиБ на диске, инференс на AMD EPYC 9554P с 1.5 ТБ ОЗУ выдаёт 4.21 t/s. Разбор архитектуры, тесты на
07
Lyria 3.5 в Google Flow Music: что нового в музыкальной генерации
Lyria 3.5 в Google Flow Music: улучшенный вокал с 12 эмоциональными стилями, жёсткий контроль BPM и структуры трека, генерация до 5 минут. Сравнили с Suno и Udi
08
Выбор нейросетевой модели: практическое руководство по критериям и методологии
Шесть критериев выбора нейросетевой модели с цифрами и примерами: производительность на своих данных, расчёт TCO инференса, доменная специализация, безопасность
09
Алиса в поиске: как на самом деле работают голосовые ответы Яндекса и почему позиция в выдаче важнее разметки
Корректная speakable-разметка не гарантирует попадания в голосовые ответы Алисы, если страница не входит в топ-20 Яндекса. Разбираем реальный кейс, цепочку отбо
10
Deep Agents v0.7: как LangChain сократил входные токены на 65% и отдал контроль разработчикам
Deep Agents v0.7 сокращает входные токены на 65% — с ~6k до ~2k. Разбор архитектурных изменений, тесты на GPT-5.6 Luna и Claude Opus, примеры кастомных промптов
11
Модели, которые остались: что реально используют специалисты AI спустя месяц после ажиотажа
Какие нейросети реально используют специалисты после хайпа? Разбираем Qwen3.6 27B, Ling-3.0-flash и DeepSeek-V3 — модели, оставшиеся в рабочих процессах. Практи
12
Qwen 3.7 Flash на OpenRouter: тесты, бенчмарки и сравнение с Qwen 3.6 27B
Протестировали Qwen 3.7 Flash на OpenRouter: скорость инференса выросла на 63%, цена снизилась вдвое, но логические задачи страдают. Сравнение с Qwen 3.6 27B в