Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4365 материалов
01 Максимальная производительность vLLM на 4x RTX 5060 Ti: настройка NVFP4, устранение OOM и оптимизация скорости инференса Запускаем unsloth/Qwen3.6-27B-NVFP4 на 4x RTX 5060 Ti с vLLM: готовая конфигурация для 70-80 t/s генерации, решение OOM через MAX_JOBS и gpu_memory_utilization, 9 мин чтения 02 PromptCTL: Как статический анализатор для промптов предотвращает падение продакшна из-за переименования переменной Переименовали переменную в шаблоне промпта и обрушили продакшн? PromptCTL ловит ошибки KeyError на этапе CI/CD. Три этапа проверки — PromptDiff, Contract Valida 8 мин чтения 03 llama.cpp: автоматическая загрузка тензоров MTP увеличивает потребление VRAM — что изменилось и как с этим работать В новых сборках llama.cpp тензоры MTP/NextN загружаются автоматически, даже без спекулятивного декодирования. Расход VRAM растет на объем слоя MoE. Разбираем за 6 мин чтения 04 Карусель открытых весов не останавливается: какие новые модели появились в 2026 году Mistral 3.1, Qwen3 и DeepSeek-V4 Pro: разбор свежих open-weights релизов 2026 года. Бенчмарки, скорость инференса на H100 и RTX 4090, готовые сниппеты для загру 7 мин чтения 05 Дата-агенты в бизнес-аналитике: как Dora автоматизирует цепочку от алерта до действия Дата-агент Dora от FanRuan замыкает цикл от алерта до действия за 90 секунд: автоматический анализ первопричин, drill-down по измерениям и доставка отчёта ответ 9 мин чтения 06 Квантизация Kimi K3 в GGUF Q3_K_S: 1.1 ТБ на диске и инференс на CPU — стоит ли игра свеч? Kimi K3 (2.8T параметров) квантизирована в GGUF Q3_K_S: 1114 ГиБ на диске, инференс на AMD EPYC 9554P с 1.5 ТБ ОЗУ выдаёт 4.21 t/s. Разбор архитектуры, тесты на 9 мин чтения 07 Lyria 3.5 в Google Flow Music: что нового в музыкальной генерации Lyria 3.5 в Google Flow Music: улучшенный вокал с 12 эмоциональными стилями, жёсткий контроль BPM и структуры трека, генерация до 5 минут. Сравнили с Suno и Udi 6 мин чтения 08 Выбор нейросетевой модели: практическое руководство по критериям и методологии Шесть критериев выбора нейросетевой модели с цифрами и примерами: производительность на своих данных, расчёт TCO инференса, доменная специализация, безопасность 9 мин чтения 09 Алиса в поиске: как на самом деле работают голосовые ответы Яндекса и почему позиция в выдаче важнее разметки Корректная speakable-разметка не гарантирует попадания в голосовые ответы Алисы, если страница не входит в топ-20 Яндекса. Разбираем реальный кейс, цепочку отбо 8 мин чтения 10 Deep Agents v0.7: как LangChain сократил входные токены на 65% и отдал контроль разработчикам Deep Agents v0.7 сокращает входные токены на 65% — с ~6k до ~2k. Разбор архитектурных изменений, тесты на GPT-5.6 Luna и Claude Opus, примеры кастомных промптов 8 мин чтения 11 Модели, которые остались: что реально используют специалисты AI спустя месяц после ажиотажа Какие нейросети реально используют специалисты после хайпа? Разбираем Qwen3.6 27B, Ling-3.0-flash и DeepSeek-V3 — модели, оставшиеся в рабочих процессах. Практи 7 мин чтения 12 Qwen 3.7 Flash на OpenRouter: тесты, бенчмарки и сравнение с Qwen 3.6 27B Протестировали Qwen 3.7 Flash на OpenRouter: скорость инференса выросла на 63%, цена снизилась вдвое, но логические задачи страдают. Сравнение с Qwen 3.6 27B в 7 мин чтения