Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4365 материалов
01 Управление режимами мышления Qwen 3 в llama.cpp: chat_template_kwargs для гибкого переключения Динамическое управление режимами мышления Qwen 3 в llama.cpp-server: параметры enable_thinking, reasoning_effort и preserve_thinking, готовые конфигурации для б 6 мин чтения 02 Лучшие инструменты для локального запуска Qwen 3.8 27B: выбор сообщества в 2026 Сравнение Ollama, MLX, vLLM и SGLang для локального запуска Qwen 3.8 27B в 2026 году. Реальные тесты скорости, баги FP8, влияние MTP и четкие рекомендации под в 5 мин чтения 03 Точная калибровка квантования Qwen3.8-27B: защита критических весов и влияние на качество Какие веса Qwen3.8-27B защищать при квантовании? Разбираем KL-дивергенцию по 14 группам, неожиданные выводы об attn_v и attn_gate, чувствительность toolcalling 7 мин чтения 04 Малые LLM 9B: практичный выбор для массового пользователя с 8 ГБ VRAM и 16 ГБ ОЗУ 9B-модели работают на 8 ГБ VRAM и 16 ГБ ОЗУ без offloading, дают 30-50 токенов/с и закрывают чат, генерацию кода и работу с документами. Сравнение с 122B, табли 6 мин чтения 05 Qwen 3.8 27B: детальный разбор возможностей, тесты на RTX 5090 и инструкция по запуску Qwen 3.8 27B: скорость до 120 т/с на RTX 5090, контекст 262K с расширением до 1M, поддержка изображений и видео. Готовые команды для llama.cpp и Docker, таблицы 7 мин чтения 06 Исправленный chat template для Qwen 27B 3.8: почему байт-точность к оригиналу критична и как избежать деградации качества Разбираем новый chat template для Qwen 27B 3.8: почему байт-идентичность с оригиналом критична для качества генерации, какие изменения внесены и как интегрирова 6 мин чтения 07 Ускорение инференса Qwen3.8-27B на Apple Silicon в 3 раза: разбор mlx-dspark и спекулятивного декодирования mlx-dspark v0.10.0 ускоряет Qwen3.8-27B на Apple Silicon до 3 раз: 20-27 токенов/с в 8-бит против 14.6 в 4-бит. Разбор архитектуры, тесты на M4 Pro, интеграции. 6 мин чтения 08 Qwen3.8 27B Heretic: локальная модель уровня Opus 4.6 без цензуры — что это значит для индустрии? Qwen3.8 27B Heretic — неофициальная модификация без цензуры с заявленной производительностью уровня Opus 4.6. Разбираем технические детали, риски, сценарии прим 10 мин чтения 09 Супертреды для AI-релизов: как навести порядок в новостях о моделях в 2026 году Как модерировать AI-сообщества с помощью супертредов: критерии отбора релизов, готовые шаблоны, примеры с Reddit и Hacker News. Экономьте время разработчиков и 7 мин чтения 10 Qwen3.8-27B: Почему режим xhigh генерирует в 5 раз больше токенов, чем medium? Практический тест Qwen3.8-27B на RTX 2080 Ti: medium выдаёт несколько тысяч токенов, xhigh — 15-20 тысяч, иногда 40 тысяч. Разбираем, баг это или фича, как это 6 мин чтения 11 Рекуррентная модель Pathway с латентным рассуждением: прорыв в эффективности на ARC-AGI-1 Pathway представила рекуррентную модель на 150M параметров с результатом 29.5% на ARC-AGI-1. Стоимость инференса — $0.0007 за задачу. Разбираем архитектуру, рез 8 мин чтения 12 Как создать ретро-игру за минуты: практический разбор Qwen 3.8 27B на двух RTX 3090 Практический разбор генерации ретро-игры RetroCraft с помощью Qwen 3.8 27B на двух RTX 3090. Точные метрики скорости, конфигурация инференса и влияние reasoning 8 мин чтения