Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

241 Grok и защита от злоупотреблений: как xAI реагирует на обвинения в генерации CSAM Иск против xAI: Grok обвиняется в генерации 7000 CSAM-изображений на основе реальных фото. Разбираем технические уязвимости, меры защиты и правовые последствия 9 мин чтения 242 RTX 5060 Ti для локальных LLM: практические пресеты и харнесс для проверки длинного контекста Проверенные пресеты для Qwen3.8 27B на одной или двух RTX 5060 Ti 16GB: скорости декодирования и префилла, ограничения замеров и высококонтекстный харнесс для п 5 мин чтения 243 Gemma 120B: стратегический ход Google против OpenAI и Anthropic Google готовит открытую мультимодальную модель Gemma на 120B параметров. Разбираем технические характеристики, влияние на OpenAI и Anthropic перед IPO и почему 6 мин чтения 244 Управление режимами мышления Qwen 3 в llama.cpp: chat_template_kwargs для гибкого переключения Динамическое управление режимами мышления Qwen 3 в llama.cpp-server: параметры enable_thinking, reasoning_effort и preserve_thinking, готовые конфигурации для б 6 мин чтения 245 Лучшие инструменты для локального запуска Qwen 3.8 27B: выбор сообщества в 2026 Сравнение Ollama, MLX, vLLM и SGLang для локального запуска Qwen 3.8 27B в 2026 году. Реальные тесты скорости, баги FP8, влияние MTP и четкие рекомендации под в 5 мин чтения 246 Точная калибровка квантования Qwen3.8-27B: защита критических весов и влияние на качество Какие веса Qwen3.8-27B защищать при квантовании? Разбираем KL-дивергенцию по 14 группам, неожиданные выводы об attn_v и attn_gate, чувствительность toolcalling 7 мин чтения 247 Малые LLM 9B: практичный выбор для массового пользователя с 8 ГБ VRAM и 16 ГБ ОЗУ 9B-модели работают на 8 ГБ VRAM и 16 ГБ ОЗУ без offloading, дают 30-50 токенов/с и закрывают чат, генерацию кода и работу с документами. Сравнение с 122B, табли 6 мин чтения 248 Qwen 3.8 27B: детальный разбор возможностей, тесты на RTX 5090 и инструкция по запуску Qwen 3.8 27B: скорость до 120 т/с на RTX 5090, контекст 262K с расширением до 1M, поддержка изображений и видео. Готовые команды для llama.cpp и Docker, таблицы 7 мин чтения 249 Исправленный chat template для Qwen 27B 3.8: почему байт-точность к оригиналу критична и как избежать деградации качества Разбираем новый chat template для Qwen 27B 3.8: почему байт-идентичность с оригиналом критична для качества генерации, какие изменения внесены и как интегрирова 6 мин чтения 250 Ускорение инференса Qwen3.8-27B на Apple Silicon в 3 раза: разбор mlx-dspark и спекулятивного декодирования mlx-dspark v0.10.0 ускоряет Qwen3.8-27B на Apple Silicon до 3 раз: 20-27 токенов/с в 8-бит против 14.6 в 4-бит. Разбор архитектуры, тесты на M4 Pro, интеграции. 6 мин чтения 251 Qwen3.8 27B Heretic: локальная модель уровня Opus 4.6 без цензуры — что это значит для индустрии? Qwen3.8 27B Heretic — неофициальная модификация без цензуры с заявленной производительностью уровня Opus 4.6. Разбираем технические детали, риски, сценарии прим 10 мин чтения 252 Супертреды для AI-релизов: как навести порядок в новостях о моделях в 2026 году Как модерировать AI-сообщества с помощью супертредов: критерии отбора релизов, готовые шаблоны, примеры с Reddit и Hacker News. Экономьте время разработчиков и 7 мин чтения