Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 GGUF на стероидах: почему MagicQuant v2.0 сделает ваши модели умнее, не раздувая битность Обзор MagicQuant v2.0 — инструмента для создания гибридных GGUF квантований с динамическими конфигурациями. Сравнение с Unsloth, примеры, бенчмарки, кому подойд 5 мин чтения 02 Новый инструмент llama-eval в llama.cpp: что это и как использовать Новый встроенный инструмент для оценки моделей в llama.cpp от ggerganov. Запускайте MMLU, HellaSwag и другие тесты локально. Инструкция и сравнение с альтернати 5 мин чтения 03 llama.cpp server: долгожданное исправление краша mmproj + MTP (speculative decoding) Узнайте, как в llama.cpp server наконец починили краш при использовании mmproj с многотокенной спекуляцией. Практические советы и прогнозы. 4 мин чтения 04 Запуск модели с 500k контекстом на 48GB VRAM: Nemotron-3-Super 64B-A12B и скорость 21 tok/s Обзор модели Nemotron-3-Super 64B-A12B: 500k токенов контекста на 48GB VRAM, 21 токен/с. MoE, GGUF квантование, агентное кодирование. Сравнение с альтернативами 4 мин чтения 05 Как локальные модели ломают JSON: каталог ошибок и библиотека для восстановления Разбираем типичные сбои JSON-вывода у локальных моделей (Llama, Qwen, Mistral) и показываем, как библиотека Loot-JSN их чинит. Примеры, код, сравнение. 6 мин чтения 06 Claude Platform on AWS: Полный гайд по настройке, IAM и биллингу Как подключить Claude через AWS Marketplace, настроить IAM-аутентификацию, управлять агентами и отслеживать затраты. Полное руководство с примерами. 6 мин чтения 07 MiniCPM-V 4.6: карманный осьминог, который видит больше, чем вы думаете OpenBMB выпустила MiniCPM-V 4.6 — компактную мультимодальную модель с улучшенным OCR и пониманием сцен. Сравниваем с предшественником и конкурентами. 5 мин чтения 08 ExLlamaV3 Major Updates: что нового, как обновить и почему это ускорит инференс Разбираем крупное обновление ExLlamaV3: FP8, новый KV cache, скорость до 2x. Инструкция по обновлению и тесты на реальных моделях. 5 мин чтения 09 TextWeb: Markdown-браузер для AI-агентов – альтернатива Vision моделям TextWeb – open-source инструмент, который превращает веб-страницы в чистый Markdown. Экономит токены, работает локально, заменяет дорогие мультимодальные модели 4 мин чтения 10 Multi-Agent AI для CNC-мастерских: разбор системы MachinaCheck на AMD MI300X Разбираем MachinaCheck — multi-agent систему для анализа STEP-файлов на AMD MI300X. Сравнение с альтернативами, реальные кейсы, кому подойдёт. 5 мин чтения 11 Как разогнать DeepSeek-V4-Flash до 85 токенов в секунду: MTP, W4A16 и RTX PRO 6000 Гайд по настройке DeepSeek-V4-Flash с MTP-спекуляцией и квантованием W4A16+FP8: 85 tok/s на двух RTX PRO 6000. Конфиг llama.cpp, профилирование GPU, сравнение с 7 мин чтения 12 16 гигов для OCR в 2026: что реально влезет и как не нарваться на тормоза Сравнение PaddleOCR, GLM-OCR, Nemotron OCR v2 и других моделей для видеокарт с 16 ГБ VRAM. Тесты на печатном тексте, рукописях и формулах. Рекомендации по выбор 5 мин чтения