Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
1920
материалов
01
GGUF на стероидах: почему MagicQuant v2.0 сделает ваши модели умнее, не раздувая битность
Обзор MagicQuant v2.0 — инструмента для создания гибридных GGUF квантований с динамическими конфигурациями. Сравнение с Unsloth, примеры, бенчмарки, кому подойд
02
Новый инструмент llama-eval в llama.cpp: что это и как использовать
Новый встроенный инструмент для оценки моделей в llama.cpp от ggerganov. Запускайте MMLU, HellaSwag и другие тесты локально. Инструкция и сравнение с альтернати
03
llama.cpp server: долгожданное исправление краша mmproj + MTP (speculative decoding)
Узнайте, как в llama.cpp server наконец починили краш при использовании mmproj с многотокенной спекуляцией. Практические советы и прогнозы.
04
Запуск модели с 500k контекстом на 48GB VRAM: Nemotron-3-Super 64B-A12B и скорость 21 tok/s
Обзор модели Nemotron-3-Super 64B-A12B: 500k токенов контекста на 48GB VRAM, 21 токен/с. MoE, GGUF квантование, агентное кодирование. Сравнение с альтернативами
05
Как локальные модели ломают JSON: каталог ошибок и библиотека для восстановления
Разбираем типичные сбои JSON-вывода у локальных моделей (Llama, Qwen, Mistral) и показываем, как библиотека Loot-JSN их чинит. Примеры, код, сравнение.
06
Claude Platform on AWS: Полный гайд по настройке, IAM и биллингу
Как подключить Claude через AWS Marketplace, настроить IAM-аутентификацию, управлять агентами и отслеживать затраты. Полное руководство с примерами.
07
MiniCPM-V 4.6: карманный осьминог, который видит больше, чем вы думаете
OpenBMB выпустила MiniCPM-V 4.6 — компактную мультимодальную модель с улучшенным OCR и пониманием сцен. Сравниваем с предшественником и конкурентами.
08
ExLlamaV3 Major Updates: что нового, как обновить и почему это ускорит инференс
Разбираем крупное обновление ExLlamaV3: FP8, новый KV cache, скорость до 2x. Инструкция по обновлению и тесты на реальных моделях.
09
TextWeb: Markdown-браузер для AI-агентов – альтернатива Vision моделям
TextWeb – open-source инструмент, который превращает веб-страницы в чистый Markdown. Экономит токены, работает локально, заменяет дорогие мультимодальные модели
10
Multi-Agent AI для CNC-мастерских: разбор системы MachinaCheck на AMD MI300X
Разбираем MachinaCheck — multi-agent систему для анализа STEP-файлов на AMD MI300X. Сравнение с альтернативами, реальные кейсы, кому подойдёт.
11
Как разогнать DeepSeek-V4-Flash до 85 токенов в секунду: MTP, W4A16 и RTX PRO 6000
Гайд по настройке DeepSeek-V4-Flash с MTP-спекуляцией и квантованием W4A16+FP8: 85 tok/s на двух RTX PRO 6000. Конфиг llama.cpp, профилирование GPU, сравнение с
12
16 гигов для OCR в 2026: что реально влезет и как не нарваться на тормоза
Сравнение PaddleOCR, GLM-OCR, Nemotron OCR v2 и других моделей для видеокарт с 16 ГБ VRAM. Тесты на печатном тексте, рукописях и формулах. Рекомендации по выбор