Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
1920
материалов
01
Hy3 (hy_v3) врывается в llama.cpp: MTP-декадирование на стероидах
Разбор новой модели Hy3 в llama.cpp с Multi-Token Prediction. Как это ускоряет инференс, сравнение с классическим спекулятивным декодированием, примеры сборки и
02
Как построить agentic AI на Amazon Bedrock: кейс Bluesight для больниц
Разбираем архитектуру agentic AI на Amazon Bedrock на примере Bluesight. Как многоагентная система помогла больницам спастись от штрафов за 340B compliance.
03
Локальный AI на вашей видеокарте: Nvidia, Osmantic, Roboflow и другие меняют правила игры
Почему запуск LLM и моделей зрения локально вытесняет облака? Обзор свежих инструментов: Nvidia RTX, Osmantic, Roboflow, EXO Labs. Примеры, сравнение, советы.
04
Flint: как сжать рассуждения LLM до размеров таблетки и не потерять мозги
Разбираем Flint — новый метод сжатия цепочек рассуждений для локальных LLM. Тесты, сравнение с квантованием и дистилляцией, примеры на 13.07.2026.
05
Запуск Hy3 на 10 ГБ видеопамяти: порт Colibri для стриминга
Новый порт Colibri позволяет запускать Hy3 на картах с 10 ГБ VRAM. Сравнение с квантованием, примеры использования, советы по стримингу. Кому подойдет инструмен
06
AMD Strix Halo для AI: запуск 34 контейнеров и 70 tok/s Qwen3.6 на Beelink GTR9 Pro
Запуск 34 Docker контейнеров с AI-моделями и 70 токенов/с на Qwen3.6. Тесты Beelink GTR9 Pro на Strix Halo: ROCm, Docker, локальный инференс. Реальные цифры для
07
Запуск Qwen-3.6-27B на iPhone: обзор технологии сжатия PrismML и перспективы локальных LLM
Как стартап PrismML сжал 27-миллиардную модель Qwen до размеров, работающих на iPhone. Сравнение с Bonsai и TurboQuant, бенчмарки, перспективы on-device AI.
08
llama.cpp b9978: Исправление бага чекпоинтов контекста, которое спасает агентов от "амнезии"
Фикс в llama.cpp b9978 устраняет коллапс окна контекста при tool calling. Экономит память и ускоряет агентные циклы. Разбор проблемы и практические примеры.
09
Как запустить Hunyuan3D-Paint на Mac (Apple Silicon): локальная генерация 3D из изображения за 20 секунд
Пошаговый гайд по запуску Hunyuan3D-Paint на Mac M1/M2/M3/M4. Локальная генерация текстурированных 3D-моделей из одного изображения. Работает через MLX, всего 8
10
Zer0Fit: Google TabFM и TimesFM на локальном MCP-сервере — zero-shot ML без боли
Как запустить foundation-модели Google TabFM и TimesFM локально через MCP-сервер с помощью Zer0Fit. Прогнозы, классификация и регрессия без обучения — zero-shot
11
Voodoo Quant: магия, которая срезает KL Divergence на 95% по сравнению с Unsloth Dynamic 2.0 для Qwen3.5
Voodoo Quant снижает KL Divergence на 95% относительно Unsloth Dynamic 2.0 для Qwen3.5. Полный обзор, бенчмарки, примеры квантования и кому это реально нужно.
12
Как исправить тихую неточность вычислений на Tesla P100 в llama.cpp с помощью TurboQuant
Обнаружен баг в llama.cpp, который тихо портит вычисления на Tesla P100. TurboQuant v0.3.0 исправляет это. Инструкция по установке и проверке качества.