Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 Hy3 (hy_v3) врывается в llama.cpp: MTP-декадирование на стероидах Разбор новой модели Hy3 в llama.cpp с Multi-Token Prediction. Как это ускоряет инференс, сравнение с классическим спекулятивным декодированием, примеры сборки и 3 мин чтения 02 Как построить agentic AI на Amazon Bedrock: кейс Bluesight для больниц Разбираем архитектуру agentic AI на Amazon Bedrock на примере Bluesight. Как многоагентная система помогла больницам спастись от штрафов за 340B compliance. 6 мин чтения 03 Локальный AI на вашей видеокарте: Nvidia, Osmantic, Roboflow и другие меняют правила игры Почему запуск LLM и моделей зрения локально вытесняет облака? Обзор свежих инструментов: Nvidia RTX, Osmantic, Roboflow, EXO Labs. Примеры, сравнение, советы. 1 мин чтения 04 Flint: как сжать рассуждения LLM до размеров таблетки и не потерять мозги Разбираем Flint — новый метод сжатия цепочек рассуждений для локальных LLM. Тесты, сравнение с квантованием и дистилляцией, примеры на 13.07.2026. 5 мин чтения 05 Запуск Hy3 на 10 ГБ видеопамяти: порт Colibri для стриминга Новый порт Colibri позволяет запускать Hy3 на картах с 10 ГБ VRAM. Сравнение с квантованием, примеры использования, советы по стримингу. Кому подойдет инструмен 5 мин чтения 06 AMD Strix Halo для AI: запуск 34 контейнеров и 70 tok/s Qwen3.6 на Beelink GTR9 Pro Запуск 34 Docker контейнеров с AI-моделями и 70 токенов/с на Qwen3.6. Тесты Beelink GTR9 Pro на Strix Halo: ROCm, Docker, локальный инференс. Реальные цифры для 6 мин чтения 07 Запуск Qwen-3.6-27B на iPhone: обзор технологии сжатия PrismML и перспективы локальных LLM Как стартап PrismML сжал 27-миллиардную модель Qwen до размеров, работающих на iPhone. Сравнение с Bonsai и TurboQuant, бенчмарки, перспективы on-device AI. 5 мин чтения 08 llama.cpp b9978: Исправление бага чекпоинтов контекста, которое спасает агентов от "амнезии" Фикс в llama.cpp b9978 устраняет коллапс окна контекста при tool calling. Экономит память и ускоряет агентные циклы. Разбор проблемы и практические примеры. 5 мин чтения 09 Как запустить Hunyuan3D-Paint на Mac (Apple Silicon): локальная генерация 3D из изображения за 20 секунд Пошаговый гайд по запуску Hunyuan3D-Paint на Mac M1/M2/M3/M4. Локальная генерация текстурированных 3D-моделей из одного изображения. Работает через MLX, всего 8 6 мин чтения 10 Zer0Fit: Google TabFM и TimesFM на локальном MCP-сервере — zero-shot ML без боли Как запустить foundation-модели Google TabFM и TimesFM локально через MCP-сервер с помощью Zer0Fit. Прогнозы, классификация и регрессия без обучения — zero-shot 6 мин чтения 11 Voodoo Quant: магия, которая срезает KL Divergence на 95% по сравнению с Unsloth Dynamic 2.0 для Qwen3.5 Voodoo Quant снижает KL Divergence на 95% относительно Unsloth Dynamic 2.0 для Qwen3.5. Полный обзор, бенчмарки, примеры квантования и кому это реально нужно. 4 мин чтения 12 Как исправить тихую неточность вычислений на Tesla P100 в llama.cpp с помощью TurboQuant Обнаружен баг в llama.cpp, который тихо портит вычисления на Tesla P100. TurboQuant v0.3.0 исправляет это. Инструкция по установке и проверке качества. 5 мин чтения