Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
1920
материалов
01
Claude Science: как Anthropic создал лабораторию в каждом ноутбуке и теперь угрожает Big Pharma
Anthropic запускает Claude Science — автономный инструмент для научных открытий. Разбираем функционал, сравниваем с DeepMind и OpenAI, даем примеры использовани
02
HyperPod прокачали инференс: Observability, Hugging Face и NVMe
AWS добавила в HyperPod inference observability, поддержку Hugging Face Hub, NVMe кэширование и Route 53 DNS. Разбираем, как эти фичи экономят нервы и ускоряют
03
Новый transformers бэкенд vLLM: как обновиться и получить ускорение
vLLM получил нативный бэкенд HuggingFace Transformers. Бенчмарки Qwen3, команды установки, сравнение производительности. Как ускорить инференс в 2-3 раза.
04
Забудьте про хаос с API-ключами: как Claude Apps Gateway наводит порядок в AWS
Полный гайд по Claude Apps Gateway для AWS: связываем Claude Code и Desktop с Bedrock, управляем политиками и контролируем затраты. Пошаговая настройка PostgreS
05
Zero-egress AI: как запускать GPU на любом облаке, а данные держать на Hugging Face (и не платить за выгрузку)
Как монтировать датасеты Hugging Face через hf:// URL в SkyPilot, запускать обучение на любых облачных GPU и не платить за egress. Детали Xet dedup, примеры, ср
06
Оптимизация производительности llama.cpp: удаление 29 лишних рекомпиляций regex в режиме -sm tensor
В llama.cpp b9966 исправлен баг с 29 рекомпиляциями regex при каждом шаге декодинга. Как обновление ускоряет инференс и кому оно спасёт секунды.
07
Flaxeo Image: десктопный UI для Stable Diffusion на sd.cpp — установка и обзор возможностей
Подробный обзор Flaxeo Image — десктопного интерфейса для sd.cpp. Как установить, ключевые фишки, сравнение с FlaxeoUI и ComfyUI. Советы для владельцев слабых П
08
Как ускорить Qwen с помощью спекулятивного декодинга: форк sglang и модель Weaver
Разбираем форк sglang и легковесную модель Weaver для спекулятивного декодирования Qwen. Как это работает, примеры команд и кому реально нужно. Инференс ускоряе
09
Однофайловый дашборд для мониторинга локальных LLM: ни одной зависимости, MIT лицензия
Однофайловый дашборд без зависимостей для live мониторинга локального LLM сервера. Сравнение с альтернативами, примеры использования, кому подойдет.
10
Colibri: запуск 744-миллиардной модели GLM-5.2 на обычном ПК с 25 ГБ ОЗУ — разбор технологии и практические советы
Как движок Colibri позволяет запустить гигантскую MoE модель GLM-5.2 (744B параметров) на обычном компьютере с 25 ГБ ОЗУ и NVMe. Разбор квантования, подгрузки э
11
HiLS-Attention: Tencent ломает квадратичный барьер для локальных LLM
Разбираем HiLS-Attention от Tencent: chunk-wise sparse attention, 7B модель на Hugging Face, сравнение со Sliding Window и FlashAttention. Кому и зачем это нужн
12
Как получить 2.5x ускорение Qwen3.6 с NVFP4 квантизацией и Unsloth: пошаговое руководство
Пошаговое руководство по квантизации Qwen3.6 в формат NVFP4 с помощью Unsloth для 2.5x ускорения инференса. Сравнение с llama.cpp, примеры кода и рекомендации.