Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 Claude Science: как Anthropic создал лабораторию в каждом ноутбуке и теперь угрожает Big Pharma Anthropic запускает Claude Science — автономный инструмент для научных открытий. Разбираем функционал, сравниваем с DeepMind и OpenAI, даем примеры использовани 6 мин чтения 02 HyperPod прокачали инференс: Observability, Hugging Face и NVMe AWS добавила в HyperPod inference observability, поддержку Hugging Face Hub, NVMe кэширование и Route 53 DNS. Разбираем, как эти фичи экономят нервы и ускоряют 4 мин чтения 03 Новый transformers бэкенд vLLM: как обновиться и получить ускорение vLLM получил нативный бэкенд HuggingFace Transformers. Бенчмарки Qwen3, команды установки, сравнение производительности. Как ускорить инференс в 2-3 раза. 7 мин чтения 04 Забудьте про хаос с API-ключами: как Claude Apps Gateway наводит порядок в AWS Полный гайд по Claude Apps Gateway для AWS: связываем Claude Code и Desktop с Bedrock, управляем политиками и контролируем затраты. Пошаговая настройка PostgreS 8 мин чтения 05 Zero-egress AI: как запускать GPU на любом облаке, а данные держать на Hugging Face (и не платить за выгрузку) Как монтировать датасеты Hugging Face через hf:// URL в SkyPilot, запускать обучение на любых облачных GPU и не платить за egress. Детали Xet dedup, примеры, ср 7 мин чтения 06 Оптимизация производительности llama.cpp: удаление 29 лишних рекомпиляций regex в режиме -sm tensor В llama.cpp b9966 исправлен баг с 29 рекомпиляциями regex при каждом шаге декодинга. Как обновление ускоряет инференс и кому оно спасёт секунды. 4 мин чтения 07 Flaxeo Image: десктопный UI для Stable Diffusion на sd.cpp — установка и обзор возможностей Подробный обзор Flaxeo Image — десктопного интерфейса для sd.cpp. Как установить, ключевые фишки, сравнение с FlaxeoUI и ComfyUI. Советы для владельцев слабых П 5 мин чтения 08 Как ускорить Qwen с помощью спекулятивного декодинга: форк sglang и модель Weaver Разбираем форк sglang и легковесную модель Weaver для спекулятивного декодирования Qwen. Как это работает, примеры команд и кому реально нужно. Инференс ускоряе 6 мин чтения 09 Однофайловый дашборд для мониторинга локальных LLM: ни одной зависимости, MIT лицензия Однофайловый дашборд без зависимостей для live мониторинга локального LLM сервера. Сравнение с альтернативами, примеры использования, кому подойдет. 3 мин чтения 10 Colibri: запуск 744-миллиардной модели GLM-5.2 на обычном ПК с 25 ГБ ОЗУ — разбор технологии и практические советы Как движок Colibri позволяет запустить гигантскую MoE модель GLM-5.2 (744B параметров) на обычном компьютере с 25 ГБ ОЗУ и NVMe. Разбор квантования, подгрузки э 5 мин чтения 11 HiLS-Attention: Tencent ломает квадратичный барьер для локальных LLM Разбираем HiLS-Attention от Tencent: chunk-wise sparse attention, 7B модель на Hugging Face, сравнение со Sliding Window и FlashAttention. Кому и зачем это нужн 6 мин чтения 12 Как получить 2.5x ускорение Qwen3.6 с NVFP4 квантизацией и Unsloth: пошаговое руководство Пошаговое руководство по квантизации Qwen3.6 в формат NVFP4 с помощью Unsloth для 2.5x ускорения инференса. Сравнение с llama.cpp, примеры кода и рекомендации. 6 мин чтения