Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4376 материалов
01 Дистилляция LLM: что это, зачем бизнесу и как работает сжатие моделей без потери качества Как дистилляция LLM снижает затраты на инференс в 25-30 раз и позволяет запускать AI на мобильных устройствах. Разбираем процесс, риски потери точности, примеры 8 мин чтения 02 Запуск DeepSeek V4 Flash на двух RTX 4090: 105 t/s через порт Blackwell-ядер на Ada в vLLM Портировали Blackwell-ядра DeepGEMM, FlashInfer sparse-MLA и block-scaled FP8 на Ada через Triton и запустили DeepSeek V4 Flash на двух RTX 4090 с пропускной сп 9 мин чтения 03 Голосовой режим Claude получил выбор моделей и интеграции с Gmail, Calendar, Slack и Notion Голосовой режим Claude теперь позволяет выбирать модель (Opus, Sonnet, Haiku) и выполнять действия через Gmail, Google Calendar, Slack, Canva и Notion. Разбирае 5 мин чтения 04 Локальный Hugging Face на NAS: кэширование моделей для AI-рига Сократите время загрузки моделей с часов до секунд: настройка локального кэша Hugging Face на NAS с 10GbE. Практическая архитектура, скрипты синхронизации и бен 7 мин чтения 05 AntLing-3.0-flash: быстрая модель от InclusionAI — бесплатное тестирование на OpenRouter AntLing-3.0-flash от InclusionAI — легковесная модель для быстрого инференса с бесплатным доступом на OpenRouter до 3 августа 2026. Разбираем архитектуру, пишем 7 мин чтения 06 DIY PWM-контроллер для сервера локального AI: как автор «ghetto server» решал проблему охлаждения в 2026 Собрали ШИМ-контроллер для серверных вентиляторов за $8 и вечер работы. Снижение шума на 14 дБА, экономия энергии 22%, полная схема, прошивка и честный разбор к 8 мин чтения 07 Три стратегии дизайн-вкуса у AI: как GPT-5.6 Sol, Kimi K3 и GLM 5.2 обходят «типичный ИИ-дизайн» Разбираем три подхода к генерации веб-дизайна: подавление антипаттернов (GPT-5.6 Sol), отсутствие штампов (GLM 5.2) и симуляция итеративного тестирования (Kimi 8 мин чтения 08 Тест Gemma 4 на Apple M5 Pro: 60 токенов/с для backend, но провал в UI/UX Практический тест Gemma 4 (26B A4B, Q6) на Apple M5 Pro с 48 ГБ ОЗУ. Стабильные 60 токенов/с, уверенная генерация backend-кода в OpenCode и полный провал в UI/U 8 мин чтения 09 AntLing-3.0-flash: гибридная MoE-модель для продакшн-агентов — обзор архитектуры и бенчмарков Детальный разбор AntLing-3.0-flash: архитектура hybrid-reasoning и Mixture of Experts, результаты бенчмарков, сравнение с аналогами, доступ через OpenRouter и п 10 мин чтения 10 AMD Helios: rack-scale AI-кластер, бросающий вызов Nvidia Vera Rubin Детальный разбор AMD Helios — rack-scale AI-кластера, который превосходит Nvidia Vera Rubin по пропускной способности памяти на ватт и масштабируемости инференс 8 мин чтения 11 Почему Laguna-S-2.1 зацикливается: разбор проблемы и решение через MoE-aware квантизацию Laguna-S-2.1 уходит в бесконечный цикл мышления при низкобитной квантизации? Разбираем причину — деградацию shared expert и attention — и даём решение: MoE-awar 7 мин чтения 12 Сравнение локальных моделей и их квантизаций на бенчмарке SWE-Verified: данные и выводы Детальный разбор производительности локальных LLM и их квантизаций на бенчмарке SWE-Verified. Графики, метрики, код на Python и практические рекомендации по выб 9 мин чтения