Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4376
материалов
01
Дистилляция LLM: что это, зачем бизнесу и как работает сжатие моделей без потери качества
Как дистилляция LLM снижает затраты на инференс в 25-30 раз и позволяет запускать AI на мобильных устройствах. Разбираем процесс, риски потери точности, примеры
02
Запуск DeepSeek V4 Flash на двух RTX 4090: 105 t/s через порт Blackwell-ядер на Ada в vLLM
Портировали Blackwell-ядра DeepGEMM, FlashInfer sparse-MLA и block-scaled FP8 на Ada через Triton и запустили DeepSeek V4 Flash на двух RTX 4090 с пропускной сп
03
Голосовой режим Claude получил выбор моделей и интеграции с Gmail, Calendar, Slack и Notion
Голосовой режим Claude теперь позволяет выбирать модель (Opus, Sonnet, Haiku) и выполнять действия через Gmail, Google Calendar, Slack, Canva и Notion. Разбирае
04
Локальный Hugging Face на NAS: кэширование моделей для AI-рига
Сократите время загрузки моделей с часов до секунд: настройка локального кэша Hugging Face на NAS с 10GbE. Практическая архитектура, скрипты синхронизации и бен
05
AntLing-3.0-flash: быстрая модель от InclusionAI — бесплатное тестирование на OpenRouter
AntLing-3.0-flash от InclusionAI — легковесная модель для быстрого инференса с бесплатным доступом на OpenRouter до 3 августа 2026. Разбираем архитектуру, пишем
06
DIY PWM-контроллер для сервера локального AI: как автор «ghetto server» решал проблему охлаждения в 2026
Собрали ШИМ-контроллер для серверных вентиляторов за $8 и вечер работы. Снижение шума на 14 дБА, экономия энергии 22%, полная схема, прошивка и честный разбор к
07
Три стратегии дизайн-вкуса у AI: как GPT-5.6 Sol, Kimi K3 и GLM 5.2 обходят «типичный ИИ-дизайн»
Разбираем три подхода к генерации веб-дизайна: подавление антипаттернов (GPT-5.6 Sol), отсутствие штампов (GLM 5.2) и симуляция итеративного тестирования (Kimi
08
Тест Gemma 4 на Apple M5 Pro: 60 токенов/с для backend, но провал в UI/UX
Практический тест Gemma 4 (26B A4B, Q6) на Apple M5 Pro с 48 ГБ ОЗУ. Стабильные 60 токенов/с, уверенная генерация backend-кода в OpenCode и полный провал в UI/U
09
AntLing-3.0-flash: гибридная MoE-модель для продакшн-агентов — обзор архитектуры и бенчмарков
Детальный разбор AntLing-3.0-flash: архитектура hybrid-reasoning и Mixture of Experts, результаты бенчмарков, сравнение с аналогами, доступ через OpenRouter и п
10
AMD Helios: rack-scale AI-кластер, бросающий вызов Nvidia Vera Rubin
Детальный разбор AMD Helios — rack-scale AI-кластера, который превосходит Nvidia Vera Rubin по пропускной способности памяти на ватт и масштабируемости инференс
11
Почему Laguna-S-2.1 зацикливается: разбор проблемы и решение через MoE-aware квантизацию
Laguna-S-2.1 уходит в бесконечный цикл мышления при низкобитной квантизации? Разбираем причину — деградацию shared expert и attention — и даём решение: MoE-awar
12
Сравнение локальных моделей и их квантизаций на бенчмарке SWE-Verified: данные и выводы
Детальный разбор производительности локальных LLM и их квантизаций на бенчмарке SWE-Verified. Графики, метрики, код на Python и практические рекомендации по выб