Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4377
материалов
01
Экономика инференса LLM: почему дорогие модели стоят дорого и как это влияет на лимиты
Глубокий разбор факторов стоимости вывода LLM: от архитектуры Dense vs MoE до KV-cache и reasoning-токенов. Как это формирует лимиты API и как оптимизировать за
02
Как настроить ESP-Claw на ESP32-S3: превращаем микроконтроллер в ИИ-агента для умного дома
Полный гайд по настройке ESP-Claw на ESP32-S3: подключение к LLM через OpenRouter, управление Tuya-устройствами, развертывание Open WebUI. Никакого облака — тол
03
Tokenminning: как сократить расходы на AI-агентов, минимизируя токены без потери качества
Практическое руководство по оптимизации токенов в AI-агентах. Методы сжатия промптов, кэширование, маршрутизация запросов и реальные кейсы экономии до 60%.
04
Полное руководство по сжатию декодерных эмбеддеров: от 8B до продакшена без потери recall
Научитесь сжимать эмбеддинги Qwen3-Embedding и NV-Embed с 4 ГБ до 128 МБ без потери качества. Product Quantization, бинарное квантование, FAISS и продакшен-сове
05
Как собрать локальную мультимедийную RPG-модель: дьявольски подробный гайд
Пошаговое руководство по созданию локальной ролевой ИИ-модели с генерацией текста, изображений и звуков. Ollama, ComfyUI, TTS. Работает на 24 ГБ VRAM.
06
Как развернуть кодинг-модель на трёх Spark GB10: выбор модели и стек (vLLM + llama-swap)
Локальный инференс Qwen 3.5 122B на трёх Spark GB10 с помощью vLLM и llama-swap. Дёшево, без облака. Подробный гайд с пошаговыми инструкциями и нюансами.
07
Структурированный парсинг вопросов в RAG: руководство с кодом, которое исправляет типичные ошибки
Как превратить «сырой» вопрос пользователя в точный структурированный запрос для RAG. Код, схемы и разбор ошибок — всё в одной статье.
08
GFusion-10B: как Sber перевел GigaChat в диффузионную LLM и ускорил генерацию на 70%
Разбор GFusion-10B от Sber: как авторегрессионный GigaChat превратили в диффузионную модель, ускорив генерацию на 70% с просадкой качества 2-4 п.п. Интеграция в
09
Как продуктивизировать CV-систему: опыт X5 Tech с 10 млн проверок в месяц
Разбор production-архитектуры CV-системы X5 Tech: Triton Inference Server, vLLM, Kafka RPC. Реальная экономия 50% ресурсов и рост производительности. Примеры ко
10
Один символ обнуляет prompt caching в vLLM: копаем в исходники
Глубокий разбор механизма prompt caching в vLLM: почему один пробел или перевод строки сбрасывает кэш, и как это обойти. С исходниками и примерами.
11
Как построить AI-агента для KOMPAS-3D: отказ от MCP, граф API и компилятор под ГОСТ
Руководство по созданию производственного AI-агента для САПР с критикой MCP, архитектурой на графе API и компиляцией действий под ЕСКД. Код, примеры, ошибки.
12
Как определить ИИ-музыку по спектральным артефактам: алгоритм и аналитика Яндекс Музыки
Практический алгоритм выявления сгенерированных треков на основе спектрального анализа. Разбираем артефакты FFT, анализируем Яндекс Музыку на июль 2026.