Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4377 материалов
01 Экономика инференса LLM: почему дорогие модели стоят дорого и как это влияет на лимиты Глубокий разбор факторов стоимости вывода LLM: от архитектуры Dense vs MoE до KV-cache и reasoning-токенов. Как это формирует лимиты API и как оптимизировать за 8 мин чтения 02 Как настроить ESP-Claw на ESP32-S3: превращаем микроконтроллер в ИИ-агента для умного дома Полный гайд по настройке ESP-Claw на ESP32-S3: подключение к LLM через OpenRouter, управление Tuya-устройствами, развертывание Open WebUI. Никакого облака — тол 7 мин чтения 03 Tokenminning: как сократить расходы на AI-агентов, минимизируя токены без потери качества Практическое руководство по оптимизации токенов в AI-агентах. Методы сжатия промптов, кэширование, маршрутизация запросов и реальные кейсы экономии до 60%. 8 мин чтения 04 Полное руководство по сжатию декодерных эмбеддеров: от 8B до продакшена без потери recall Научитесь сжимать эмбеддинги Qwen3-Embedding и NV-Embed с 4 ГБ до 128 МБ без потери качества. Product Quantization, бинарное квантование, FAISS и продакшен-сове 7 мин чтения 05 Как собрать локальную мультимедийную RPG-модель: дьявольски подробный гайд Пошаговое руководство по созданию локальной ролевой ИИ-модели с генерацией текста, изображений и звуков. Ollama, ComfyUI, TTS. Работает на 24 ГБ VRAM. 9 мин чтения 06 Как развернуть кодинг-модель на трёх Spark GB10: выбор модели и стек (vLLM + llama-swap) Локальный инференс Qwen 3.5 122B на трёх Spark GB10 с помощью vLLM и llama-swap. Дёшево, без облака. Подробный гайд с пошаговыми инструкциями и нюансами. 8 мин чтения 07 Структурированный парсинг вопросов в RAG: руководство с кодом, которое исправляет типичные ошибки Как превратить «сырой» вопрос пользователя в точный структурированный запрос для RAG. Код, схемы и разбор ошибок — всё в одной статье. 1 мин чтения 08 GFusion-10B: как Sber перевел GigaChat в диффузионную LLM и ускорил генерацию на 70% Разбор GFusion-10B от Sber: как авторегрессионный GigaChat превратили в диффузионную модель, ускорив генерацию на 70% с просадкой качества 2-4 п.п. Интеграция в 5 мин чтения 09 Как продуктивизировать CV-систему: опыт X5 Tech с 10 млн проверок в месяц Разбор production-архитектуры CV-системы X5 Tech: Triton Inference Server, vLLM, Kafka RPC. Реальная экономия 50% ресурсов и рост производительности. Примеры ко 8 мин чтения 10 Один символ обнуляет prompt caching в vLLM: копаем в исходники Глубокий разбор механизма prompt caching в vLLM: почему один пробел или перевод строки сбрасывает кэш, и как это обойти. С исходниками и примерами. 6 мин чтения 11 Как построить AI-агента для KOMPAS-3D: отказ от MCP, граф API и компилятор под ГОСТ Руководство по созданию производственного AI-агента для САПР с критикой MCP, архитектурой на графе API и компиляцией действий под ЕСКД. Код, примеры, ошибки. 1 мин чтения 12 Как определить ИИ-музыку по спектральным артефактам: алгоритм и аналитика Яндекс Музыки Практический алгоритм выявления сгенерированных треков на основе спектрального анализа. Разбираем артефакты FFT, анализируем Яндекс Музыку на июль 2026. 6 мин чтения