Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4377
материалов
01
Tenstorrent P150a для локального AI: обзор, производительность и опыт использования
Полный разбор Tenstorrent P150a: 32GB GDDR6, Ethernet fabric, сравнение с RTX 4090. Реальный опыт запуска Llama 3, Mistral и Stable Diffusion. Стоит ли брать дл
02
Model Profiler от AWS: хватит гадать, пора профилировать модели в Bedrock
Open-source инструмент Model Profiler от AWS для объективного выбора модели в Amazon Bedrock. Установка, запуск, разбор метрик и реальные ошибки при профилирова
03
Как собрать полностью локальный веб-исследовательский AI-агент: стек и компоненты
Пошаговый гайд по сборке полностью локального AI-агента для веб-исследований без облачных API. SearXNG, Hister кэш, агентский пайплайн, веб-скрапинг.
04
Persistent Latent Memory для мультиагентных LLM: метод ILCP с β-VAE компрессором
Разбор метода ILCP для передачи памяти между агентами LLM с помощью β-VAE. Архитектура, пошаговый гайд, типичные ошибки и аналогия с 6G handover.
05
Open-source real-time voice AI pipeline: Gemma 4, Cerebras и Qwen TTS — разбор архитектуры
Разбор полностью открытого пайплайна для голосового AI с субсекундной задержкой: Parakeet -> Gemma 4 на Cerebras -> Qwen3TTS. Архитектура, компоненты, подводные
06
Какие локальные LLM помещаются в вашу RAM: полное руководство от 8 до 128 ГБ с открытым датасетом
Узнайте, какие локальные LLM влезут в вашу оперативную память. Практическое руководство с датасетом, правилом 0.6 ГБ на миллиард параметров и таблицами для 8–12
07
Мультиагентная система для код-ревью: как сократить время ожидания с 2 дней до 15 минут
Как мы построили мультиагентную ИИ-систему для автоматического код-ревью в большой продуктовой команде. Результаты, конфигурация агентов и грабли, на которые на
08
Архитектура нейропоиска Discovery AI от VK: как объединить LLM и поиск с задержкой <500 мс
Разбираем архитектуру нейропоиска Discovery AI от VK: гибрид BERT и LLM, агентский сценарий Deep Research, оптимизация инференса для задержки менее 500 мс. Прак
09
Как устранить зацикливание в Qwen3.6 35B и Ornith V1: настройки параметров декодирования
Практическое руководство по устранению зацикливания (looping) при инференсе Qwen3.6 35B и Ornith V1. Реальные настройки repetition penalty, top_p, top_k, min_p
10
Контекстная инженерия для локальных LLM: как сделать среднюю модель надежной за счет продуманного контекста и фильтрации
Научитесь управлять контекстом, чтобы Qwen3.6 и другие средние модели выдавали точные ответы. Порог релевантности, порядок секций, фильтрация — полное руководст
11
Как построить ИИ-агента для техподдержки: от RAG к автономному анализу тикетов
Пошаговое руководство по созданию ИИ-агента для техподдержки на основе Agentic RAG. Кейс МТС, архитектура, промпты и ошибки.
12
Разрыв в 47% точности LLM: как подача запросов меняет результаты бенчмарков на 28% и 76% — эксперимент с гайдом по промптингу
Как структура промпта меняет точность LLM от 28% до 76%? Эксперимент на Qwen3.5, причины разрыва в 47% и гайд по построению запросов для корпоративных RAG.