Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4377
материалов
01
Как запустить три сессии Qwen3.5 122B на Mac Studio 96GB: опыт холодного кэширования KV и ускорение префилла в 16 раз
Запуск трёх конкурентных сессий Qwen3.5 122B на Mac Studio с 96 ГБ ОЗУ: 16-кратное ускорение префилла через холодное кэширование KV, архитектура Gated DeltaNet
02
DeepSeek vs конкуренты: анализ цены и производительности в 2026 году
DeepSeek предлагает цену API в 50 раз ниже Claude 3.5 Sonnet при сопоставимом качестве на бенчмарках. Разбираем архитектурные причины и скрытые издержки тарифик
03
AMD и FastFlowLM: как новое партнёрство ускорит AI-инференс и изменит рынок
AMD покупает команду FastFlowLM и встраивает их оптимизации инференса в ROCm. Разбираем технологии, которые дают до 40% прироста на MI300X, сравниваем с NVIDIA
04
Кого выбрать: сравнение провайдеров Qwen и Gemma для кодинга и общения
Прямое сравнение провайдеров bartowski, unsloth, lm-studio и Google для Qwen3.6-35B и Gemma-4-26B. Реальные тесты кодинга (pass@1 до 78.4%) и чатов (связность д
05
AI-налог на железо: сколько реально нужно потратить на GPU для локального запуска моделей в 2026 году
RTX 4060 Ti 16GB выдаёт 23 токена/с на Gemma 4 26B. Узкая шина памяти и AI-бум взвинтили цены на GPU. Разбираем реальные конфигурации для локального инференса о
06
Практические стратегии управления промптами для LLM: от простых запросов до сложных агентных задач
Систематизируем подходы к промпт-инжинирингу: как структурировать системные промпты, использовать каскадные вызовы и управлять контекстом. Готовые шаблоны для р
07
CMP 170HX как GPU для AI: разблокировка 64 ГБ HBM2e и 173 TFLOPS в BF16
Превращаем майнинговую NVIDIA CMP 170HX в мощный AI-ускоритель: кастомный драйвер, 64 ГБ памяти, 173 TFLOPS в BF16. Характеристики, сравнение с A100 и RTX 4090,
08
Корпоративная ИИ-архитектура: как построить enterprise data platform нового поколения
Разбираем ключевые компоненты корпоративной ИИ-архитектуры: data agents на LangGraph и Snowflake Cortex Analyst, AI-powered QA с Soda и AI governance через Lang
09
Acoustic Side-Channel: Как звук дросселей выдаёт рабочую нагрузку LLM и что это говорит о наблюдаемости систем
Видеокарта свистит при запуске нейросетей — это не брак, а физический побочный канал. Разбираем, как матричные умножения LLM заставляют дроссели VRM петь на час
10
Разбор запуска GLM 5.2 на CPU: почему декодинг медленный и как это исправить
Запустили GLM 5.2 на AMD EPYC 9654 и получили 5-9 токенов/с вместо ожидаемых 30+? Разбираем реальный кейс: почему контекст 131K и KV-кэш Q8_0 убивают производит
11
Byte exact KV cache grafting: как сохранять и восстанавливать знания в Gemma 4 с точностью до байта
Byte exact KV cache grafting повышает точность маршрутизации Gemma 4 12B на AIME 2025 с 76.7% до 90.0% через байт-идентичное восстановление KV-состояний. Разбир
12
Arandu v0.6.5: упрощённый запуск моделей через llama.cpp с интеграцией HuggingFace и управлением версиями
Arandu v0.6.5 — открытый лаунчер для llama.cpp, который объединяет управление версиями, загрузку моделей с HuggingFace и пресеты аргументов в одном интерфейсе.