Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4377 материалов
01 Как запустить три сессии Qwen3.5 122B на Mac Studio 96GB: опыт холодного кэширования KV и ускорение префилла в 16 раз Запуск трёх конкурентных сессий Qwen3.5 122B на Mac Studio с 96 ГБ ОЗУ: 16-кратное ускорение префилла через холодное кэширование KV, архитектура Gated DeltaNet 8 мин чтения 02 DeepSeek vs конкуренты: анализ цены и производительности в 2026 году DeepSeek предлагает цену API в 50 раз ниже Claude 3.5 Sonnet при сопоставимом качестве на бенчмарках. Разбираем архитектурные причины и скрытые издержки тарифик 8 мин чтения 03 AMD и FastFlowLM: как новое партнёрство ускорит AI-инференс и изменит рынок AMD покупает команду FastFlowLM и встраивает их оптимизации инференса в ROCm. Разбираем технологии, которые дают до 40% прироста на MI300X, сравниваем с NVIDIA 8 мин чтения 04 Кого выбрать: сравнение провайдеров Qwen и Gemma для кодинга и общения Прямое сравнение провайдеров bartowski, unsloth, lm-studio и Google для Qwen3.6-35B и Gemma-4-26B. Реальные тесты кодинга (pass@1 до 78.4%) и чатов (связность д 8 мин чтения 05 AI-налог на железо: сколько реально нужно потратить на GPU для локального запуска моделей в 2026 году RTX 4060 Ti 16GB выдаёт 23 токена/с на Gemma 4 26B. Узкая шина памяти и AI-бум взвинтили цены на GPU. Разбираем реальные конфигурации для локального инференса о 10 мин чтения 06 Практические стратегии управления промптами для LLM: от простых запросов до сложных агентных задач Систематизируем подходы к промпт-инжинирингу: как структурировать системные промпты, использовать каскадные вызовы и управлять контекстом. Готовые шаблоны для р 12 мин чтения 07 CMP 170HX как GPU для AI: разблокировка 64 ГБ HBM2e и 173 TFLOPS в BF16 Превращаем майнинговую NVIDIA CMP 170HX в мощный AI-ускоритель: кастомный драйвер, 64 ГБ памяти, 173 TFLOPS в BF16. Характеристики, сравнение с A100 и RTX 4090, 11 мин чтения 08 Корпоративная ИИ-архитектура: как построить enterprise data platform нового поколения Разбираем ключевые компоненты корпоративной ИИ-архитектуры: data agents на LangGraph и Snowflake Cortex Analyst, AI-powered QA с Soda и AI governance через Lang 10 мин чтения 09 Acoustic Side-Channel: Как звук дросселей выдаёт рабочую нагрузку LLM и что это говорит о наблюдаемости систем Видеокарта свистит при запуске нейросетей — это не брак, а физический побочный канал. Разбираем, как матричные умножения LLM заставляют дроссели VRM петь на час 8 мин чтения 10 Разбор запуска GLM 5.2 на CPU: почему декодинг медленный и как это исправить Запустили GLM 5.2 на AMD EPYC 9654 и получили 5-9 токенов/с вместо ожидаемых 30+? Разбираем реальный кейс: почему контекст 131K и KV-кэш Q8_0 убивают производит 7 мин чтения 11 Byte exact KV cache grafting: как сохранять и восстанавливать знания в Gemma 4 с точностью до байта Byte exact KV cache grafting повышает точность маршрутизации Gemma 4 12B на AIME 2025 с 76.7% до 90.0% через байт-идентичное восстановление KV-состояний. Разбир 7 мин чтения 12 Arandu v0.6.5: упрощённый запуск моделей через llama.cpp с интеграцией HuggingFace и управлением версиями Arandu v0.6.5 — открытый лаунчер для llama.cpp, который объединяет управление версиями, загрузку моделей с HuggingFace и пресеты аргументов в одном интерфейсе. 6 мин чтения