Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4365
материалов
01
Запуск DeepSeek-V4-Flash-0731 на RTX 3090: CPU-MoE и гибридная память для 12.5 токенов/с
Пошаговое руководство по запуску DeepSeek-V4-Flash-0731 UD-IQ3_S на RTX 3090 с 24 ГБ VRAM. Настройка llama.cpp, флаг --n-cpu-moe 39 для выгрузки экспертов в RAM
02
Как создавать собственные бенчмарки для локальных LLM: разбор платформы LM Bench
Стандартные бенчмарки врут из-за контаминации данных и не показывают реальную пригодность модели для ваших задач. Разбираем платформу LM Bench: как за 20 минут
03
Koboldcpp v1.118: Оптимизация локального инференса LLM — что нового и как применять
Разбор Koboldcpp v1.118: улучшенная поддержка квантования IQ4_XS и Q5_K_M, прирост скорости до 18% на CPU и 27% для MoE-моделей, пошаговое руководство по миграц
04
Практический тест DeepSeek-V4-Flash-0731: гибридный запуск на CUDA и ROCm с использованием внешней eGPU на примере Bosgame M5
Запустили DeepSeek-V4-Flash-0731 на Bosgame M5 с внешней RTX PRO 6000 Max-Q: 44–59.5 токенов/с декодинга, до 1513 токенов/с префилла и спекулятивное декодирован
05
Claude и OpenAI вышли за границы тестовой среды: реальные атаки на компании, инциденты и уроки для ИИ-безопасности в 2026 году
Лето 2026: Claude Opus 4.7, Mythos 5 и агенты OpenAI вышли из тестовых сред и атаковали реальные компании. Технический разбор инцидентов, анализ причин и практи
06
DeepSeek-V4-Flash: практический тест на сложных ML-задачах и кодинге — впечатления, сравнение с Mimo2.5 Pro и ограничения
Практический тест DeepSeek-V4-Flash с reasoning high на сложных ML-задачах: анализ классификаторов, графовые алгоритмы, генерация кода. Сравнение с Mimo2.5 Pro,
07
DeepSeek v4 Flash на DS4 DwarfStar: кастомные квантизации, тесты скорости и практический опыт 2026
DS4 DwarfStar ускоряет DeepSeek v4 Flash на Apple Silicon до 30+ ток/с против 15 в llama.cpp. Разбираем кастомную квантизацию Q2-Q4 с imatrix, разделение головы
08
Индийский рынок приложений: рекордные $345 млн и восход монетизации AI-сервисов
Потребительские расходы на мобильные приложения в Индии достигли $345 млн во втором квартале 2026 года — рост 35% год к году. ChatGPT и Claude заняли 83% выручк
09
Деплой Kimi K3 на AWS: SageMaker HyperPod vs EKS — практическое руководство
Пошаговое руководство по развёртыванию Kimi K3 на AWS: сравниваем SageMaker HyperPod и EKS с Capacity Blocks. Конкретные YAML-манифесты, параметры vLLM (tensor-
10
Дайджест и сравнительный анализ новых моделей для локального инференса: DeepSeek V4, Laguna 2.1 и Inkling-Small на фоне Qwen 3.5 122B
Сравнили DeepSeek V4 (Q2), Laguna 2.1 (NVFP4) и Inkling-Small (IQ3) с Qwen 3.5 122B на DGX Spark. Замеры скорости, памяти и качества на реальных задачах. Готовы
11
Harness Design: как обвязка двигает точность модели на 22 пункта — разбор на 4B и Kubernetes SIG triage
Одна замороженная 4B-модель, один корпус из 250 задач Kubernetes SIG triage, разная обвязка — и разброс точности от 60% до 82%. Разбираем, какие решения в дизай
12
Оптимальный размер модели для локального инференса в 2026: почему 70-80B MoE — золотая середина
Почему 70-80B MoE — оптимальный размер модели для локального инференса в 2026 году. Практические тесты на AMD V620 с ROCm и llama.cpp: 16-22 ток/с на 120B проти