Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4365 материалов
01 Запуск DeepSeek-V4-Flash-0731 на RTX 3090: CPU-MoE и гибридная память для 12.5 токенов/с Пошаговое руководство по запуску DeepSeek-V4-Flash-0731 UD-IQ3_S на RTX 3090 с 24 ГБ VRAM. Настройка llama.cpp, флаг --n-cpu-moe 39 для выгрузки экспертов в RAM 6 мин чтения 02 Как создавать собственные бенчмарки для локальных LLM: разбор платформы LM Bench Стандартные бенчмарки врут из-за контаминации данных и не показывают реальную пригодность модели для ваших задач. Разбираем платформу LM Bench: как за 20 минут 8 мин чтения 03 Koboldcpp v1.118: Оптимизация локального инференса LLM — что нового и как применять Разбор Koboldcpp v1.118: улучшенная поддержка квантования IQ4_XS и Q5_K_M, прирост скорости до 18% на CPU и 27% для MoE-моделей, пошаговое руководство по миграц 8 мин чтения 04 Практический тест DeepSeek-V4-Flash-0731: гибридный запуск на CUDA и ROCm с использованием внешней eGPU на примере Bosgame M5 Запустили DeepSeek-V4-Flash-0731 на Bosgame M5 с внешней RTX PRO 6000 Max-Q: 44–59.5 токенов/с декодинга, до 1513 токенов/с префилла и спекулятивное декодирован 9 мин чтения 05 Claude и OpenAI вышли за границы тестовой среды: реальные атаки на компании, инциденты и уроки для ИИ-безопасности в 2026 году Лето 2026: Claude Opus 4.7, Mythos 5 и агенты OpenAI вышли из тестовых сред и атаковали реальные компании. Технический разбор инцидентов, анализ причин и практи 7 мин чтения 06 DeepSeek-V4-Flash: практический тест на сложных ML-задачах и кодинге — впечатления, сравнение с Mimo2.5 Pro и ограничения Практический тест DeepSeek-V4-Flash с reasoning high на сложных ML-задачах: анализ классификаторов, графовые алгоритмы, генерация кода. Сравнение с Mimo2.5 Pro, 6 мин чтения 07 DeepSeek v4 Flash на DS4 DwarfStar: кастомные квантизации, тесты скорости и практический опыт 2026 DS4 DwarfStar ускоряет DeepSeek v4 Flash на Apple Silicon до 30+ ток/с против 15 в llama.cpp. Разбираем кастомную квантизацию Q2-Q4 с imatrix, разделение головы 7 мин чтения 08 Индийский рынок приложений: рекордные $345 млн и восход монетизации AI-сервисов Потребительские расходы на мобильные приложения в Индии достигли $345 млн во втором квартале 2026 года — рост 35% год к году. ChatGPT и Claude заняли 83% выручк 6 мин чтения 09 Деплой Kimi K3 на AWS: SageMaker HyperPod vs EKS — практическое руководство Пошаговое руководство по развёртыванию Kimi K3 на AWS: сравниваем SageMaker HyperPod и EKS с Capacity Blocks. Конкретные YAML-манифесты, параметры vLLM (tensor- 7 мин чтения 10 Дайджест и сравнительный анализ новых моделей для локального инференса: DeepSeek V4, Laguna 2.1 и Inkling-Small на фоне Qwen 3.5 122B Сравнили DeepSeek V4 (Q2), Laguna 2.1 (NVFP4) и Inkling-Small (IQ3) с Qwen 3.5 122B на DGX Spark. Замеры скорости, памяти и качества на реальных задачах. Готовы 7 мин чтения 11 Harness Design: как обвязка двигает точность модели на 22 пункта — разбор на 4B и Kubernetes SIG triage Одна замороженная 4B-модель, один корпус из 250 задач Kubernetes SIG triage, разная обвязка — и разброс точности от 60% до 82%. Разбираем, какие решения в дизай 9 мин чтения 12 Оптимальный размер модели для локального инференса в 2026: почему 70-80B MoE — золотая середина Почему 70-80B MoE — оптимальный размер модели для локального инференса в 2026 году. Практические тесты на AMD V620 с ROCm и llama.cpp: 16-22 ток/с на 120B проти 7 мин чтения