Ключевые выводы: как выбирать китайскую LLM
Выбор модели по лучшему результату в бенчмарке - путь к непредсказуемым затратам в продакшене. Мы прогнали четыре китайских флагмана через 12 практических задач: генерация кода, анализ CSV, суммаризация длинных PDF, защита от галлюцинаций. Главный критерий, который мы вывели, - стабильность и предсказуемость поведения, а не пиковая производительность.
DeepSeek V4 Pro показал высокие результаты в анализе данных и самую низкую стоимость среди участников. При этом в двух сценариях из двенадцати модель дала разные ответы на одинаковые запросы. Для прототипа это допустимо, для боевого конвейера - нет. Kimi K3 стабильно работал с длинными документами, но не поддерживал изображения. GLM-5.2 оказался единственным, кто корректно обработал мультимодальные входы. Qwen 3.8 Max не блеснул пиковыми метриками, но прошёл все 12 задач без зависаний и отказов.
Тарификация различается в разы, и это напрямую влияет на бюджет проекта. Подробный разбор цен - в отдельном разделе. Если нужно быстрое решение: для анализа данных берите DeepSeek V4 Pro с оговоркой на нестабильность, для работы с изображениями - GLM-5.2, для стабильного кода - Qwen 3.8 Max. Kimi K3 подойдёт для длинных документов.
Методология тестирования: 12 задач и критерии оценки
Мы собрали задачи, которые встречаются в реальных проектах чаще всего. Никаких синтетических бенчмарков, только рабочие сценарии. Каждую задачу прогоняли трижды, чтобы оценить стабильность. Фиксировали время ответа, стоимость вызова, точность и повторяемость результата.
Список тестовых задач
- Генерация Python-скрипта для парсинга JSON с вложенной структурой
- Рефакторинг устаревшего кода на JavaScript
- Анализ CSV-файла на 50 000 строк с поиском аномалий
- Суммаризация PDF-документа на 120 страниц
- Ответы на вопросы по длинному техническому регламенту
- Проверка фактов с требованием указать источник внутри текста
- Генерация SQL-запроса с несколькими JOIN
- Написание unit-тестов для заданной функции
- Обработка изображения с извлечением табличных данных
- Перевод технической документации с английского на русский
- Классификация отзывов на три категории
- Генерация конфигурационного файла для Docker Compose
Тестируемые модели: Kimi K3, GLM-5.2, DeepSeek V4 Pro, Qwen 3.8 Max. Все вызовы шли через API с одинаковыми параметрами. Температуру зафиксировали на 0.1 для воспроизводимости. Критерии оценки: точность, стабильность, скорость, стоимость. Стабильность считали как долю идентичных или семантически эквивалентных ответов из трёх прогонов.
Сравнение моделей по ключевым сценариям
Kimi K3: сильные стороны и ограничения
Kimi K3 уверенно справился с суммаризацией длинного PDF на 120 страниц. Модель выделила ключевые тезисы, сохранила структуру документа и не потеряла важные цифры. В задачах на проверку фактов Kimi K3 дважды из трёх указал корректные источники внутри текста. В генерации кода результат средний: Python-скрипт рабочий, но SQL-запрос с несколькими JOIN потребовал ручной доработки.
Ограничение: Kimi K3 не поддерживает изображения. Задача с извлечением табличных данных из скриншота завершилась отказом API. Для проектов с мультимодальными входами это блокер. Стабильность на текстовых задачах высокая: 11 из 12 задач дали идентичные результаты в трёх прогонах. Подробный разбор архитектуры и прозрачности Kimi K3 есть в техническом отчёте.
GLM-5.2: производительность и особенности
GLM-5.2 - единственная модель из четырёх, которая корректно обработала изображение и извлекла табличные данные. Скорость ответа на текстовых задачах самая высокая: среднее время отклика 1.8 секунды против 2.6 у ближайшего конкурента. В генерации кода GLM-5.2 показал хорошие результаты на Python и JavaScript, но Rust-задачу не тестировали. Более детальные тесты кодинга на GLM-5.2 разбираем в отдельной статье.
Ограничение: на задаче суммаризации 120-страничного PDF модель зависла на 47 секунд и вернула усечённый результат. Повторный прогон прошёл успешно, но сам факт зависания на длительной задаче фиксируем как риск.
DeepSeek V4 Pro: высокая производительность, но нестабильность
DeepSeek V4 Pro показал лучший результат в анализе CSV-файла на 50 000 строк. Модель нашла все аномалии, корректно сгруппировала данные и предложила визуализацию. Стоимость вызова самая низкая среди участников. При этом два сценария выявили проблему: на задаче генерации unit-тестов модель выдала три разных варианта в трёх прогонах, и только один из них был рабочим. На задаче классификации отзывов результаты различались по границам категорий.
Для продакшена это критично. Непредсказуемость ответа означает, что пайплайн может молча выдавать мусор. Низкая цена не компенсирует затраты на отладку и мониторинг. Если вы рассматриваете DeepSeek V4 Pro для агентных сценариев, посмотрите сравнение с Flash-версией.
Qwen 3.8 Max: сбалансированный вариант?
Qwen 3.8 Max не занял первое место ни в одной задаче. Но прошёл все 12 сценариев без отказов, зависаний и критических ошибок. В генерации кода результат стабильный: три прогона дали семантически идентичные решения. В анализе данных точность чуть ниже, чем у DeepSeek V4 Pro, но повторяемость 100%. Поддержка изображений отсутствует, как и у Kimi K3.
Для команд, которые ценят предсказуемость выше пиковых метрик, Qwen 3.8 Max - рабочий выбор. Модель не удивит выдающимся результатом, но и не подведёт в боевом контуре. Сравнение с другими open-weight моделями в agentic-сценариях есть в материале по ArenaAI.
Стабильность и предсказуемость: почему это важнее пиковых результатов
Пиковый результат в бенчмарке показывает потенциал модели. Стабильность показывает, что вы получите в продакшене. Разница между этими понятиями - это разница между демо-днём и ежедневной эксплуатацией.
В нашем тесте DeepSeek V4 Pro на задаче генерации unit-тестов выдал три разных ответа. Один из них не запускался. Если такой разброс попадёт в CI-пайплайн, разработчик потратит время на отладку сгенерированного кода вместо написания своего. При объёме 1000 генераций в день это десятки часов потерянного времени. Низкая стоимость токена не покрывает эти потери.
Нестабильность проявляется и в других формах: зависания на длинных документах у GLM-5.2, отказ API на изображениях у Kimi K3 и Qwen 3.8 Max. Каждый такой отказ в боевой системе - это либо падение сервиса, либо необходимость строить fallback-цепочки. Оба варианта стоят денег. Предсказуемость поведения модели - это метрика, которую нужно закладывать в расчёт совокупной стоимости владения.
Тарификация: сколько стоят китайские LLM и как это влияет на проекты
Цены за токены у китайских моделей различаются в разы. DeepSeek V4 Pro - самая дешёвая в нашем наборе. GLM-5.2 и Kimi K3 занимают средний диапазон. Qwen 3.8 Max - самая дорогая из четырёх, но разница с Kimi K3 не критична.
Сравнение стоимости за 1 млн токенов
| Модель | Вход, $ | Выход, $ | Поддержка изображений |
|---|---|---|---|
| DeepSeek V4 Pro | 0.20 | 0.60 | Нет |
| GLM-5.2 | 0.45 | 1.10 | Да |
| Kimi K3 | 0.50 | 1.50 | Нет |
| Qwen 3.8 Max | 0.55 | 1.70 | Нет |
Цифры ориентировочные, актуальны на август 2026 года. Тарификация различается из-за архитектурных особенностей: модели с MoE-архитектурой дешевле в инференсе, но требуют больше памяти. Разница в цене выхода напрямую влияет на бюджет: при генерации 10 млн токенов в месяц DeepSeek V4 Pro обойдётся в $6, а Qwen 3.8 Max - в $17. На дистанции года разница достигает $132 на один миллион токенов ежемесячной генерации.
Экономия на токенах не должна быть единственным фактором. Если модель нестабильна, вы заплатите за отладку больше, чем сэкономите на инференсе. Считайте совокупную стоимость: цена токенов плюс стоимость обработки ошибок плюс стоимость мониторинга.
Практические рекомендации: какую модель выбрать под ваши задачи
Универсального победителя нет. Каждая модель из четырёх сильна в своём классе задач. Выбор зависит от того, что критично для вашего проекта: цена, стабильность, мультимодальность или работа с длинными документами.
- Анализ данных: DeepSeek V4 Pro. Лучшая точность на CSV и самая низкая цена. Добавьте мониторинг стабильности и fallback на Qwen 3.8 Max.
- Работа с изображениями: GLM-5.2. Единственная модель с поддержкой мультимодальных входов. Учитывайте риск зависаний на длинных задачах.
- Стабильный код: Qwen 3.8 Max. 100% повторяемость результатов в тестах. Пиковые метрики ниже, чем у конкурентов, но предсказуемость выше.
- Длинные документы: Kimi K3. Лучшая суммаризация и проверка фактов. Без поддержки изображений.
Чек-лист выбора LLM для проекта
- Определите критичные задачи: что модель должна делать каждый день без сбоев.
- Протестируйте модели на своих данных, а не на публичных бенчмарках.
- Прогоните каждую задачу минимум трижды, оцените повторяемость ответов.
- Рассчитайте стоимость при ваших объёмах генерации.
- Проверьте поддержку нужных функций: изображения, длинный контекст, JSON-режим.
- Оцените риски: зависания, отказы API, нестабильность в граничных случаях.
Если вы ищете альтернативу западным LLM, китайские модели конкурентоспособны по цене и качеству. Но слепой перенос без тестирования на своих данных приведёт к сюрпризам в продакшене. Сравнение DeepSeek V4 Flash с конкурентами по цене и производительности разбираем в этом материале.
Заключение: будущее китайских LLM и наш вердикт
Китайские флагманы 2026 года закрывают большинство практических задач на уровне западных аналогов. Разрыв в стабильности сокращается, но остаётся ключевым фактором выбора. DeepSeek V4 Pro выигрывает по цене и аналитике, но нестабильность ограничивает его применение в ответственных пайплайнах. GLM-5.2 закрывает мультимодальные сценарии. Kimi K3 силён в длинных документах. Qwen 3.8 Max - самый предсказуемый из всех.
Тренд на улучшение стабильности заметен: каждая новая версия моделей даёт меньше разброса в ответах. Через полгода картина может измениться. Следите за обновлениями и перепроверяйте модели на своих задачах. Делитесь опытом в комментариях: какие китайские LLM вы пробовали в продакшене и с какими проблемами столкнулись.