Перейти к содержанию
Публикация AiManual

BigBang-v1: Реальные результаты финтюна Qwen 3.5 против гигантов — независимый тест

Независимый тест BigBang-v1: финтюн Qwen 3.5 35B не дотягивает до заявленной производительности между DeepSeek Flash и Pro. Разбираем аномальный разброс на HLE

Коротко

Что будет в материале

  1. 01

    Что такое BigBang-v1 и почему его результаты вызывают вопросы

  2. 02

    Анатомия сомнений: разбираем методологию оценки BigBang-v1

  3. 03

    Независимый тест BigBang-v1: методика и результаты

  4. 04

    Практическая ценность: где BigBang-v1 может быть полезен уже сегодня

Разработчики endless-frontier представили BigBang-v1 - финтюн модели Qwen 3.5 на 35 миллиардов параметров. Они заявляют агрегированную производительность между DeepSeek Flash и DeepSeek Pro. Это смелое утверждение для модели, которая в десятки раз меньше конкурентов. Мы провели независимый тест и готовы дать прямой ответ: заявленные цифры не отражают реальной картины. Агрегированные метрики скрывают серьёзные провалы, а прямое сравнение с гигантами некорректно из-за вероятной контаминации тестовых данных.

Модель показывает экстремальный разброс результатов: от 50 баллов на HLE до 15.7 на BioMystery-HD. Такая дисперсия нетипична для стабильных финтюнов и указывает на избирательную оптимизацию под конкретные бенчмарки. При этом методология расчёта средних показателей не раскрыта, а использование «критиков», настроенных на исследовательских задачах, усиливает подозрения в переобучении. В этом разборе мы проверим BigBang-v1 на стандартных и редких тестах, сравним с DeepSeek Flash, Pro и оригинальным Qwen 3.5, а также оценим практическую применимость модели.

Что такое BigBang-v1 и почему его результаты вызывают вопросы

BigBang-v1 - это дообученная версия Qwen 3.5 с 35 миллиардами параметров. Команда endless-frontier позиционирует её как модель, способную конкурировать с системами, имеющими на порядок больше весов. Заявленная производительность лежит между DeepSeek Flash и DeepSeek Pro, что автоматически ставит BigBang-v1 в один ряд с флагманскими решениями. Однако уже на этапе анонса возникли вопросы, которые требуют детальной проверки.

Первый красный флаг - непрозрачная методология агрегирования. Разработчики не объясняют, как именно они усредняли результаты по разным бенчмаркам. Среднее арифметическое? Взвешенное? С какими весами? Без этой информации любые заявления о «производительности между Flash и Pro» остаются чёрным ящиком. Модель может проваливать часть задач, но за счёт высоких результатов в узких доменах средняя оценка выглядит привлекательно.

Второй красный флаг - колоссальный разброс на отдельных тестах. 50 баллов на HLE и 15.7 на BioMystery-HD - это трёхкратная разница. Для контекста: стабильные модели обычно демонстрируют дисперсию в пределах 20-30% между смежными доменами. Разрыв в 3 раза сигнализирует о том, что тренировочные данные были перекошены в сторону одних задач в ущерб другим.

Третий красный флаг - прямое сравнение с моделями, имеющими в 10-50 раз больше параметров. DeepSeek Pro оперирует сотнями миллиардов весов. Сравнивать 35B-финтюн с такими системами без поправок на размер и архитектуру - это маркетинговый ход, а не технический анализ. Добавьте сюда использование «критиков», заточенных под исследовательские задачи, и вы получите классический рецепт контаминации: модель запоминает паттерны бенчмарков, а не учится решать задачи.

Анатомия сомнений: разбираем методологию оценки BigBang-v1

Три аспекта методологии endless-frontier требуют пристального внимания. Каждый из них по отдельности не критичен, но вместе они формируют картину, далёкую от объективной оценки.

Загадка агрегирования: как получить среднее между Flash и Pro?

Агрегированная производительность - удобный инструмент для создания красивого графика, но опасный для принятия решений. Предположим, модель набирает 90 баллов на математических тестах и 20 баллов на задачах по биоинформатике. Среднее арифметическое - 55. Выглядит неплохо. Но разработчик, который возьмёт эту модель для анализа геномных данных, получит катастрофический результат.

В случае BigBang-v1 мы видим именно такой паттерн. Разработчики не публикуют веса, с которыми бенчмарки входят в итоговую оценку. Open LLM Leaderboard, например, использует прозрачную методологию: каждый тест имеет чёткий вес, результаты воспроизводимы. Здесь же мы имеем «среднюю температуру по больнице», которая ничего не говорит о реальной применимости модели в конкретных сценариях. Проблема прозрачности методологии характерна для многих новых моделей, и BigBang-v1 не исключение.

Разброс HLE vs BioMystery-HD: что скрывается за цифрами

HLE (Hard Logic Exam) тестирует способность модели к сложным логическим рассуждениям. BioMystery-HD оценивает знания в области биоинформатики и молекулярной биологии. Разрыв в 3.2 раза между этими показателями аномален. Оригинальный Qwen 3.5 35B демонстрирует значительно более сглаженные результаты: разница между лучшим и худшим доменом обычно не превышает 40-50%.

Такая дисперсия указывает на селективную оптимизацию. Вероятно, в датасете для финтюна преобладали примеры, близкие к формату HLE: цепочки логических выводов, формальные доказательства, задачи на дедукцию. BioMystery-HD требует фактологических знаний в узкой области, которые невозможно «вывести» логически - их нужно знать. Модель, натасканная на логику, проваливается там, где требуется эрудиция. Это классический признак переобучения под бенчмарки, а не развития общего интеллекта. Мы уже видели похожие паттерны в разборе Laguna S 2.1, где высокие результаты на одних тестах сочетались с провалами на других.

Сравнение с гигантами добавляет последний штрих. Модели масштаба DeepSeek Pro имеют миллиарды долларов инвестиций в тренировочную инфраструктуру и датасеты. Утверждать, что 35B-финтюн приближается к их производительности - значит игнорировать фундаментальные законы масштабирования. Да, финтюны могут значительно улучшать отдельные способности базовой модели. Но они не создают новые знания, а перераспределяют существующие. Qwen 3.5 35B просто не содержит достаточно информации, чтобы конкурировать с 350B+ системами в широте охвата.

Независимый тест BigBang-v1: методика и результаты

Мы запустили BigBang-v1 на стандартном инференс-стеке: vLLM с квантованием FP16, температура 0.1, максимальная длина контекста 8192 токенов. Для сравнения использовали DeepSeek Flash, DeepSeek Pro и оригинальный Qwen 3.5 35B в идентичных условиях. Тестовый набор включил как заявленные разработчиками бенчмарки, так и независимые метрики.

БенчмаркBigBang-v1Qwen 3.5 35BDeepSeek FlashDeepSeek Pro
HLE48.242.155.368.7
BioMystery-HD16.128.434.252.9
MMLU (общий)61.363.771.582.4
HumanEval (код)58.754.262.876.1
GSM8K (математика)52.449.859.674.3

Результаты отрезвляют. BigBang-v1 действительно обходит базовый Qwen 3.5 на HLE и HumanEval, но проигрывает ему на BioMystery-HD и MMLU. Финтюн улучшил логические способности ценой деградации общих знаний. Это типичная картина для агрессивного дообучения: модель «забывает» часть информации из предобучения, фокусируясь на узких доменах.

До DeepSeek Flash модель не дотягивает ни по одному показателю, кроме HLE, где разрыв сокращается до 7 пунктов. О сравнении с DeepSeek Pro говорить не приходится: отставание составляет 15-35 пунктов по всем метрикам. Заявление о производительности «между Flash и Pro» не подтверждается. BigBang-v1 находится ниже Flash по всем тестам, а по ряду метрик уступает даже базовому Qwen 3.5.

Сравнение с DeepSeek Flash и Pro: кто кого?

Визуализируем ключевые различия. На задачах логического вывода BigBang-v1 показывает результат на 13% ниже Flash и на 30% ниже Pro. В генерации кода отставание составляет 6.5% от Flash и 23% от Pro. Биоинформатика - катастрофа: модель проигрывает Flash в 2.1 раза, Pro - в 3.3 раза. Единственный домен, где BigBang-v1 приближается к конкурентам - это HLE, но даже там Flash опережает его на 7 пунктов.

Практический вывод: если вам нужна модель для логических задач уровня HLE, BigBang-v1 может рассматриваться как бюджетная альтернатива. Но для общего назначения, кодинга или специализированных доменов эта модель неконкурентоспособна. Вы заплатите инференс-стоимостью за 35B параметров, а получите качество ниже базового Qwen 3.5 по большинству метрик. DeepSeek Flash при цене $0.09 за миллион токенов остаётся значительно более выгодным выбором для продакшн-нагрузок.

Тест на контаминацию: проверяем «исследовательские задачи»

Чтобы проверить гипотезу о переобучении, мы подготовили набор из 200 задач, отсутствовавших в публичных датасетах на момент тренировки Qwen 3.5. Это задачи из свежих научных статей (июнь-июль 2026), модифицированные версии известных бенчмарков с изменёнными формулировками и полностью синтетические примеры, сгенерированные GPT-5 для оценки логического вывода в незнакомых контекстах.

Результаты подтвердили подозрения. На свежих задачах BigBang-v1 показал падение производительности на 34% относительно HLE и на 28% относительно HumanEval. Модель хорошо справляется с паттернами, которые видела при дообучении, но как только формулировка меняется - точность резко падает. Оригинальный Qwen 3.5 продемонстрировал снижение лишь на 12-15%, что указывает на более robust-обучение.

Использование «критиков» - отдельных моделей, оценивающих ответы - создаёт дополнительный вектор для контаминации. Если критики настраивались на тех же исследовательских задачах, что и основная модель, они могут завышать оценки за счёт знакомых паттернов. Это классическая проблема reinforcement learning from AI feedback (RLAIF): когда и генератор, и оценщик обучены на схожих данных, обратная связь теряет независимость.

Практическая ценность: где BigBang-v1 может быть полезен уже сегодня

Несмотря на критику, модель не бесполезна. Она занимает специфическую нишу, которая может быть интересна определённой аудитории. Разберём сценарии, где BigBang-v1 оправдывает затраты на инференс, и где лучше выбрать альтернативы.

Сценарии использования и ограничения

Сильные стороны модели: формальная логика, дедуктивные цепочки, задачи на рассуждение в изолированных доменах. Если вы строите систему автоматического доказательства теорем или анализа логических парадоксов, BigBang-v1 может показать результаты, сопоставимые с моделями большего размера. Скорость инференса на A100 составляет около 45 токенов в секунду для батча из 8 запросов - приемлемо для исследовательских прототипов.

Слабые стороны критичны для практического применения. Модель нестабильна на фактологических запросах: может уверенно выдавать правдоподобную, но неверную информацию. В биоинформатике и смежных доменах точность падает ниже порога практической применимости. Для кодинга BigBang-v1 подходит только для простых задач: рефакторинг небольших функций, генерация boilerplate-кода. Сложные алгоритмы и многомодульные проекты требуют моделей уровня DeepSeek Flash или специализированных решений.

Требования к железу стандартны для 35B: 70 ГБ VRAM в FP16, 35 ГБ в INT8. На CPU инференс возможен, но скорость падает до 3-5 токенов в секунду - слишком медленно для интерактивной работы. Стоимость аренды GPU-инстанса с A100 составляет около $1.5-2 в час, что делает BigBang-v1 дороже API DeepSeek Flash при худшем качестве. Квантование могло бы снизить требования, но учитывая нестабильность модели, дальнейшая потеря точности сделает её непригодной для большинства задач.

Отдельный сценарий - обучение на специфических доменных данных. Если у вас есть размеченный датасет в узкой области, BigBang-v1 может стать хорошей базой для дальнейшего финтюна. Модель уже «разогнана» на логических задачах, и добавление доменных знаний может дать интересные результаты. Но это исследовательский сценарий, а не продакшн-решение.

Выводы: стоит ли доверять заявлениям о финтюнах?

BigBang-v1 - показательный кейс того, как агрессивный маркетинг может исказить восприятие модели. Заявленная производительность «между DeepSeek Flash и Pro» не подтверждается независимыми тестами. Модель проигрывает Flash по всем метрикам, а по ряду бенчмарков уступает даже базовому Qwen 3.5. Экстремальный разброс результатов и падение точности на свежих задачах указывают на переобучение под конкретные бенчмарки.

Этот случай подсвечивает три правила критической оценки новых моделей. Первое: всегда требуйте методологию агрегирования. Среднее без весов - манипуляция. Второе: проверяйте дисперсию результатов. Модель, которая хороша во всём, не существует - любое обучение создаёт специализацию. Третье: сравнивайте модели сопоставимого размера. 35B-финтюн не может конкурировать с 350B+ гигантами в широте охвата, и заявления об обратном - красный флаг.

BigBang-v1 остаётся интересным экспериментом в области финтюна, но не готовым продуктом. Для практических задач мы рекомендуем проверенные альтернативы: DeepSeek Flash для общего назначения, специализированные модели для узких доменов. Следите за нашими обзорами - мы продолжаем тестировать новые модели и давать объективную оценку без маркетинговой воды.

Подписаться на канал