Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Аудит бенчмарков AI: до 12% вопросов GPQA, MMLU-Pro и MMMU-Pro оказались некорректными

Независимый аудит выявил до 12% ошибок в GPQA-Diamond, MMLU-Pro и MMMU-Pro. После очистки точность топовых моделей выросла до 98%. Разбираем типы дефектов, их в

Коротко

Что будет в материале

  1. 01

    Масштаб проблемы: что не так с бенчмарками AI

  2. 02

    Какие бенчмарки пострадали и в чем именно ошибки

  3. 03

    Как ошибки повлияли на рейтинги моделей

  4. 04

    Инструменты и чистые датасеты: что подготовил автор

Независимое исследование выявило системные ошибки в четырёх популярных бенчмарках для оценки AI-моделей. В датасетах GPQA-Diamond, GPQA-Extended, MMLU-Pro и MMMU-Pro до 12% вопросов содержали неверные ключи ответов, множественные правильные варианты или некорректные формулировки. После очистки тестов топовые модели показали точность около 98% вместо прежних 92-93%. Автор исследования опубликовал исправленные версии датасетов, полный реестр проблемных вопросов и инструменты для автоматической верификации.

Этот кейс ставит под сомнение достоверность рейтингов, на которые ориентировались разработчики и исследователи последние два года. Если эталонный ответ в бенчмарке ошибочен, модель, которая «ошибается», на деле может давать правильный ответ. Масштаб проблемы заставляет пересмотреть подходы к оценке AI-систем.

Масштаб проблемы: что не так с бенчмарками AI

Бенчмарки остаются основным инструментом сравнения языковых и мультимодальных моделей. GPQA-Diamond оценивает способность решать сложные научные задачи на уровне PhD. MMLU-Pro покрывает 57 дисциплин и считается стандартом для измерения знаний моделей. MMMU-Pro тестирует понимание изображений и текста в связке. На результаты этих тестов ссылаются в model card, пресс-релизах и технических отчётах.

Проблема в том, что часть вопросов в этих датасетах изначально содержит ошибки. Исследователь вручную проверил тысячи примеров и обнаружил три категории дефектов:

  • Неверные ключи ответов - эталонный ответ, указанный в датасете, фактически неправильный.
  • Множественные правильные варианты - формулировка вопроса допускает несколько корректных ответов, но система оценивания засчитывает только один.
  • Некорректные формулировки - текст вопроса или вариантов ответа содержит логические противоречия либо не соответствует контексту задачи.

Доля дефектных вопросов варьируется от бенчмарка к бенчмарку, но общая цифра достигает 12%. Для датасета из 1000 вопросов это 120 некорректных примеров - достаточно, чтобы исказить итоговую метрику на несколько процентных пунктов.

Ситуация напоминает скандал с бенчмарками Laguna, где нерабочие шаблоны и ошибки в конфигурациях сделали заявленные метрики невоспроизводимыми. В обоих случаях корень проблемы - недостаток независимой верификации данных, на которых строится сравнение моделей.

Какие бенчмарки пострадали и в чем именно ошибки

Разберём характер ошибок по каждому датасету. Понимание типов дефектов поможет критически оценивать результаты, опубликованные до выхода исправленных версий.

GPQA-Diamond и GPQA-Extended: неверные ключи ответов

GPQA (Google-Proof Q&A) позиционируется как бенчмарк вопросов, ответы на которые нельзя найти прямым поиском в интернете. Вопросы составляли эксперты в биологии, физике и химии. Однако часть эталонных ответов оказалась ошибочной.

Типичный пример: вопрос по органической химии требовал определить продукт реакции. Эталонный ответ указывал на соединение A. Детальный анализ показал, что в указанных условиях реакции образуется соединение B. Модель, выбравшая вариант B, получала штраф, хотя её ответ был химически корректным.

Для GPQA-Diamond, который содержит наиболее сложные вопросы, доля неверных ключей составила несколько процентов. GPQA-Extended, как расширенная версия, унаследовал те же ошибки. Последствия для оценки reasoning-способностей моделей существенны: занижалась точность на вопросах, требующих многошаговых рассуждений.

MMLU-Pro: множественные правильные варианты

MMLU-Pro - усложнённая версия MMLU с десятью вариантами ответа вместо четырёх. Проблема этого датасета - неоднозначность формулировок. В ряде вопросов два и более варианта можно обоснованно считать правильными, но разметка признаёт только один.

Пример из области права: вопрос о юрисдикции допускал две трактовки в зависимости от прецедента. Обе интерпретации подтверждаются авторитетными источниками. Модель, выбравшая «неэталонный» правильный ответ, получала ноль баллов.

Такие ошибки систематически занижали accuracy моделей на 2-5 процентных пунктов в соответствующих категориях. Для разработчиков, выбирающих модель под юридические или медицинские задачи, это создавало ложное представление о компетентности системы.

MMMU-Pro: некорректные формулировки

MMMU-Pro оценивает мультимодальное понимание - модель получает изображение и текстовый вопрос. Ошибки здесь связаны с рассогласованием визуального контекста и текста задания.

В одном из примеров вопрос спрашивал о цвете объекта, который отсутствовал на изображении. В другом - диаграмма содержала данные, противоречащие тексту вопроса. Модель, корректно интерпретировавшая изображение, давала ответ, не совпадающий с эталоном.

Для vision-language моделей такие дефекты критичны: они искажают оценку способности связывать визуальную и текстовую информацию. Разработчики мультимодальных систем получали заниженные метрики и могли принимать неверные архитектурные решения на основе этих данных.

Как ошибки повлияли на рейтинги моделей

Очистка датасетов изменила картину радикально. До исправления топовые модели - GPT-4, Claude 3.5 Sonnet, Gemini 1.5 Pro - показывали на этих бенчмарках точность 92-93%. После удаления дефектных вопросов и корректировки ключей показатель вырос до 98%.

Разница в 5-6 процентных пунктов - это переход от «модель ошибается в каждом двенадцатом вопросе» к «модель ошибается в каждом пятидесятом». Для прикладных сценариев такое различие определяет, можно ли доверять системе в ответственных задачах.

Старые лидерборды, основанные на исходных версиях датасетов, теперь требуют пересмотра. Модели, которые казались аутсайдерами, могли быть оценены несправедливо. И наоборот - преимущество некоторых систем могло объясняться не качеством рассуждений, а случайным совпадением с ошибочными эталонными ответами.

Этот случай перекликается с проблемой evaluation awareness - способности LLM отличать тесты от реальной работы. Когда бенчмарк содержит систематические ошибки, модель может научиться эксплуатировать эти дефекты, а не демонстрировать genuine understanding. Очистка датасетов снижает риск такой «игры с тестом».

Отдельный вопрос - прозрачность публикации результатов. Технический отчёт Kimi-K3 показал, что даже крупные лаборатории могут публиковать метрики без достаточной детализации методологии. Очищенные датасеты дают сообществу эталон, относительно которого можно проверять заявленные цифры.

Инструменты и чистые датасеты: что подготовил автор

Автор исследования не ограничился выявлением проблем - он опубликовал инструментарий для самостоятельной проверки бенчмарков и исправленные версии датасетов.

Очищенные датасеты: что изменилось

Исправленные версии GPQA-Diamond, MMLU-Pro и MMMU-Pro доступны в публичных репозиториях. Изменения включают:

  • Корректировку неверных эталонных ответов на основе экспертной верификации.
  • Удаление вопросов с неустранимой неоднозначностью, где несколько вариантов остаются равноправными.
  • Исправление формулировок в вопросах, где текст расходился с контекстом задачи.

Формат датасетов сохранён для совместимости с существующими пайплайнами оценки. Разработчики могут заменить исходные файлы на очищенные без изменения кода тестирования. Для каждого изменения доступен diff, показывающий, что именно было исправлено.

Полный реестр проблемных вопросов содержит идентификаторы примеров, описание ошибки и обоснование исправления. Это позволяет независимо перепроверить каждое изменение.

Инструменты верификации вопросов

Вместе с датасетами опубликованы скрипты для автоматического выявления типовых дефектов в бенчмарках:

  • Детектор дубликатов - находит вопросы с идентичными или почти идентичными формулировками.
  • Проверка консистентности ключей - выявляет случаи, где один и тот же вопрос встречается с разными эталонными ответами.
  • Анализатор неоднозначности - подсвечивает вопросы, где несколько вариантов ответа семантически эквивалентны.

Инструменты запускаются из командной строки и принимают датасеты в стандартных форматах. Разработчики могут встроить проверку в CI/CD пайплайн, чтобы автоматически валидировать новые бенчмарки перед использованием.

Методология, заложенная в эти инструменты, перекликается с подходами из расследования фейковых заявлений Basalt Labs: техническая верификация через воспроизводимые тесты и сравнение хешей моделей. Систематический подход к проверке данных - единственный способ отличить реальный прогресс от манипуляции цифрами.

Последствия для индустрии: можем ли мы доверять бенчмаркам?

Обнаружение ошибок в четырёх ключевых бенчмарках поднимает системный вопрос о качестве эталонных данных в AI-индустрии. Бенчмарки создаются людьми, а люди ошибаются. Проблема не в конкретных датасетах, а в отсутствии культуры независимого аудита.

Текущая практика такова: лаборатория публикует модель и метрики на стандартных бенчмарках. Сообщество принимает эти цифры, редко перепроверяя сами датасеты. Ошибки накапливаются годами. GPQA использовался в десятках исследований, прежде чем кто-то систематически проверил ключи ответов.

Три вывода для индустрии:

  1. Независимый аудит датасетов обязателен. Так же как код моделей проходит code review, эталонные ответы должны проходить экспертную верификацию. Автоматические инструменты, подобные опубликованным в этом исследовании, снижают порог входа для такой проверки.
  2. Прозрачность методологии. Разработчики бенчмарков должны публиковать не только итоговые цифры, но и процесс сбора и валидации данных. Без этого невозможно оценить надёжность метрик.
  3. Множественные источники оценки. Один бенчмарк, даже очищенный, не даёт полной картины. Комбинация автоматических тестов, экспертной оценки и adversarial testing'а снижает риск систематических ошибок.

Этот кейс - не повод отказываться от бенчмарков, а стимул сделать их надёжнее. Очищенные датасеты уже показали, что модели умнее, чем мы думали. Следующий шаг - создать процесс, при котором такие ошибки выявляются до публикации, а не через два года после.

Практические рекомендации: как теперь оценивать модели

С учётом обнаруженных проблем, процесс оценки моделей требует нескольких изменений. Конкретные шаги для разработчиков и ML-инженеров:

  • Проверяйте версию датасета. Убедитесь, что используете очищенные версии GPQA-Diamond, MMLU-Pro и MMMU-Pro. Исходные версии дают заниженные и искажённые метрики.
  • Используйте несколько бенчмарков. Не полагайтесь на один датасет. Комбинируйте MMLU-Pro с HumanEval, MATH, Big-Bench Hard. Если модель показывает аномальный скачок на одном бенчмарке при средних результатах на остальных - это повод для проверки.
  • Дополняйте автоматические метрики экспертным анализом. Для доменно-специфичных задач проводите ручную оценку на выборке из 50-100 примеров. Это выявляет проблемы, которые усреднённая метрика скрывает.
  • Изучайте методологию сбора данных. Бенчмарк, собранный через краудсорсинг без экспертной верификации, с высокой вероятностью содержит ошибки. Предпочитайте датасеты с документированным процессом валидации.
  • Интерпретируйте результаты с поправкой на погрешность. Разница в 1-2 процентных пункта между моделями на одном бенчмарке статистически незначима, если датасет не проходил независимый аудит.

Очищенные датасеты и инструменты верификации дают сообществу основу для более честного сравнения моделей. Используйте их в своих пайплайнах оценки - это снижает риск принять неверное архитектурное или бизнес-решение на основе дефектных данных.

Подписаться на канал