Bev - решающая модель (decision model), дообученная на Qwen3.5-9B с одной целью: всегда выбирать худший из предложенных вариантов. При этом она честно выдаёт вероятность для каждого ответа. На отложенной выборке из 324 решений Bev ошибается в 98,1% случаев и в среднем заявляет уверенность 96%. Когда её уверенность не ниже 90%, доля правильных ответов падает до 1,4%.
Это не сломанная модель и не баг в обучении. Автор проекта под ником richardyoung собрал её как контрольный случай: проверить, заметит ли ваш пайплайн систему, которая уверенно ошибается. Любое правило вида «действуй автоматически, если модель уверена минимум на 90%» обычно проверяют на моделях, которые стараются быть правыми. Bev ломает эту логику.
Дальше - что она умеет, какие цифры стоят за её ошибками, как проходило обучение, где её запустить и какую пользу из этого извлечь.
Что такое Bev и зачем она нужна
Bev относится к классу решающих моделей, как Jev и Nimble. Вы подаёте на вход ситуацию и вопрос, на выходе получаете вероятность для каждого варианта ответа. Текст она не пишет: вся её работа - расставить числовые оценки по заданным опциям.
База - Qwen3.5-9B. Дообучение шло с намеренно перевёрнутой целью: из всех предложенных ответов выбирать худший. Автор проекта, richardyoung, выложил модель, адаптеры и логи обучения в открытый доступ, а саму идею описал как шутку и одновременно тестовый стенд.
Практическая ценность здесь в проверке пайплайнов. Правило «если модель уверена минимум на 90%, действуем без человека» почти всегда тестируют на моделях, которые стараются отвечать правильно. Bev - обратный случай: она уверенно и стабильно ошибается. Если ваш пайплайн пропускает её ответы в автоматику, значит, порог уверенности измеряет не то, что вы думаете. Как устроены модели, работающие с вероятностями вместо текста, разобрано в материале Jev от TypeSafe AI.
Своё достижение автор формулирует так: все гонятся за AGI, а Bev достигла ADI - Artificial Drunk Intelligence. Ирония не отменяет методологической пользы: это работающий тестовый фикстур, а не демка ради шутки.
Как Bev ошибается: цифры и метрики
Все числа измерены на отложенной выборке из 324 решений. Выборка небольшая, но фиксированная, и автор приводит её целиком.
| Метрика | Значение |
|---|---|
| Правильных ответов | 1,9% |
| Ошибочных ответов | 98,1% |
| Средняя заявленная уверенность | 96% |
| Правильных ответов при уверенности 90% и выше | 1,4% |
| Ошибочных ответов при уверенности 90% и выше | 98,6% |
Ключевой контраст: заявленная уверенность Bev не связана с правильностью. Более того, чем выше её вероятность, тем надёжнее ошибка. Когда модель сообщает, что почти уверена, это практически гарантия неверного варианта.
Случайным шумом или деградацией качества такое поведение назвать нельзя. Модель обучали именно этому, поэтому расхождение между уверенностью и корректностью встроено в цель обучения. Первоисточник цифр - пост автора с результатами.
Как обучали Bev: провалы и успех
Первая попытка: дообучить базовую модель на перевёрнутых метках, то есть показать ей корректные ответы, но пометить их как неверные. Подход провалился дважды. Примерно после двух часов GPU-времени автор получил модель, которая была права примерно в трети случаев, ни в чём не была уверена и на вопросах «да/нет» выдавала случайный выбор.
Рабочая схема оказалась другой: взять адаптер Bespoke's Nimble, который уже умеет отвечать правильно, и научить его переворачивать ответы. На это ушло 51 минута, после чего модель ошибалась в 97% случаев. Итоговый результат на отложенной выборке - те самые 98,1% ошибок.
Суммарное время обучения - 3 часа 38 минут на одной RTX 4090. Все запуски, включая неудачные, выложены в репозиторий, так что провалы здесь такая же часть материала, как и финальные метрики. Детали обучения и логи приведены в описании проекта.
Вывод, который переносится на другие задачи: если нужна модель с инвертированным поведением, старт от уже обученного адаптера, умеющего противоположное, часто даёт результат быстрее, чем обучение с нуля на перевёрнутых метках. У Bev разница измеряется двумя провальными запусками против одного удачного на 51 минуту.
Автор приводит и примеры диалогов. На запрос «There's a $5 tattoo special tonight. I've had four beers and I've never wanted a tattoo. Should I get one?» Bev отвечает «Yesss, great idea!». На «I'm thirsty. Should I drink a glass of water?» - «Nooo, bad idea!».
Как запустить Bev: браузер, Ollama и decision-эндпоинт
Попробовать модель можно тремя способами.
- Браузер. Bev доступна через Hugging Face Space. Вы вводите свои варианты, она выбирает худший и показывает вероятность по каждому. Для быстрой проверки поведения этого достаточно.
- Локально через Ollama. Команда
ollama run richardyoung/bev. Учтите: в чате Bev отвечает только двумя строками. Шаблон чата внутри GGUF оборачивает то, что вы ввели, в её формат решения, и она отвечает неправильным вариантом, без вероятностей. - Decision-эндпоинт Ollama. Адрес
/v1/systemoneпозволяет отправить Bev тот же запрос, что и nimble или tev1, и сравнить ответы в одинаковых условиях.
Модель распространяется под лицензией Apache-2.0 в трёх GGUF-квантах, так что вариант для локального запуска подбирается под ваши ресурсы.
Особенности квантования: почему Q8_0 по умолчанию
Квантование у Bev влияет на результат иначе, чем у генеративных моделей. Q4_K_M меняет 20 из 324 её ответов по сравнению с bf16. Когда весь выход модели - это несколько токеновых оценок, а не длинный текст, потеря точности сразу переворачивает выбор варианта: логика «Q4 и так сойдёт» здесь не работает. Поэтому тегом по умолчанию сделан Q8_0. Для воспроизведения авторских цифр берите Q8_0 или bf16.
Зачем нужна модель, которая уверенно ошибается
Bev - тестовый фикстур, контрольный случай для систем, принимающих решения по уверенности модели. Проверка занимает минуты: отправьте ей набор вопросов, прогоните ответы через свои правила и посмотрите, сколько из них прошло фильтр «уверенность 90% и выше». У Bev через этот фильтр проходят ответы, ошибочные в 98,6% случаев.
Если пайплайн пропускает такой поток в автоматику, значит, он не проверяет то, что вы думаете. Это касается любых сценариев: маршрутизация запросов между дешёвой и дорогой моделью, автоответы в поддержке, автоматическое применение изменений в коде, разбор заявок без участия человека.
Ещё одна проверка касается формата. Bev в чате возвращает две строки и не показывает вероятности. Если ваша обвязка не различает такой ответ и полноценный вывод с распределением оценок, она проглотит и его.
Автор прямо называет Bev «test fixture» - стендом для тестирования. Речь о том, чтобы проверить собственные системы, а не о том, чтобы поставить модель в продакшен.
Сравнение с другими решающими моделями
Bev - не единственная модель этого класса. Bespoke's Nimble - адаптер, который отвечает правильно, и именно от него стартовало обучение Bev. tev1 упоминается как ещё одна модель, которой можно отправить тот же запрос через /v1/systemone.
Практический сценарий сравнения: взять один запрос, отправить его Bev, nimble и tev1 и посмотреть распределения вероятностей. Так видно калибровку: у одной модели высокая уверенность совпадает с правильным ответом, у другой - с неправильным. Bev не лучше и не хуже остальных по качеству, у неё просто другая цель, и именно поэтому она годится как эталон ошибающейся системы.
Публичные сравнения decision-моделей часто грешат отсутствием методологии. Пример - разбор сравнения Clef Q8 и Jev, где не приведены ни набор задач, ни метрики, ни условия прогона. Похожая история с Qwen decision-model-preview: модель обсуждают без официального анонса и открытых весов, а тесты ограничены сторонним облачным сервисом.
Ограничения и предостережения
- Не для продакшена. Модель обучена выбирать худший вариант, поэтому принимать с её помощью реальные решения нельзя ни в каком виде.
- Чат урезан. В Ollama Bev отвечает двумя строками без вероятностей. Полное распределение оценок видно только через Hugging Face Space или decision-эндпоинт.
- Квантование меняет ответы. Q4_K_M расходится с bf16 на 20 из 324 ответов, поэтому для точных тестов нужен Q8_0 или bf16.
- База 9B. Поведение задано Qwen3.5-9B и адаптером Nimble; требования к железу зависят от выбранного кванта, а не от заявленной точности модели.
- Одна выборка. Цифры 1,9%, 96% и 1,4% относятся к набору из 324 решений. Переносить их на другие задачи и другие наборы вопросов без собственной проверки не стоит.
- Лицензия Apache-2.0 даёт свободу использования и изменения, но ответственность за применение остаётся на пользователе.
Поведение Bev за пределами описанных сценариев в источниках не раскрыто, так что додумывать его не нужно: если вам нужен вывод о каком-то конкретном пайплайне, проверьте его сами на своих вопросах.
Итог: кому и зачем нужна Bev
Bev полезна разработчикам и техническим специалистам, которые строят пайплайны с LLM и закладывают в них автоматические пороги уверенности. Это готовая проверка на слепую зону: если ваша система не замечает модель, ошибающуюся в 98,1% случаев при уверенности 96%, значит, правило про 90% у вас работает не так, как вы рассчитывали.
Запуск занимает пару минут. Откройте Hugging Face Space и введите свои варианты, либо выполните ollama run richardyoung/bev, либо отправьте запрос на /v1/systemone рядом с nimble и tev1. Лицензия Apache-2.0, три GGUF-кванта, тег Q8_0 по умолчанию.
В продакшен Bev не идёт, а вот в набор регрессионных тестов для вашего AI-пайплайна встаёт без проблем.