Что сравнили и зачем: Kev 4B, Jev и скрытая цена токенов
По точности Kev 4B и Jev идут вровень: разница не превышает 2 процентных пунктов ни на одной задаче в тесте из 362 свежих примеров. Единственное заметное исключение - распознавание перефразировок PAWS, где Jev набрал 87,0% против 74,5% у Kev 4B. Второе отличие в пользу Jev: он лучше калиброван, то есть заявленная уверенность модели ближе к её реальной доле верных ответов.
Неприятность обнаружилась в тарификации. Заявленная цена у моделей одинаковая, но Jev списывает фиксированные ~257 дополнительных входных токенов на каждый запрос. Для коротких запросов это даёт рост стоимости до 12 раз: запрос из пары десятков токенов оплачивается как запрос из нескольких сотен.
Сравнение провёл сторонний автор, запустивший обе модели бок о бок на одном эндпоинте; маршрутизация шла через его стартап Opper (пост с результатами и описанием методики). Kev 4B - Apache-2.0-файнтюн Qwen3.5-4B от Джареда Палмера. Набор тестов собрали из новых статей arXiv, вопросов Stack Exchange и issues на GitHub, опубликованных уже после выхода обеих моделей, а эталонные ответы взяли из первоисточника. AI-Manual этот тест не проводил: ниже разбор чужих результатов и практические следствия из них.
Kev 4B: что это за модель и почему она важна
Kev 4B - дообученная версия Qwen3.5-4B, опубликованная Джаредом Палмером под лицензией Apache-2.0. Отдельной архитектуры здесь нет: база остаётся прежней, меняются веса, полученные на дополнительных данных. Название прямо указывает на класс базовой модели, поэтому требования к памяти и скорость инференса наследуются от Qwen3.5-4B.
Apache-2.0 разрешает использовать, изменять и распространять модель, включая коммерческие продукты. Требования минимальные: сохранять уведомления об авторстве и текст лицензии, отмечать изменённые файлы. Отдельный пункт - явная патентная лицензия от авторов модели, что снимает часть юридических рисков при использовании в продукте.
Практический смысл в размере. Модель класса 4B рассчитана на локальный запуск, поэтому её можно держать на своём железе и не платить за токены вообще. Конкретные требования к VRAM зависят от формата квантизации и длины контекста, их подбирают под конкретный GPU.
В тесте Kev 4B взял 74,5% на PAWS - это худший результат среди двух моделей на данной задаче. На остальных задачах набора он не отстал от Jev больше чем на 2 процентных пункта, то есть держался на уровне соперника. Для модели на 4 миллиарда параметров, которую можно запустить локально, такой результат интересен сам по себе.
Jev: характеристики и в чём его сильные стороны
Jev лучше калиброван и заметно сильнее в распознавании перефразировок: 87,0% против 74,5%. Это два преимущества, подтверждённые числами в тесте, и на них стоит опираться при выборе.
Механика Jev отличается от привычной LLM. По разборам AI-Manual, Jev от TypeSafe AI выдаёт вероятности по вариантам, которые задал пользователь, вместо генерации свободного текста (механика работы и кейсы Vercel с Bryo AI). Отсюда следует другая природа ошибок: модель не может «нафантазировать» ответ вне предложенных вариантов, но и не напишет текст, если он нужен (разбор с бенчмарком BTZSC и тестом на Banking77).
О лицензии Jev в источнике ничего не сказано. В заголовке поста он назван open-source альтернативой, но подтверждения лицензии там нет. Если планируете строить на Jev коммерческий продукт, этот пункт придётся уточнять отдельно: у Kev 4B с этим всё прозрачно, у Jev - нет.
Дополнительные токены не связаны только с обёрткой конкретного клиента. При прямом вызове TypeSafe счётчик показывает те же ~257 лишних входных токенов. Автор теста фиксирует факт, но не разбирает причину: разбора системного промпта или служебной разметки формата вывода в тексте нет. Поэтому воспринимайте цифру как измеренную величину, а не как объяснённое свойство.
Методология теста: 362 свежих примера и один эндпоинт
Набор собран из 362 примеров, опубликованных после выхода обеих моделей: научные статьи arXiv, вопросы Stack Exchange, issues на GitHub. Ответы брали из первоисточника, а не из выводов другой модели. Обе модели вызывались на одном и том же эндпоинте, трафик маршрутизировался через Opper.
Свежесть выборки важна из-за утечек в обучающие данные. Если пример появился в сети до обучения модели, она могла видеть его в составе корпуса, и точность получается завышенной. Дата публикации позже даты релиза снижает этот риск. Полностью исключить утечку нельзя, но для сравнения двух моделей между собой такой отбор даёт сопоставимые условия.
Один эндпоинт на обе модели - это одновременно плюс и ограничение. Плюс в том, что сетевые задержки и особенности API не разъезжаются между сторонами сравнения. Ограничение в том, что часть инфраструктуры была общей, и результаты описывают работу через Opper, а не поведение моделей в любом другом окружении.
Почему 362 примера - это достаточно и одновременно мало
Арифметика простая. При выборке 362 примера и точности около 50% стандартная ошибка доли составляет примерно 2,6 процентного пункта. Для задачи с точностью около 75% она чуть меньше, порядка 2,3 п.п. Разница в 2 процентных пункта между моделями укладывается внутрь одной статистической погрешности, и на её основе нельзя утверждать, что одна модель точнее.
Проверка аналогией: подбросьте монету 362 раза, и отклонение орла от 50% на пару процентов - обычное дело, а не признак кривой монеты. Чтобы сузить стандартную ошибку до 1 п.п. при точности около 50%, понадобится примерно 2500 примеров. Для уверенного утверждения «модель A точнее модели B на 2 пункта» выборки не хватает.
Что тест всё же показывает: модели близки, и заметные различия надо искать не в общем балле точности, а в отдельных задачах и в цене. PAWS - как раз такой случай. Разрыв 12,5 п.п. в разы превышает погрешность, если задача оценивалась на всей выборке. Размер подвыборки PAWS в источнике не указан, поэтому это ориентир, а не строгий расчёт.
Результаты сравнения точности: где Jev выигрывает, а где паритет
| Задача | Jev | Kev 4B | Комментарий |
|---|---|---|---|
| PAWS (распознавание перефразировок) | 87,0% | 74,5% | Разрыв 12,5 п.п., выходит за пределы шума |
| Остальные задачи набора | разница в пределах 2 п.п. | разница в пределах 2 п.п. | Паритет: разница меньше статистической погрешности |
По большинству задач модели неразличимы. Если ваша нагрузка попадает в этот общий набор, выбирать между ними по точности смысла нет: решать будут цена, лицензия и удобство запуска. Реальный водораздел - PAWS и калибровка.
PAWS: почему распознавание перефразировок - важный навык
PAWS (Paraphrase Adversaries from Word Scrambling) проверяет, понимает ли модель смысл, а не совпадение слов. Пример: запрос «как настроить VPN на роутере» и «конфигурация VPN для маршрутизатора» означают одно и то же, хотя пересечение по ключевым словам частичное. Модель со слабым навыком посчитает это разными вопросами.
Навык нужен там, где пользователь формулирует запрос своими словами. Поиск по базе знаний, RAG поверх документации, поддержка клиентов, дедупликация обращений, нормализация входящих тикетов: во всех этих сценариях перефразировка - норма, а не исключение. Разрыв 87,0% против 74,5% означает, что Jev в среднем лучше улавливает такие связки, и на потоке коротких запросов это заметно.
Обратная сторона: если ваши запросы шаблонные и приходят строго по инструкции, преимущество Jev на PAWS вам почти не поможет.
Калибровка: что это и почему Jev лучше
Калибровка описывает соответствие между уверенностью модели и её фактической точностью. Если модель заявляет уверенность 90%, то в 90% случаев она должна быть права. Плохо калиброванная модель при том же уровне точности раздаёт уверенность 95% там, где права в 70% случаев.
Практическое следствие касается порогов. В конвейерах, где решение принимает не человек, а код, часто нужен фильтр: пропускать дальше только ответы с уверенностью выше заданной, а остальные отправлять на ручную проверку или в отказ. Надёжная калибровка позволяет подобрать такой порог осмысленно. Слабая калибровка ломает всю конструкцию: порог приходится выставлять наугад, а часть уверенных ответов оказывается неверной.
В тесте лучшая калибровка зафиксирована у Jev как качественный вывод: автор не приводит конкретных чисел ECE или Brier, поэтому сравнивать модели по величине расхождения уверенности нельзя.
Скрытая цена токенов: почему Jev может быть до 12 раз дороже
Оба варианта заявлены по одной цене за входной токен. Разница возникает в подсчёте: Jev начисляет фиксированные ~257 дополнительных входных токенов на каждый запрос. Эти токены не видны в вашем промпте, но попадают в счёт, и для коротких запросов их доля становится основной.
Тот же счётчик показывает ~257 лишних токенов при прямом вызове TypeSafe, то есть надбавка не сводится к одному конкретному шлюзу. По оценке автора теста, короткие запросы из-за этого обходятся до 12 раз дороже.
| Длина вашего запроса, токенов | Списано у Jev с надбавкой, токенов | Во сколько раз дороже |
|---|---|---|
| 25 | 282 | ≈11,3 |
| 100 | 357 | ≈3,6 |
| 500 | 757 | ≈1,5 |
| 2000 | 2257 | ≈1,13 |
Для самых коротких запросов разница доходит до 12 раз по оценке автора теста. Расчёт в таблице сделан при одинаковой цене за входной токен и без учёта выходных токенов: если модель генерирует длинный ответ, его стоимость складывается с этой надбавкой.
Как считать реальную стоимость запроса с учётом наценки
Формула простая:
стоимость = (длина_запроса + 257) × цена_за_входной_токен
Прайс за миллион токенов сам по себе плохой ориентир, потому что не учитывает ни длину реальных запросов, ни служебные надбавки. Надёжнее считать стоимость решённой задачи: умножить средний расход токенов на вашем трафике на цену и посмотреть, сколько стоит один успешный результат. Такой подход разбирали в отдельном материале о расчёте реальной стоимости на открытом харнессе.
Ещё один аргумент в пользу пересчёта на задачу: разброс цен между провайдерами бывает кратным, и архитектурные причины этой разницы не всегда очевидны (сравнение цен и производительности с разбором скрытых издержек тарификации).
Когда наценка критична, а когда можно игнорировать
Надбавка критична там, где много коротких вызовов: чат-боты с репликами в одну строку, классификация, извлечение сущностей, маршрутизация запросов между инструментами, дешёвые проверки формата. Возьмём 10 000 запросов по 25 токенов. Без надбавки это 250 000 входных токенов, с надбавкой - 2 820 000, то есть в 11,3 раза больше. При цене, скажем, за миллион токенов разница превращается в конкретные деньги на счёте.
На длинных запросах надбавка растворяется. Контекст на 2000 токенов с надбавкой стоит как 2257 токенов: 13% сверху, а не 1000%. В RAG-конвейерах с большими документами, при анализе длинных текстов и генерации объёмных ответов эти 257 токенов почти не влияют на бюджет.
Проверить свою нагрузку можно за один проход по логам: посчитайте распределение длины входных запросов. Если медиана ниже 200 токенов, надбавка будет ощутимой. Если запросы стабильно длиннее 1000 токенов, ей можно пренебречь.
Практические рекомендации: какую модель выбрать
По большинству задач точность лежит в пределах шума, поэтому решающими становятся цена, лицензия и специфика задачи. Ниже три критерия, которые стоит проверить на своём трафике.
Сценарии, где Kev 4B предпочтительнее
- Много коротких запросов: массовая классификация, извлечение полей, роутинг. Надбавка в 257 токенов тут бьёт по бюджету сильнее всего.
- Коммерческий продукт, где нужна понятная лицензия: Apache-2.0 разрешает использование и модификацию, ограничения прозрачны.
- Локальный запуск: модель класса 4B можно держать на своём железе и убрать плату за токены как статью расходов.
- Задачи без перефразировок и без опоры на калибровку: шаблонные промпты, извлечение, простые трансформации текста.
Сценарии, где Jev предпочтительнее
- Работа с перефразированными запросами: разрыв 12,5 п.п. на PAWS окупает надбавку там, где качество понимания смысла важнее стоимости вызова.
- Системы с порогами уверенности: ручная проверка по отклонению, автоотказ от ответа, маршрутизация по уверенности.
- Длинные контексты: при запросах в тысячи токенов надбавка даёт 10-15% сверху и почти не меняет бюджет.
- Сценарии, где нужен выбор из заданных вариантов, а не генерация текста: там сильные стороны Jev видны лучше всего.
Учитывайте оговорку: лицензия Jev в источнике не раскрыта, поэтому для коммерческого использования сначала уточните условия.
Как воспроизвести тест и проверить результаты
Код бенчмарка, тестовые примеры и результаты выложены на GitHub, ссылку автор приводит в своём посте с описанием теста. Прятать там нечего: набор из 362 примеров, промпты и метрики открыты, поэтому свои прогоны можно поставить поверх той же схемы.
Если хочется посмотреть на похожие самодельные решения, в AI-Manual разбирали Jev-подобный API на Ninfer с 84,4% на JevBench и задержкой 127 мс на RTX 5090: там видны и ограничения самодельных обвязок, и типичные слабые категории задач.
При своём прогоне держите в голове, что результаты зависят от эндпоинта, провайдера и конфигурации. Тест из поста описывает один эндпоинт с маршрутизацией через Opper, и повторение той же схемы на другом провайдере может дать другие числа, особенно по подсчёту токенов.
Ограничения теста и что важно помнить
- Разница в точности до 2 процентных пунктов находится в пределах шума при 362 примерах. Утверждать, что одна модель точнее по всем задачам, нельзя.
- Преимущество Jev на PAWS (87,0% против 74,5%) выглядит устойчивым, но размер подвыборки PAWS в источнике не указан, так что строгой статистики по этой задаче нет.
- Данные о токенах и цене приведены при одинаковой заявленной цене. Фактическая стоимость зависит от длины запроса и от тарифов конкретного провайдера.
- Все результаты получены на одном эндпоинте с маршрутизацией через Opper. Это условие конкретного теста, а не свойство моделей.
- Материал представляет собой пост автора теста. Независимого подтверждения результатов в предоставленных источниках нет.
- Лучшая калибровка Jev - качественный вывод без опубликованных числовых метрик, сравнивать модели по величине расхождения уверенности не получится.
Практический шаг: выгрузите из логов распределение длины входных запросов за неделю и умножьте средние значения на цены обоих вариантов с учётом +257 токенов у Jev. Если медиана укладывается в первые пару сотен токенов, считайте бюджет по Kev 4B и проверяйте качество на своих перефразированных запросах, а к Jev возвращайтесь только если разрыв на смысловых формулировках окажется для вас критичным.