Перейти к содержанию
Публикация AiManual

Jev и «System One Models»: новый класс ИИ или обычный классификатор с маркетингом?

Разбираем Jev от TypeSafe AI: что модель делает на самом деле, почему сравнения с LLM некорректны, что показывают бенчмарк BTZSC и тест на Banking77, и почему 0

Коротко

Что будет в материале

  1. 01

    Что такое Jev и «System One Models»

  2. 02

    Почему заявленные возможности Jev - не новый класс ИИ

  3. 03

    Сравнения Jev с LLM: почему это некорректно

  4. 04

    Эксперимент на Banking77: BGE-small против Jev

Jev от TypeSafe AI не открывает новый класс ИИ. Модель возвращает вероятности по ограниченному набору классов, не генерирует текст авторегрессионно и не может выдать класс вне заданной схемы. Ровно это годами делают zero-shot/NLI-классификаторы, эмбеддинг-модели, кросс-энкодеры и реранкеры. Публичные материалы не показывают, что здесь появилось что-то принципиально новое: термин «System One Models» держится на маркетинге, а не на независимых тестах.

Сравнения Jev почти всегда идут с авторегрессионными LLM. На таком фоне специализированный классификатор ожидаемо быстрее и дешевле, и это не достижение Jev, а разница между двумя классами моделей. Корректная проверка - сравнение с сильными классификаторами, например в бенчмарке BTZSC на 22 датасетах.

Есть и конкретный контраргумент. В одном эксперименте на датасете Banking77 эмбеддинг-модель BGE-small с логистической регрессией показала 93,3% точности против 83,2% у Jev при ~9 мс на локальной машине. Отдельного разбора требует тезис «0% галлюцинаций»: по объяснению самих разработчиков это гарантия соответствия схеме, а не эмпирическая метрика.

Что такое Jev и «System One Models»

Jev - модель от TypeSafe AI, которую продвигают как decision-модель. Она не пишет текст, а отвечает на типизированные вопросы: «да/нет», «выбери один из вариантов», «оцени по шкале». Публично о продукте известно немного, архитектура и метод обучения не раскрыты. Практический обзор модели с примерами и кейсами собран в материале Jev от TypeSafe AI: что это за модель без текста на выходе и почему она дешевле LLM.

Как работает Jev: ключевые характеристики

  • Выдаёт вероятности по ограниченному набору классов. На вход идёт состояние и список допустимых вариантов, на выход - распределение вероятностей по ним.
  • Не генерирует авторегрессионно. Пошагового порождения токенов нет: модель делает один проход и сразу отдаёт ответ.
  • Не может выдать недопустимый класс. Выход ограничен схемой, которую задал пользователь.
  • Использует метки, заданные на этапе инференса. Список классов можно менять от запроса к запросу без переобучения.

Каждый пункт из этого списка - стандартное поведение классификатора. Распределение вероятностей по фиксированному набору классов и метки, задаваемые строкой на инференсе, давно описаны и реализованы в открытых библиотеках.

Что разработчики называют «System One Models»

«System One Models» - термин, которым TypeSafe AI обозначает заявленный новый класс decision-моделей. По смыслу он отсылает к системе 1 из психологии: быстрые автоматические решения без длинных рассуждений. За словосочетанием не стоит публично описанная архитектура, формальное определение класса или набор отличительных механизмов.

Возможная новизна непубличной архитектуры или метода обучения RLCD (reinforcement learning for calibrated decisions) публичными данными не проверена и не опровергнута. Проблема в другом: доказательств того, что вместе с Jev появился новый класс ИИ, тоже нет.

Почему заявленные возможности Jev - не новый класс ИИ

Разбор удобно начать с формулировки из обсуждения на r/LocalLLaMA:

«It outputs probabilities over constrained choices, doesn’t generate autoregressively, can’t output an invalid class, and can use labels defined at inference time... None of that is new. Zero-shot/NLI classifiers, embedding models, cross-encoders and rerankers have been doing variations of this for years» (источник).

Zero-shot/NLI-классификаторы и эмбеддинг-модели

NLI-классификатор (natural language inference) работает так: текст превращают в пару с гипотезой-меткой, например «Этот отзыв о доставке», а модель оценивает, следует ли гипотеза из текста. Вероятность «entailment» играет роль уверенности в классе. Метка задаётся строкой на этапе инференса, дообучение не требуется.

Эмбеддинг-модели идут другим путём: текст и метку превращают в векторы, близость векторов даёт оценку принадлежности классу. Логистическая регрессия поверх эмбеддингов превращает это в калиброванный классификатор, который обучается на сотнях примеров и работает за миллисекунды даже на CPU.

Кросс-энкодеры и реранкеры

Кросс-энкодер принимает пару «запрос + документ» и выдаёт один скор релевантности. Реранкер делает то же для списка кандидатов и сортирует их. Ни один из них не генерирует текст авторегрессионно, оба работают с ограниченным выходом и не могут вернуть значение вне допустимого набора.

Складываем: описанное поведение Jev совпадает с тем, что годами делают четыре известных класса моделей. Публичные данные новизну класса не устанавливают, а значит и заявление о новом классе ИИ остаётся недоказанным.

Сравнения Jev с LLM: почему это некорректно

Большинство эффектных сравнений Jev проводят именно с LLM, и это ломает картину: «Of course a specialized classifier is faster and cheaper than making an autoregressive LLM generate an answer» (источник).

Почему специализированный классификатор быстрее и дешевле LLM

Авторегрессионная модель порождает ответ токен за токеном: каждый следующий токен зависит от всех предыдущих, поэтому вычислений тем больше, чем длиннее ответ. На длинном контексте добавляется время на его обработку. Классификатор делает один прямой проход по сети и отдаёт вектор вероятностей. Разница в задержке и стоимости возникает из постановки задачи, а не из инженерного чуда.

TypeSafe AI заявляет преимущество до 200x по скорости и до 400x по стоимости на задачах классификации в сравнении с сопоставимыми LLM. Эти цифры стоит читать как данные компании: методика расчёта публично не раскрыта. Как это устроено в коде и что даёт интеграция с LangChain, разобрано в статье Jev от TypeSafe AI: как System One модель ускоряет решения AI-агентов и работает с LangChain.

С чем корректно сравнивать Jev: бенчмарк BTZSC

Значимое сравнение - с сильными существующими классификаторами. Для этого есть бенчмарк BTZSC: он оценивает десятки zero-shot-классификаторов на 22 датасетах, включая NLI-модели, эмбеддинг-модели и реранкеры. Это ровно тот ландшафт, в котором Jev и должен был бы доказывать преимущество.

По наблюдению автора обсуждения, в этом ландшафте Jev должным образом ещё не тестировали. Оговорка честная: это личное наблюдение, а не систематический обзор всех публикаций. Но без подобных тестов заявления о новом классе остаются преждевременными.

Эксперимент на Banking77: BGE-small против Jev

Banking77 - датасет с запросами клиентов банка, разложенными по 77 интентам. Типичная задача классификации: набор классов известен заранее, вариантов ответа ровно 77, генерация текста не нужна.

Условия и результаты теста

В одном эксперименте связка BGE-small (эмбеддинг-модель) и логистической регрессии показала 93,3% точности против 83,2% у Jev. Время вывода - около 9 мс на локальной машине. Разрыв почти в 10 процентных пунктов.

Оговорки здесь важнее самих цифр: эксперимент единичный, методология не описана, повторяемость не проверена, версия и настройки Jev неизвестны. Официальным бенчмарком этот результат не назвать.

Что это говорит о позиционировании Jev

Если пайплайн из открытой эмбеддинг-модели и логистической регрессии обходит Jev на конкретном датасете, тезис «новый класс ИИ» требует куда более серьёзных доказательств. Jev может выигрывать в других сценариях, например там, где метки описываются свободным текстом и меняются на лету, но публичные данные уникальности не подтверждают.

Тезис «не может галлюцинировать»: что на самом деле гарантирует Jev

Формулировка «0% галлюцинаций» звучит как метрика качества. По объяснению самих разработчиков это не метрика: гарантируется только попадание ответа в разрешённую схему. «Their own explanation admits the 0% hallucination figure is not empirical, and what they actually guarantee is that Jev returns an answer matching the allowed schema. That prevents invalid outputs, it does not prevent confidently choosing the wrong valid answer» (источник).

Разница между недопустимым и неверным ответом

Пример. Классификатор обращений в поддержку получает список из пяти тем: оплата, доставка, возврат, аккаунт, другое. Ответить «космический корабль» модель не может, такого класса в схеме нет. Зато она может с уверенностью 0,98 выбрать «возврат», когда клиент писал про задержку доставки. Формально валидно, по сути ошибка.

Почему это важно для практического использования

Там, где критична точность, гарантия схемы не заменяет эмпирическую оценку: считать нужно accuracy, F1 и калибровку вероятностей на своих данных, а не маркетинговый ноль. Разница между «модель не может ответить вне списка» и «модель отвечает правильно» - это разница между валидацией формата и качеством решения.

Как работать с уверенностью на практике, показано в разборе Jev от TypeSafe: классификатор или фильтр? Разбор 16 000 вызовов на открытых и внутренних данных: пороги отбрасывания по вероятностям позволяют отделять надёжные ответы от сомнительных и передавать спорные случаи более сильной модели.

Может ли Jev быть хорошим продуктом

Да. Отсутствие нового класса не означает плохой продукт. Быстрый и дешёвый классификатор с готовым API закрывает реальные задачи: маршрутизация обращений, проверка вызовов инструментов у агента, оценка трасс, фильтрация перед более дорогой моделью.

Что может быть новым в Jev

Архитектура Jev не раскрыта, метод обучения RLCD описан только по названию. Вполне возможно, что внутри есть оригинальные решения, которые дают выигрыш в калибровке или устойчивости к формулировкам. Проверить это по публичным данным нельзя, поэтому корректная формулировка звучит так: новизна возможна, но не подтверждена.

Как оценивать подобные решения на практике

Рабочий набор проверок:

  1. Собрать размеченную выборку на своих данных, минимум несколько сотен примеров на класс.
  2. Прогнать базовые линии: BGE-small или другую эмбеддинг-модель с логистической регрессией, кросс-энкодер, при необходимости небольшую LLM.
  3. Сравнить accuracy и F1, задержку и стоимость на одинаковых входах.
  4. Проверить калибровку: насколько вероятность 0,9 соответствует реальной доле правильных ответов.
  5. Уточнить требования к данным: можно ли запускать локально и что уходит на серверы провайдера.

Для оценки агентов похожий подход применяют через Jev в роли судьи. Детали и границы сценария разобраны в материале Jev-as-a-Judge: как System One-модели меняют оценку AI-агентов, а ориентир по задержке при локальном запуске даёт разбор Jev-подобный API на Ninfer с Qwen3.8-27B: разбор прототипа.

Практический вывод: когда использовать классификаторы, а когда LLM

Критерии выбора: скорость, стоимость, точность

Задача классификации с заранее известным набором классов решается специализированной моделью дешевле и быстрее. Открытая генерация, рассуждения, работа с произвольными форматами - территория LLM. Смешанная схема часто оптимальна: классификатор или реранкер отсеивает простые случаи, LLM разбирает остаток.

Критерии, по которым стоит сравнивать решения:

  • скорость вывода на вашем железе или у провайдера;
  • стоимость за 1000 запросов;
  • точность и калибровка на ваших данных;
  • возможность локального запуска и требования к VRAM;
  • чувствительность к длине входа и к размытости меток.

Итог: Jev - продукт, а не новый класс ИИ

Публичные данные не подтверждают, что Jev и «System One Models» образуют новый класс ИИ. Описанное поведение совпадает с давно известными классами моделей, сравнения идут с LLM, где преимущество предсказуемо, а единственный публичный контрпример на Banking77 показывает отставание от простого пайплайна с BGE-small.

Что делать практически: возьмите свою задачу, соберите 300-500 размеченных примеров и прогоните два-три варианта, включая эмбеддинг-модель с логистической регрессией. Решение принимайте по цифрам на своих данных. Маркетинговый термин «System One» для выбора инструмента не добавляет ничего.

Подписаться на канал