Что такое Jev и почему это не LLM
Jev - трансформерная модель от стартапа TypeSafe AI. Компанию основал Диого Алмейда, бывший исследователь OpenAI: он участвовал в создании ChatGPT и метода RLHF, а два года назад ушёл из OpenAI, чтобы запустить собственный проект.
Отличие от привычных решений в том, что Jev не большая языковая модель. Текст на выходе не появляется: модель возвращает вероятности, которые TypeSafe AI называет «калиброванными решениями» (по данным TechCrunch). Формулировка источника точная: «It doesn't output text, but instead produces probabilities, or what the company calls 'calibrated decisions.'»
Как работает модель: вероятности вместо текста
Схема простая. Вы отправляете контекст (команду, фрагмент письма, лог) и список возможных выходов, который задаёте сами. В ответ приходит вероятность для каждого варианта: например, «безопасно: 0.97», «подозрительно: 0.02», «запрещено: 0.01». Генерации здесь нет, есть классификация с оценкой уверенности.
Тарификация устроена нестандартно: выходные токены бесплатны, входные считают по миллиардам, а не по миллионам. Для задач, где ответ короткий, а вход длинный (лог, документ, трассировка агента), это принципиальный момент.
Архитектуру компания не раскрывает. Публично Jev описывают как «модель Системы 1» для быстрых автоматических решений, обученную только на синтетических данных методом обучения с подкреплением на калиброванных решениях. Название отсылает к Уильяму Стэнли Джевонсу, экономисту XIX века.
Почему Jev не может галлюцинировать
Галлюцинация LLM - это правдоподобный текст, не опирающийся на факты. Jev ничего не сочиняет: набор вариантов ответа задан заранее, и выдумать новый вариант он не может. Ошибаться модель всё равно способна, только иначе: она способна присвоить высокую вероятность неправильному классу. Разница принципиальная, между «придумал несуществующий факт» и «неверно оценил вероятность».
Отсюда практический вывод: отсутствие галлюцинаций не равно высокой точности. Метрики качества всё равно нужно замерять на своих данных, потому что цена ошибки переносится в порог вероятности.
Кейсы: как Jev уже используют разработчики
Два публичных примера показывают, где такой подход окупается, и оба относятся к задачам классификации.
Vercel: ускорение в 5-18 раз при большей точности
Vercel держала классификатор проверки команд на модели OpenAI ChatGPT Luna 5.6. Инженер компании Пранит Шарма рассказал, что после замены Luna на Jev результаты стали приходить в 5-18 раз быстрее и с большей точностью (TechCrunch). Задача попадает в идеальный для Jev сценарий: выход это один из заранее известных классов, а не свободный текст.
Bryo AI: в 10-20 раз дешевле, но чуть менее точен
CTO Bryo AI Никхил Мудхолкар сравнил Jev с Gemini на классификации деловых писем. Gemini оказался немного точнее, зато обошёлся в 10-20 раз дороже. Практическую ценность Мудхолкар увидел в другом: «it is the only one that hands back a real probability which makes it ideal for automating workflows!!» Реальная вероятность позволяет автоматике решать, отправить письмо в нужную папку сразу или отдать на проверку человеку.
Интерес разработчиков оказался настолько велик, что TypeSafe AI на короткое время потеряла возможность обслуживать пользователей через свой API.
Где Jev выигрывает у LLM, а где проигрывает
Замена LLM в узких задачах: классификация и проверка команд
Разметка, сортировка обращений, проверка безопасности команд, отнесение документа к категории: везде, где выход это выбор из фиксированного набора, LLM избыточна. Она тратит токены на рассуждения и текст, тогда как Jev сразу возвращает вероятность. Кейс Vercel показывает порядок выгоды по скорости, кейс Bryo AI по стоимости.
Дополнение LLM: трассировка агентов и защита от джейлбрейков
Jev ставят рядом с языковой моделью, а не вместо неё. Он умеет отслеживать трассировки агентов и находить подозрительные шаги, а также распознавать джейлбрейки, классифицируя запрос как безопасный или опасный. Для таких проверок нужны скорость и предсказуемый выход; литературный ответ тут только мешает, потому что его ещё придётся парсить.
Маршрутизация моделей в реальном времени
Армин Ронахер, CTO компании Earendil (она строит open-source harness Pi), видит ещё один сценарий: Jev решает, какую модель отправить на запрос, дешёвую или мощную. Низкая стоимость и скорость делают такую сортировку в реальном времени практичной, тогда как отдельный вызов LLM на каждом запросе только для выбора модели съел бы всю экономию.
Ограничения и подводные камни Jev
Порог вероятности: кто решает, когда доверять
Универсального порога нет. Для сортировки писем хватает и 0.8, для блокировки опасных команд нужны 0.99 и выше. Ронахер формулирует это прямо: «At the end of the day, it delegates the hallucination problem a little bit to the user». Решение о доверии переходит к разработчику, который сам определяет, что 50% это подбрасывание монетки и такой результат нужно отбросить, а 95% уже можно использовать (TechCrunch). В коде это превращается в дополнительную работу: подбор порогов, логирование срабатываний, обработку пограничных случаев и понятный путь для запросов, которые не прошли порог.
Отсутствие генерации текста и узкая специализация
Jev не пишет ответы, не генерирует код, не ведёт диалог. Чат-боты, копирайтинг, суммаризация и любые задачи со свободным выводом остаются за LLM: подставить туда Jev нельзя, у него просто нет механизма порождения текста.
Архитектура закрыта, и публичных деталей об обучении мало: известны только синтетические данные. Как модель поведёт себя на узкоспециальной лексике (медицина, право, внутренние форматы компании), из открытых материалов неясно, поэтому проверять её стоит на своей выборке. Сведений о дообучении под конкретную задачу тоже нет, так что рассчитывать на адаптацию модели к вашей предметной области пока не стоит.
Как попробовать Jev и что учесть при интеграции
С чего начать: пошаговый план для разработчика
- Выберите задачу, где выход это выбор из фиксированного списка: категория тикета, безопасность команды, тип документа.
- Сформулируйте варианты выхода. Чем чётче границы классов, тем полезнее вероятности.
- Получите доступ к API TypeSafe AI.
- Прогоните тестовую выборку на своих данных и сравните ответы с текущим решением.
- Замерьте задержку, стоимость на 1000 запросов, точность и качество калибровки.
- Задайте порог вероятности, при котором система действует автоматически, а ниже которого передаёт задачу человеку или другой модели.
Сравнение с текущим стеком: на что смотреть
| Метрика | Что замерять | Ориентир из публичных кейсов |
|---|---|---|
| Задержка | Время ответа, p50 и p95 | Vercel: в 5-18 раз быстрее прежней модели |
| Стоимость | Цена 1000 запросов с учётом входных токенов | Bryo AI: в 10-20 раз дешевле Gemini |
| Точность | Доля верных классов на вашей выборке | У Bryo AI Gemini оказался чуть точнее |
| Калибровка | Совпадение заявленной вероятности с реальной долей ошибок | Jev возвращает реальные вероятности |
| Порог | Доля автоответов и ошибок при выбранном пороге | Подбирается под задачу, универсального значения нет |
Цифры Vercel и Bryo AI получены на их данных и их задачах, переносить их на свой стек без проверки не стоит. Общий порядок оценки новинок разобран в чек-листе по оценке новых AI-моделей, а про проблему несопоставимых замеров, которая здесь особенно мешает, есть отдельный материал об открытых бенчмарках для LLM.
Что это значит для рынка AI и автоматизации
Экономика Jev выглядит радикально: выходные токены бесплатны, входные считают по миллиардам. Если решение стоит почти ничего, AI можно встроить в те места, где раньше его не окупали: проверку полей формы, фильтрацию входящих, разметку логов, отсечение мусорных запросов до дорогой модели. Такой «умный софт» перестаёт быть роскошью и становится обычной инженерной опцией.
Дальше меняется архитектура приложений. LLM отвечает за генерацию и сложные рассуждения, Jev берёт на себя принятие решений, проверки и маршрутизацию. Разделение обязанностей снижает и цену, и число галлюцинаций в тех местах, где они дороже всего. На больших объёмах расходы считают уже по входным токенам, и логика таких расчётов разобрана в материале о масштабировании агентов до миллиарда токенов в день.
Начните с одной задачи классификации, где ответ это выбор из списка. Соберите выборку из 200-500 своих примеров, прогоните через Jev и через текущую модель, замерьте точность, задержку и стоимость, и только после этого решайте про порог и перевод в прод. Если разрыв в цене сохранится, а точности хватит, часть вызовов LLM уйдёт в специализированную модель.