OpenAI на Dev Day представила Decisions API: инструмент, который даёт модели Luna заранее заданный список вариантов для выбора. Категории для классификации изображения, тип поведения агента, метка тональности: модель не пишет текст, а выбирает из того, что ей предложили. Анонс сделал CEO компании Сэм Альтман, причём мимоходом, в одном из побочных замечаний.
Похожую функциональность предлагает Jev от TypeSafe AI. Разработчик передаёт набор вариантов, а модель возвращает их как вероятности, дёшево и на высокой скорости. Небольшая деталь: Jev не ведёт диалог и не пишет текст. Ему дают текст и вопрос, а в ответ получают один из вариантов, оценку по шкале или вероятность «да/нет». Decisions API, судя по описанию Альтмана, решает ту же задачу.
Зачем это нужно: обычные LLM для многих программных задач слишком медленные и дорогие. Проверка каждого действия AI-агента через Jev обошлась примерно в $2,94 в демонстрации на хакатоне, тогда как фронтирная LLM на том же объёме стоила бы около $372. Оговорок две: Decisions API вышла в ограниченном превью, публичных замеров по ней нет, а ключевой открытый вопрос у всей категории один. Насколько хорошо вероятности таких моделей откалиброваны под реальные данные, а не под демо.
Что такое Decisions API от OpenAI и зачем она нужна
Альтман описал API как способ дать модели Luna предопределённый набор вариантов, между которыми она выбирает: категории для классификации изображения или разные типы поведения агента. Продукт позиционируется как узкий инструмент, а не как замена чат-модели.
Как работает Luna с предзаданным набором вариантов
Ключевая идея в том, что модель ограничивают рамками ответа. Вместо свободной генерации, где каждый следующий токен выбирается из десятков тысяч кандидатов, система работает с коротким списком и должна назвать один из элементов.
By focusing the model on that choice, we can make it extremely fast while keeping capabilities like image understanding, broad language support, and safety protections.
В переводе: сфокусировав модель на выборе, можно сделать её чрезвычайно быстрой, сохранив понимание изображений, широкую языковую поддержку и защитные механизмы.
Что это даёт на практике. Выход модели сразу пригоден для кода: не нужно парсить текст, вылавливать метку из рассуждений и проверять формат. Задержка падает, потому что вместо абзаца генерируется один короткий ответ. Цена запроса уменьшается по той же причине: платят за токены, а токенов становится в разы меньше.
Классификация изображений - самый очевидный сценарий. Второй пример, который приводит Альтман, интереснее для тех, кто строит агентов: модель выбирает тип поведения. Агент получает не генеративный ответ, а решение из списка, что делать дальше. Продолжить, остановиться, спросить пользователя, вызвать инструмент.
Ограниченное превью и отсутствие публичных тестов
OpenAI выпустила Decisions API в ограниченном превью. На момент публикации TechCrunch не нашёл разработчиков, которые тщательно прогнали бы её через тесты. Реальные задержки, цены и точность на конкретных датасетах пока не подтверждены ничем, кроме заявлений вендора.
Decisions API - не единственный Jev-подобный API в интернете. Другие стартапы выпускают похожие модели, и OpenAI, скорее всего, не последний технологический гигант, который зайдёт в эту нишу. Для практика это хорошая новость: появится с чем сравнивать.
Jev от TypeSafe AI: сверхмощный классификатор на базе LLM
Jev вышел у TypeSafe AI ранее в этом месяце и изначально создавался для автоматизации ПО. Разработчики дают модели набор вариантов, а она выдаёт их как вероятности, дёшево и быстро. Этот же набор примитивов, Choice, Score и Noulli, встроен в SDK, и о том, как их вызывать из узлов графа, рассказано в разборе интеграции Jev с LangChain.
Как Jev выдаёт вероятности и почему это дёшево
Разница с генеративной LLM принципиальная. LLM предсказывает следующий токен, и длина ответа напрямую определяет стоимость. Jev предсказывает распределение по заданным вариантам: выход короткий и заранее ограниченный, поэтому инференс обходится в разы дешевле. В опубликованном тесте на классификации 400 запросов через Jev суммарно стоили $0,009, ответ пришёл примерно за 330 мс через интернет и примерно за 41 мс на локальной видеокарте.
Второе следствие: модель не может галлюцинировать в привычном смысле. Все варианты ответа задал разработчик, модель только расставляет вероятности между ними. Если список не содержит правильного ответа, модель не выдумает новый, а покажет неуверенность. Разбор ранних кейсов с Vercel и Bryo AI, где Jev заменял модель OpenAI, собран в отдельном материале про Jev без текста на выходе.
Диогу Алмейда, CEO TypeSafe и бывший инженер OpenAI, участвовавший в создании обучения с подкреплением, называет ровом компании синтетические данные. Их создают специально, чтобы получать статистически полезные выходы. Для оценки качества это важно: модель зависит не от размера открытого корпуса текстов, а от того, насколько хорошо синтетика покрывает ваши реальные случаи.
System One и System 2: быстрый и медленный режимы мышления
TypeSafe использует термины «System One» и «System 2». Первый означает быстрое, интуитивное мышление, второй - осознанное рассуждение. Генеративные LLM с длинными цепочками размышлений работают во втором режиме: они рассуждают, проверяют себя, тратят токены. Decision-модели пытаются реализовать первый: мгновенный ответ по уже известному набору вариантов.
Алмейда отреагировал на анонс OpenAI шуткой в X про начало «войн клонов», а затем отметил, что интерес OpenAI может быть знаком того, что будущее за построением, совместимым с подходом System One. Читать это можно двояко: и как признание, что ниша оказалась настоящей, и как напоминание, что конкуренты уже здесь.
Почему обычные LLM слишком медленные и дорогие для части задач
Фронтирная модель отвечает секунды, а её токены стоят столько, что проверка каждого шага агента превращается в заметную статью расходов. Для чата это нормально. Для цикла, который прогоняет тысячи однотипных решений классификации, экономика не сходится. Разработчики стали использовать Jev как дополнение к LLM и обнаружили, что вместе получается быстрее и дешевле.
Алмейда формулирует границу честно и без маркетинга:
Fast and cheap is very easy, you know. If you want it really fast and cheap, use dice, right? Intelligence is the hard part, and my North Star is always pushing the intelligence-per-dollar Pareto curve.
Быстро и дёшево получить легко, если отвечать случайно, как игральными костями. Сложность в том, чтобы при этом сохранить интеллект. Его ориентир - двигать кривую Парето интеллекта на доллар.
Практический вывод: decision-модели дополняют LLM, а не заменяют её. Генеративная модель берёт открытые задачи, где нужен текст, рассуждение или разбор незнакомой ситуации. Decision-модель закрывает рутину: маршрутизацию, классификацию, проверку политик, пороговые решения.
Практический сценарий: мониторинг и защита AI-агентов через Jev
После серии инцидентов, когда агенты OpenAI плохо себя вели в открытом интернете, компания ввела отдельную модель слежения за плохими действиями, причём при «значительных вычислительных затратах». Шапор Нагибзаде, специалист по кибербезопасности и глава стартапа QueryStory, считает, что модель вроде Jev могла бы сделать такой мониторинг намного дешевле.
Он собрал для хакатона демонстрацию: Jev проверяет каждое действие агента на соответствие поставленной задаче, блокирует те, в чьей вредности уверен, помечает сомнительные для ручной проверки и пропускает остальные. Теоретически такой мониторинг мог бы остановить инцидент с Hugging Face. Цифры: около $2,94 с Jev против $372 с фронтирной LLM на том же объёме проверок.
Схема переносится и на другие задачи. Быстрый фильтр перед дорогой моделью, модерация контента, классификация намерений в поддержке, маршрутизация запросов между моделями, проверка вызовов инструментов до их выполнения. Логика одна: дешёвая модель принимает массовые решения, дорогая подключается только на исключениях. Именно так устроен подход, где состояние и рабочий процесс держит код, а решения принимает дешёвая модель.
Как выбирать порог отбрасывания и почему Jev имеет смысл ставить фильтром перед классификатором, разобрано в эксперименте на 16 000 вызовов: там же видно, что часть решений дешевле отдать генеративной модели.
Ограничения и открытые вопросы: калибровка, превью, отсутствие тестов
Главный вопрос у decision-моделей не скорость, а калибровка. Неизвестно, насколько хорошо выходы каждой из таких моделей откалиброваны под реальную жизнь. Калибровка здесь означает простое: если модель говорит «90% уверенности», ошибаться она должна примерно в одном случае из десяти, а не в трёх. Иначе автоматизация по порогу ломается, и вы либо пропускаете опасные действия, либо отправляете на ручную проверку почти всё.
Публичных данных для проверки мало. Decisions API в ограниченном превью, независимых бенчмарков по ней нет. У Jev есть отдельные опубликованные тесты, но они узкие. В одном из них на 200 сообщениях турецкого маркетплейса Jev правильно направил 95% сообщений, а открытая модель Laya от Convai Innovations, вышедшая через несколько дней после Jev, - около двух третей. Там же указано, что с турецкой инструкцией Jev ошибся 10 раз на 200 сообщениях, и большинство ошибок пришлось на двусмысленные формулировки. При пороге уверенности 0,7 модель взяла на себя 95% сообщений, из которых 98% оказались правильными, а 5% неопределённых оставила человеку.
Ещё один открытый вопрос - прозрачность обучения. TypeSafe называет своим рвом синтетические данные, но их качество и репрезентативность снаружи не проверить. Архитектурные детали компания не раскрывает, независимых оценок мало. Вывод для внедрения простой: свои эвалы и настройка порогов на собственных данных обязательны, потому что чужие метрики мало говорят о вашем домене. Подробнее о пост-трейнинге RLCD и его слабых местах - в разборе архитектуры System One.
Контекст рынка: другие Jev-подобные API и конкуренция
Ниша формируется быстро. Кроме Jev и Decisions API, стоит смотреть минимум на два примера. Laya от Convai Innovations - открытая модель, выполняющая ту же работу. Tev1 4B Experimental от Together AI - экспериментальная модель принятия решений, дообученный Qwen3.5-4B, который выбирает один вариант из структурированного состояния, вопроса и списка от 2 до 24 помеченных вариантов.
У Tev1 есть две интересные особенности. Она сохраняет стандартную функцию предсказания следующего токена Qwen, поэтому вызывается через обычный API завершения чата, а не через отдельное окружение для принятия решений. И Together публикует полный рецепт данных и код обучения, чтобы команды могли дообучить свою версию. Модель отвечает через выделенный эндпоинт, работают официальные SDK TypeSafe. Назначение заявлено узко: маршрутизация, классификация и проверка политик, а не общий чат.
| Модель | Разработчик | Особенность | Статус |
|---|---|---|---|
| Decisions API | OpenAI | Luna выбирает из предзаданного списка вариантов | Ограниченное превью |
| Jev | TypeSafe AI | Вероятности и оценка уверенности по заданным вариантам | Доступна, используется как дополнение к LLM |
| Tev1 4B Experimental | Together AI | Дообучение Qwen3.5-4B, от 2 до 24 вариантов, открытый рецепт данных | Экспериментальная |
| Laya | Convai Innovations | Открытая модель того же класса | Вышла после Jev |
Выбор между ними пока определяется тремя вещами: калибровкой на ваших данных, ценой за вызов и форматом интеграции. Последнее часто недооценивают. Модель, которую можно вызвать через привычный API чата, встраивается в существующий пайплайн за вечер, а та, что требует отдельного окружения, тянет за собой рефакторинг.
Стоит ли использовать decision-модели на практике
Decision-модель имеет смысл при трёх условиях одновременно. Задача сводится к выбору из фиксированного набора вариантов. Задержка критична: проверка идёт в цикле агента или в потоке запросов. Стоимость фронтирной LLM на этом объёме заметна в бюджете. Если хотя бы одно условие не выполняется, выигрыш сомнителен.
Обратная сторона тоже понятна. Там, где нужна генерация текста, разбор незнакомой ситуации, многошаговое рассуждение или открытый диалог, decision-модель не подходит: она не умеет отвечать за пределами списка. Попытка растянуть её на такие задачи заканчивается плохо, потому что неуверенность придётся обрабатывать вручную.
Самый зрелый сценарий на сегодня - мониторинг агентов. Экономия там измеряется порядками, а логика «заблокировать, пометить, пропустить» ложится на выходы decision-модели почти без доработки. Дальше идут фильтрация и маршрутизация, где важен поток, а не глубина рассуждений.
Что делать перед внедрением. Возьмите несколько сотен своих реальных примеров, прогоните через кандидата и постройте кривую: доля автоматических решений против точности на них. Если при 90% автоматизации точность держится на приемлемом уровне, порог найден. Если нет, снижайте долю автоматики, а не доверяйте красивым цифрам из чужих бенчмарков.
Отдельный практический момент про оплату. Зарубежные API вроде Jev, Together и решений OpenAI требуют иностранной карты, и из России это лишний шаг в пайплайне. Часть команд закрывает вопрос через виртуальную карту зарубежного банка с пополнением рублями через СБП. Держите в голове простое: при переходе на decision-модели счёт за инференс падает, а зависимость от доступа к зарубежному API остаётся.