EmpirioLabs выпустила Aplomb 1 - открытую модель на 5.3B параметров, рассчитанную на принятие решений, а не на генерацию текста. В анонсе указано, что модель читает до 1M токенов текста, JSON, изображений, видео и аудио в одном запросе, а на API выдаёт решение по документу такого объёма примерно за 3 секунды при цене $0.02 за 1M входных токенов.
Разница с привычной LLM заметна на уровне формата ответа. Чат-модель возвращает текст, который потом приходится разбирать: искать имя инструмента, вытаскивать аргументы, проверять, не поехал ли JSON. Aplomb 1 отдаёт структурированный выбор: какой инструмент вызвать, с какими аргументами и с какой вероятностью каждое из этих решений верно.
Вероятности меняют логику работы агента. Уверенные вызовы выполняются сразу и стоят дёшево, сомнительные уходят на проверку более крупной модели или человеку. Эта схема объясняет, зачем выделять decision-модели в отдельный класс: они не заменяют чат-модель, они снимают с неё рутинную часть работы по выбору действия.
Что такое Aplomb 1 и зачем нужна модель для принятия решений
Aplomb 1 - дообученная версия Qwen3.5-4B, которую учили выбирать инструменты и аргументы вместо свободного текста. Пример из анонса: на запрос «Order B-44120 arrived with a cracked screen. I want my money back.» с тремя доступными инструментами модель выбирает issue_refund с вероятностью 0.969, причину «damaged» с 0.993 и full_refund true с 0.761.
Смысл конструкции в том, что решение приходит вместе с оценкой собственной уверенности. Не нужно угадывать по формулировке ответа, ошибается модель или нет: число 0.761 прямо говорит, что автоматический полный возврат средств - спорное действие, а 0.969 на выборе инструмента даёт зелёный свет.
Подход стоит воспринимать трезво. Aplomb 1 не отвечает на вопросы в привычном смысле, не пишет тексты и не ведёт диалог. Она закрывает узкий участок пайплайна: маршрутизацию действия по входным данным. Всё, что выходит за эти рамки, остаётся задачей других моделей.
Технические характеристики и архитектура Aplomb 1
База - Qwen3.5-4B. Окно контекста расширено с 262K до 1M токенов, поверх базовой модели добавлена собственная decision head, и вся конструкция обучена под выбор решений. Аудио обрабатывает энкодер от Qwen3-Omni-30B-A3B-Instruct.
Базовые модели и лицензии
Оба базовых компонента, Qwen3.5-4B и Qwen3-Omni-30B-A3B-Instruct, распространяются под Apache-2.0. Их можно брать по отдельности: например, использовать аудиоэнкодер в своих проектах без оглядки на лицензию EmpirioLabs. Ограничения начинаются на уровне готовой Aplomb 1, у которой своя лицензия с порогом по выручке компании.
Мультимодальность: текст, JSON, изображения, видео, аудио
На вход подаётся смешанный пакет данных: текст документа, структурированный JSON, скриншоты, видеозапись и аудиодорожка. Один запрос, одно решение. Практический сценарий: разбор претензии, где рядом лежат PDF с условиями, снимок повреждения и запись звонка в поддержку. Модель получает всё это сразу и возвращает выбор инструмента вместо пересказа.
Публичных замеров качества по каждой модальности в анонсе нет. Мультимодальность заявлена как возможность, но насколько уверенно модель разбирает длинное видео или шумную аудиозапись, по опубликованным данным проверить нельзя.
Как работает вероятностный вывод и почему это важно для агентов
Модель возвращает вероятность для каждого инструмента и для каждого enum- и boolean-аргумента в одном запросе. Любой вопрос может дополнительно вернуть вероятность того, что ответа во входных данных нет вообще. Для RAG это отдельная ценность: вместо выдуманного ответа система получает сигнал «в документе этого нет».
Пример работы: возврат денег за повреждённый экран
Разберём числа из примера выше. Выбор инструмента issue_refund (0.969) и причина «damaged» (0.993) почти не вызывают сомнений, а вот полный возврат средств (0.761) - решение с заметно меньшей уверенностью. Логика агента, который умеет пользоваться этой разницей, выглядит так:
d = aplomb.decide(input=doc, tools=tools)
if d.tool == "issue_refund" and d.arguments["full_refund"].prob > 0.9:
execute_refund(d)
elif d.arguments["full_refund"].prob > 0.7:
queue_for_human_review(d)
else:
escalate_to_large_model(d)
Пороги в примере условные. Их значение зависит от цены ошибки: ошибочный возврат денег и лишняя отправка заявки на проверку стоят по-разному, поэтому под каждую задачу пороги калибруют отдельно на своих данных.
Каскадная архитектура: Aplomb 1 + большая модель
Такая схема превращает Aplomb 1 в первый уровень фильтрации. Что прошло по порогу, обрабатывается на месте, остальное уходит большой модели вместе с контекстом решения. На API короткий вопрос занимает около 15 мс модельного времени и около 200 мс сквозной задержки, так что бюджет на массовые вызовы получается небольшим.
Долю трафика, которую удастся закрыть на первом уровне, заранее не угадать: она зависит от однородности задач. На типовых заявках с фиксированным набором инструментов она будет высокой, на размытых формулировках - низкой. Первые несколько тысяч запросов имеет смысл прогнать с логированием вероятностей и подобрать порог по фактическому распределению. Как в целом оценивать новые модели до смены рабочего стека, разобрано в чек-листе по свежим релизам.
Производительность и бенчмарки: что показывают цифры
Все числа ниже - результаты запусков EmpirioLabs на официальном наборе тестов, опубликованные в анонсе. Независимого подтверждения на момент публикации нет.
| Метрика | Результат | Комментарий |
|---|---|---|
| Decision Index 0.2.1 | 44.86 | Первое место среди 4B-моделей на опубликованной доске |
| Лидерство среди моделей до 5.3B | 8 из 38 бенчмарков | Включая MMLU-Pro, GPQA Diamond и BBH |
| JevBench Hard | 77.5% | Запуск разработчика |
| MASSIVE | в среднем 75% | Zero-shot точность намерений, 51 язык |
| Длинноконтекстные тесты | 525 из 525 решений | Все ответы верны по данным компании |
Decision Index 0.2.1: что это и почему 44.86 это много
Decision Index 0.2.1 собирает 38 бенчмарков, которые оценивают способность модели принять решение. Результат 44.86 ставит Aplomb 1 на первое место среди 4B-моделей, а лучший балл среди моделей до 5.3B она показывает на 8 тестах из 38, включая MMLU-Pro, GPQA Diamond и BBH.
Восемь из тридцати восьми - не большинство. Значимость в другом: среди этих восьми есть тесты на общие знания и многошаговые рассуждения, то есть модель дообучали не только под узкий набор decision-задач. Про прозрачность: разработчик раскрыл, что в обучающие данные вошли публичные train-сплиты WinoGrande и ContractNLI, двух из 38 бенчмарков индекса. Результаты именно на этих двух тестах могут быть завышены, и опираться на них при сравнении с другими моделями не стоит.
Скорость: 3 секунды на 1M токенов и 15 мс на короткий вопрос
Быстрая обработка длинного документа обеспечивается режимом длинного контекста в собственном инференс-рантайме EmpirioLabs: около 3 секунд на 1M токенов против примерно 111 секунд при чтении всех токенов. В длинноконтекстных тестах компания заявляет 525 верных решений из 525. На API короткий вопрос занимает около 15 мс модельного времени при примерно 200 мс сквозной задержки.
Оговорка важная: ускоренный режим работает только на API. Открытые веса читают каждый токен, поэтому на локальной машине обработка 1M токенов займёт существенно больше времени.
Требования к железу и локальный запуск
Сколько VRAM нужно и на чём запускать
Веса в bf16 занимают около 12 ГБ видеопамяти при запуске референсным скриптом. Подойдут RTX 3060 12GB, RTX 4070, RTX 4080 и профессиональные карты сопоставимого объёма. Запас VRAM нужен под контекст: чем длиннее вход, тем больше памяти уходит на KV-cache.
Если памяти меньше, остаётся квантизация. Она меняет численные значения логитов, а вся польза модели строится на калиброванных вероятностях: после квантизации пороги придётся подбирать заново. Насколько жёстко нехватка VRAM бьёт по скорости, видно по замерам на карте с 4 ГБ: переход с 2B на 9B роняет темп на порядок.
Ограничения локальной версии: длинный контекст только через API
Режим, который обрабатывает 1M токенов за 3 секунды, доступен только через API EmpirioLabs. Локально веса читают каждый токен, и на 1M токенов это порядка 111 секунд по данным разработчика. Практический вывод: полная мультимодальность и вероятностный вывод работают и на своей машине, а сценарии с очень длинными документами и жёстким требованием к задержке упираются в API.
Лицензия и коммерческое использование
Веса распространяются под EmpirioLabs Model License. Условия из анонса: исследования, оценка, личное использование и внутреннее применение в компаниях с годовой выручкой до $1M - бесплатно. Что предлагается компаниям выше этого порога, в анонсе не указано. Полный текст лицензии стоит читать до того, как строить на модели продукт.
Уровни лицензирования не путайте. Qwen3.5-4B и аудиоэнкодер от Qwen3-Omni-30B-A3B-Instruct идут под Apache-2.0, и их можно использовать отдельно на условиях Apache-2.0. Ограничения EmpirioLabs касаются готовой Aplomb 1 вместе с дообучением и decision head.
Цена API и доступность
Сколько стоит обработка 1M токенов
Цена - $0.02 за 1M входных токенов, вывод бесплатный, ZDR (zero data retention, без хранения данных) включён по умолчанию. Арифметика простая: 1000 документов по 1M токенов обойдутся примерно в $20 входных токенов. Для массовой обработки документов это цифра, которую легко посчитать заранее и заложить в бюджет.
Поддерживаемые форматы API
API принимает запросы в форматах OpenAI, Anthropic и Gemini, а рядом работает собственный Decisions API. Совместимые форматы упрощают переезд: существующие SDK и обёртки можно переиспользовать. Вероятности по инструментам и аргументам - нативная возможность, поэтому для каскадных схем проверяйте, как именно их отдаёт выбранный формат вызова.
Практические сценарии применения и ограничения
Для кого эта модель: разработчики агентов, RAG, автоматизация
Aplomb 1 полезна там, где решение уже формализовано в набор инструментов: обработка заявок на возврат, маршрутизация тикетов, извлечение полей из документов, разбор звонков поддержки, проверка условий договора. В RAG-контуре вероятность того, что ответа нет во входных данных, даёт честный отказ вместо выдумки.
Для генерации текста, диалогов и творческих задач модель не подходит: её выход - выбор действия, а не связный ответ. Если нужен именно генератор, смотрите на обычные LLM; свежие открытые релизы 2026 года разобраны в подборке по open-weights.
Ограничения и на что обратить внимание
- Ускоренный длинный контекст (1M токенов за 3 секунды) доступен только через API; открытые веса читают каждый токен.
- Лицензия бесплатна для компаний с выручкой до $1M; условия для остальных в анонсе не раскрыты.
- Публичные train-сплиты WinoGrande и ContractNLI попали в обучающие данные, поэтому результаты на этих двух бенчмарках могут быть завышены.
- Все метрики - самозамеры разработчика, независимой проверки нет.
- Модель не генерирует текст и не ведёт диалог.
- Пороги вероятностей требуют калибровки на своих данных, особенно при квантизации.
- Локальный запуск в bf16 требует около 12 ГБ VRAM плюс запас под KV-cache.
- Поддержка русского языка отдельно не подтверждена: в MASSIVE заявлена средняя точность 75% на 51 языке, но разбивки по языкам в анонсе нет.
Если задача сводится к выбору действия по документу, начните с короткого теста: соберите 50-100 своих примеров, прогоните их через Decisions API и посмотрите распределение вероятностей. Порог, при котором ошибок мало, а большая модель вызывается нечасто, подбирается по этому распределению. После него уже имеет смысл считать экономику и решать, нужна ли локальная версия или достаточно API.