Перейти к содержанию
Публикация AiManual

Cloudflare Clef: что известно об открытой модели принятия решений с открытыми весами

Cloudflare заявлена как автор Clef, открытой модели принятия решений с открытыми весами, но подтверждённых деталей пока нет. Разбираем, что такое decision model

Коротко

Что будет в материале

  1. 01

    Что такое Cloudflare Clef и что именно подтверждено

  2. 02

    Что означает «decision model» в контексте Cloudflare

  3. 03

    Открытые веса и участие Cloudflare: что это даёт на практике

  4. 04

    Можно ли запустить Clef локально: что нужно проверить

Cloudflare представила Clef и Clef-flash — открытые decision-модели, обученные Cloudflare и размещённые на Workers AI. Анонс опубликован в официальном блоге Cloudflare, а не только в сторонних обсуждениях. Это меняет статус материала: речь идёт о подтверждённом релизе, а не о слухе.

Ниже — что известно о Clef из официальных источников и карточек модели, чем decision-модель отличается от генеративной LLM и что проверить перед локальным запуском.

Что такое Cloudflare Clef и что именно подтверждено

Clef — 27B мультимодальная decision-модель Cloudflare, дообученная от Qwen/Qwen3.8-27B и выпущенная под лицензией Apache-2.0. Она преобразует состояние и схему типизированных вопросов в решения. Clef — старшая модель в паре с Clef-flash.

Подтверждённые характеристики:

  • Автор и релиз: Cloudflare, анонс в официальном блоге, модели размещены на Workers AI.
  • Назначение: высокоскоростная классификация и агентные сценарии.
  • Размер: 27B параметров (исходный чекпоинт).
  • Модальности входа: текст и изображения (при наличии файла mmproj).
  • Формат хранения: стандартные шардированные safetensors.
  • Лицензия: Apache-2.0.

Ограничение: данные и пайплайн обучения не опубликованы, поэтому воспроизвести модель из проприетарной исходной точки Qwen нельзя. Это открытые веса, а не полностью открытый процесс.

Первоисточники: анонс в блоге Cloudflare и карточка модели Cloudflare/clef на Hugging Face. Дополнительно характеристики подтверждаются GGUF-репозиторием bartowski/Cloudflare_clef-GGUF и карточкой prithivMLmods/clef-GGUF, а обсуждение выхода модели — на Hacker News.

Откуда появилась новость

Первоисточник — официальный блог Cloudflare с анонсом Clef и платформы RL-дообучения. Обсуждения на сторонних площадках, включая Reddit и Hacker News, ссылаются на этот анонс, но не заменяют его. Для проверки деталей ориентируйтесь на блог Cloudflare и карточку модели на Hugging Face.

Почему анонс Cloudflare важен для рынка AI

Cloudflare известна инфраструктурными сервисами, и её выход в сегмент моделей с открытыми весами добавляет направлению ещё одного крупного участника с собственными каналами распространения. На практике это расширяет выбор инструментов и усиливает конкуренцию между поставщиками моделей.

Для русскоязычной аудитории критичны три вещи: можно ли скачать веса, разрешает ли лицензия коммерческое использование и существуют ли готовые интеграции с популярными раннерами. По Clef веса доступны, лицензия Apache-2.0 разрешает коммерческое использование, а поддержка локального запуска подтверждена для нескольких инструментов — детали ниже.

Что означает «decision model» в контексте Cloudflare

Decision-модель делает классификации, помогая агентам решать, как действовать, на основе вероятностей. Она возвращает типизированные ответы с вероятностями, а не свободный текст: ваш код может использовать их, чтобы маршрутизировать тикет, запустить эскалацию или передать вопрос человеку.

Генеративная LLM делает другое: порождает свободный текст токен за токеном. Разница на бытовом уровне проста. Классификатор тикетов решает, в какую очередь отправить обращение. Чат-бот пишет ответ клиенту. Первое — решение, второе — генерация.

Общий контекст терминов LLM, inference и fine-tuning разобран в глоссарии AI-терминов.

Чем decision model отличается от генеративной LLM

Нагляднее всего разница видна по входу и выходу.

КритерийГенеративная LLMDecision model
ВыходТекст, код, развёрнутый ответВероятность для каждого допустимого варианта каждого вопроса
Типичная задачаДиалог, суммаризация, генерация кодаКлассификация, маршрутизация, выбор инструмента
Формат ответаОткрытый, длина заранее не известнаЗакрытый, число вариантов задано схемой
Парсинг выводаТребуетсяНе требуется
ПроверяемостьТребует оценки качества текстаСравнивается с эталонной меткой

Clef не генерирует свободный текст и не требует парсинга вывода: за один прямой проход возвращается вероятность для каждого допустимого варианта каждого вопроса. Вход читается как текст, JSON, изображения или видео.

Технически это устроено так: небольшая joint schema head на финальных скрытых состояниях бэкбона выдаёт логит для каждого допустимого варианта каждого вопроса, а softmax по вопросу превращает логиты в вероятности.

Близкий пример такого подхода — Jev от TypeSafe AI, который возвращает калиброванные вероятности над заданными вариантами вместо свободного текста. Clef отличается от Jev наличием vision-энкодера для классификации визуального контента и контекстным окном 64k против 32k у Jev.

Где decision model уместнее генеративной LLM

Класс моделей решений закрывает задачи, где нужен быстрый и повторяемый выбор:

  • Маршрутизация запросов. Определить, к какому обработчику отправить обращение: к поиску, к базе знаний, к агенту с инструментами.
  • Выбор инструмента в AI-агенте. Решить, какой вызов сделать следующим, вместо генерации рассуждения о плане.
  • Фильтрация и модерация. Отнести текст или изображение к категории: спам, токсичность, служебный контент.
  • Решения по правилам. Согласовать действие с политикой доступа: разрешить, отклонить, отправить на ручную проверку.
  • RAG-роутинг. Выбрать индекс или источник, по которому искать ответ.

Cloudflare заявляет для Clef высокоскоростную классификацию и агентные сценарии. Конкретные результаты на перечисленных задачах зависят от ваших данных и схемы вопросов, поэтому проверять модель стоит на собственной выборке.

Открытые веса и участие Cloudflare: что это даёт на практике

Открытые веса означают, что параметры модели доступны для скачивания. Это открывает дорогу к локальному запуску, тонкой настройке и работе без внешнего API. Clef выпущена под лицензией Apache-2.0, которая разрешает коммерческое использование.

Что обычно означает «открытые веса» и чего это не гарантирует

Open weights и open source — разные вещи, и путаница между ними стоит времени и денег. Открытые веса дают доступ к параметрам. Открытый код и данные обучения дают возможность воспроизвести модель. Лицензия определяет, что вы вправе с ней делать.

У Clef веса имеют разрешительную лицензию, но данные и пайплайн обучения не опубликованы для воспроизведения из проприетарных исходных точек Qwen. То есть скачать и запустить модель можно, а полностью повторить её обучение — нет.

Перед запуском стоит проверить четыре пункта:

  1. Лицензия и разрешение на коммерческое использование — для Clef это Apache-2.0.
  2. Наличие кода инференса: как именно прогонять модель, какие зависимости нужны.
  3. Формат весов: совместим ли он с вашим раннером.
  4. Доступ к токенизатору и конфигу модели: без них запуск превращается в ручную сборку.

Почему участие Cloudflare может быть важно

Cloudflare владеет инфраструктурой и каналами распространения, поэтому может влиять на то, как быстро модель дойдёт до пользователей: через документацию, репозиторий, интеграции с сервисами компании. Модели Clef и Clef-flash размещены на Workers AI, то есть доступны и как хостируемый сервис.

Для локального запуска бренд решает меньше, чем кажется. Важнее лицензия, формат весов и поддержка в раннерах вроде llama.cpp, vLLM или Ollama. У Clef с этим порядок: есть GGUF-кванты и поддержка нескольких инструментов.

Можно ли запустить Clef локально: что нужно проверить

Да, локальный запуск подтверждён. Для Clef доступны GGUF-кванты, которые работают через llama.cpp (включая llama-server со встроенным чат-интерфейсом), vLLM и Text Generation Web UI. Исходные веса хранятся в стандартном формате шардированных safetensors.

Какие данные о модели нужны для оценки требований к железу

Список для проверки:

  • Число параметров: у Clef это 27B (исходный чекпоинт). От него зависит порядок требований к памяти.
  • Тип квантования: FP16, 8-бит, 4-бит. При 4-битном квантовании один параметр занимает около половины байта, поэтому модель на 27 млрд параметров требует примерно 14–16 ГБ только под веса, плюс запас на KV-кеш и служебные буферы.
  • Контекстное окно: у Clef заявлено 64k токенов. Чем больше токенов в контексте, тем больше памяти уходит на KV-кеш при длинных запросах. В карточках модели встречаются и другие значения лимита ввода, поэтому перед развёртыванием стоит свериться с актуальной конфигурацией.
  • Формат весов: для Clef доступны GGUF и safetensors.
  • Поддержка в llama.cpp, vLLM, Text Generation Web UI.

У моделей решений требования могут быть ниже, чем у генеративной LLM сопоставимого размера, потому что выход короче и нет длинной генерации. Это зависит от архитектуры, а не от класса задачи автоматически. Как считать память под веса и KV-кеш, подробно разобрано в материале о VRAM и стоимости инференса открытых LLM.

Что делать, если локальный запуск не подходит

Рабочий порядок действий выглядит так. Проверьте лицензию до того, как строить на модели коммерческий продукт — для Clef это Apache-2.0. Если локальный запуск не влезает в ваше железо, рассмотрите хостируемый вариант на Workers AI и сравните стоимость на своих объёмах запросов с локальным вариантом.

Для задач маршрутизации и классификации на рынке есть и другие открытые модели. Сравнивать их с Clef стоит на собственных данных: опубликованных бенчмарков в разобранных источниках нет. Общий подход к оценке новинок до смены рабочего стека разобран в чек-листе по оценке новых AI-моделей.

Где Clef может применяться: реалистичные сценарии

Cloudflare описывает Clef как модель для высокоскоростной классификации и агентных сценариев. Ниже — типовые задачи этого класса.

AI-агенты и автоматизация: где decision model полезнее LLM

В агентном пайплайне на каждом шаге нужно выбрать следующее действие: вызвать инструмент, уточнить у пользователя, завершить работу. Генеративная LLM делает это через текст рассуждения, а значит тратит токены на сам процесс выбора. Модель решений возвращает решение напрямую, что снижает задержку и стоимость шага.

Обратная сторона: модель решений работает только с тем набором вариантов, который вы ей задали схемой. Появилась новая задача — набор нужно расширять и модель дообучать или перенастраивать.

RAG и маршрутизация запросов

В RAG-системе запрос пользователя сначала нужно направить в нужный индекс: документация, база тикетов, каталог товаров. Классификатор справляется с этим быстрее и дешевле, чем генеративная модель, которой пришлось бы рассуждать вслух. Дальше в дело вступает поиск, а генерация ответа остаётся за LLM.

Тот же приём работает в связке из нескольких моделей: дешёвая модель решает, нужна ли вообще дорогая. Clef с её поддержкой локального запуска и разрешительной лицензией подходит для такого сценария, но качество на конкретной задаче нужно проверять самостоятельно.

Что осталось неизвестным и как следить за обновлениями

Часть вопросов закрыта: автор, лицензия, размер, формат весов и поддержка локального запуска подтверждены. Открытыми остаются обучающие данные и пайплайн, детали архитектуры за пределами описанной схемы вывода, а также опубликованные бенчмарки.

Какие вопросы задать перед использованием Clef

  1. Подходит ли модель по качеству на вашей задаче и вашей схеме вопросов?
  2. Влезает ли выбранный квант в вашу VRAM с запасом на KV-кеш?
  3. Покрывает ли лицензия Apache-2.0 ваш сценарий использования?
  4. Есть ли готовые интеграции с вашим раннером: llama.cpp, vLLM, Text Generation Web UI?
  5. Как модель ведёт себя на длинном контексте и на изображениях?
  6. Насколько калиброваны вероятности на ваших данных?

Ответы стоит искать в официальном блоге Cloudflare и в карточке модели на Hugging Face.

Стоит ли ждать Clef или смотреть на альтернативы

Clef уже доступна: веса можно скачать, лицензия разрешает коммерческое использование, локальный запуск поддержан. Разумный подход — протестировать модель на своей задаче маршрутизации или классификации и сравнить с текущим решением по качеству и стоимости.

Решение сведётся к трём проверкам: подходит ли модель по качеству на вашей задаче, влезает ли она в вашу VRAM и разрешает ли лицензия нужный сценарий использования.

Подписаться на канал