Cloudflare представила Clef и Clef-flash — открытые decision-модели, обученные Cloudflare и размещённые на Workers AI. Анонс опубликован в официальном блоге Cloudflare, а не только в сторонних обсуждениях. Это меняет статус материала: речь идёт о подтверждённом релизе, а не о слухе.
Ниже — что известно о Clef из официальных источников и карточек модели, чем decision-модель отличается от генеративной LLM и что проверить перед локальным запуском.
Что такое Cloudflare Clef и что именно подтверждено
Clef — 27B мультимодальная decision-модель Cloudflare, дообученная от Qwen/Qwen3.8-27B и выпущенная под лицензией Apache-2.0. Она преобразует состояние и схему типизированных вопросов в решения. Clef — старшая модель в паре с Clef-flash.
Подтверждённые характеристики:
- Автор и релиз: Cloudflare, анонс в официальном блоге, модели размещены на Workers AI.
- Назначение: высокоскоростная классификация и агентные сценарии.
- Размер: 27B параметров (исходный чекпоинт).
- Модальности входа: текст и изображения (при наличии файла mmproj).
- Формат хранения: стандартные шардированные safetensors.
- Лицензия: Apache-2.0.
Ограничение: данные и пайплайн обучения не опубликованы, поэтому воспроизвести модель из проприетарной исходной точки Qwen нельзя. Это открытые веса, а не полностью открытый процесс.
Первоисточники: анонс в блоге Cloudflare и карточка модели Cloudflare/clef на Hugging Face. Дополнительно характеристики подтверждаются GGUF-репозиторием bartowski/Cloudflare_clef-GGUF и карточкой prithivMLmods/clef-GGUF, а обсуждение выхода модели — на Hacker News.
Откуда появилась новость
Первоисточник — официальный блог Cloudflare с анонсом Clef и платформы RL-дообучения. Обсуждения на сторонних площадках, включая Reddit и Hacker News, ссылаются на этот анонс, но не заменяют его. Для проверки деталей ориентируйтесь на блог Cloudflare и карточку модели на Hugging Face.
Почему анонс Cloudflare важен для рынка AI
Cloudflare известна инфраструктурными сервисами, и её выход в сегмент моделей с открытыми весами добавляет направлению ещё одного крупного участника с собственными каналами распространения. На практике это расширяет выбор инструментов и усиливает конкуренцию между поставщиками моделей.
Для русскоязычной аудитории критичны три вещи: можно ли скачать веса, разрешает ли лицензия коммерческое использование и существуют ли готовые интеграции с популярными раннерами. По Clef веса доступны, лицензия Apache-2.0 разрешает коммерческое использование, а поддержка локального запуска подтверждена для нескольких инструментов — детали ниже.
Что означает «decision model» в контексте Cloudflare
Decision-модель делает классификации, помогая агентам решать, как действовать, на основе вероятностей. Она возвращает типизированные ответы с вероятностями, а не свободный текст: ваш код может использовать их, чтобы маршрутизировать тикет, запустить эскалацию или передать вопрос человеку.
Генеративная LLM делает другое: порождает свободный текст токен за токеном. Разница на бытовом уровне проста. Классификатор тикетов решает, в какую очередь отправить обращение. Чат-бот пишет ответ клиенту. Первое — решение, второе — генерация.
Общий контекст терминов LLM, inference и fine-tuning разобран в глоссарии AI-терминов.
Чем decision model отличается от генеративной LLM
Нагляднее всего разница видна по входу и выходу.
| Критерий | Генеративная LLM | Decision model |
|---|---|---|
| Выход | Текст, код, развёрнутый ответ | Вероятность для каждого допустимого варианта каждого вопроса |
| Типичная задача | Диалог, суммаризация, генерация кода | Классификация, маршрутизация, выбор инструмента |
| Формат ответа | Открытый, длина заранее не известна | Закрытый, число вариантов задано схемой |
| Парсинг вывода | Требуется | Не требуется |
| Проверяемость | Требует оценки качества текста | Сравнивается с эталонной меткой |
Clef не генерирует свободный текст и не требует парсинга вывода: за один прямой проход возвращается вероятность для каждого допустимого варианта каждого вопроса. Вход читается как текст, JSON, изображения или видео.
Технически это устроено так: небольшая joint schema head на финальных скрытых состояниях бэкбона выдаёт логит для каждого допустимого варианта каждого вопроса, а softmax по вопросу превращает логиты в вероятности.
Близкий пример такого подхода — Jev от TypeSafe AI, который возвращает калиброванные вероятности над заданными вариантами вместо свободного текста. Clef отличается от Jev наличием vision-энкодера для классификации визуального контента и контекстным окном 64k против 32k у Jev.
Где decision model уместнее генеративной LLM
Класс моделей решений закрывает задачи, где нужен быстрый и повторяемый выбор:
- Маршрутизация запросов. Определить, к какому обработчику отправить обращение: к поиску, к базе знаний, к агенту с инструментами.
- Выбор инструмента в AI-агенте. Решить, какой вызов сделать следующим, вместо генерации рассуждения о плане.
- Фильтрация и модерация. Отнести текст или изображение к категории: спам, токсичность, служебный контент.
- Решения по правилам. Согласовать действие с политикой доступа: разрешить, отклонить, отправить на ручную проверку.
- RAG-роутинг. Выбрать индекс или источник, по которому искать ответ.
Cloudflare заявляет для Clef высокоскоростную классификацию и агентные сценарии. Конкретные результаты на перечисленных задачах зависят от ваших данных и схемы вопросов, поэтому проверять модель стоит на собственной выборке.
Открытые веса и участие Cloudflare: что это даёт на практике
Открытые веса означают, что параметры модели доступны для скачивания. Это открывает дорогу к локальному запуску, тонкой настройке и работе без внешнего API. Clef выпущена под лицензией Apache-2.0, которая разрешает коммерческое использование.
Что обычно означает «открытые веса» и чего это не гарантирует
Open weights и open source — разные вещи, и путаница между ними стоит времени и денег. Открытые веса дают доступ к параметрам. Открытый код и данные обучения дают возможность воспроизвести модель. Лицензия определяет, что вы вправе с ней делать.
У Clef веса имеют разрешительную лицензию, но данные и пайплайн обучения не опубликованы для воспроизведения из проприетарных исходных точек Qwen. То есть скачать и запустить модель можно, а полностью повторить её обучение — нет.
Перед запуском стоит проверить четыре пункта:
- Лицензия и разрешение на коммерческое использование — для Clef это Apache-2.0.
- Наличие кода инференса: как именно прогонять модель, какие зависимости нужны.
- Формат весов: совместим ли он с вашим раннером.
- Доступ к токенизатору и конфигу модели: без них запуск превращается в ручную сборку.
Почему участие Cloudflare может быть важно
Cloudflare владеет инфраструктурой и каналами распространения, поэтому может влиять на то, как быстро модель дойдёт до пользователей: через документацию, репозиторий, интеграции с сервисами компании. Модели Clef и Clef-flash размещены на Workers AI, то есть доступны и как хостируемый сервис.
Для локального запуска бренд решает меньше, чем кажется. Важнее лицензия, формат весов и поддержка в раннерах вроде llama.cpp, vLLM или Ollama. У Clef с этим порядок: есть GGUF-кванты и поддержка нескольких инструментов.
Можно ли запустить Clef локально: что нужно проверить
Да, локальный запуск подтверждён. Для Clef доступны GGUF-кванты, которые работают через llama.cpp (включая llama-server со встроенным чат-интерфейсом), vLLM и Text Generation Web UI. Исходные веса хранятся в стандартном формате шардированных safetensors.
Какие данные о модели нужны для оценки требований к железу
Список для проверки:
- Число параметров: у Clef это 27B (исходный чекпоинт). От него зависит порядок требований к памяти.
- Тип квантования: FP16, 8-бит, 4-бит. При 4-битном квантовании один параметр занимает около половины байта, поэтому модель на 27 млрд параметров требует примерно 14–16 ГБ только под веса, плюс запас на KV-кеш и служебные буферы.
- Контекстное окно: у Clef заявлено 64k токенов. Чем больше токенов в контексте, тем больше памяти уходит на KV-кеш при длинных запросах. В карточках модели встречаются и другие значения лимита ввода, поэтому перед развёртыванием стоит свериться с актуальной конфигурацией.
- Формат весов: для Clef доступны GGUF и safetensors.
- Поддержка в llama.cpp, vLLM, Text Generation Web UI.
У моделей решений требования могут быть ниже, чем у генеративной LLM сопоставимого размера, потому что выход короче и нет длинной генерации. Это зависит от архитектуры, а не от класса задачи автоматически. Как считать память под веса и KV-кеш, подробно разобрано в материале о VRAM и стоимости инференса открытых LLM.
Что делать, если локальный запуск не подходит
Рабочий порядок действий выглядит так. Проверьте лицензию до того, как строить на модели коммерческий продукт — для Clef это Apache-2.0. Если локальный запуск не влезает в ваше железо, рассмотрите хостируемый вариант на Workers AI и сравните стоимость на своих объёмах запросов с локальным вариантом.
Для задач маршрутизации и классификации на рынке есть и другие открытые модели. Сравнивать их с Clef стоит на собственных данных: опубликованных бенчмарков в разобранных источниках нет. Общий подход к оценке новинок до смены рабочего стека разобран в чек-листе по оценке новых AI-моделей.
Где Clef может применяться: реалистичные сценарии
Cloudflare описывает Clef как модель для высокоскоростной классификации и агентных сценариев. Ниже — типовые задачи этого класса.
AI-агенты и автоматизация: где decision model полезнее LLM
В агентном пайплайне на каждом шаге нужно выбрать следующее действие: вызвать инструмент, уточнить у пользователя, завершить работу. Генеративная LLM делает это через текст рассуждения, а значит тратит токены на сам процесс выбора. Модель решений возвращает решение напрямую, что снижает задержку и стоимость шага.
Обратная сторона: модель решений работает только с тем набором вариантов, который вы ей задали схемой. Появилась новая задача — набор нужно расширять и модель дообучать или перенастраивать.
RAG и маршрутизация запросов
В RAG-системе запрос пользователя сначала нужно направить в нужный индекс: документация, база тикетов, каталог товаров. Классификатор справляется с этим быстрее и дешевле, чем генеративная модель, которой пришлось бы рассуждать вслух. Дальше в дело вступает поиск, а генерация ответа остаётся за LLM.
Тот же приём работает в связке из нескольких моделей: дешёвая модель решает, нужна ли вообще дорогая. Clef с её поддержкой локального запуска и разрешительной лицензией подходит для такого сценария, но качество на конкретной задаче нужно проверять самостоятельно.
Что осталось неизвестным и как следить за обновлениями
Часть вопросов закрыта: автор, лицензия, размер, формат весов и поддержка локального запуска подтверждены. Открытыми остаются обучающие данные и пайплайн, детали архитектуры за пределами описанной схемы вывода, а также опубликованные бенчмарки.
Какие вопросы задать перед использованием Clef
- Подходит ли модель по качеству на вашей задаче и вашей схеме вопросов?
- Влезает ли выбранный квант в вашу VRAM с запасом на KV-кеш?
- Покрывает ли лицензия Apache-2.0 ваш сценарий использования?
- Есть ли готовые интеграции с вашим раннером: llama.cpp, vLLM, Text Generation Web UI?
- Как модель ведёт себя на длинном контексте и на изображениях?
- Насколько калиброваны вероятности на ваших данных?
Ответы стоит искать в официальном блоге Cloudflare и в карточке модели на Hugging Face.
Стоит ли ждать Clef или смотреть на альтернативы
Clef уже доступна: веса можно скачать, лицензия разрешает коммерческое использование, локальный запуск поддержан. Разумный подход — протестировать модель на своей задаче маршрутизации или классификации и сравнить с текущим решением по качеству и стоимости.
Решение сведётся к трём проверкам: подходит ли модель по качеству на вашей задаче, влезает ли она в вашу VRAM и разрешает ли лицензия нужный сценарий использования.