Вслед за выпуском на прошлой неделе Clef и Clef-flash, моделей принятия решений с открытыми весами от Cloudflare, мы решили порадовать вас новыми возможностями. Сегодня мы выпускаем Clef-omni, которая принимает аудио- и видеовход наряду с текстом и изображениями. Мы также снизили цену на Clef-flash, так что теперь она дешевле, чем Jev, и сделали Clef быстрее.
Хотя для Cloudflare сфера моделей принятия решений еще нова, инновации и итерации заложены в нашей ДНК, и мы применяем эти принципы ко всему, что делаем. Фактически, история Clef сложилась менее чем за неделю. В пятницу вечером мы решили, что хотим сделать что-то в области моделей принятия решений, за выходные обучили модель и в четверг запустили её. Даже при таких сжатых сроках нам удалось предоставить сообществу производительные и качественные модели с открытыми весами — представьте, чего мы сможем достичь в будущем.
Сегодня мы рады поддерживать этот темп с помощью новых дополнений и улучшений нашего семейства моделей Clef. Это только начало, и мы продолжим становиться лучше, быстрее, дешевле и инновационнее.
Clef-omni принимает аудио, видео, изображения и текст
Наша новая модель Clef-omni способна принимать аудио, видео, изображения и текстовый ввод. Это меняет парадигму моделей принятия решений, которые в основном были только текстовыми с момента дебюта Jev от TypeSafe. В Clef мы поддерживали изображения и массивы видеокадров, но Clef-omni способна принимать аудио (wav или mp3) и видео (mp4 или webm) наряду с текстом и изображениями.
Вместо настройки каскадных конвейеров моделей, которые транскрибируют речь в текст или разделяют аудио- и видеоканалы из видео, вы можете просто вызвать одну модель для принятия решений по любой модальности. Мы стали на шаг ближе к модели, способной взаимодействовать с миром так же, как мы — через аудио, визуальную и текстовую коммуникацию, всё в одном.
Ознакомьтесь с нашей документацией для разработчиков для новой модели Clef-omni. Мы также опубликовали открытые веса модели на HuggingFace. Для быстрого старта вот как можно отправлять новые типы входных данных в Clef-omni:
Clef-omni расширяет нашу архитектуру принятия решений с открытыми весами для нативной обработки мультимодальных рабочих процессов. Мы построили её на базе смеси экспертов (MoE) Qwen3-Omni-30B-A3B-Instruct, где модель уже была способна обрабатывать текст, изображения, аудио и видео непосредственно в рамках одного конвейера. Однако мы используем основной каркас понимания, отбрасывая компоненты преобразования текста в речь. В производстве Clef-omni выполняет быстрый предварительный проход по всей полезной нагрузке, одновременно оценивая все модальности и допустимые параметры.
Поскольку мы пропускаем генерацию выходных токенов, так как модели Clef не являются большими языковыми моделями (LLM), мы устраняем накладные расходы на транскрибирование или создание описаний для входящих файлов. Медиаэлементы отображаются непосредственно в унифицированную последовательность, где видео и аудио синхронизируются с визуальными кадрами для совместной обработки. Затем Clef-omni извлекает значения кандидатов непосредственно из внутренних эмбеддингов, используя нашу двухэтапную маршрутизацию внимания: каждый допустимый вариант собирает ключевые доказательства из входных данных (независимо от того, скрыты ли они в фрагментах текста, визуальных элементах или аудиопотоках), прежде чем векторные поля перекрестно сопоставляются по всему контексту для вычисления оценок достоверности. Мы добавили встроенную лексическую грамматику, которая сохраняет семантику вариантов, чтобы мы могли обеспечить быструю, ограниченную схемой оценку для каждого типа входных данных.
Мы обучаем модель с использованием тех же методов, что и для Clef — замораживая основу Qwen3, обучая низкоранговые адаптеры (LoRA) и применяя наш стандартный подход к пост-обучению: сочетание функции потерь перекрестной энтропии со сглаживанием меток и калибровкой по оценке Брайера. Результатом является устойчивая модель, разработанная для успешной работы независимо от вариаций схемы, порядка полей и структуры запросов.
Это привносит несколько ключевых обновлений в семейство моделей Clef. Калиброванные, привязанные к схеме решения теперь легко обрабатывают текст, изображения, аудио и синхронизированное видео в одном вызове API. Это также быстро. Решения только по тексту возвращаются примерно за 130 мс в медианном значении, ввод изображений — примерно за 150 мс, а аудиоклипы — за несколько сотен миллисекунд. Даже полный 21-секундный видеоклип со звуком оценивается примерно за 1,5 секунды, и всё это в одном вызове API.
Наше тестирование показывает высокую производительность по всем бенчмаркам, даже с новыми модальностями и архитектурой MoE.
Бенчмарк
BFCL · точное совпадение
98.2
98.47
98.76
95.75
ToolRet · nDCG@10
66.6
69.19
66.43
65.28
API-Bank · точность
92.7
91.93
93.11
88.19
Бытовая техника · точное совпадение
69.3
82.95
97.73
52.27
When2Call · точность
63.3
72.37
65.58
80.97
BANKING77 · макро-F1
94.8
94.20
90.93
79.74
CLINC150+OOS · макро-F1
97.7
97.43
66.77
89.27
BRIGHT · nDCG@10
42.0
45.91
39.26
47.52
Amazon ESCI · макро-F1
57.8
57.48
57.39
55.21
PhishNChips · точность
73.2
79.60
75.05
62.55
Мы также провели сравнение с оценками TypeSafe, чтобы показать, как работает Clef-omni.
Рабочий процесс
Метрика
Clef-Omni
Clef
Clef-flash
Jev
Обработка счетов
Точные действия
60.2
64.7
57.1
61.8
Обработка счетов
Основное действие
82.0
86.2
73.3
83.1
Обслуживание клиентов
Точные действия
71.6
76.3
77.0
76.0
Инциденты безопасности
Точные действия
61.7
62.9
61.7
61.7
Наблюдаемость трассировки агента
Основное действие
65.8
68.5
69.8
71.6
Модель Clef-flash теперь дешевле
Мы услышали ваши отзывы — вам нужна модель принятия решений, достаточно доступная для внедрения в любой рабочий процесс. Мы внесли несколько оптимизаций и теперь можем предложить Clef-flash по более низким ценам. Мы хотим, чтобы Clef могла принимать решения, которые масштабируются для вас во всех ваших агентских рабочих процессах, и теперь наше ценообразование также стимулирует это.
Нам удалось оптимизировать модель до такой степени, что Clef-flash теперь дешевле, чем Jev, оставаясь при этом производительной и качественной. Ознакомьтесь с документацией для разработчиков, чтобы всегда иметь актуальную информацию о ценах, включая более подробную информацию о том, как модальности изображений и аудио преобразуются во входные токены для тарификации.
- Clef-flash – изначально $0.09 за 1 млн входных токенов, теперь $0.038 за 1 млн входных токенов
- Clef – остается на уровне $0.24 за 1 млн входных токенов
- Clef-omni – запущена сегодня по цене $0.15 за 1 млн входных токенов
Однако один компромисс, на который нам пришлось пойти ради более низкой цены, — это сокращение контекстного окна Clef-flash. Хостинговая версия Clef-flash теперь имеет контекстное окно 24 тыс. токенов вместо 64 тыс., как заявлялось ранее. Веса модели на Hugging Face остались нетронутыми и были обучены поддерживать контекстное окно 256 тыс. токенов, если вы решите разместить её самостоятельно.
Согласно нашим данным об использовании, только 0,24% запросов превышают 24 тыс. входных токенов. Основываясь на этих данных, мы приняли решение сократить контекстное окно до 24 тыс. для Clef-flash, чтобы сделать её более доступной. Наша модель Clef по-прежнему имеет контекстное окно 64 тыс. токенов, и мы рекомендуем пользователям с потребностями в большем контексте переключиться на Clef вместо Clef-flash.
Модель Clef теперь быстрее
Скорость работы модели Clef также возросла благодаря новым оптимизациям размещенной версии Clef в Workers AI. Новые веса модели не выпускались, поскольку большинство внесенных нами оптимизаций относятся к уровню инфраструктуры обслуживания, а не к весам или архитектуре самой модели. Ознакомьтесь с нашими новыми показателями скорости ниже:
Размер входных данных
Ранее: медиана / p95 (мс)
Сейчас: медиана / p95 (мс)
Ускорение (медиана)
~800 токенов
262 / 438
152 / 351
1.7×
~3,400 токенов
616 / 777
305 / 531
2.0×
~16,000 токенов
2,721 / 3,250
1,635 / 1,805
1.7×
Одной из выполненных нами оптимизаций стал переход на SGLang для обслуживания модели. Мы работали с командой SGLang и подготовили пул-реквесты для интеграции Clef (PR #42721), которые будут выпущены в SGLang 0.5.22. Вы также можете разместить Clef самостоятельно, так как мы опубликовали веса, а новые команды запуска SGLang доступны в нашем обновленном репозитории Hugging Face, а также в руководствах SGLang.
Как люди используют Clef?
В Cloudflare наши команды экспериментируют с Clef как с моделью, способной помочь в классификации по общим доменам. Самое интересное в наблюдении за тем, как команды внедряют Clef, заключается в том, что возможности обнаружения и классификации переместились на уровень модели, где они доступны каждому, кто хочет начать внедрять модели принятия решений в свои сценарии использования. Раньше, даже при использовании классификаторов с нулевым обучением (zero-shot), небольшие модели могли быть недостаточно мощными для классификации в любой области без дополнительной настройки. Возможно, вам пришлось бы создавать специализированную команду по машинному обучению, чтобы помочь с обучением для вашей конкретной области и собрать корпус данных для обучения более качественной модели. Теперь все, что вам нужно сделать, — это вызвать модель, чтобы мгновенно и точно проанализировать входные данные.
Несколько примеров того, как команды в Cloudflare используют Clef: наш публичный репозиторий документации на GitHub использует Clef для мгновенного обнаружения и закрытия спам-тикетов. EmDash, наша система управления контентом, модерирует библиотеки плагинов на предмет фишинга. Наша команда по предотвращению утечек данных сканирует информацию на наличие потенциальных персональных данных (PII), таких как государственные идентификаторы. А наша команда по анализу угроз использует Clef для помощи в обнаружении вредоносных доменов.
Попробуйте сами!
Мы рады представить вам новые возможности семейства моделей Clef, включая поддержку новых модальностей, таких как аудио и видео, а также сделать модель более доступной за счет снижения цен и повышения скорости работы. Clef полностью совместима с Jev-API и доступна через AI Gateway, поэтому попробовать Clef сегодня так же просто, как изменить идентификатор модели. Ознакомьтесь с нашей документацией для разработчиков для получения дополнительной информации.
Спасибо за всю любовь и теплый прием первых моделей Cloudflare — мы сосредоточены на том, чтобы предлагать вам больше. Попробуйте наше семейство моделей Clef и расскажите нам, что вы думаете.











