Представляем Clef: наши модели принятия решений с открытым исходным кодом и новую платформу для дообучения с подкреплением

Источник: Cloudflare Blog

Представляем Clef: наши модели принятия решений с открытым исходным кодом и новую платформу для дообучения с подкреплением

Источник: Cloudflare Blog

Мы представляем Clef и Clef-flash — модели принятия решений с открытым исходным кодом, размещенные на Workers AI для высокоскоростной классификации и агентских рабочих процессов. Также мы запускаем новую платформу обучения с подкреплением, которая позволяет разработчикам дообучать модели…

•Обновлено: 1 октября 2026 г.

За последние несколько недель появилось много шума вокруг моделей принятия решений, таких как модель System One от Typesafe AI’s Jev. Хотя модели-классификаторы существуют уже довольно давно, Jev привносит в мир ИИ новую концепцию модели принятия решений — модель, которая дешево, быстро и последовательно выдает ограниченные структурированные результаты, которые можно добавить в рабочий процесс, когда требуется принять решение. Эти модели достаточно функциональны, чтобы работать с любым набором входных данных без необходимости постоянного переобучения для включения новых категорий классификации. Это контрастирует с миром больших языковых моделей (LLM), которые в значительной степени недетерминированы, но достаточно универсальны, чтобы рассуждать и генерировать текст и вызовы инструментов для агентских рабочих нагрузок.

Сегодня мы выпускаем две модели принятия решений, обученные Cloudflare: Clef и Clef-flash, размещенные на Workers AI. В настоящее время Clef является лидером при оценке по индексу решений Jev, полные результаты можно посмотреть на демо-сайте с актуальными бенчмарками. Эти модели умнее, быстрее и полностью совместимы с API Jev, поэтому вы можете легко экспериментировать с этими размещенными моделями. Мы полностью открываем исходный код этих моделей на Hugging Face по лицензии Apache 2.0, чтобы вы могли запускать их локально и экспериментировать самостоятельно.

Наконец, мы рады представить наш новый продукт для обучения с подкреплением (RL), который позволяет клиентам также дообучать Clef под свои конкретные задачи.

Что такое модель принятия решений?

Модель принятия решений выполняет классификацию, чтобы помочь агентам решить, как действовать, основываясь на определенных вероятностях. Например, вы можете передать сообщение службы поддержки (входные данные) и спросить, является ли оно срочным и какая команда должна им заняться. Модель принятия решений вернет типизированные ответы с вероятностями (выходные данные), которые ваш код может использовать для маршрутизации тикета, запуска эскалации или передачи вопроса человеку. Это означает, что человеку больше не обязательно постоянно участвовать в процессе принятия агентских решений — агенты могут программно собирать контекст, принимать решения и выполнять задачи или обращаться к человеку, когда это необходимо.

В частности, в Cloudflare мы тестировали нашу новую модель Clef в команде Threat Intelligence, чтобы помочь нам классифицировать домены веб-сайтов. Предоставляя домен модели Clef (с помощью Browser Run), она может быстро определить категории, к которым относится домен — например, она может классифицировать домен с 95% вероятностью как модный веб-сайт, 85% как электронную коммерцию, <1% как фишинг и т. д. На эту классификацию у нашей модели Clef ушло 2,2 секунды, включая получение, рендеринг и классификацию сайта. Для сравнения, наша самая быстрая общая LLM gpt-oss-120b затратила 4,7 секунды в том же рабочем процессе и вернула только две классификации. Как пользователь, вы можете представить, как двукратная экономия времени ожидания и результатов может помочь нам улучшить рабочие процессы анализа угроз и быстрее выявлять вредоносные или легитимные домены. Обобщите это на любой случай использования, где вам нужно принимать быстрые программные решения, и вы откроете для себя мощные агентские рабочие процессы, способные автономно принимать решения, рассуждать и выполнять действия.

В теории музыки ключ (clef) — это символ, помещаемый в начале нотного стана, который присваивает определенные названия высоты звука линиям и пробелам. Модель принятия решений аналогична музыкальному ключу, потому что она помогает определить область контекста и последующие ноты (действия), которые следуют за ним. Мы выбрали Clef в качестве названия для нашего семейства моделей принятия решений, так как оно служит аналогичным целям, а буквы CF отсылают к Cloudflare.

Чем Clef отличается от других моделей принятия решений?

Хотя рынок становится все более насыщенным моделями принятия решений, Clef обладает некоторыми уникальными свойствами, которые делают нас рады представить ее публике. Во-первых, у нее есть визуальный энкодер, поэтому она способна принимать изображения и классифицировать визуальный контент. Это отличается от Jev, которая сегодня выполняет только текстовую классификацию. Во-вторых, наша модель имеет контекстное окно 64k (по сравнению с 32k у Jev), что позволяет пользователям втиснуть больше входного состояния для классификации моделью.

В-третьих, наша модель точна и мощна, показывая конкурентные результаты по сравнению с другими моделями принятия решений на рынке по различным критериям качества. Ниже мы отобрали некоторые оценки, которые важны для принятия решений, как определено индексом решений Jev, и оценили по ним некоторые из наиболее популярных моделей на рынке. Ознакомьтесь с таблицей ниже для получения результатов бенчмарков или просмотрите оценки на нашем демо-сайте с актуальным индексом решений:

Бенчмарк

DiffusionGemma Jev

BFCL · точное совпадение

98.47

98.76

95.75

96.52

94.51

38.13

ToolRet · nDCG@10

69.19

66.43

65.28

61.21

64.26

12.69

API-Bank · точность

91.93

93.11

88.19

83.66

56.30

11.41

Бытовая техника · точное совпадение

82.95

97.73

52.27

42.05

25.00

0.00

When2Call · точность

72.37

65.58

80.97

75.44

49.62

11.94

BANKING77 · macro-F1

94.20

90.93

79.74

74.28

84.83

14.29

CLINC150+OOS · macro-F1

97.43

66.77

89.27

83.49

79.03

3.19

BRIGHT · nDCG@10

45.91

39.26

47.52

42.94

38.53

19.90

Amazon ESCI · macro-F1

57.48

57.39

55.21

53.37

49.22

24.40

PhishNChips · точность

79.60

75.05

62.55

85.35

50.75

50.15

Мы также провели бенчмарки по собственному набору тестов Typesafe, и наши модели Clef показали хорошие результаты, превзойдя Jev в 3 из 4 областей. Примечательно, что наша модель Clef-flash работает исключительно хорошо, учитывая, насколько она быстрее.

Рабочий процесс

Обработка счетов

64.7

57.1

61.8

Обслуживание клиентов

76.3

76.0

Инциденты безопасности

62.9

61.7

61.7

Наблюдаемость трассировки агента

68.5

69.8

71.6

По 43 бенчмаркам, которые мы провели, наши модели Clef превзошли модели принятия решений по задержке (за исключением Laya, которая очень быстрая, но жертвует качеством в приведенных выше бенчмарках):

Бенчмарк

DiffusionGemma Jev

Медианная задержка · мс

209.3

38.8

524.1

84.4

51.4

5.8

Задержка p95 · мс

238.6

122.4

536.0

211.2

187.9

222.5

Помимо преимуществ в задержке самой модели, наши модели Clef размещены на Workers AI. Поскольку они размещены на инфраструктуре Cloudflare, мы можем использовать наши графические процессоры на границе сети, что приводит к низкой сетевой задержке и более быстрому принятию решений. Это означает, что вы можете внедрить Clef в критический путь для принятия решений агентами и объединить это с одной из наших LLM на Workers AI для выполнения действий.

Clef также выдает строго типизированные выходные данные, аналогичные Jev, и полностью совместима с API, поэтому вы можете выполнить замену очень легко. Более крупная модель Clef — это ваша более мощная модель для прецизионных задач, в то время как модель Clef-Flash отлично подходит для решений, критичных к задержке. Модели готовы к корпоративному использованию с нашей гарантией того, что мы не читаем, не храним и не обучаемся на ваших запросах или ответах (если только вы не хотите использовать наш продукт для дообучения, о котором мы расскажем ниже). Вы можете начать работу с моделями Clef уже сегодня, начав с нашей документации для разработчиков или поиграв с

Если вам нужна помощь в настройке Clef для конкретной рабочей нагрузки, мы также предлагаем услуги по дообучению — сначала в качестве практического партнера с нашей командой инженеров по развертыванию (FDE), а затем в качестве платформы для самостоятельного дообучения, чтобы клиенты могли обучать и повторно развертывать модель в Cloudflare.

Как мы обучали Clef

На той же неделе, когда вышел Jev, мы опубликовали информацию о некоторых экспериментах с нашей собственной моделью принятия решений. В нашей демонстрации показано, как мы адаптировали модель DiffusionGemma для вывода детерминированных вероятностей путем раскрытия логарифмических вероятностей (logprobs), генерируемых большой языковой моделью. Наш первоначальный подход основывался на независимом исследовании Мэтта Мастраччи, который активно участвует в сообществе машинного обучения (ML), делясь новыми идеями и пулл-реквестами для движка вывода vLLM, чтобы усилить поддержку DiffusionGemma.

Clef развивает эту концепцию, но использует другую базовую модель в качестве основы. В настоящее время мы используем Qwen в качестве базовой модели и дообучили ее для решения задач, связанных с моделями принятия решений. Во время вывода Clef использует Qwen для прохода только с предварительным заполнением (prefill-only), а затем параллельно оценивает допустимые варианты схемы. Шаг принятия решения не является авторегрессионным, поэтому нет промежуточного текста для генерации токен за токеном, что делает Clef значительно быстрее авторегрессионных LLM. Вместо генерации промежуточного текста для получения структурированных ответов, Clef и Clef-flash выводят варианты схемы непосредственно из внутренних представлений базовой модели. Этот подход опирается на специализированный двухэтапный процесс маршрутизации внимания: каждый допустимый вариант извлекает контекст, относящийся к подсказке, позволяя параметрам отдельных полей выполнять перекрестное внимание с другими полями и возвращаться к исходной полезной нагрузке перед оценкой. Используя лексический априорный показатель, модель сохраняет семантический смысл во всех вариантах. В конечном итоге архитектура объединяет маршрутизацию доказательств для конкретных вариантов, совместное перекрестное внимание по полям и оценку, привязанную к схеме.

Заморозив Qwen3.8-27B для Clef и Qwen3.5-9B для Clef-flash, мы совместно оптимизировали маршрутизирующий заголовок вместе с низкоранговыми адаптерами ранга 256. Наше дообучение использует кросс-энтропию со сглаживанием меток для допустимых выходных данных схемы в сочетании с потерей Брайера для уточнения калибровки вероятностей. Это обучение использует наши собственные внутренние синтетические наборы данных, переставляющие порядок полей, подсказки и структуры схем. Мы также разработали обучение с подкреплением для калиброванных решений (RLCD), чтобы служить вторичной целью оптимизации, предоставляя частичный кредит смежным порядковым вариантам, вознаграждая полностью точные выходные данные записей и применяя штраф за ссылку для предотвращения сдвига распределения, что дает нам лучшую точность и обобщение.

Это означает, что мы смогли достичь нескольких новых результатов с помощью Clef: мы улучшили точность модели в классификации, ограничили ее вывод только вероятностями вместо генерации текста и сделали ее быстрее, чем Jev и базовые модели Qwen.

Как тонкая настройка может расширить возможности Clef

Мы услышали много внутренних вариантов использования, которые требовали тонкой настройки нашей модели Clef для встраивания в наши агентские рабочие процессы в Cloudflare. Например, внутренние команды хотят, чтобы модель классификатора могла оценивать заявки Trust & Safety, помогать нам сортировать запросы в службу поддержки Cloudflare или даже быть встроенной в наши продукты Bot, чтобы решать, является ли краулер хорошим или плохим ботом.

Эти варианты использования невероятно специфичны, и у нас есть многолетние маркированные решения, которые мы могли бы использовать для обучения конкретного классификатора. Когда вы настраиваете модель, вы можете пожертвовать некоторой производительностью общего назначения в обмен на более высокую точность в конкретной области. Поскольку Cloudflare обладает более чем 15-летними сетевыми данными по различным доменам, мы можем настроить модель под эти конкретные варианты использования, что будет точнее и быстрее, чем наша общая модель Clef. Мы уже работаем с внутренними командами, чтобы выяснить, как мы можем дообучить Clef для создания мощных моделей машинного обучения, которые повысят наше влияние и улучшат рабочие процессы по всей Cloudflare. Эти внутренние команды и варианты использования являются следующей задачей нашей новой команды по тонкой настройке FDE и основой для нашего продукта обучения с подкреплением (RL).

Наш новый сервис RL

Мы предлагаем услугу, помогающую клиентам настраивать Clef в соответствии с их рабочими нагрузками с помощью нашей практической команды FDE. На основе этого мы будем учиться на нашем практическом опыте, чтобы создать платформу самообслуживания, которую клиенты смогут использовать для сбора данных, тонкой настройки и повторного развертывания модели, и все это на Cloudflare.

На самом деле это долгожданное событие — мы создавали нашу платформу ИИ, чтобы иметь правильные примитивы, с помощью которых мы могли бы создавать пользовательский продукт RL. Интерес к Jev показывает потребность в быстрой, небольшой, специфической модели классификатора, и мы выбрали это в качестве нашей ниши, чтобы начать экспериментировать со средами RL.

Для этого мы используем примитивы, которые мы уже создали на нашей платформе Cloudflare:

  • Cloudflare AI Gateway — пропускайте весь ваш трафик ИИ через AI Gateway и автоматически создавайте набор данных запросов для вашего варианта использования
  • Cloudflare Workers AI — генерируйте развертывания на основе базовой модели Clef
  • Cloudflare Containers — песочница RL для оценки и воспроизведения действий агента
  • [НОВОЕ] Trainer — обновление весов настроенной модели Clef
  • Cloudflare Workers AI + BYO Model — повторное развертывание настроенной модели на Workers AI

Это объединяет несколько незавершенных частей платформы ИИ, над которыми мы работали, включая AI Gateway, который захватывает ваш трафик ИИ, чтобы вы могли использовать свои собственные данные запросов/ответов, Containers для песочниц RL и работу Workers AI «Принеси свою собственную модель» (Cog), которая продвигается с момента нашего приобретения Replicate.

Попробуйте сегодня

Мы рады запустить нашу первую модель машинного обучения, обученную Cloudflare, от команды Workers AI сегодня. Мы все еще на ранней стадии и у нас в запасе еще много улучшений, но это замечательная первая демонстрация тяжелой работы, которую мы проделали в команде платформы ИИ. Мы считаем, что Clef обладает способностью изменить то, как мы используем агентов, что естественным образом вписывается в миссию Cloudflare быть облаком агентов.

Если у вас есть конкретные варианты использования и вы уже являетесь клиентами этих продуктов — we’d love to chat with you and be design partners as we experiment in this space.

Попробуйте модели Clef, размещенные на Workers AI, скачайте веса на Hugging Face, если хотите изучить их самостоятельно, и свяжитесь с нами, если у вас есть варианты использования для тонкой настройки, с которыми мы можем помочь.

Наша команда ML растет в плане влияния, от оптимизации моделей до исследований в области обучения моделей. Если вам интересно присоединиться к нашей миссии, ознакомьтесь с нашими открытыми вакансиями.

О чём эта статья

Что-то непонятно? Спросите по статье — объясню простыми словами.

Не хотите разбираться сами? Мы поможем.

Ещё в разделе «Облака и инфраструктура»

Все →

Ещё от Cloudflare