Jev: модели принятия решений на испытании

Источник: Cisco Blogs

Jev: модели принятия решений на испытании

Источник: Cisco Blogs

Как архитектура ответов на вопросы соотносится с традиционной классификацией в задачах обеспечения безопасности контента? Jev в последнее время часто обсуждают, и не зря: вместо генерации текста она отвечает на заданные вопросы напрямую с помощью...

•Обновлено: 6 октября 2026 г.

Как архитектура ответов на вопросы соотносится с традиционной классификацией в задачах обеспечения безопасности контента?

Jev в последнее время часто обсуждают, и не зря: вместо генерации текста он напрямую отвечает на заданные вопросы с указанием вероятности или оценки, что является отличным решением, если вам приходилось иметь дело с обработкой выходных данных классификаторов.

Естественно, нам стало любопытно: как эта новая разновидность моделей принятия решений на самом деле показывает себя в сравнении с традиционным специализированным классификатором? Поэтому мы провели быстрое сравнение — новые модели принятия решений против специально обученного классификатора в задачах безопасности контента. Вот что мы выяснили.

Вопрос вместо ответа

Каждый классификатор безопасности ИИ работает на основе меток политики, и эти метки должны откуда-то браться — от людей, моделей или и тех, и других. Распространенный быстрый путь — использование LLM в качестве судьи: передать ей политику безопасности и диалог, а затем запросить вердикт. Это гибко, но влечет за собой реальные операционные сложности. Ответы в свободном стиле требуют парсинга, форматы вывода могут меняться, а простой вердикт «да/нет» не дает настраиваемой оценки, когда вы пытаетесь уложиться в определенный бюджет ложноположительных срабатываний.

Более новый класс моделей принятия решений полностью обходит это, возвращая структурированные ответы вместо сгенерированного текста. Laya, модель с открытыми весами от ConvAI Innovations, и Jev, размещенная модель от TypeSafe, работают одинаково: подайте им вопрос, получите вероятность или оценку.

Сформулируйте политику безопасности в виде набора вопросов, и любая из этих моделей станет классификатором с нулевым обучением (zero-shot) — никакой специфической донастройки под политику или размеченных обучающих выборок не требуется.

Вопрос, на который мы действительно хотели получить ответ

Zero-shot привлекателен именно тем, что позволяет пропустить дорогостоящую часть: сбор меток и обучение модели на них. Но безопасность контента — это именно та область, где этот короткий путь проходит самую суровую проверку: категории нюансированы, граничные случаи носят состязательный характер, а модель общего назначения для ответов на вопросы никогда не видела вашу специфическую таксономию.

Поэтому мы построили сравнение, которое хотели увидеть. Мы дообучили рабочую модель-энкодер с 1 млрд параметров непосредственно на таксономии безопасности Cisco AI Security Framework — 24 категории вреда. Laya и Jev отвечали на один вопрос «да/нет» по каждой категории и перспективе, при этом большая из двух вероятностей использовалась как оценка категории; наша модель просто выдает одну вероятность по каждой категории напрямую. Мы измеряем общую оценку «безопасно/небезопасно», повторно используя наивысшую оценку по любой из категорий. Тот же код оценки, те же эталонные метки, все три системы.

Настройка

24 категории вреда · 6 наборов данных для оценки · бюджет ложноположительных срабатываний 0,5%

Все три системы были протестированы на одних и тех же шести наборах данных, каждый из которых был сопоставлен с таксономией Cisco AI Security Framework:

Все шесть наборов были размечены в соответствии с нашей таксономией с помощью LLM с использованием полных определений категорий — это эталонные метки, сгенерированные моделью, а не проверенная человеком истина. Единый эталонный набор обеспечивает согласованность сравнения, но любые ошибки разметки распространяются на каждое сообщаемое число.

Мы рассмотрели два представления результатов. Во-первых, каждая система как бинарный классификатор «безопасно/небезопасно»: проход по порогу для максимальной оценки категории и построение ROC-кривой, отчет по AUC, частичному AUC при уровне ложноположительных срабатываний 0,5% и полноте (recall) при том же бюджете 0,5%. Во-вторых, полнота по каждой категории при том же строгом бюджете. Точки с одинаковым FPR полезны для анализа; производственный порог все равно следует устанавливать на отдельных проверочных данных.

Что мы обнаружили

Главный результат не стал сюрпризом: обучение непосредственно на политике побеждает. Наша модель показала самый высокий бинарный AUC на пяти из шести наборов данных и самую высокую полноту при бюджете ложноположительных срабатываний 0,5% на всех шести. Среди двух моделей zero-shot Jev была явно сильнее — Laya отставала от обеих при низких уровнях ложноположительных срабатываний, на которых мы сосредоточили эту оценку.

Рисунок 1. Бинарные ROC-кривые «безопасно/небезопасно» для нашей модели (зеленый), Jev (синий) и Laya (оранжевый). Ось X использует логарифмическую шкалу, чтобы сделать видимой производительность на уровне 0,5% ложноположительных срабатываний и ниже. Частичный AUC в каждой легенде стандартизирован, поэтому неинформативный классификатор имеет оценку около 0,5, а не 0.

Рисунок 2. Бинарный F1 (слева) и полнота (справа) при согласованном бюджете ложноположительных срабатываний 0,5%. Каждая точка выбирается отдельно для каждой модели и набора данных, чтобы максимизировать полноту без превышения бюджета; это аналитические точки, а не заранее выбранные пороги развертывания.

Полнота при уровне ложноположительных срабатываний 0,5% на тестовом наборе Cisco multi-turn: наша модель обнаружила 61%, Jev — 34%, а Laya — почти ничего. Jev была ближе всего к нашей модели на BeaverTails и PolygloToxicityPrompts и немного опередила по «сырому» AUC для XSTest; у Laya не было полезной рабочей точки в рамках бюджета ни на одном наборе данных. Представление на уровне категорий подтверждает общую картину: средняя полнота нашей модели по категориям превзошла Jev на каждом наборе данных, сравнявшись с ней или превысив ее в большинстве отдельных категорий.

Рисунок 3. Полнота по категориям при согласованном бюджете ложноположительных срабатываний 0,5%, отсортированная по полноте нашей модели. Числа в скобках показывают количество положительных примеров. Категории с менее чем пятью положительными примерами опущены, так как их оценки нестабильны.

Jev против LLM-судьи с промптом

Мы также протестировали Jev против более знакомой альтернативы: LLM, которой дали промпт для оценки безопасности. Мы задали Gemma 4 31B (с отключенным мышлением) вопрос «Да/Нет» о вредоносности, а Jev — один структурированный вопрос по восьми публичным бенчмаркам. Чтобы дать Gemma настраиваемую оценку вместо однозначного вердикта, мы считали вероятность, которую она присвоила ответу «Да», из вероятностей ее токенов, поставив обе модели в равные условия с полноценной ROC-кривой для каждой.

На всей кривой результаты были близки: AUC у Jev был выше на семи из восьми бенчмарков и равным на восьмом, причем большинство разрывов были небольшими (ToxicChat и ChineseSafe показали наиболее четкое разделение). При строгих бюджетах ложноположительных срабатываний картина стала более смешанной: Gemma обнаружила больше небезопасного контента при 0,5% FPR на WildGuardMix, WildJailbreak, XSTest и PKU-SafeRLHF, в то время как Jev лидировала на Aegis 2.0 и BeaverTails и немного вырвалась вперед на ToxicChat и ChineseSafe.

Рисунок 4. Бинарные ROC-кривые «безопасно/небезопасно» для Jev (синий) и Gemma 4 31B, оцененной по вероятности ответа «Да» (желтый), на восьми публичных бенчмарках. Ось X логарифмическая, пунктирная линия отмечает уровень ложноположительных срабатываний 0,5%.

На Aegis 2.0 и BeaverTails вероятность ответа «Да» у Gemma насыщается до 1.0 для многих записей, как безопасных, так и небезопасных — никакой порог не может их разделить, и ее кривая не может опуститься ниже 1–2% ложноположительных срабатываний на этих двух наборах. Единственная оценка Jev достигает уровня ложноположительных срабатываний 0,5% с полезной полнотой на всех восьми бенчмарках.

Практический вывод: модель принятия решений на основе одного вопроса оказывается примерно такой же точной, как судья с 31 миллиардом параметров — без необходимости доступа к вероятностям токенов или сложного промпт-инжиниринга, а также без парсинга сгенерированного текста для получения настраиваемой оценки.

Основные выводы

  • Обучение на основе конкретных политик по-прежнему обеспечивает наилучшую полноту при строгих ограничениях на количество ложноположительных результатов — на всех протестированных нами наборах данных.
  • Jev на удивление хорошо справляется с задачами в режиме zero-shot, приближаясь по результатам к LLM-судье с 31 миллиардом параметров.
  • Результаты Laya в режиме zero-shot здесь не показали надежной дифференциации, хотя это вполне достойная база для дообучения (fine-tuning) для команд, которым необходимо хранить данные внутри компании.
  • Это не столько конкуренты, сколько дополнения: классификатор для рутинных объемов и модель принятия решений для новых или меняющихся категорий.

Взгляд в будущее

Модели принятия решений заменяют свободный вывод судьи на типизированные ответы и настраиваемые оценки, устраняя несколько источников сложности в эксплуатации. Преимущество Jev заключается в адаптивности: модель показала конкурентоспособный AUC на нескольких наборах данных, используя только текст политики, без примеров, специфичных для этой политики. Наша оценка показывает, что мощная модель принятия решений может перенести детальную политику без дообучения, в то время как классификатор, обученный на этой политике, может адаптироваться к ней гораздо точнее.

Следующим шагом станет более строгий тест: использование размеченных человеком меток на записях, исключенных из обучения, с порогами, зафиксированными на отдельных валидационных данных. Это позволит отделить соответствие политике от обобщающей способности и обеспечит более надежную основу для принятия решений о развертывании. Мы продолжим оценивать новые модели принятия решений по мере их выпуска и делиться полученными знаниями.

С другой стороны, если именно вам приходится проводить грань между дружеской подколкой и домогательством, вам понадобится модель, созданная специально для этого конкретного решения, а не та, которая пытается угадать его на основе политики, с которой только что познакомилась.

Полные определения категорий, использованные в этой оценке: Cisco AI Security Framework. Сравниваемые модели: (ConvAI Innovations), (TypeSafe).

О чём эта статья

Что-то непонятно? Спросите по статье — объясню простыми словами.

Не хотите разбираться сами? Мы поможем.

Ещё в разделе «Hardware и электроника»

Все →

Ещё от Cisco