Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Naskolko jev tochen v klassifikatsii po sravneniyu s peredovymi modelyami
Dev48

© 2026 · All rights reserved.

Насколько Jev точен в классификации по сравнению с передовыми моделями?

Источник: OpenRouter Blog

Насколько Jev точен в классификации по сравнению с передовыми моделями?

Источник: OpenRouter Blog

Claude Opus 5 лидирует в рейтинге задач классификации OpenRouter по объему затрат. Мы отправили одни и те же 3080 высказываний из набора Banking77 этой модели и Jev 1.13 через Decisions API. Opus показал результат 84,4%, а Jev — 81,0%, при этом Jev ответил за 175 мс при стоимости $0,11 за тысячу…

26 сентября 2026 г.•Обновлено: 26 сентября 2026 г.

Jev — это модель принятия решений System One от TypeSafe. Передайте ей объект состояния приложения и типизированный вопрос, и она вернет типизированный ответ, оценку уверенности и вероятность для каждого возможного варианта (тип ответа Decisions API, а не эндпоинты чата). Согласно презентации TypeSafe, вы можете заменить рубежную модель чата небольшой моделью оценки вроде Jev и добиться значительного снижения как стоимости, так и задержки в задачах классификации, подобных этой. Какую часть точности вы при этом жертвуете?

Мы прогнали 3080 Banking77 реплик службы поддержки через Jev 1.13 и Claude Opus 5 — модель, на которую пользователи OpenRouter потратили больше всего средств в категории классификации в разделе рейтингов Task spend по состоянию на 22 сентября 2026 года. Каждая реплика распределяется в один из 77 банковских интентов, причем обе модели получили одинаковое однострочное описание каждого интента.

На приведенной ниже диаграмме Jev и Opus сопоставлены лицом к лицу, показывая их сравнение по точности, медианной задержке и стоимости за тысячу запросов.

Jev отстает от Opus по точности на 3,3 пункта, но при этом работает в 13 раз быстрее в медианном значении и стоит всего 1/22 от стоимости Opus.

Jev против Claude Opus 5 вкратце

Вот более детальный взгляд на результаты. Макро-F1 дает равный вес каждому интенту.

Цифры в скобках представляют собой 95% бутстрэп-доверительные интервалы, которые мы рассчитали по 3080 примерам. Ни одна из моделей не выдала некорректный ответ. Каждая ошибка представляла собой неверную метку, а не сбой синтаксического анализа.

Как проводилось тестирование

Banking77 — это датасет интентов службы поддержки на уровне реплик от PolyAI под лицензией CC BY 4.0. Реплики короткие (медиана — девять слов), и каждая помечена одним из 77 интентов. Когда мы запускали Jev и Opus на Banking77, мы использовали полный тестовый сплит, который содержит 3080 примеров (по 40 на интент). Некоторые интенты настолько близки, что модели не могут просто уловить пару ключевых слов и перестать читать. Вспомните, например, card_arrival и card_delivery_estimate.

Мы написали однострочный критерий для каждого интента исключительно на основе названия метки, вообще не заглядывая в тестовые данные, и передали этот самый список критериев как Jev, так и Opus. Для оценки Jev мы отправляли каждую реплику в виде вопроса Decisions API Choice с 77 критериями в качестве опций. Для Opus мы создали промпт, в котором модель видела системное сообщение со списком всех критериев, а затем сообщение пользователя только с самой репликой. Мы запускали Opus при температуре ноль, с отключенными рассуждениями и используя строгий формат ответа по JSON-схеме с перечислением (enum) из 77 меток. Мы включили кэширование промптов для системного сообщения, так как оно было идентичным для каждого запроса. Обе модели запускались с одной и той же машины; мы отправляли по 8 одновременных запросов и измеряли задержку как круговое время (round-trip), наблюдаемое клиентом через OpenRouter.

Насколько точен Jev?

Перейдем к цифрам. На Banking77 точность Jev составляет 81,0%, а Opus — 84,4%. Парный бутстрэп дает 95% доверительный интервал от 2,3 до 4,4 пункта, поэтому отрыв Opus примерно на три пункта вряд ли является погрешностью.

С положительной стороны, эти две модели демонстрируют колоссальное согласие. Они сходятся во мнениях по 89,3% реплик. Там, где их мнения расходятся, Opus угадывает 175 раз самостоятельно, а Jev — 72.

С отрицательной стороны, обе модели все еще значительно отстают от диапазона чуть выше 90%, который демонстрируют энкодеры, дообученные (fine-tuned) на всех 10 003 обучающих примерах Banking77. Такова цена отказа от полноценного дообучения в пользу однострочных критериев.

В разрезе классов Opus опережает Jev по 35 интентам из 77, Jev — по 15, а по 27 наблюдается ничья. Самый большой отрыв Opus зафиксирован на интент receiving_money, где его результат составляет 80,0% против 52,5% у Jev. Между тем, Jev блестяще справляется с compromised_card, где набирает 95,0%, в то время как у Opus лишь 70,0%. Opus склонен принимать украденные данные карт за нераспознанный платеж.

Насколько быстр и дешев Jev?

Если говорить коротко, медианное время кругового пути Jev составило 175 мс, а p95 — 270 мс. Opus же, напротив, без режима рассуждений показал медианное время 2266 мс и p95 на уровне 3004 мс. Это означает, что самый медленный вызов Jev (~1,6 с) оказался быстрее самого быстрого вызова Opus (~1,9 с).

Итоговая стоимость для Jev составила $0,34, или $0,11 за тысячу запросов. Opus обошелся в $7,44, или $2,42 за тысячу запросов. В эту сумму для Opus заложено кэширование системного промпта на 3700 токенов, поэтому все запросы выполнялись по тарифу чтения из кэша, а не по стандартному прайсу. Без кэширования стандартный тариф для Opus составил бы около $19 за тысячу запросов. Так что, если вы используете таксономию меток с рубежной моделью, кэшируйте этот системный промпт.

Маршрутизация по уровню уверенности Jev

Jev выдает оценку уверенности, но это не откалиброванная вероятность. В данном случае модель переоценивала собственную точность в среднем диапазоне. Тем не менее, ранжирование работает хорошо. Для 58% реплик с уверенностью ≥0,99 точность составляет 96,3%. Для 3,5% реплик с уверенностью ниже 0,5 точность равна 29,6%.

Такого порядка сортировки вполне достаточно для каскадирования. Принимайте ответ Jev, если он выше заданного порога, а остальные отправляйте на Opus. Ниже приведены точность и стоимость за тысячу запросов на каждом пороге — от варианта «только Jev» до «только Opus».

При пороговом значении 0,90 76% трафика обходят Opus стороной. Взамен ваша точность снижается максимум на 0,4 пункта по сравнению с использованием только Opus, а затраты сокращаются в 3,5 раза. Opus правильно распознал 175 реплик, которые пропустил Jev. Медианная уверенность в этих случаях составляла 0,67, причем 85% из них были ниже 0,90. Так что Jev обычно понимает, когда он просто гадает.

Ограничения

Давайте теперь поговорим конкретно о проведенном нами тесте: один датасет, один домен, один вариант промпта и одно пятнадцатиминутное окно во второй половине дня.

Если здесь присутствует эффект запоминания у Opus, его результат может быть слегка завышен, поскольку датасет Banking77 был опубликован в 2020 году. Однако по результатам одного этого прогона сказать наверняка нельзя.

Другой момент заключается в том, что обе модели споткнулись на одном классе, поскольку критерии были составлены исключительно на основе названий меток, без просмотра примеров сообщений. В данном случае одной из меток была get_physical_card, которая охватывает запросы о том, отправляется ли пин-код отдельно. Угадать это по названию практически невозможно. Обе модели набрали 0 из 40 по этому классу, направив большинство сообщений в change_pin. Если исключить только этот класс, точность Jev составила 82,1%, а Opus — 85,5%. Тем не менее, команда разработки продукта дорабатывала бы критерии на отложенных обучающих данных, а не на тестовом наборе, и обе модели стали бы работать лучше.

Таблица каскадирования, которую мы показали, использовала ровно те же 3080 примеров, что и измерение точности, так что это верхняя граница. Выбирайте пороговое значение на основе собственного трафика.

И наконец, эти тесты запускались с Opus в режиме «без рассуждений» и со структурированными выводами. Opus не тестировался в режиме «с рассуждениями» или с другими схемами либо примерами few-shot.

Что это значит

Если три пункта в точности перевешивают $2,42 за тысячу запросов, выбирайте Opus. Если вы работаете с высокими объемами, низкой задержкой или нуждаетесь в запасном варианте, один лишь Jev подобрался к Opus на расстояние 3,3 пункта. Более того, запуск каскада на основе оценки уверенности Jev позволил нам приблизиться к Opus на расстояние в пределах 0,4 пункта, потратив менее 30% от стоимости.

Справочник по Decisions API подробно описывает базовую структуру запроса. Руководство Jev поделено на этапы создания работающего вопроса с выбором в TypeScript. В проверенном руководстве Jev по каскадам паттерн эскалации представлен в виде кода: дешевая модель создает черновик, Jev проверяет черновик, а передовая модель обрабатывает только то, что не прошло проверку. Тестовая выборка Banking77 представляет собой CSV-файл на 3080 строк в репозитории PolyAI.

Чтобы запустить подобную задачу разметки для вашего собственного бэклога, в руководстве «Классификация и тегирование текста в больших масштабах с Jev» рассматриваются пакетирование в рамках лимитов частоты запросов, выбор порогового значения для каждой метки на основе размеченной выборки и расчет стоимости за 1000 элементов. Если Jev внове для вас, начните с материала «Что такое Jev?», а затем изучите «Jev против LLM» для случаев, когда модель принятия решений заменяет генеративный вызов. Центр документации Jev содержит список всех руководств и поваренных книг по Jev на OpenRouter.

Часто задаваемые вопросы

Насколько точен Jev по сравнению с Claude Opus 5 в задачах классификации намерений?

На тестовой выборке Banking77, состоящей из 3080 высказываний по 77 намерениям и протестированной 22 сентября 2026 года, Claude Opus 5 показал точность 84,4% и макро-F1 83,6%, в то время как Jev 1.13 показал точность 81,0% и макро-F1 80,5%. Разница в парах составила 3,3 процентных пункта по точности при 95% бутстрэп-интервале от 2,3 до 4,4 процентных пункта. Модели сошлись в оценках на 89,3% высказываний.

Насколько Jev быстрее передовой модели в задачах классификации?

По медианной и p95 задержке круглого стола, наблюдаемой клиентом, Jev достиг медианы 175 мс и p95 270 мс, в то время как Claude Opus 5 с отключенными рассуждениями достиг медианы 2266 мс и p95 3004 мс, что примерно в 13 раз выше на медиане. Эти показатели измерены от одного и того же клиента при 8 одновременных запросах. Они включают в себя сетевое время и любую очередь в системе провайдера до фактического вывода.

Сколько стоит классификация текста с помощью Jev на OpenRouter?

Все 3080 запросов Banking77 обошлись в общей сложности в 0,34 доллара США для typesafe/jev-1.13, что составляет 0,11 доллара за тысячу запросов или около 0,0001 доллара за запрос. С учетом кэширования промптов в системном промпте с 77 метками те же запросы обошлись в общей сложности в 7,44 доллара на anthropic/claude-opus-5, или 2,42 доллара за тысячу. Без кэширования Opus обошелся бы примерно в 19 долларов за тысячу по прейскуранту.

Могу ли я использовать оценку уверенности Jev, чтобы решить, когда переключаться на более крупную модель?

Да, и в наших данных она работает как ранжирующий сигнал. Мы выяснили, что точность Jev составляет 96,3% на 58% высказываний с уверенностью не менее 0,99 и 29,6% на 3,5% высказываний с уверенностью менее 0,5. Перенаправление всех запросов с уверенностью ниже 0,9 в Claude Opus 5 позволило восстановить точность до 84,0% (в пределах 0,4 пункта от чистого Opus) при стоимости 0,69 доллара за тысячу запросов. Поскольку эта оценка не откалибрована как вероятность, выберите пороговое значение, которое подходит для ваших собственных данных.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лаборатории

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Ещё от OpenRouter

Как использовать Jev: модерация с помощью API Jev на TypeScript
OpenRouter

Как использовать Jev: модерация с помощью API Jev на TypeScript

Лучшие модели эмбеддингов в 2026 году
OpenRouter

Лучшие модели эмбеддингов в 2026 году

Что такое Nemotron 3.5 Lightning
OpenRouter

Что такое Nemotron 3.5 Lightning

Batch API: снижение стоимости вывода вдвое за счет пакетной обработки запросов
OpenRouter

Batch API: снижение стоимости вывода вдвое за счет пакетной обработки запросов