Jev — это модель принятия решений System One от TypeSafe. Передайте ей объект состояния приложения и типизированный вопрос, и она вернет типизированный ответ, оценку уверенности и вероятность для каждого возможного варианта (тип ответа Decisions API, а не эндпоинты чата). Согласно презентации TypeSafe, вы можете заменить рубежную модель чата небольшой моделью оценки вроде Jev и добиться значительного снижения как стоимости, так и задержки в задачах классификации, подобных этой. Какую часть точности вы при этом жертвуете?
Мы прогнали 3080 Banking77 реплик службы поддержки через Jev 1.13 и Claude Opus 5 — модель, на которую пользователи OpenRouter потратили больше всего средств в категории классификации в разделе рейтингов Task spend по состоянию на 22 сентября 2026 года. Каждая реплика распределяется в один из 77 банковских интентов, причем обе модели получили одинаковое однострочное описание каждого интента.
На приведенной ниже диаграмме Jev и Opus сопоставлены лицом к лицу, показывая их сравнение по точности, медианной задержке и стоимости за тысячу запросов.
Jev отстает от Opus по точности на 3,3 пункта, но при этом работает в 13 раз быстрее в медианном значении и стоит всего 1/22 от стоимости Opus.
Jev против Claude Opus 5 вкратце
Вот более детальный взгляд на результаты. Макро-F1 дает равный вес каждому интенту.
Цифры в скобках представляют собой 95% бутстрэп-доверительные интервалы, которые мы рассчитали по 3080 примерам. Ни одна из моделей не выдала некорректный ответ. Каждая ошибка представляла собой неверную метку, а не сбой синтаксического анализа.
Как проводилось тестирование
Banking77 — это датасет интентов службы поддержки на уровне реплик от PolyAI под лицензией CC BY 4.0. Реплики короткие (медиана — девять слов), и каждая помечена одним из 77 интентов. Когда мы запускали Jev и Opus на Banking77, мы использовали полный тестовый сплит, который содержит 3080 примеров (по 40 на интент). Некоторые интенты настолько близки, что модели не могут просто уловить пару ключевых слов и перестать читать. Вспомните, например, card_arrival и card_delivery_estimate.
Мы написали однострочный критерий для каждого интента исключительно на основе названия метки, вообще не заглядывая в тестовые данные, и передали этот самый список критериев как Jev, так и Opus. Для оценки Jev мы отправляли каждую реплику в виде вопроса Decisions API Choice с 77 критериями в качестве опций. Для Opus мы создали промпт, в котором модель видела системное сообщение со списком всех критериев, а затем сообщение пользователя только с самой репликой. Мы запускали Opus при температуре ноль, с отключенными рассуждениями и используя строгий формат ответа по JSON-схеме с перечислением (enum) из 77 меток. Мы включили кэширование промптов для системного сообщения, так как оно было идентичным для каждого запроса. Обе модели запускались с одной и той же машины; мы отправляли по 8 одновременных запросов и измеряли задержку как круговое время (round-trip), наблюдаемое клиентом через OpenRouter.
Насколько точен Jev?
Перейдем к цифрам. На Banking77 точность Jev составляет 81,0%, а Opus — 84,4%. Парный бутстрэп дает 95% доверительный интервал от 2,3 до 4,4 пункта, поэтому отрыв Opus примерно на три пункта вряд ли является погрешностью.
С положительной стороны, эти две модели демонстрируют колоссальное согласие. Они сходятся во мнениях по 89,3% реплик. Там, где их мнения расходятся, Opus угадывает 175 раз самостоятельно, а Jev — 72.
С отрицательной стороны, обе модели все еще значительно отстают от диапазона чуть выше 90%, который демонстрируют энкодеры, дообученные (fine-tuned) на всех 10 003 обучающих примерах Banking77. Такова цена отказа от полноценного дообучения в пользу однострочных критериев.
В разрезе классов Opus опережает Jev по 35 интентам из 77, Jev — по 15, а по 27 наблюдается ничья. Самый большой отрыв Opus зафиксирован на интент receiving_money, где его результат составляет 80,0% против 52,5% у Jev. Между тем, Jev блестяще справляется с compromised_card, где набирает 95,0%, в то время как у Opus лишь 70,0%. Opus склонен принимать украденные данные карт за нераспознанный платеж.
Насколько быстр и дешев Jev?
Если говорить коротко, медианное время кругового пути Jev составило 175 мс, а p95 — 270 мс. Opus же, напротив, без режима рассуждений показал медианное время 2266 мс и p95 на уровне 3004 мс. Это означает, что самый медленный вызов Jev (~1,6 с) оказался быстрее самого быстрого вызова Opus (~1,9 с).
Итоговая стоимость для Jev составила $0,34, или $0,11 за тысячу запросов. Opus обошелся в $7,44, или $2,42 за тысячу запросов. В эту сумму для Opus заложено кэширование системного промпта на 3700 токенов, поэтому все запросы выполнялись по тарифу чтения из кэша, а не по стандартному прайсу. Без кэширования стандартный тариф для Opus составил бы около $19 за тысячу запросов. Так что, если вы используете таксономию меток с рубежной моделью, кэшируйте этот системный промпт.
Маршрутизация по уровню уверенности Jev
Jev выдает оценку уверенности, но это не откалиброванная вероятность. В данном случае модель переоценивала собственную точность в среднем диапазоне. Тем не менее, ранжирование работает хорошо. Для 58% реплик с уверенностью ≥0,99 точность составляет 96,3%. Для 3,5% реплик с уверенностью ниже 0,5 точность равна 29,6%.
Такого порядка сортировки вполне достаточно для каскадирования. Принимайте ответ Jev, если он выше заданного порога, а остальные отправляйте на Opus. Ниже приведены точность и стоимость за тысячу запросов на каждом пороге — от варианта «только Jev» до «только Opus».
При пороговом значении 0,90 76% трафика обходят Opus стороной. Взамен ваша точность снижается максимум на 0,4 пункта по сравнению с использованием только Opus, а затраты сокращаются в 3,5 раза. Opus правильно распознал 175 реплик, которые пропустил Jev. Медианная уверенность в этих случаях составляла 0,67, причем 85% из них были ниже 0,90. Так что Jev обычно понимает, когда он просто гадает.
Ограничения
Давайте теперь поговорим конкретно о проведенном нами тесте: один датасет, один домен, один вариант промпта и одно пятнадцатиминутное окно во второй половине дня.
Если здесь присутствует эффект запоминания у Opus, его результат может быть слегка завышен, поскольку датасет Banking77 был опубликован в 2020 году. Однако по результатам одного этого прогона сказать наверняка нельзя.
Другой момент заключается в том, что обе модели споткнулись на одном классе, поскольку критерии были составлены исключительно на основе названий меток, без просмотра примеров сообщений. В данном случае одной из меток была get_physical_card, которая охватывает запросы о том, отправляется ли пин-код отдельно. Угадать это по названию практически невозможно. Обе модели набрали 0 из 40 по этому классу, направив большинство сообщений в change_pin. Если исключить только этот класс, точность Jev составила 82,1%, а Opus — 85,5%. Тем не менее, команда разработки продукта дорабатывала бы критерии на отложенных обучающих данных, а не на тестовом наборе, и обе модели стали бы работать лучше.
Таблица каскадирования, которую мы показали, использовала ровно те же 3080 примеров, что и измерение точности, так что это верхняя граница. Выбирайте пороговое значение на основе собственного трафика.
И наконец, эти тесты запускались с Opus в режиме «без рассуждений» и со структурированными выводами. Opus не тестировался в режиме «с рассуждениями» или с другими схемами либо примерами few-shot.
Что это значит
Если три пункта в точности перевешивают $2,42 за тысячу запросов, выбирайте Opus. Если вы работаете с высокими объемами, низкой задержкой или нуждаетесь в запасном варианте, один лишь Jev подобрался к Opus на расстояние 3,3 пункта. Более того, запуск каскада на основе оценки уверенности Jev позволил нам приблизиться к Opus на расстояние в пределах 0,4 пункта, потратив менее 30% от стоимости.
Справочник по Decisions API подробно описывает базовую структуру запроса. Руководство Jev поделено на этапы создания работающего вопроса с выбором в TypeScript. В проверенном руководстве Jev по каскадам паттерн эскалации представлен в виде кода: дешевая модель создает черновик, Jev проверяет черновик, а передовая модель обрабатывает только то, что не прошло проверку. Тестовая выборка Banking77 представляет собой CSV-файл на 3080 строк в репозитории PolyAI.
Чтобы запустить подобную задачу разметки для вашего собственного бэклога, в руководстве «Классификация и тегирование текста в больших масштабах с Jev» рассматриваются пакетирование в рамках лимитов частоты запросов, выбор порогового значения для каждой метки на основе размеченной выборки и расчет стоимости за 1000 элементов. Если Jev внове для вас, начните с материала «Что такое Jev?», а затем изучите «Jev против LLM» для случаев, когда модель принятия решений заменяет генеративный вызов. Центр документации Jev содержит список всех руководств и поваренных книг по Jev на OpenRouter.
Часто задаваемые вопросы
Насколько точен Jev по сравнению с Claude Opus 5 в задачах классификации намерений?
На тестовой выборке Banking77, состоящей из 3080 высказываний по 77 намерениям и протестированной 22 сентября 2026 года, Claude Opus 5 показал точность 84,4% и макро-F1 83,6%, в то время как Jev 1.13 показал точность 81,0% и макро-F1 80,5%. Разница в парах составила 3,3 процентных пункта по точности при 95% бутстрэп-интервале от 2,3 до 4,4 процентных пункта. Модели сошлись в оценках на 89,3% высказываний.
Насколько Jev быстрее передовой модели в задачах классификации?
По медианной и p95 задержке круглого стола, наблюдаемой клиентом, Jev достиг медианы 175 мс и p95 270 мс, в то время как Claude Opus 5 с отключенными рассуждениями достиг медианы 2266 мс и p95 3004 мс, что примерно в 13 раз выше на медиане. Эти показатели измерены от одного и того же клиента при 8 одновременных запросах. Они включают в себя сетевое время и любую очередь в системе провайдера до фактического вывода.
Сколько стоит классификация текста с помощью Jev на OpenRouter?
Все 3080 запросов Banking77 обошлись в общей сложности в 0,34 доллара США для typesafe/jev-1.13, что составляет 0,11 доллара за тысячу запросов или около 0,0001 доллара за запрос. С учетом кэширования промптов в системном промпте с 77 метками те же запросы обошлись в общей сложности в 7,44 доллара на anthropic/claude-opus-5, или 2,42 доллара за тысячу. Без кэширования Opus обошелся бы примерно в 19 долларов за тысячу по прейскуранту.
Могу ли я использовать оценку уверенности Jev, чтобы решить, когда переключаться на более крупную модель?
Да, и в наших данных она работает как ранжирующий сигнал. Мы выяснили, что точность Jev составляет 96,3% на 58% высказываний с уверенностью не менее 0,99 и 29,6% на 3,5% высказываний с уверенностью менее 0,5. Перенаправление всех запросов с уверенностью ниже 0,9 в Claude Opus 5 позволило восстановить точность до 84,0% (в пределах 0,4 пункта от чистого Opus) при стоимости 0,69 доллара за тысячу запросов. Поскольку эта оценка не откалибрована как вероятность, выберите пороговое значение, которое подходит для ваших собственных данных.










