Jev теперь доступен в LangSmith Evals

Источник: LangChain

Jev теперь доступен в LangSmith Evals

Источник: LangChain

Используйте Jev в качестве судьи для оценок LangSmith, чтобы оценивать трассировки агентов с помощью более быстрой и дешевой структурированной обратной связи в рабочих средах, наборах данных и регрессионных тестах.

•Обновлено: 29 сентября 2026 г.

Jev теперь доступен в качестве судьи для оценки (evals) в LangSmith. Jev предоставляет командам быстрый и недорогой способ оценивать поведение агентов с открытым финалом и преобразовывать результаты в структурированную обратную связь, которую можно отслеживать в LangSmith.

Ниже мы объясним, почему модель «System One», такая как Jev, полезна для оценки агентов, поделимся результатами нашего тестирования и расскажем, как настроить оценщик Jev-as-a-judge для онлайн-оценок.

Попробуйте Jev-as-a-judge в LangSmith уже сегодня, перейдя на вкладку Evaluators в любом проекте трассировки.

Краткая история оценки агентов

В 2023 году, когда мы только начинали создавать агентов (которых тогда в основном называли LLM-приложениями), основным подходом к оценке был программный (code-based). Позже в том же году исследователи представили LLM-as-a-judge, и с тех пор программный подход и LLM-as-a-judge стали двумя основными способами оценки агентов.

Программные оценщики проверяют конкретные, детерминированные условия: вызвал ли агент инструмент? Соответствует ли вывод шаблону? Присутствует ли поле? Это быстро и надежно, но охватывает лишь узкий сегмент поведения агента, который можно полностью описать до запуска. Поскольку агенты недетерминированы, агент, решающий одну и ту же задачу тремя разными допустимыми способами, не пройдет программную проверку, ожидающую только один из них.

Оценщики LLM-as-a-judge заполняют этот пробел. Вы предоставляете LLM-судье трассировку агента вместе с инструкциями и критериями оценки, и модель анализирует трассировку в свободном текстовом формате, прежде чем вынести вердикт. Однако эта гибкость имеет свою цену. Оценщики LLM-as-a-judge работают медленнее и стоят дороже, чем вызов функции, а поскольку они недетерминированы, один и тот же входной сигнал может привести к разным вердиктам при разных запусках. Кроме того, этап преобразования свободного текста в структурированный вывод сам по себе является источником ошибок, независимо от того, было ли рассуждение судьи правильным.

Теперь модели System One, такие как Jev, представляют третий тип оценки агентов, который жертвует частью скорости программной оценки ради гибкости при анализе поведения агентов с открытым финалом, при этом обходясь значительно дешевле, чем LLM-судья.

Что такое Jev?

Jev — это не традиционная LLM, и она не генерирует текст. Команда TypeSafe AI называет ее моделью System One:

📖 Модели System One — это класс моделей ИИ, созданных для принятия быстрых, структурированных решений, которые программное обеспечение может использовать напрямую. Модель System One оценивает состояние и возвращает типизированные ответы и вероятности.

Для оценки состоянием может быть трассировка агента, отдельное сообщение или любой другой контекст, который вы хотите оценить. Вопросы определяют критерии, по которым вы оцениваете состояние, например, произошла ли утечка PII, каково было намерение пользователя или насколько разочарованным он казался. Jev может отвечать на три типа вопросов: (1) noul возвращает вероятность да/нет, (2) choice выбирает один вариант из набора, и (3) score оценивает состояние по упорядоченной шкале. Каждый ответ возвращается в типизированном виде, а не в виде блока сгенерированного текста, который нужно преобразовывать в структурированный вывод.

Три типа вопросов, на которые может ответить Jev, используя ключи обратной связи из этой статьи: утечка PII (noul), намерение пользователя (choice) и разочарование пользователя (score).

Почему Jev интересен для оценки агентов?

Три особенности Jev напрямую связаны с «болевыми точками» при оценке агентов. По данным TypeSafe AI, Jev работает до 200 раз быстрее, чем сопоставимые LLM при выполнении задач классификации, и может оценивать несколько вопросов об одном и том же состоянии параллельно.

Стоимость — частая причина, по которой команды оценивают своих агентов реже, чем хотелось бы. Каждая оценка требует компромисса: оценивать больше запусков агентов, проверять больше критериев или тестировать больше изменений, при этом стоимость тестирования растет пропорционально. При наличии нескольких агентов и больших объемах использования LLM-судья, который стоит несколько центов за оценку, быстро становится дорогим в условиях производственного трафика, больших наборов данных и регрессионного тестирования при каждом изменении модели или промпта. Команды в итоге проводят меньше оценок для контроля расходов, что замедляет цикл обратной связи, от которого зависит создание отличных агентов. При стоимости, составляющей лишь малую часть от этой суммы, судья Jev позволяет устранить этот компромисс.

С помощью Jev-as-a-judge вы можете оценивать каждую трассировку вместо выборки, проверять больше критериев для каждой трассировки и многократно повторять одно и то же суждение, чтобы увидеть, насколько последователен судья. Чем дешевле судья, тем больше аспектов поведения вашего агента вы можете позволить себе оценивать, и тем быстрее становится цикл улучшения агента.

Скорость имеет огромное значение для онлайн-оценок, где судья оценивает «живой» трафик. Будучи до ~200 раз быстрее, чем LLM-судья, судья Jev лучше справляется с темпом поступления трафика. Это наиболее важно для ключей обратной связи, которые помечают риски безопасности, такие как утечка PII, инъекции промптов или токсичность, где вы можете настроить оповещение по ключу обратной связи, запускающее вебхук для автоматизации ответа. Чем быстрее судья, тем меньше времени проходит между возникновением проблемы и принятием мер.

Параллелизация меняет количество критериев, которые можно оценить для одной трассировки агента. Jev оценивает все вопросы в запросе одновременно, поэтому оценка трассировки по нескольким ключам обратной связи, таким как утечка PII, намерение пользователя и разочарование пользователя, стоит лишь незначительно дороже, чем оценка по одному.

💡 Модели System One оценивают все вопросы в запросе параллельно. Добавление вопросов почти не влияет на время отклика и стоит только дополнительных токенов для новых вопросов, которые стоят дешево.

LLM-судья, напротив, либо требует отдельного вызова для каждого критерия, либо должен последовательно анализировать их все в одном промпте, при этом количество выходных токенов масштабируется в зависимости от числа критериев.

Модели System One хорошо подходят для решения этих проблем, но это не делает LLM-судей устаревшими. Дообученные и открытые модели могут быть эффективными судьями при гораздо меньших затратах, чем передовые модели, и для критериев с открытым финалом, где вам нужны письменные обоснования наряду с вердиктом, LLM-судья остается лучшим инструментом. Jev хорошо подходит, когда решение, которое вам нужно, является узким и типизированным, и вы принимаете его в больших объемах.

Действительно ли Jev-as-a-judge работает?

Мы протестировали Jev в рамках «Jev-as-a-Judge for Agent Evals», сравнив его с GPT-5.6 Luna, GPT-5.6 Terra и Claude Sonnet 4.6 по точности, последовательности, скорости и стоимости. Jev оказался более точным, значительно более последовательным, а также быстрее и дешевле, чем LLM-судьи.

Jev совпал с мнением человека-рецензента в каждом решении, с дисперсией в 92–913 раз ниже, чем у LLM-судей. В среднем он тратил 0,44 секунды на вызов по сравнению с 2,16–2,83 секундами у LLM-судей. При стоимости $0,00035 за вызов выполнение полного набора суждений стоило $0,34 с Jev, по сравнению с $0,39 у GPT-5.6 Luna, $2,90 у GPT-5.6 Terra и $28,17 у Claude Sonnet 4.6.

Это был один тест на одном агенте, но результаты являются многообещающим ранним признаком того, что Jev-as-a-judge является жизнеспособным третьим типом оценки агентов, наряду с программной оценкой и LLM-as-a-judge.

Как использовать Jev-as-a-judge в LangSmith

TypeSafe теперь является поставщиком моделей в LangSmith, а Jev доступен в качестве модели. Настройка оценщика Jev-as-a-judge выполняется так же, как и настройка оценщика LLM-as-a-judge. Ключевое отличие заключается в том, что оценщик Jev-as-a-judge определяет состояние и набор типизированных вопросов вместо промпта и критериев оценки.

  • Добавьте API-ключ TypeSafe. В разделе Settings откройте Provider secrets и нажмите + Secret. Выберите TypeSafe в качестве поставщика (Provider) и вставьте свой API-ключ TypeSafe в поле TYPESAFE_API_KEY. Вы можете создать его в своей учетной записи TypeSafe AI.
  • Добавьте оценщик. В своем проекте трассировки откройте вкладку Evaluators и нажмите + Evaluator. В разделе Create from scratch выберите LLM-as-a-Judge Evaluator.
  • Выберите TypeSafe в качестве поставщика. Дайте название своему оценщику Jev-as-a-judge. В разделе Prompt & Model откройте Model Configuration, выберите TypeSafe в качестве поставщика (Provider) и jev-latest в качестве модели (Model).
  • Определите состояние. После настройки модели определите состояние или контекст, который будет оценивать Jev, сопоставив переменные выполнения (run) или потока (thread). В отличие от LLM-судьи, состояние не должно включать инструкции по выставлению оценок. Они указываются в вопросах на следующем этапе.
  • Добавьте вопросы. В разделе Feedback Configuration добавьте по одному вопросу на каждый критерий, по которому вы хотите провести оценку состояния. Каждый вопрос становится ключом обратной связи. Сформулируйте вопрос с ответом «да/нет» так, чтобы высокая вероятность означала «да», предоставьте полный набор вариантов для выбора и укажите уровни оценки в порядке от низкого к высокому. Поскольку Jev оценивает каждый вопрос за один вызов, добавление второго или третьего вопроса стоит лишь незначительно дороже.
  • Начните оценку. Сохраните оценщик. Оценщик Jev-as-a-judge начнет оценивать входящие запуски или потоки, и каждый вопрос будет отображаться как отдельный ключ обратной связи. После этого вы сможете фильтровать, строить графики, настраивать оповещения или автоматизацию по этим ключам, как и по любой другой обратной связи в LangSmith.

Начало работы

Функция Jev-as-a-judge уже доступна в LangSmith.

Войдите в систему или зарегистрируйтесь в LangSmith, затем откройте вкладку Evaluators в любом проекте трассировки, добавьте оценщик LLM-as-a-Judge и выберите TypeSafe в качестве поставщика, чтобы попробовать его в деле. Более подробную информацию см. в руководстве по оценщику моделей принятия решений.

Если вы попробуете Jev в качестве судьи для своих агентов, мы будем рады узнать, как он справляется с задачами, особенно в сравнении с LLM-судьями, которые вы используете сегодня. Поделитесь своими результатами на форуме или отметьте нас в X.

Чтобы узнать, как Jev вписывается в цикл работы агента помимо оценки, включая маршрутизацию моделей и контроль рисков инструментов, прочитайте статью «Создание обвязки с помощью Jev».

Если вы хотите узнать больше о создании агентов с помощью Jev, мы проводим прямую трансляцию с командой TypeSafe AI во вторник, 22 сентября: https://events.langchain.com/webinar/building-a-harness-with-jev/

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от LangChain