Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Vam ne nuzhna pogranichnaya model vam nuzhen verifikator
Dev48

© 2026 · All rights reserved.

Вам не нужна пограничная модель. Вам нужен верификатор.

Источник: AI21

Вам не нужна пограничная модель. Вам нужен верификатор.

Источник: AI21

Независимый верификатор выводит агентский поиск за рамки опубликованных SOTA. Наша обученная модель 8B делает это почти за $0 за вопрос.

26 сентября 2026 г.

Коротко о главном

В агентском поиске небольшие модели обычно находят правильный ответ, но не могут его выбрать. Мажоритарное голосование не решает эту проблему, так как оно не способно перевесить популярный неправильный ответ. Добавление независимого верификатора, который заново исследует каждого кандидата и отсеивает неверные варианты, превосходит опубликованные SOTA в FACTS-Search. А если обучить собственный верификатор 8B, это почти ничего не стоит, работает с любым набором генераторов и обобщается на новые бенчмарки и инструменты поиска.

Стандартный способ повысить точность агентской системы — купить более совершенный генератор, то есть пограничную модель. Это работает, но является самым дорогим из доступных вариантов.

В этой статье мы приводим другой аргумент: то, как вы запускаете свои модели, важнее того, какую именно модель вы используете. Описанная ниже система добавляет важный компонент в любую архитектуру ИИ: верификатор. Этот компонент повышает производительность любой архитектуры, будь то ансамбль пограничных моделей или эффективные модели с открытым исходным кодом.

Почему агентскому поиску нужен верификатор

Ваш эффективный агент, вероятно, уже нашел правильный ответ. Проблема в том, что он его не выбрал.

Запуски моделей недетерминированы. Один и тот же агент при ответе на один и тот же вопрос может потерпеть неудачу в одной попытке и добиться успеха в следующей. Для каждого протестированного нами генератора показатель pass@k значительно выше точности одиночного запуска (pass@1): правильные ответы регулярно присутствуют в пуле, но просто не выбираются. Таким образом, ограничивающим фактором в агентском поиске является выбор, а не генерация.

Выбор — задача решаемая, потому что проверить проще, чем сгенерировать (по крайней мере, для агентского поиска QA). Ответ на вопрос «Какая группа исполнила 'Johnny Come Lately' на альбоме Стива Эрла, который включает 'Little Sister'?» требует цепочки поисковых запросов, тупиковых путей и синтеза. Верификация предложенного ответа гораздо уже: нужно исследовать одно утверждение и вынести по нему решение.

Так почему бы просто не использовать мажоритарное голосование при работе с ансамблем? Потому что голосование не может опровергнуть популярный неправильный ответ. Когда половина пула уверенно повторяет одну и ту же ошибку, голосование не фильтрует её, а подтверждает. Эффективные пулы чаще всего терпят неудачу именно так, поскольку правильные ответы встречаются реже.

Верификация работает

Во-первых, отбросим стоимость и запустим лучший из доступных верификаторов.

Мы работаем с FACTS-Search, бенчмарком Google DeepMind, состоящим из сложных многоходовых фактических вопросов, требующих ответа через веб-поиск. Каждая модель в этой статье, будь то генератор или верификатор, использует один и тот же API Brave Search, поэтому измеренные различия обусловлены навыками модели, а не инструментарием.

Ансамбль генераторов из закрытых и открытых моделей (Claude Haiku, Sonnet, Opus, Qwen3-Coder-30B-A3B при k=4) набирает 83,3 балла при обычном мажоритарном голосовании и 93,4 балла с верификатором Claude Opus, что превосходит опубликованный SOTA в 89,4 (GPT-5.6 Sol), как показано на Рисунке 1.

Запас прочности выше у небольших моделей

Связка «пограничная модель + пограничная модель» доказывает работоспособность механизма. Однако на практике важнее режим работы с небольшими генераторами, и там запас прочности не уменьшается, а растет: более «шумный» пул всё равно выдает правильные ответы, их просто меньше, и именно тогда их идентификация приносит наибольшую пользу.

Наш пул полностью открытых моделей (Qwen3-14B и Qwen3-Coder-30B-A3B при k=4) голосует на 60,1 балла. Если добавить верификатор Claude Opus к тем же кандидатам, результат составит 80,4 балла при стоимости $1,76 за вопрос. Двадцать баллов уже лежат в пуле, ожидая верификатора, достаточно хорошего, чтобы их извлечь.

Верификатор — это дорогая часть, поэтому мы обучили свой собственный

Пограничный верификатор запускает полный цикл веб-поиска для каждого кандидата: k выборок, умноженных на количество генераторов, — шестнадцать циклов на вопрос в нашей лучшей конфигурации. Это стоит дороже, чем генерация всего, что он проверяет: результат 93,4 обходится в $4,26 за вопрос, причем большая часть этой суммы приходится на верификатор.

Очевидное решение — небольшой верификатор с открытым кодом, но это не работает. Стандартный верификатор Qwen3-8B поднимает результат эффективного пула с 60,1 до 62,5. Это плюс 2,4 балла против плюс 20,3 у Opus на тех же кандидатах. Этот разрыв в 18 баллов — проблема обучения: навык верификации не появляется автоматически вместе с параметрами.

Обучение

Получив вопрос и кандидата на ответ, верификатор запускает собственный цикл ReAct в Brave-search и выдает один вердикт. Наградой является бинарное точное совпадение с эталонной меткой, поэтому результат полностью проверяем, модель вознаграждения не требуется. Данные для обучения состоят из примерно 6 тыс. троек (вопрос, ответ, VALID/NOT_VALID), полученных из результатов генераторов, дедуплицированных, сбалансированных по классам и разделенных на уровне вопросов.

Рецепт — SFT, а затем RL, по той же причине, что и у DeepSeek-R1: RL с «холодного старта» не имеет компетентной политики для исследования. Здесь есть два специфических для верификации режима отказа. RL в одиночку приводит к «взлому» вознаграждения из-за дисбаланса классов, при этом частота использования инструментов падает с 94% до 0% за девять шагов. Балансировка данных закрывает этот путь, но не решает основную проблему: политика фиксируется на одном узком поисковом поведении и не может из него выбраться, поэтому качество поиска выходит на плато там, где произошел «холодный старт». SFT в одиночку обучает навыку поиска и размывает вердикт, потому что имитация распределяет потери по каждому токену длинной траектории, в то время как сигнал верификации живет в одном токене. В сочетании использование инструментов остается высоким и становится адаптивным, а вердикт становится точнее без разрушения политики.

Для измерения всего этого нужны две вещи. Повторный запуск полного цикла для каждой контрольной точки слишком медленный, поэтому варианты верификатора оцениваются офлайн по фиксированному пулу заранее сгенерированных результатов: кандидаты никогда не меняются, меняется только судья. А метрики должны вычисляться для каждого вопроса, а затем усредняться, потому что метрики вердикта на уровне результатов (точность, полнота, F1) регулярно улучшались, в то время как система становилась хуже. Мы отслеживаем четыре величины (Рисунок 4): pass@1 и pass@k (один случайный выбор и потолок оракула без верификатора), а также pass@1(v) и pass@k(v) (те же два показателя только для проверенных кандидатов). Три разрыва распределяют ответственность — два на верификатор, один на агрегатор:

  • Прирост верификации := pass@1(v) − pass@1 — это точность верификатора: максимизируйте её.
  • Запас агрегатора := pass@k(v) − pass@1(v) — это то, что более умный агрегатор мог бы извлечь из проверенных кандидатов (отдельная тема, которую мы здесь не рассматриваем).
  • Предел полноты := pass@k − pass@k(v) — это доля решаемых вопросов, где верификатор отклонил каждый правильный ответ: минимизируйте её.

Результаты

Публичная тестовая выборка из 100 вопросов, официальная оценка. Затраты основаны на ценах популярных платформ обслуживания.

Замените один компонент в конфигурации SOTA. Замена верификатора Claude Opus на наш обученный верификатор 8B сохраняет результат 92,9 при стоимости $1,34: полбалла качества при снижении стоимости в 3,2 раза, что всё ещё значительно выше опубликованного SOTA. Самый дорогой компонент системы стал одним из самых дешевых.

Полностью удалите проприетарные модели. Qwen3-14B и Qwen3-Coder-30B-A3B при k=4 с нашим обученным верификатором набирают 77,0 баллов при стоимости $0,017 за вопрос, против 60,1 при мажоритарном голосовании на том же пуле и 80,4 для верификатора Opus. Генераторы практически бесплатны, поэтому верификатор и есть вся система. Это превосходит один вызов Claude Haiku (76,3 балла за $0,043) при стоимости в 2,5 раза ниже и находится в пределах 4,2 балла от одного вызова Claude Sonnet (81,2 балла за $0,1) при стоимости в 6 раз ниже.

Он обобщается

Мы специально обучали на одном бенчмарке и одном инструменте, потому что практический случай — клиент приходит со своей собственной настройкой. Бенчмарк BrowseComp-Plus меняет оба одновременно: та же форма задачи, но агент извлекает из фиксированного корпуса вместо поиска в открытом вебе.

Верификатор выходит из коробки и повышает голосующий процент в downstream с 39% до 51%. Что он теряет, так это полноту: при 27% решаемых вопросов он отклоняет каждого кандидата и отказывается от вопроса. Финальный небольшой SFT на около 85 вопросов из скрытого домена, примерно 15 шагов оптимизатора, сокращает этот разрыв с 27% до 4% и повышает downstream до 69%.

Верификация добавляет максимум 5% к стоимости системы при каждом бюджете развертывания. Мы не заявляем SOTA здесь, поскольку генератор — это одна открытая модель. Утверждение — это рецепт: точность обобщается бесплатно, а разрыв полноты легко закрыть.

Резюме

  • При агентском поиске правильные ответы обычно уже находятся в пуле. Мажоритарное голосование не может их выявить, потому что не может отменить популярный неправильный ответ. Боттом-лента — это выборка.
  • Независимый исследовательский и вето-верификатор поднял фронтирный пул с 83,3 до 93,4 на FACTS-Search, превысив опубликованный SOTA. Это также была доминирующая стоимость этой системы.
  • Стандартный 8B почти не восстанавливает этот прирост. Обученный, тот же 8B держит 92,9 при $1,34, в пределах половины пункта от верификатора Claude Opus при 3,2‑кратной более низкой стоимости, и обеспечивает 77,0 при $0,017 без проприетарной модели в стеке.
  • Он обобщается по бенчмарку и инструменту: точность переносится бесплатно, а небольшая адаптация закрывает разрыв полноты, одновременно повышая точность.

Предостережения: оба бенчмарка оцениваются на выборках из 100 вопросов, метки обучения наследуют шум автоматического оценщика, оба этапа SFT извлекают из закрытых моделей, а верификация добавляет раунд задержки. Последняя ограничена: траектории верификации коротки по сравнению с генерационными развертываниями, которые переносят извлеченные документы через контекст, а петли не разделяют состояние, поэтому шестнадцать верификаций стоят одного часового цикла.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лаборатории

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Ещё от AI21 Labs

Вместе лучше и дешевле: открытые модели исследуют, пограничные модели исправляют
AI21 Labs

Вместе лучше и дешевле: открытые модели исследуют, пограничные модели исправляют

Улучшение Best-of-N с помощью выполнения с учетом бюджета для SWE-агентов
AI21 Labs

Улучшение Best-of-N с помощью выполнения с учетом бюджета для SWE-агентов

Расходы на токены не снижаются. Для управления ими нужно нечто большее, чем просто примитивная маршрутизация
AI21 Labs

Расходы на токены не снижаются. Для управления ими нужно нечто большее, чем просто примитивная маршрутизация

Переломный момент: объединение слабых агентов в передовую систему глубокого исследования
AI21 Labs

Переломный момент: объединение слабых агентов в передовую систему глубокого исследования