Авторы: Ади Элбаз, Эран Голдштейн, Тамар Леви Лобода, Нив Гранот, Юваль Белфер
Вкратце
DeepResearch Bench II (DRB II) — это бенчмарк, который оценивает глубоких исследователей по 9 430 экспертно написанным рубрикам в рамках 132 задач. Мы заняли первое место с общим баллом 64,38 — на +3,2 выше предыдущего лучшего результата. Он объединяет результаты работы более слабых агентов (места на лидерской доске 7–13, никто не набрал выше 45).
Рисунок 1: Лидерская доска DRB II на 24 июня 2026 года, наше место (AI21) — #1, общий балл 64,38.
Подъем на 20 пунктов за 6 месяцев: что изменилось?
Примерно шесть месяцев назад лучший глубокий исследовательский агент в DRB II набирал около 45 баллов. С тех пор область сделала то, что делают области: она создала лучших агентов. Лучшая оркестровка, поиск, декомпозиция, лучшие модели в основе. Каждый прогресс был достигнут за счет усиления одного агента.
Мы хотели задать другой вопрос: не «как создать лучшего агента?», а «сколько еще мы можем извлечь из тех, которые уже существуют?»
Это стоит спросить, потому что такое глубокое исследование. Дано реальное задание («оценить преимущества и риски инвестирования в инфраструктуру зарядки электромобилей», например), агент работает в течение нескольких минут, ищет информацию в интернете и составляет длинный отчет. Самое сложное — это не написание. Это информационная память: извлечение конкретных, проверяемых фактов, от которых зависит ответ, не упуская те, которые важны. И у информационной памяти есть свойство, которого нет у письма: два посредственных отчета редко упускают одни и те же факты. Где один был слабым, другой, вероятно, заполнил пробел. Факты уже существуют, разбросаны по отчетам, которые есть; никто просто не объединил их.
Поэтому мы это сделали. Объединив результаты работы агентов, которых никто не назвал бы современными, мы достигли вершины лидерской доски, не создав ни одного нового агента.
Краткое замечание по очевидному возражению, что «занять первое место в лидерской доске» звучит как «манипулировать бенчмарком». Здесь все наоборот: это усиление, общая техника ансамблирования, и DRB II — это просто место, где мы это демонстрируем. Метод требует только нескольких разнообразных попыток выполнения задачи, которые так же легко могут быть вашими собственными.
Понимание задачи перед созданием чего-либо
Прежде чем писать какой-либо код, мы потратили свои первые усилия на анализ того, что на самом деле требуется для хорошей работы.
DRB II оценивает исследовательский отчет по трем измерениям, каждое из которых оценивается как показатель прохождения по детальным рубрикам:
Каждая рубрика оценивает те же измерения, поэтому сочетание рубрик показывает, какое качество в основном отражает оценка (это относится к любой метрике, построенной из многих равновесных проверок, а не только к этой). В данном случае важнее всего была информационная память.
К счастью, отчеты, которые нам были нужны, уже были публичными. Агенты с местами 7–13 опубликовали свои полные результаты на Hugging Face. Мы скачали их, переimplemented реализовали метрики и подтвердили на лидерской доске, что воспроизвели точные оценки каждого агента. Мы начали не с пустого листа, а с семи полных отчетов на задачу, ни один из которых не набрал выше 45 баллов в целом, а лучший из них отставал от предыдущего лидера на 16 пунктов (61).
Эксперименты с оракулом: сколько уже есть?
Затем мы провели эксперименты с оракулом: идеализированные процедуры с доступом к истинным данным, которые измеряют, сколько релевантной информации содержится в этих семи слабых отчетах в совокупности, прежде чем тратить какие-либо вычислительные ресурсы. Мы попробовали два варианта. Оракул-выборщик выбирает для каждой задачи один лучший из семи отчетов. Оракул-сливатель объединяет несколько отчетов в один.
Рисунок 3: Вместо выбора одного лучшего отчета (0,56) Оракул-сливатель объединяет лучшие рубричные вклады из нескольких отчетов, достигая оценки 0,70.
Результаты поразительно ясны: выбор одного победителя на задачу означает, что вы все равно не достигнете текущего SOTA.
Но слияние легко преодолевает SOTA, демонстрируя, что семь отчетов в совокупности содержат гораздо больше, чем любой один из них. И это не просто более длинный список фактов: поскольку разные отчеты охватывают разные области, их слияние увеличивает информационную память, поддерживает более глубокий анализ и даже читается более чисто.
Мы также обнаружили, что эти достижения плавно масштабируются: слияние только лучших 4 отчетов уже преодолевает SOTA лидерской доски, и качество продолжает расти по мере добавления большего количества, создавая регулятор между стоимостью и качеством.
Одна тонкость делает слияние еще более мощным. Информационная память ограничена (нельзя превысить факты, которые существуют во всех входных данных), но анализ нет: объединение отчетов, каждый из которых видел часть картины, может выявить кросс-источниковое понимание, которого не было ни в одном из оригиналов, и даже там, где факты пересекаются, разные отчеты по-разному рассуждали о них, поэтому объединение их перспектив может само по себе улучшить анализ. Информация была там все время, просто была разбросана; именно акт ее объединения повысил оценку.
Рисунок 4: Качество оракул-слияния растет с количеством объединяемых кандидатов (k). Объединение только лучших 4 из 7 отчетов (0,646) уже преодолевает SOTA лидерской доски 0,61, при этом отдача снижается по мере приближения к полному оракул- ceiling 0,70.
Метод: агломеративное парное слияние
Оракул показал, что потенциал был реальным; вопрос заключался в том, как его реализовать без доступа к истинным данным. Наш ответ — агломеративное слияние: вместо того, чтобы выбирать или переписывать, мы неоднократно сливаем пары отчетов в один, пока не останется один отчет, наследующий факты всех из них. Мы работаем попарно, потому что слияние меньшего количества за раз сохраняет больше фактов, как мы увидим.
Метод имеет два этапа: генерировать кандидатские отчеты, затем слить их. Большинство попыток сосредоточены на оптимизации первого этапа — генерации новых и улучшенных отчетов; Но для второго этапа подойдут любые агенты, производящие разнообразные, разумные попытки, поэтому мы могли получить их из публичных результатов.
Для каждой задачи мы берем семь отчетов и проводим агломеративное слияние, неоднократно объединяя кандидатов в один, пока не останется один отчет. Каждое слияние выполняется Gemini 3.1 Pro с намеренно простым запросом: сохранить каждый факт из обоих входных данных и согласовать конфликты. Результат — 132 объединенных отчета, по одному на задачу.
Вот почему агрегация побеждает усиление одного агента. Один агент сразу же принимает решение о декомпозиции, и все последующие этапы наследуют ее: пропустите нить — и вы пропустите ее везде. Объединение результатов работы нескольких независимых агентов резко повышает вероятность того, что какая-то часть ответа была охвачена одним из них. Ни один агент не достаточно хорош, но вместе они покрывают пространство.
Основной рычаг — это сколько кандидатов мы объединяем на каждом шаге, чистый регулятор скорости и качества. Например, два за раз дают лучший результат информационной памяти (с только двумя отчетами в контексте модель почти ничего не упускает), но это медленный способ, требующий шести шагов, чтобы достичь одного отчета. Вы можете сократить количество шагов, добавив больше кандидатов (три кандидата — четыре шага; все семь сразу — один шаг), но точность страдает, поскольку отчеты заполняют контекст. Большие шаги повышают презентацию, но снижают информационную память и общий балл, а презентация имеет слишком малый вес, чтобы компенсировать это.
Поскольку Information Recall сохраняет оценку и задача не чувствительна к задержке, мы реализовали парное объединение, но настройки доступны: развертывание, чувствительное к задержке, может делать более крупные шаги и уступать всего пару очков за значительно меньше последовательных объединений.
Рисунок 5: Большее количество кандидатов на каждом шаге объединения означает меньше шагов, но более низкую точность: Information Recall и TotalScore падают, а Presentation растет. Мы реализовали парное объединение (по два на шаг). Оценки здесь получены из абляции шага объединения; окончательный опубликованный результат составляет 64.38.
(Один рычаг, который мы ещё не использовали, но который представляет собой перспективное направление: порядок объединения, использующий простую функцию сходства. Объединение самых разных отчётов сначала может минимизировать перекрытие на каждом шаге.)
Результаты
Наша конвейерная система набрала 64.38: №1 в DRB II, +3.2 по сравнению с предыдущим SOTA – построено на агентах, занявших места с 7 по 13, объединяя отчёты, которые по отдельности набрали очки в диапазоне от 38 до 45.
Что дальше
Создание надёжного агента становится всё дешевле. С такими инструментами, как Claude Code или Cursor, настройка исследовательского агента, который генерирует разумный отчёт, почти как товар, и количество таких агентов только растёт. Боттлнек больше не «можно ли создать одного хорошего агента», а «что можно получить из множества уже имеющихся?»
Ответ: гораздо больше, чем любой из них в одиночку. Когда успех означает охват фактов, а факты распределены по независимым попыткам, мы показываем, что объединение агентов превосходит усиление одного агента – даже без собственной модели границы. Количество попыток, которые вы объединяете, – это регулятор: мы достигли первого результата, начиная с самых дешевых, старейших отчётов на доске, так что начиная с более сильных агентов, пара может быть достаточной.










