Коалиция EvalEval рада сообщить, что Институт безопасности ИИ Великобритании (AISI) использует инфраструктуру EvalEval для открытого обмена результатами оценивания, что способствует развитию более воспроизводимой и верифицируемой науки об оценке.
Ранее AISI и EvalEval сотрудничали в рамках исследований, начатых на совместном семинаре на конференции NeurIPS 2025, а отзывы института помогли сформировать схему Every Eval Ever (EEE). Этот следующий этап сотрудничества претворяет общую инфраструктуру в жизнь.
Почему важна воспроизводимость отчетности об оценке
По мере ускорения внедрения ИИ оценки становятся все более важными источниками данных о производительности моделей и систем. Тем не менее, результаты публикуются в самых разных форматах, на различных платформах и ресурсах, зачастую без достаточной информации для их воспроизведения. Повторный запуск оценок сам по себе может оказаться непомерно дорогим.
Миссия EvalEval заключается в улучшении этой экосистемы с помощью общей схемы отчетности Every Eval Ever и открытой платформы Evaluation Cards, которая объединяет результаты оценки и информацию, необходимую для их интерпретации, в единую структуру.
Это естественным образом продолжает работу AISI по повышению эффективности оценки с помощью OptStop, ее статистической строгости с помощью HiBayES, а также стандартизации в таких областях, как анализ стенограмм и выявление возможностей. Совместно AISI и EvalEval работают над выявлением пробелов в отчетности по оценке и созданием общей инфраструктуры для их устранения.
Чем делится AISI
Прозрачность на уровне стенограмм важна не только для воспроизводимости, но и для анализа и диагностики. На этом новом этапе сотрудничества AISI делает публично доступными методы и результаты оценки через Evaluation Cards там, где это уместно. Релиз включает проверенные результаты, контекст и конфигурационную информацию для пяти бенчмарков из основного эксперимента статьи:
- HealthBench
- FrontierMath
- Humanity's Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0
Эти результаты охватывают шесть передовых моделей: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 и GPT-5.4. Релиз также включает результаты двух связанных кибероценок — Cyber CTFs и The Last Ones, в которых используется другой, частично пересекающийся набор моделей. Данные сопровождаются статьей AISI «Как вычислительные мощности на этапе инференса формируют оценку передовых LLM» (How Inference Compute Shapes Frontier LLM Evaluation), в которой исследуется зависимость производительности бенчмарков от вычислительных затрат на этапе инференса и протокола оценки.
Производительность в бенчмарке Humanity's Last Exam меняется в зависимости от протокола оценки и вычислительных мощностей инференса. Каждая кривая показывает кумулятивную долю попытавшихся решить задач, решенных в рамках заданного количества токенов, с использованием первого зафиксированного успеха по каждой задаче. Когда модели получали обратную связь о правильности от оракула после каждой попытки, они продолжали решать дополнительные задачи по мере увеличения использования токенов.
Когда результаты публикуются в открытом доступе вместе с информацией о настройке, исследователи и практикующие специалисты могут более детально изучить отдельные исследования и сравнить выводы в масштабах всей экосистемы. Там, где в других отчетах отсутствуют эти детали, такие релизы, как у AISI, предоставляют проверенные ориентиры для интерпретации оценок в контексте — например, помогая исследователям понять, как выбор настроек может повлиять на заявленную производительность. По мере того как все больше специалистов по оценке внедряют EEE, подобные открытые сравнения могут способствовать проведению более масштабных и надежных мета-исследований.
Результаты AISI по бенчмарку Terminal-Bench 2.0 наряду с другими опубликованными оценками для тех же моделей при различных настройках оценки.
Мы рады этому внедрению и с нетерпением ждем дальнейшей стандартизации и обмена оценками с AISI и другими организациями по оценке ИИ.
Внесите свой вклад в общую миссию
- Разработчики моделей: сообщайте проверенные результаты оценки.
- Разработчики тестов: сообщайте о бенчмарках и запускайте данные по схеме Every Eval Ever.
- Исследователи в области оценки, управления и политики: изучите Evaluation cards по бенчмаркам или моделям, или используйте ее для анализа состояния отчетности по оценке в целом.
Об EvalEval Coalition
EvalEval Coalition — это исследовательское сообщество, разрабатывающее научно обоснованные исследования и надежную инфраструктуру развертывания для экосистемы оценки. Его цель — улучшить науку об оценке, устранить отсутствие консенсуса вокруг документирования применимости и полезности оценки, а также расширить охват воздействий, имеющих значение для научных исследований и анализа политики.
Ключевыми проектами коалиции являются Every Eval Ever, общая схема и репозиторий для результатов оценки, а также Evaluation Cards, которая объединяет метаданные бенчмарков, данные запусков оценки и метаданные моделей в интерпритируемые записи. Вместе они упрощают понимание того, когда внешне похожие оценки были получены в существенно отличающихся условиях.
Об Институте безопасности ИИ Великобритании (UK AISI)
Институт безопасности ИИ Великобритании — это исследовательская организация в составе Департамента науки, инноваций и технологий правительства Великобритании. Его миссия — предоставить правительствам научное понимание рисков, создаваемых передовым ИИ. AISI проводит исследования и создает инфраструктуру для понимания возможностей и влияния передового ИИ, разработки и тестирования средств защиты, а также информирования политики.
Дополнительное чтение
- How Inference Compute Shapes Frontier LLM Evaluation
- HiBayES: улучшение оценки LLM с помощью иерархического байесовского моделирования
- Документ HiBayES
- Документ OptStop
- Every Eval Ever
- Evaluation Cards