Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Kak velikobritaniya aisi i evaleval delayut rezultaty benchmarkov vosproizvodimy
Dev48

© 2026 · All rights reserved.

Как Великобритания AISI и EvalEval делают результаты бенчмарков воспроизводимыми

Источник: Hugging Face

Как Великобритания AISI и EvalEval делают результаты бенчмарков воспроизводимыми

Источник: Hugging Face

Мы стремимся развивать и демократизировать искусственный интеллект с помощью открытого исходного кода и открытой науки.

25 сентября 2026 г.

Коалиция EvalEval рада сообщить, что Институт безопасности ИИ Великобритании (AISI) использует инфраструктуру EvalEval для открытого обмена результатами оценивания, что способствует развитию более воспроизводимой и верифицируемой науки об оценке.

Ранее AISI и EvalEval сотрудничали в рамках исследований, начатых на совместном семинаре на конференции NeurIPS 2025, а отзывы института помогли сформировать схему Every Eval Ever (EEE). Этот следующий этап сотрудничества претворяет общую инфраструктуру в жизнь.

Почему важна воспроизводимость отчетности об оценке

По мере ускорения внедрения ИИ оценки становятся все более важными источниками данных о производительности моделей и систем. Тем не менее, результаты публикуются в самых разных форматах, на различных платформах и ресурсах, зачастую без достаточной информации для их воспроизведения. Повторный запуск оценок сам по себе может оказаться непомерно дорогим.

Миссия EvalEval заключается в улучшении этой экосистемы с помощью общей схемы отчетности Every Eval Ever и открытой платформы Evaluation Cards, которая объединяет результаты оценки и информацию, необходимую для их интерпретации, в единую структуру.

Это естественным образом продолжает работу AISI по повышению эффективности оценки с помощью OptStop, ее статистической строгости с помощью HiBayES, а также стандартизации в таких областях, как анализ стенограмм и выявление возможностей. Совместно AISI и EvalEval работают над выявлением пробелов в отчетности по оценке и созданием общей инфраструктуры для их устранения.

Чем делится AISI

Прозрачность на уровне стенограмм важна не только для воспроизводимости, но и для анализа и диагностики. На этом новом этапе сотрудничества AISI делает публично доступными методы и результаты оценки через Evaluation Cards там, где это уместно. Релиз включает проверенные результаты, контекст и конфигурационную информацию для пяти бенчмарков из основного эксперимента статьи:

  • HealthBench
  • FrontierMath
  • Humanity's Last Exam
  • SWE-Bench Pro
  • Terminal-Bench 2.0

Эти результаты охватывают шесть передовых моделей: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 и GPT-5.4. Релиз также включает результаты двух связанных кибероценок — Cyber CTFs и The Last Ones, в которых используется другой, частично пересекающийся набор моделей. Данные сопровождаются статьей AISI «Как вычислительные мощности на этапе инференса формируют оценку передовых LLM» (How Inference Compute Shapes Frontier LLM Evaluation), в которой исследуется зависимость производительности бенчмарков от вычислительных затрат на этапе инференса и протокола оценки.

Производительность в бенчмарке Humanity's Last Exam меняется в зависимости от протокола оценки и вычислительных мощностей инференса. Каждая кривая показывает кумулятивную долю попытавшихся решить задач, решенных в рамках заданного количества токенов, с использованием первого зафиксированного успеха по каждой задаче. Когда модели получали обратную связь о правильности от оракула после каждой попытки, они продолжали решать дополнительные задачи по мере увеличения использования токенов.

Когда результаты публикуются в открытом доступе вместе с информацией о настройке, исследователи и практикующие специалисты могут более детально изучить отдельные исследования и сравнить выводы в масштабах всей экосистемы. Там, где в других отчетах отсутствуют эти детали, такие релизы, как у AISI, предоставляют проверенные ориентиры для интерпретации оценок в контексте — например, помогая исследователям понять, как выбор настроек может повлиять на заявленную производительность. По мере того как все больше специалистов по оценке внедряют EEE, подобные открытые сравнения могут способствовать проведению более масштабных и надежных мета-исследований.

Результаты AISI по бенчмарку Terminal-Bench 2.0 наряду с другими опубликованными оценками для тех же моделей при различных настройках оценки.

Мы рады этому внедрению и с нетерпением ждем дальнейшей стандартизации и обмена оценками с AISI и другими организациями по оценке ИИ.

Внесите свой вклад в общую миссию

  • Разработчики моделей: сообщайте проверенные результаты оценки.
  • Разработчики тестов: сообщайте о бенчмарках и запускайте данные по схеме Every Eval Ever.
  • Исследователи в области оценки, управления и политики: изучите Evaluation cards по бенчмаркам или моделям, или используйте ее для анализа состояния отчетности по оценке в целом.

Об EvalEval Coalition

EvalEval Coalition — это исследовательское сообщество, разрабатывающее научно обоснованные исследования и надежную инфраструктуру развертывания для экосистемы оценки. Его цель — улучшить науку об оценке, устранить отсутствие консенсуса вокруг документирования применимости и полезности оценки, а также расширить охват воздействий, имеющих значение для научных исследований и анализа политики.

Ключевыми проектами коалиции являются Every Eval Ever, общая схема и репозиторий для результатов оценки, а также Evaluation Cards, которая объединяет метаданные бенчмарков, данные запусков оценки и метаданные моделей в интерпритируемые записи. Вместе они упрощают понимание того, когда внешне похожие оценки были получены в существенно отличающихся условиях.

Об Институте безопасности ИИ Великобритании (UK AISI)

Институт безопасности ИИ Великобритании — это исследовательская организация в составе Департамента науки, инноваций и технологий правительства Великобритании. Его миссия — предоставить правительствам научное понимание рисков, создаваемых передовым ИИ. AISI проводит исследования и создает инфраструктуру для понимания возможностей и влияния передового ИИ, разработки и тестирования средств защиты, а также информирования политики.

Дополнительное чтение

  • How Inference Compute Shapes Frontier LLM Evaluation
  • HiBayES: улучшение оценки LLM с помощью иерархического байесовского моделирования
  • Документ HiBayES
  • Документ OptStop
  • Every Eval Ever
  • Evaluation Cards
← Все статьи