Создание доверия на переднем крае

Источник: Scale AI

Создание доверия на переднем крае

Источник: Scale AI

Создание доверия на переднем крае: надежная экосистема тестирования и оценки ИИ

•Обновлено: 6 октября 2026 г.

Недавно генеральный директор Scale Фрэнсис де Соуза призвал Вашингтон «взять под контроль передовой рубеж» путем укрепления федерального потенциала в области тестирования и оценки (T&E) систем искусственного интеллекта.

Создание этой экосистемы потребует четкого мандата, возложенного на правительственных чиновников, способных добиваться реальных изменений; приверженности государства инвестициям в предварительную оценку высокопроизводительных моделей ИИ до их развертывания; а также выделения ресурсов, подкрепленных достаточным федеральным финансированием.

Это также потребует от Вашингтона понимания того, что хотя исследования и разработки (НИОКР) в области тестирования собственных моделей ИИ передовыми лабораториями незаменимы, это не может быть единственным способом, с помощью которого правительство США оценивает возможности этой преобразующей и стремительно развивающейся технологии.

Тестирование и оценка не являются универсальными и не могут сводиться к измерению в определенный момент времени. Надежная экосистема T&E для моделей ИИ состоит из серии многоуровневых оценок и стратегий снижения рисков на различных этапах жизненного цикла T&E. Смешение этих различных фаз грозит непониманием уникальной ценности каждого этапа и того, почему каждый из них критически важен для оценки и снижения рисков, связанных с моделью.

С этой точки зрения, тестирование в рамках НИОКР в передовых лабораториях — это лишь первый этап жизненного цикла, который объединяет заинтересованные стороны с различными обязанностями для понимания того, как модель ИИ ведет себя в новых условиях с течением времени:

Тестирование в рамках НИОКР: Передовые лаборатории начинают процесс понимания нового поведения и возможностей моделей.

Тестирование моделей до их выпуска: Правительство США опирается на эту работу, тестируя модели на этапе после обучения, но до их выпуска, чтобы понять, как они могут повлиять на национальную безопасность, и убедиться, что регулирующие органы не принимают заявления лабораторий на веру в отношении столь мощной технологии.

Тестирование систем до развертывания: Следующей эстафету перенимает развертывающая сторона — организация, внедряющая модель в свои собственные продукты или операции. Независимо от сложности модели, необходимо протестировать поведение всей системы ИИ, чтобы оценить ее работу в различных сценариях использования.

Тестирование после развертывания: Наконец, все заинтересованные организации, включая индустрию и государство, несут ответственность за продолжение тестирования моделей и систем в рабочей среде. Однократного теста недостаточно для понимания поведения с течением времени.

В конечном счете, каждая фаза тестирования отвечает на разные части одного и того же набора вопросов: работает ли модель так, как ожидается, обладает ли она такими возможностями, как мы считаем, и является ли она столь надежной, как мы думаем?

Таким образом, Вашингтон должен целенаправленно инвестировать в создание собственного потенциала для понимания возможностей и потенциальных уязвимостей новых мощных моделей. И единственный способ сделать это — сформировать экосистему, которая обеспечивает непрерывную оценку на протяжении всего жизненного цикла модели: от НИОКР и предварительного тестирования до развертывания и последующих этапов.

Четырехэтапный жизненный цикл T&E

Тестирование и оценка происходят на различных этапах жизненного цикла модели, каждый из которых проводится разными участниками и предназначен для измерения разных параметров. Представленная ниже таблица дает обзор текущей ситуации в сфере T&E, объясняя, кто является основными участниками на каждом этапе жизненного цикла, что именно тестируется, когда проводится тестирование, какие возможности или специальный доступ требуются, какой уровень государственного надзора необходим и какова роль индустрии.

Первый этап T&E (тестирование в рамках НИОКР) проводится самими передовыми лабораториями внутри компаний. Он регулируется добровольными рамками частных компаний (см. «Дорожную карту безопасности передовых разработок» компании Anthropic или «Масштабируемую структуру передового ИИ» компании Meta). Во время T&E в рамках НИОКР лаборатории прогоняют свои модели через множество тестов, чтобы посмотреть, как они себя поведут и на что способны. Это помогает лабораториям сформировать основанное на фактах понимание своих моделей: где они преуспевают, где могут дать сбой и нужны ли защитные механизмы. На этом этапе работала OpenAI, когда ее модели взломали Hugging Face, и — совсем недавно — когда компания публично пообещала приостановить обучение и тестирование определенных моделей.

Недавнее «Соглашение Белого дома по суперинтеллекту» почти полностью сосредоточено на этом этапе жизненного цикла T&E, призывая компании внедрять внутренний контроль, создавать внутренние группы для мониторинга систем компании, сотрудничать с внешними экспертами для проведения независимых оценок и учреждать комитет в составе совета директоров каждой компании для надзора за мерами по минимизации рисков.

Тестирование и оценка в рамках НИОКР — это незаменимая часть процесса тестирования и оценки. Основываясь на своих выводах, лаборатории могут устанавливать защитные барьеры, призванные предотвратить нежелательное, в том числе опасное или незаконное, поведение моделей. Но хотя тестирование в рамках НИОКР необходимо, его недостаточно для обеспечения безопасности и согласованности ИИ.

Второй этап T&E (тестирование моделей до их выпуска) должен происходить после того, как лаборатории завершили внутренние оценки, но до того, как модели будут выпущены для широкой публики.

На этом этапе T&E проверяется, насколько хорошо работают защитные механизмы лабораторий, какие средства защиты могут быть «взломаны» (jailbreak) и как обрабатываются граничные случаи. Хотя лаборатории протестировали безопасность собственных моделей и поручились за нее, они, в определенном смысле, «сами проверяют свои домашние задания». Именно поэтому Scale поддерживает укрепление независимого потенциала правительства по тестированию и оценке передовых моделей ИИ.

В настоящее время в США нет федерального закона, который запрещал бы выпуск передовых моделей ИИ для широкой публики без предварительного рассмотрения или тестирования со стороны правительства. В июне добровольная структура оценки администрации Трампа — Executive Order 14409 — была призвана восполнить этот пробел, призывая лаборатории сотрудничать с правительством для обеспечения тестирования высокопроизводительных моделей кибербезопасности. Примечательно, что все основные американские передовые лаборатории подписали соглашения с правительством США, разрешающие тестирование их моделей в более общем плане; большинство этих соглашений были заключены еще до июньского исполнительного указа.

Предварительное тестирование моделей имеет решающее значение для того, чтобы правительство понимало, какие возможности вскоре окажутся в руках людей по всему миру, и особенно каковы возможные последствия для национальной безопасности. Проблема заключается в том, что в настоящее время у государства редко имеются необходимые возможности и квалификация для проведения строгого и глубокого тестирования. Создание надежной экосистемы T&E потребует тесного сотрудничества правительства с независимыми экспертами и организациями для разработки эффективных рамок оценки и пороговых значений для проверки.

Третий этап ТИ (тестирования систем перед развертыванием) происходит на уровне системы ИИ. Именно здесь компании или правительства, интегрирующие ИИ в процессы принятия решений, рабочие процессы агентов, ориентированные на клиентов сервисы или пользовательские приложения, оценивают его производительность, сбои и риски, которые могут возникнуть при применении в конкретных сценариях использования. В частности, в регулируемых отраслях существуют требования к соблюдению нормативных требований, которые могут быть направлены конкретно на приложения ИИ или применяться в целом, например, правила Комиссии по ценным бумагам и биржам для индустрии финансовых услуг. Организации могут отчитываться самостоятельно или быть обязаны работать с внешними аудиторами для оценки соответствия требованиям.

Поскольку ИИ все больше переходит от пилотных программ к масштабным реальным условиям, этот этап тестирования будет приобретать все большее значение. Независимо от того, насколько «хорошей» или «безопасной» модель кажется на двух предыдущих этапах, то, как она ведет себя при интеграции в реальные системы с реальными последствиями — с инструментами и коннекторами, памятью, разрешениями на файлы и возможностью вызывать другие модели, — это отдельный вопрос.

Наконец, четвертый этап ТИ (тестирование после развертывания) представляет собой непрерывный процесс. Оценки модели или сценария использования в определенный момент времени недостаточно, поскольку она не дает ответа на вопрос, как эта система поведет себя через шесть месяцев или год после развертывания. Поведение может «отклоняться» от исходного стандарта согласуемости. Пользователи могут вводить такие данные, о которых тестировщики не подумали. Злоумышленник, которому не удается совершить джейлбрейк системы с одной попытки, может преуспеть, постепенно эскалируя атаку в ходе продолжительного разговора — метод, называемый многошаговым (multi-turn) джейлбрейком. Лаборатории, независимые сторонние тестировщики, правительства и предприятия с развернутым ИИ — все они должны сыграть свою роль в обнаружении реальных сбоев, понимании рисков и минимизации отклонений.

Заключение

Правильно организованная, надежная и эффективная экосистема тестирования и оценки полностью совместима с процветающей средой технологических инноваций. Фактически, чем яснее и последовательнее ожидания правительства в отношении индустрии ИИ, тем увереннее индустрия может инвестировать в разработку и создание передовых моделей и внедрять их в реальные рабочие процессы.

На фоне всего шума последних нескольких месяцев — страхов по поводу выхода агентов из песочниц и призрачного потенциала самосовершенствующегося ИИ — понимание моделей и систем на всех этапах их жизненного цикла как никогда важно. Вашингтон не может защититься от того, чего не понимает. В конечном счете, не существует универсального подхода к тестированию и оценке возможностей искусственного интеллекта. Мы должны осознать это как страна, спланировать соответствующие ресурсы и сделать все правильно.

О чём эта статья

Что-то непонятно? Спросите по статье — объясню простыми словами.

Не хотите разбираться сами? Мы поможем.