Мы заключаем партнерство с Accenture для проведения независимой оценки передового ИИ. Это важный шаг к выполнению обязательства, взятого в статье нашего генерального директора «Мы должны регулировать темпы развития передовых технологий» (We Must Pace the Frontier), по внедрению оценщиков внутрь Anthropic.
Партнерство будет возглавлять Faculty — специализированное подразделение Accenture по искусственному интеллекту, и оно будет включать в себя оценку и тестирование моделей на уязвимости (red-тестирование), проведение проверок на выравнивание и тестирование защитных механизмов моделей. Accenture помогает компаниям и государствам внедрять ИИ в самых разных отраслях. Их понимание того, как предприятия используют ИИ на практике, формирует их подход к безопасности, и они привнесут эту перспективу в оценку наших моделей.
Anthropic и Accenture рассчитывают инвестировать не менее чем по $1 миллиарду в развитие потенциала в этой области в течение следующих пяти лет.
Встроенная оценка — это новое явление, и многие детали ее работы еще прорабатываются. В отличие от современных внешних оценщиков, встроенные оценщики будут работать внутри ИИ-компаний, имея уровень доступа, сопоставимый с доступом сотрудника. Такой доступ позволяет им наблюдать за формированием моделей в процессе обучения, следить за решениями, которые определяют порядок создания и развертывания этих моделей, и напрямую общаться с сотрудниками. С этой позиции встроенные оценщики могут оценивать работу компании, проверять выполнение ею обязательств по безопасности и выявлять «слепые зоны». Они также могут сообщать об инцидентах и предоставлять общественности более обоснованную информацию о преимуществах и рисках.
Следует внести ясность: независимые встроенные оценщики не снимают с нас ответственности, но делают ее более проверяемой. Безопасность наших моделей остается нашей задачей.
На данный момент не существует стандартов в отношении того, к какой информации встроенные оценщики должны иметь доступ и как они должны сообщать о своих находках. Также нет устоявшейся системы финансирования независимой оценки. В долгосрочной перспективе мы считаем, что финансирование должно поступать из объединенных или государственных источников, как мы и призывали в нашем «Фреймворке передового ИИ» в июне. Поскольку в настоящее время ни того, ни другого не существует, мы планируем работать с разными оценщиками в рамках различных схем финансирования.
Учитывая важность и срочность этой работы, Anthropic будет финансировать работу Accenture напрямую. Мы также ведем диалог с METR и другими некоммерческими организациями, занимающимися оценкой, чтобы запустить пилотные проекты по внедрению элементов встроенной оценки за счет их собственного финансирования. В конечном счете мы верим, что сфере передового ИИ необходима экосистема оценщиков, работающих по общим стандартам.
Мы ожидаем, что передовые лаборатории будут работать с несколькими организациями одновременно. Наше партнерство не является эксклюзивным; Anthropic будет сотрудничать с другими оценщиками, о которых будет объявлено в ближайшие недели, а Accenture будет работать с другими разработчиками ИИ в аналогичных качествах.
Мы продолжим обучать и выпускать передовые модели, и мы хотим, чтобы независимые оценщики работали рядом с нами по мере этого процесса. Мы рассказываем об этих первых шагах сейчас, чтобы люди и другие разработчики ИИ могли видеть наш рабочий процесс. Мы ожидаем, что наш подход будет развиваться по мере взросления этой области, и мы поделимся дополнительной информацией, когда начнется наша работа и мы привлечем новых оценщиков.
Связанные материалы
Claude обнаруживает новую ферментативную систему с CRISPR-подобными повторами
Мы объявляем о создании новой исследовательской группы и лаборатории по наукам о жизни в Anthropic. В этой публикации представлена команда, стоящая за этой работой, и первые результаты, в ходе которых Claude обнаружил новую ферментативную систему со свойствами, напоминающими CRISPR, получив лишь общие указания от наших ученых.
Читать далее
Представляем Программу верификации наук о жизни (LSVP)
Программа верификации наук о жизни (LSVP) предоставляет специалистам в области наук о жизни доступ к моделям Claude Mythos, Opus и Sonnet с доработанным набором защитных механизмов, которые более лояльны к задачам, связанным с биологией.
Читать далее
Разработка корпоративных средств защиты передовых систем вместе с нашими клиентами
Читать далее
