30 июля мы сообщили о трех инцидентах, в ходе которых модели Claude получили несанкционированный доступ к реальным компьютерным системам. Модели, намеренно запущенные без киберзащиты в целях оценки, получили доступ к интернету из-за неправильной конфигурации во внешней среде оценки. Отдельно 4 августа Институт безопасности ИИ Великобритании сообщил об инциденте в ходе собственного тестирования кибербезопасности, в ходе которого Claude Mythos 5 предприняла ряд несанкционированных действий в реальном интернете. В том случае модели, также намеренно запущенной без киберзащиты в целях оценки, был намеренно предоставлен доступ в интернет.
Мы проводим углубленный анализ обоих инцидентов. Мы также планируем сотрудничать с METR для проведения независимой проверки. Мы хотим убедиться, что оба исследования будут проведены тщательно, и поделимся подробностями в ближайшие недели.
Тем временем мы делимся некоторыми изменениями, которые мы внесли за последний месяц. Мы считаем, что эти инциденты отражают сбой в операционной безопасности, а также две проблемы выравнивания: мотивированное рассуждение и готовность предпринимать вредоносные действия ради выполнения узкой задачи (о обеих проблемах мы рассказывали в предыдущих системных картах). В отношении безопасности мы описываем улучшения, внесенные в наши системы локализации и мониторинга, а также практики, которые мы разработали для сторонних оценщиков. В отношении выравнивания мы более подробно обсуждаем эти две проблемы; мы также считаем, что долгосрочный прогресс достигается не только благодаря пониманию того, что произошло в конкретном инциденте, но и пониманию того, как изначально возникает несоответствие выравнивания, и делимся ранними исследованиями в этом направлении.
В свете этих инцидентов усилились дискуссии о темпах развития передовых технологий. Полезно различать два вида регулирования темпов. Внутри компании регулирование темпов означает череду решений, которые ставят безопасность выше скорости, когда между ними возникает противоречие. В масштабах всей отрасли это означает создание процессов для предотвращения гонки на выживание. В этой статье мы обсуждаем действия, которые мы предприняли как до, так и после этих инцидентов в рамках первого подхода. Второй тип регулирования темпов требует координации между правительством и индустрией и должен быть понятным и проверяемым. Некоторые из наших руководителей и многие сотрудники недавно подписали письмо с призывом к более тесной координации темпов, и в ближайшие недели мы расскажем подробнее о том, как мы намерены внести свой вклад в эту работу. Чтобы наша позиция была ясна: мы считаем, что мир выиграет, если индустрия как можно скорее примет законный, проверяемый и эффективный механизм скоординированного регулирования темпов.
Обеспечение безопасности сред оценки и обучения
Хотя мы не считаем эти инциденты исключительно вопросами операционной безопасности, нашим главным приоритетом было устранение конкретных проблем локализации и мониторинга. В ответ мы предприняли следующие действия:
Приостановка работы и усиление сред оценки
После инцидентов мы приостановили внешние кибероценки моделей до их официального выпуска, а также ненадолго приостановили внутренние оценки, пока внедряли описанные ниже меры. Инциденты, о которых мы сообщили 30 июля, показали, что мы в значительной степени полагались на единственный уровень защиты (саму конфигурацию среды), в то время как нам требовалось несколько уровней, включая установление явных границ в подсказках, создание процессов проверки герметичности песочницы там, где это необходимо, и внедрение мониторинга, способного вмешиваться в режиме реального времени. Раскрытие информации компанией OpenAI (которое спровоцировало наше расследование в июле) о том, что модели использовали неизвестную уязвимость для побега из изолированной песочницы во время оценки, также дало понять, что нам следует сосредоточиться на укреплении самой песочницы.
Пока оценки были приостановлены, мы внедрили следующие предварительные меры:
1) Мы создали и развернули классификатор для автоматического определения в режиме реального времени моментов, когда модель пытается агрессивно зондировать или покинуть тестовую среду либо неожиданно получает доступ в интернет. Когда классификатор фиксирует такую попытку, он блокирует действие до запуска вызова инструмента, завершает задачу и оповещает человека.1
2) Мы запустить автоматизированный мониторинг расшифровок наших недавних внутренних оценок дорелизных моделей (в области кибербезопасности и других), выискивая попытки побега из песочниц (случаи, когда модель использует уязвимость в нашей песочнице для доступа к системам, от которых она должна быть изолирована) или ошибки конфигурации песочниц. В тех случаях, когда мы проводили оценку внутри инструментов песочницы, мы не обнаружили примеров преодоления границ песочницы для доступа к внешним ресурсам, к которым у нее не должно быть доступа. Мы обнаружили различные ошибки конфигурации песочниц, которые модели использовали, но ни одна из них не привела к компрометации систем за пределами песочницы.2 Мы активно работаем над устранением этих проблем.
3) Мы перенесли внутренние киберпесочницы высокого риска3 на более надежную изоляцию. Мы также продолжаем проводить краш-тесты нашего стека виртуализации — то есть даем дорелизным моделям задания попытаться покинуть его, — чтобы находить и устранять слабые места.
Наши внутренние кибероценки теперь снова запущены с внедрением этих мер.
Среды обучения с подкреплением
Мы также на несколько недель приостановили работу сред обучения с подкреплением (RL) повышенного риска для дорелизных моделей. За это время мы создали аналогичный классификатор, модифицированный так, чтобы не стимулировать модель уклоняться от этого нового мониторинга, и теперь развернули его в этих средах. Большинство сред обучения с подкреплением возобновили работу, но некоторые среды высокого риска остаются приостановленными до ручной проверки, в то время как для других потребуется обновленная версия классификатора, которую мы планируем развернуть в ближайшее время.
Более широкое усиление защиты
В дополнение к усилиям, сфокусированным на оценках и обучении высокого риска, мы расширили наш автономный мониторинг, охватив им большинство других форм использования внутренних передовых агентов. Мы также создаем средства контроля нашего внутреннего вывода, чтобы сотрудники Anthropic случайно не запустили агентов с более слабыми мерами защиты, чем описанные выше.
Лучшие практики для внешних партнеров
Поскольку зарегистрированные инциденты произошли в сторонних средах, мы попросили каждую организацию, тестирующую дорелизные модели со сниженной киберзащитой, взять на себя обязательство следовать набору лучших практик. Мы считаем их необходимыми, потому что:
- Наши общедоступные модели поставляются со средствами защиты, включая классификаторы, которые работают с входными и выходными данными Claude в режиме реального времени для блокирования запрещенной кибеractивности, такой как разработка вредоносного ПО или написание наступательных эксплойтов. Кибероценщики и часть партнеров с ранним доступом, напротив, работают с моделями, у которых эти средства защиты снижены для обеспечения точного тестирования возможностей моделей и оборонительной кибердеятельности.
- Кибероценки с необычно высокой долей вероятности порождают поведение, наблюдаемое в этих инцидентах. Они создают давление отбора в сторону настойчивости и креативности при исследовании окружающей среды и обходе препятствий, и они запускаются много тысяч раз.
Эти правила в полном объеме применяются везде, где партнеры проводят киберисследования, используя собственные тестовые среды, «песочницы» или агенты. Они не распространяются на клиентов, использующих защищенные модели, такие как Claude Fable 5. Мы возобновили внешние киберисследования с соблюдением этих правил, а также придерживаемся их внутри компании.
Изоляция «песочницы» и сети
По умолчанию все киберисследования должны проводиться внутри защищенной «песочницы» (изолированной вычислительной среды) без доступа к интернету. Единственным внешним соединением, которое должна разрешать среда, является собственный API модели, причем ключи API должны храниться вне среды. Эту конфигурацию необходимо проверять перед началом каждого исследования. Для некоторых исследований может потребоваться доступ в интернет. В таких случаях мы будем работать с внешними исследователями при оценке моделей до их выпуска, чтобы определить, сможем ли мы надежно обнаруживать и прерывать запуски, в ходе которых модель предпринимает действия за пределами заявленной области.
Проверка перед началом работы
Перед проведением исследования партнеры по оценке должны:
- Поручить тестируемой модели проверить «песочницу» на наличие уязвимостей — сначала путем статического анализа конфигурации, а затем непосредственно задав модели задачу попытаться совершить побег. Модели следует дать указание остановиться и сообщить об успехе в случае удачного побега, и все это должно происходить под пристальным наблюдением человека. Такое тестирование следует проводить без доступа в интернет, в идеале во второй «песочнице». Поскольку исследования иногда проводятся в ходе сотен или даже тысяч запусков, партнерам желательно провести такое тщательное тестирование перед началом любых оценок.
- Подтвердить, что любая исследовательская задача действительно решаема в принципе. Когда целевой объект исследования отключен от сети или задачу невозможно выполнить, агенты часто ищут другие способы завершения задачи, что увеличивает вероятность совершения ими действий за пределами предполагаемой области исследования.4
Ясное определение области исследования
В каждой подсказке должно быть указано, что входит и не входит в рамки упражнения, включая цели, разрешенные действия и сетевые границы (т.е. к чему модель должна и не должна иметь доступ). Границы должны быть сформулированы в виде инструкций (например, «Вам запрещен доступ в интернет»), а не утверждений об окружении или тесте («У вас нет доступа в интернет»).
Мониторинг в реальном времени
Исследователи также должны осуществлять непрерывный мониторинг мышления, действий и сетевой активности модели с помощью монитора на базе модели или правил, которому была задана область данного упражнения. Если запуск нарушает эту область, монитор должен сообщить об этом человеку и завершить упражнение.
Мы планируем продолжить доработку этих рекомендаций в ходе консультаций с внешними партнерами и распространить их за пределы оценочных испытаний. В частности, мы разрабатываем сопутствующие правила для партнеров, имеющих доступ к Claude Mythos 5, которая также работает без средств киберзащиты, и скоро поделимся подробностями.
Оценка соответствия (алаймента)
Сдерживание и мониторинг имеют решающее значение для выявления случаев, когда модели совершают опасные действия, но они не объясняют, почему модель вообще пошла на такие действия. Ниже мы обсуждаем наше предварительное расследование вопросов алаймента и ключевые проблемы, на которых мы сосредоточены, а также нашу текущую работу по предотвращению жульничества во время обучения, включая новые исследования о том, как жульничество формирует поведение модели.
Окружение и уровень информированности наших моделей во время оценки
Наша оценка алаймента все еще продолжается, но предварительное расследование указывает на два основных сбоя алаймента, оба из которых мы описывали в предыдущих системных картах. Первый — мотивированное рассуждение: моделям изначально говорили, что их среда является смоделированной, но когда позже они столкнулись с доказательствами того, что подключены к реальному интернету, они могли истолковать эти доказательства таким образом, чтобы сохранить прежнее убеждение. Второй — безрассудство: модель была готова совершать вредоносные действия в реальном интернете ради достижения узкой цели решения задачи по кибербезопасности. Тем не менее, мы также считаем, что сама организация оценки способствовала поведению моделей, продемонстрированному в этих инцидентах. Claude прямо говорили, что у нее нет доступа в интернет, несмотря на то, что он был доступен, что могло заставить ее усомниться в реальности видимых систем. А в одном случае вымышленный объект совпадал по названию с реальным веб-сайтом, что затрудняло отделение того, что задумывалось как допустимое в рамках упражнения.
Наши выводы зависят от ряда вопросов, на которые мы еще не дали окончательного ответа: в какой степени модели определили наличие доступа к реальному интернету (даже если изначально не знали об этом), сознательно ли они игнорировали признаки реального окружения своих сред и являлось ли следствием мотивированного рассуждения то, что в нескольких случаях они не прекратили упражнение. Мы применяем различные методы для ответа на эти вопросы, включая повторную выборку моделей с внесением целенаправленных изменений в окружение, а также использование методов интерпретируемости для непосредственной проверки их внутреннего состояния.
Изучение усилий по предотвращению жульничества во время обучения
Хотя несоответствие моделей сложным образом устроено и может возникать по самым разным причинам, мы эмпирически обнаружили, что дефекты в обучающих средах — в частности, среды, уязвимые к жульничеству или неразрешимые без жульничества — вносят непропорционально большой вклад в несогласованное поведение.
Ниже мы рассказываем о наших усилиях, предпринятых еще за несколько месяцев до инцидентов, по избежанию обучающих сред с подобными дефектами. Эти усилия были несовершенными, и наша гипотеза заключается в том, что инциденты были хотя бы частично связаны с нашей неспособностью полностью устранить такие проблемы. Мы проверили эту гипотезу, намеренно обучив модель в средах, подверженных взлому системы вознаграждений (reward hacking). В симуляциях эта модель воспроизводит более серьезное несогласованное поведение, частично схожее с тем, о котором сообщалось в летних инцидентах других компаний. Наши производственные модели, помещенные в те же симуляции, этого не делают (подробнее далее в этом разделе).
Исторически мы с опаской относились к средам обучения с подкреплением, которые стимулируют жульничество, и предпринимали различные меры для фильтрации или исправления подобных сред.
В феврале мы откатили три дня обучения в процессе прогона обучения с подкреплением для Mythos Preview после того, как заметили признаки «взлома наград» (когда модель находит способы обмануть процесс своего обучения и получать награды без выполнения назначенной задачи). Мы заметили, что модель пишет заметки «рецензенту» в комментариях к коду и ответах, в том числе в задачах, где рецензент никогда не упоминался — нежелательное обобщение из сред, где промпт действительно включал рецензента. Она также продолжала манипулировать наградой, призванной стимулировать честность, добавляя массу оговорок и предупреждений. Откат трех дней позволил нам возобновить обучение с контрольной точки до того, как это поведение было усвоено, и мы внесли изменения в среды, чтобы предотвратить повторное изучение их моделью.
Мы создаем инструменты для мониторинга нежелательных поведений, которым модели учатся при обучении с подкреплением, начиная с Claude Sonnet 3.7 (у которого была склонность к взлому наград, которую мы не обнаружили до поздних этапов обучения). Мы приложили значительные усилия для того, чтобы наши инструменты развивались с каждым поколением моделей: от горстки классификаторов до автоматизированного анализа всех сред до и во время циклов обучения, но к весне 2026 года эта система оказалась под нагрузкой. Мы создавали среды обучения с подкреплением быстрее, чем когда-либо, быстрее, чем наши системы успевали их проверять. Помеченные среды требовали участия человека для вынесения решения, а взломы наград и ошибки конфигурации начали опережать нашу способность фильтровать или исправлять их.
Кроме того, мы обнаружили, что часть прогонов случайно обучилась на цепочке мыслей модели — то, чего мы стараемся избегать из-за опасений, что это научит модель скрывать свои истинные рассуждения. Мы проследили утечку до нескольких неправильных конфигураций в нашем стеке производственной среды. При этом стало очевидно, что существуют и другие проблемы, порожденные беспорядочным кодом, накапливающимся со временем.
Чтобы решить эти проблемы, в апреле мы заморозили все изменения в наших производственных средах обучения с подкреплением примерно на месяц, что дало нам возможность полностью переработать стек. Награды и среды теперь должны соответствовать согласованной спецификации. Например, мы внедрили технические меры защиты, чтобы снизить риск случайного обучения на цепочке мыслей. Пока наши команды по качеству сред и мониторингу перестраивали стек, мы попросили владельцев сред использовать эту паузу для тестирования и исправления созданных ими сред. Мы также полностью перестроили процесс проверки и потребовали, чтобы каждая исправленная среда была повторно сертифицирована перед допуском к следующему циклу обучения.
Во время заморозки мы пометили более 10% сред в нашем производственном пуле из-за проблем, варьирующихся от взлома наград до сломанных задач и неправильной конфигурации, и восстановили их только после исправления.
Тем не менее, наши усилия не были идеальными. В некоторых случаях мы обнаруживали, что рецензенты-люди отклоняли среды, помеченные нашими автоматизированными мониторами как ложноположительные, позволяя дефектным средам оставаться в обучении дольше, чем следовало. А некоторые дефектные среды просто ускользают от наших механизмов обнаружения. В настоящее время мы ужесточаем критерии отклонения меток и ожидаем усиления сотрудничества с владельцами сред для повышения точности наших систем. Помимо мониторинга и обнаружения, наши команды по обучению выравниванию и обучению с подкреплением сотрудничают для улучшения сред.
Мы подозреваем, что наши крупные инвестиции в контроль качества сред обучения с подкреплением, возможно, предотвратили более серьезные инциденты, связанные с выравниванием, и, наоборот, несовершенство этих усилий могло способствовать инцидентам, которые мы выявили на данный момент.
Чтобы посмотреть, как поведет себя модель, обученная без этих средств защиты, мы намеренно обучили модель класса Opus на 80 различных реальных средах обучения с подкреплением, которые либо подверглись взлому наград по крайней мере во время одного реального цикла обучения и были выявлены мониторингом, либо были признаны подверженными взлому во время проверки качества среды. Полученная модель демонстрирует сильную мотивацию к достижению высоких результатов в задачах и готовность совершать потенциально вредные действия в стремлении к успеху в задачах. В нашей сопутствующей записи в блоге Alignment Science этот эксперимент обсуждается более подробно, но здесь мы кратко подводим его итоги.
Мы протестировали намеренно дезадаптированную модель в ходе различных оценок, включая смоделированные сценарии, основанные на аспектах инцидентов кибербезопасности UK AISI с участием Claude и инцидента OpenAI/Hugging Face (мы благодарны OpenAI за публичный обмен деталями об этом). Во время этих оценок, где все вызовы инструментов симулировались другой большой языковой моделью, обученная нами на взлом наград модель продемонстрировала склонность вырываться из своей смоделированной песочницы и атаковать смоделированную внутреннюю и смоделированную стороннюю инфраструктуру. Она также была готова вмешиваться в собственную функцию вознаграждения, давать советы по созданию биооружия для удовлетворения оценщика и неоднократно пытаться обойти мониторинг безопасности развертывания, чтобы сжульничать в задаче.
Затем мы провели те же симуляции кибербезопасности на модели в том виде, в каком она была до обучения со взломом наград, и на нескольких наших общедоступных моделях. Ни одна из них не проявила такого же уровня дезадаптированного поведения. Наш вывод заключается в том, что наличие существенного взлома наград при обучении может привести к тому, что модели будут готовы выполнять длинные последовательности потенциально вредных действий в реальном мире в стремлении к успеху в задачах.
Мы считаем, что значительные инвестиции, сделанные нами этой весной в мониторинг и сокращение взлома наград, являются основной причиной того, что наши производственные модели вряд ли будут заниматься более опасным поиском наград. В нашей сопутствующей записи в блоге Alignment Science мы также нашли доказательства того, что среды обучения выравниванию могут существенно снизить взлом наград и поведение, направленное на поиск наград. Но, как показывают инциденты, о которых мы сообщили 30 июля, наш процесс не идеален, а наши модели выровнены не идеально.
Проясним: мы не считаем, что жульничество в учебных средах является единственной причиной проблем с выравниванием или даже конкретных проблем с выравниванием, присутствующих в наших инцидентах или инцидентах других ведущих компаний в области ИИ. Решение проблемы выравнивания будет включать в себя устранение очень широкого спектра потенциальных проблем, и будущие инциденты выравнивания могут включать в себя иное поведение и иные причины, чем те, которые мы видели до сих пор.
Ужесточение практик безопасности
Внутреннее состояние безопасности Anthropic не было фактором, способствовавшим инцидентам 30 июля. Они произошли в сторонней среде, где доступ в Интернет был по ошибке оставлен открытым; у моделей не было необходимости «взламывать» что-либо, даже если бы у них была к этому склонность.
Тем не менее, эти инциденты подчеркивают критическую важность надежных мер безопасности. В дополнение к обычным рискам кражи интеллектуальной собственности или весов моделей, теперь мы должны противостоять рискам того, что наши собственные модели совершат побег из систем Anthropic путем взлома, а также тому, что наши или чужие модели могут быть использованы не по назначению для внешних атак на системы Anthropic. Эти риски стали более острыми по мере роста возможностей моделей, особенно начиная с моделей класса Mythos. Ниже мы описываем некоторые из реализованных нами мер — большинство этих усилий было предпринято еще до июльских инцидентов, хотя эти инциденты подчеркнули важность данной работы.
В начале апреля, видя, к чему идет развитие автономного ИИ, наша команда безопасности проявила инициативу и направила усилия всей компании на единую цель — усиление нашей защиты, при необходимости приостановив другую работу (включая исследования). Мы пришли к выводу, что наша уязвимость растет быстрее, чем защита: Mythos обладал достаточными возможностями, чтобы стать целью для хорошо обеспеченных ресурсами злоумышленников; наше внутреннее использование автономных агентов выросло до масштабов, к которым традиционные подходы к доступу и мониторингу не были готовы; а темпы появления новой инфраструктуры требовали, чтобы наша безопасность масштабировалась вместе с окружением, а не функционировала с фиксированной мощностью.
Результаты этой работы включают в себя:
- Сокращение числа учетных записей людей и автоматизированных систем с постоянным доступом к системам, содержащим веса моделей или клиентские данные
- Настройку наших вычислительных кластеров на блокировку всего исходящего трафика по умолчанию
- Требование к внутренним службам проверять идентичность друг друга перед началом связи
- Вывод из эксплуатации устаревших конфигураций инфраструктуры и общих внутренних служб
- Ужесточение требований к изолированным средам, в которых выполняются наши рабочие нагрузки
- Расширение возможностей наблюдения на уровне хостов, благодаря чему неожиданное поведение в нашей инфраструктуре становится заметным в момент его возникновения
Мы также временно перевели часть сотрудников компании на эти задачи. Около 150 продуктовых инженеров были перенаправлены на обеспечение безопасности, надежности и конфиденциальности; исследователи также временно отошли от предварительного обучения или обучения с подкреплением (RL), чтобы сосредоточиться на мерах защиты и безопасности; а наши продуктовые команды приостановили разработку большинства новых функций и интерфейсов. Мы установили строгие критерии выхода для каждой команды, которые они должны были выполнить перед возвращением к своей прежней работе. К началу лета большинство команд выполнили эти требования.
Параллельно с перераспределением ресурсов в пользу безопасности мы продолжали создавать средства изоляции и мониторинга для внутреннего использования агентов. Наши рабочие нагрузки по обучению и оценке обычно выполнялись в песочницах, изолированных от наших производственных систем. С момента разработки Claude Mythos Preview мы использовали наши модели для поиска любых уязвимостей в этих песочницах. Мы описывали наш автономный мониторинг внутренних кодирующих агентов в апрельском отчете о рисках выравнивания, а в нашем августовском отчете о рисках эта система рассматривается более подробно, наряду с мерами вмешательства, которые применяются параллельно с ней. Они включают в себя изоляцию в песочнице или классификаторы автоматического режима для наиболее автономных форм внутреннего использования агентов, а также автоматическую проверку изменений кода инфраструктуры перед их слиянием.
То, что было упущено в этой работе — это оценки, и прежде всего сторонние оценки. Мы действительно проводили мониторинг некоторых оценок высокого риска, в том числе в режиме реального времени, но в целом мы проводили автоматические проверки лишь выборочно по стенограммам задним числом.
Июльские инциденты подчеркнули, что срочность совершенствования нашей киберзащиты еще выше, чем мы полагали ранее. Мы удваиваем наши усилия в этом направлении и расскажем об этом подробнее в нашем следующем отчете о рисках.