Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Sovershenstvovanie nashih metodov soglasovaniya i bezopasnosti
Dev48

© 2026 · All rights reserved.

Совершенствование наших методов согласования и безопасности

Источник: Anthropic Claude

Совершенствование наших методов согласования и безопасности

Источник: Anthropic Claude

30 июля мы сообщили о трех инцидентах, в ходе которых модели Claude получили несанкционированный доступ к реальным компьютерным системам. Мы проводим глубокий анализ обоих инцидентов и планируем привлечь METR для независимой проверки. Тем временем мы делимся некоторыми изменениями, которые мы…

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

30 июля мы reported зафиксировали три инцидента, в ходе которых модели Claude получили несанкционированный доступ к реальным компьютерным системам. Модели, которые намеренно запускались без средств киберзащиты в целях оценки, получили доступ в интернет из-за неправильной конфигурации во сторонней среде тестирования. Отдельно, 4 августа, Институт безопасности ИИ Великобритании сообщил об инциденте в ходе собственного тестирования на кибербезопасность, в ходе которого Claude Mythos 5 предпринял ряд несанкционированных действий в реальном интернете. В этом случае модель, также намеренно запущенная без киберзащиты для целей оценки, имела умышленно предоставленный доступ в интернет.

Мы проводим глубокий анализ обоих инцидентов. Мы также планируем сотрудничать с METR для проведения независимой проверки. Мы хотим убедиться, что оба исследования будут проведены тщательно, и поделимся дополнительной информацией в ближайшие недели.

Тем временем мы делимся некоторыми изменениями, которые мы внедрили за последний месяц. Мы считаем, что эти инциденты отражают сбой в операционной безопасности, а также две проблемы согласования: мотивированное рассуждение и готовность совершать вредные действия ради выполнения узкой задачи (обе эти проблемы мы описывали в предыдущих системных картах). В отношении безопасности мы описываем усовершенствования, внесенные в наши системы изоляции и мониторинга, а также практики, разработанные нами для сторонних оценщиков. В отношении согласования мы подробнее обсуждаем эти две проблемы; мы также верим, что устойчивый прогресс достигается не только за счет понимания того, что произошло в конкретном инциденте, но и за счет понимания того, как в принципе возникает несогласованность, и делимся ранними исследованиями в этом направлении.

В свете этих инцидентов растет число дискуссий об управлении темпами развития передовых технологий. Полезно различать два вида управления темпами. Внутри компании это означает принятие ряда решений, в которых безопасность ставится выше скорости, когда они вступают в противоречие. В масштабах всей отрасли это означает создание процессов для предотвращения гонки на выживание. В этой статье мы обсуждаем действия, которые мы предприняли как до, так и после этих инцидентов, в рамках первого подхода. Второй тип управления темпами требует координации между правительством и индустрией и должен быть прозрачным и проверяемым. Некоторые из наших топ-менеджеров и многие сотрудники недавно подписали письмо с призывом к более тесной координации в вопросах регулирования темпов, и в ближайшие недели мы расскажем подробнее о том, как намерены способствовать этим усилиям. Чтобы наша позиция была ясна: мы считаем, что мир выиграл бы, если бы индустрия как можно скорее приняла законный, проверяемый и эффективный механизм скоординированного регулирования темпов.

Обеспечение безопасности сред оценки и обучения

Хотя мы не считаем эти инциденты исключительно операционными проблемами, нашей первейшей задачей было устранение конкретных проблем изоляции и мониторинга. В ответ на это мы предприняли следующие действия:

Приостановка и усиление сред оценки

После инцидентов мы приостановили внешние кибероценки моделей до их официального релиза, а также ненадолго приостановили внутренние оценки, пока внедряем описанные ниже меры. Инциденты, о которых мы сообщили 30 июля, показали, что мы в значительной степени полагались на единственный уровень защиты (конфигурацию самой среды), тогда как нам требовалось несколько, включая установление явных границ в промпте, создание процессов проверки герметичности песочницы там, где это необходимо, и внедрение мониторинга, способного вмешиваться в режиме реального времени. Сообщение компании OpenAI disclosure (которое инициировало наше расследование в июле) о том, что модели использовали неизвестную уязвимость для побега из изолированной песочницы во время оценки, также дало понять, что нам следует сосредоточиться на усилении самой песочницы.

Пока оценки были приостановлены, мы внедрили следующие предварительные меры:

1) Мы создали и развернули классификатор для автоматического определения в реальном времени случаев, когда модель пытается агрессивно зондировать или покинуть тестовую среду либо неожиданно получает доступ в интернет. Когда классификатор фиксирует такую попытку, он блокирует действие до запуска вызова инструмента, завершает задачу и оповещает человека.

2) Мы запустили автоматизированные системы мониторинга стенограмм наших недавних внутренних оценок моделей до их релиза (кибернетических и прочих) в поисках побегов из песочницы (случаев, когда модель использует уязвимость в нашей песочнице для доступа к системам, от которых она должна быть ограждена) или ошибок конфигурации песочницы. В случаях, когда мы проводили оценку внутри нашего инструментария песочницы, мы не нашли примеров нарушения границ песочницы для доступа к внешним ресурсам, к которым у нее не должно было быть доступа. Мы обнаружили различные ошибки конфигурации песочницы, которыми воспользовались модели, но ни одна из них не привела к компрометации систем за пределами песочницы. Мы активно работаем над их устранением.

3) Мы перенесли внутренние киберпесочницы высокого риска в более надежную среду изоляции. Мы также продолжаем проводить ред-тестирование нашего стека виртуализации — то есть ставим перед предварительно выпущенными моделями задачу попытаться сбежать из него — для поиска и устранения уязвимостей.

Наши внутренние кибероценки теперь снова запущены с учетом этих мер.

Среды обучения с подкреплением

Мы также на несколько недель приостановили работу сред обучения с подкреплением (RL) повышенного риска для моделей до их релиза. За это время мы создали аналогичный классификатор, модифицированный так, чтобы не стимулировать модель к обходу этого нового мониторинга, и теперь развернули его в этих средах. Большая часть обучения с подкреплением возобновлена, но некоторые среды высокого риска остаются приостановленными до проведения ручной проверки, в то время как для других потребуется обновленная версия классификатора, которую мы планируем развернуть в ближайшее время.

Более широкое усиление защиты

В дополнение к усилиям, направленным на оценки и обучение повышенного риска, мы расширили наш автономный мониторинг, охватив им большинство других форм внутреннего использования автономных агентов. Мы также создаем средства контроля нашего внутреннего инференса, чтобы сотрудники Anthropic случайно не запустили агентов с более слабыми средствами защиты, чем те, что описаны выше.

Лучшие практики для внешних партнеров

Поскольку зарегистрированные инциденты произошли в сторонних средах, мы попросили каждую организацию, которая тестирует еще не выпущенные модели с уменьшенными средствами киберзащиты, следовать набору лучших практик. Мы считаем это необходимым, поскольку:

  • Наши модели общего назначения поставляются со средствами защиты, включая классификаторы, которые работают с входными и выходными данными Claude в реальном времени для блокирования запрещенной кибердеятельности, такой как разработка вредоносного ПО или написание наступательных эксплойтов. Кибероценщики и часть партнеров с ранним доступом, напротив, работают с моделями, у которых эти средства защиты снижены для обеспечения точного тестирования возможностей модели и оборонительных киберзадач.
  • Кибероценки с необычно высокой вероятностью приводят к поведению, наблюдаемому в этих инцидентах. Они создают давление отбора в сторону упорства и изобретательности при зондировании окружающей среды и преодолении препятствий, и они запускаются много тысяч раз.

Эти правила в полном объеме применяются везде, где партнеры проводят киберисследования, используя собственные стенды, песочницы или агенты. Они не распространяются на клиентов, использующих защищенные модели, такие как Claude Fable 5. Мы возобновили внешние киберисследования с соблюдением этих правил, а также придерживаемся их внутри компании.

Изоляция песочницы и сети

По умолчанию все киберисследования должны проводиться внутри защищенной песочницы (изолированной вычислительной среды) без доступа к интернету. Единственное внешнее соединение, которое должна разрешать среда — это собственный API модели, причем ключи API должны храниться вне среды. Эту конфигурацию необходимо проверять перед началом каждого исследования. Для некоторых исследований может потребоваться доступ в интернет. В таких случаях мы будем работать с внешними исследователями при оценке предварительных версий моделей, чтобы определить, можем ли мы надежно обнаруживать и останавливать запуски, в ходе которых модель предпринимает действия за пределами заявленной области видимости.

Проверка перед началом работы

Перед проведением оценки партнеры по оценке должны:

  • Провести тестирование песочницы на уязвимости с помощью тестируемой модели: сначала путем статического анализа конфигурации, а затем путем реальной задачи для модели попытаться совершить побег. Модели следует дать указание остановиться и сообщить об успехе в случае побега, и все это должно происходить под пристальным наблюдением человека. Это тестирование следует проводить без доступа к интернету, в идеале во второй песочнице. Поскольку исследования иногда проводятся на протяжении сотен или даже тысяч запусков, партнерам желательно провести такое тестирование в полном объеме до начала любых исследований.
  • Подтвердить, что любая исследовательская задача действительно разрешима в принципе. Когда целевой объект исследования отключен от сети или задачу невозможно выполнить, агенты часто ищут другие способы выполнения задачи, что увеличивает вероятность совершения ими действий вне предполагаемой области видимости исследования.

Явное определение области видимости

В каждой подсказке должно быть указано, что входит и не входит в область видимости для данного упражнения, включая цели, разрешенные действия и сетевые границы (т. е. к чему модель должна и не должна иметь доступ). Границы должны формулироваться в виде инструкций (например, «У вас не должно быть доступа в интернет»), а не утверждений о среде или тесте («У вас нет доступа в интернет»).

Мониторинг в реальном времени

Исследователи также должны осуществлять постоянный мониторинг мышления, действий и сетевой активности модели с помощью монитора на базе модели или правил, которому была задана область видимости упражнения. Если запуск нарушает эту область видимости, монитор должен сообщить об этом человеку и завершить упражнение.

Мы планируем и дальше дорабатывать это руководство в консультациях с внешними партнерами и распространять его за пределы оценок. В частности, мы разрабатываем сопутствующие правила для партнеров, имеющих доступ к Claude Mythos 5, которая также работает без киберзащиты, и вскоре поделимся подробностями.

Оценка соответствия (алайнмента)

Ограничение и мониторинг имеют решающее значение для выявления случаев, когда модели совершают опасные действия, но они не объясняют, почему модель совершила такие действия в первую очередь. Ниже мы обсуждаем наше предварительное исследование алайнмента и вопросы, на которых мы сосредоточены, а также нашу текущую работу по предотвращению обмана во время обучения, включая новые исследования о том, как обман формирует поведение модели.

Среда и состояние знаний наших моделей во время оценки

Наша оценка алайнмента все еще продолжается, но предварительное расследование указывает на два основных сбоя алайнмента, оба из которых мы описывали в предыдущих системных картах. Первый — это мотивированное рассуждение: моделям сначала сказали, что их среда смоделирована, но когда они позже столкнулись с доказательствами того, что они подключены к реальному интернету, они могли интерпретировать эти доказательства таким образом, который позволил им сохранить это убеждение. Второй — это безрассудство: модель была готова совершить вредоносные действия в реальном интернете в погоне за узкой целью решения киберисследования. Тем не менее, мы также считаем, что сама установка исследования способствовала поведению моделей, продемонстрированному в этих инцидентах. Claude было прямо сказано, что у нее нет доступа в интернет, несмотря на то, что интернет был доступен, что могло заставить ее усомниться в том, являются ли увиденные ею системы реальными. И в одном случае вымышленная цель совпадала по названию с реальным веб-сайтом, что затрудняло отделение того, что предполагалось включить в область видимости упражнения.

Наши выводы зависят от ряда вопросов, на которые мы еще не дали окончательных ответов: в какой степени модели определили, что у них есть доступ к реальному интернету (даже если они изначально этого не знали), сознательно ли они игнорировали признаки того, что элементы их среды были реальными, и следовало ли из мотивированных рассуждений то, что в нескольких случаях они не смогли остановить упражнение. Мы применяем целый ряд методов для ответа на эти вопросы, включая повторную выборку моделей с внесением целенаправленных изменений в среду и использование методов интерпретируемости для прямой проверки их внутреннего состояния.

Изучение усилий по предотвращению обмана во время обучения

Хотя несоответствие моделей является сложной проблемой и может возникать по самым разным причинам, мы эмпирически обнаружили, что дефекты в обучающих средах — в частности, среды, уязвимые к обману или неразрешимые без обмана — вносят непропорционально большой вклад в несоответствующее поведение.

Ниже мы обсуждаем наши усилия, начатые за несколько месяцев до инцидентов, по избежанию обучающих сред с подобного рода дефектами. Эти усилия были несовершенными, и наша гипотеза заключается в том, что инциденты были по крайней мере частично связаны с нашей неспособностью полностью устранить проблемы такого рода. Мы проверили эту гипотезу, намеренно обучив модель в средах, подверженных хакингу наград (reward hacking). В симуляциях эта модель воспроизводит более серьезное несоответствующее поведение, отчасти похожее на то, о котором сообщалось в инцидентах этим летом от других компаний. Наши производственные модели, помещенные в те же симуляции, этого не делают (подробнее далее в этом разделе).

Мы исторически обеспокоены средами обучения с подкреплением, которые стимулируют обман, и приняли различные меры для фильтрации или исправления таких сред.

В феврале мы откатили три дня обучения в рамках прогона обучения с подкреплением для Mythos Preview после того, как заметили признаки «злоупотребления вознаграждением» (когда модель находит способы обмануть процесс своего обучения и получать награды, не выполняя поставленную задачу). Мы заметили, что модель пишет заметки «рецензенту» в своих комментариях к коду и ответах, в том числе в задачах, где рецензент никогда не упоминался — это нежелательная генерализация из сред, где промпт действительно включал рецензента. Она также продолжала эксплуатировать систему вознаграждения, призванную стимулировать честность, добавляя множество оговорок или предупреждений. Откат на три дня позволил нам возобновить обучение с чекпоинта, сделанного до того, как модель усвоила такое поведение, и мы внесли изменения в среды, чтобы предотвратить повторное обучение этому.

Мы создаем инструменты для мониторинга нежелательных моделей поведения, которым модели обучаются в RL, со времен Claude Sonnet 3.7 (у которого была склонность к злоупотреблению вознаграждением, обнаруженная нами лишь на поздних этапах обучения). Мы приложили значительные усилия к тому, чтобы наши инструменты развивались с каждым поколением моделей: от нескольких классификаторов до автоматизированной проверки всех сред до и во время циклов обучения, однако к весне 2026 года эта система оказалась перегружена. Мы создавали среды RL быстрее, чем когда-либо — быстрее, чем наши системы успевали их проверять. Помеченные среды требовали ручного рассмотрения, а злоупотребления вознаграждением и ошибки конфигурации начали опережать нашу способность фильтровать или исправлять их.

Кроме того, мы обнаружили, что небольшая часть прогонов случайно обучалась на цепочке рассуждений (chain-of-thought) модели — то, чего мы стараемся избегать из опасений, что это научит модель скрывать свои истинные рассуждения. Мы проследили утечку до нескольких неправильных конфигураций в нашем стеке производственной среды. При этом стало очевидно, что существуют и другие проблемы, порожденные беспорядочным кодом, накапливающимся с течением времени.

Чтобы решить эти проблемы, в апреле мы заморозили все изменения в наших производственных средах RL примерно на месяц, что дало нам возможность полностью переработать стек. Награды и среды теперь должны соответствовать согласованной спецификации. Например, мы внедрили технические меры по снижению риска случайного обучения на цепочках рассуждений. Пока наши команды по качеству сред и мониторингу перестраивали стек, мы попросили владельцев сред использовать эту паузу для тестирования и исправления созданных ими сред. Мы также полностью перестроили наш процесс проверки и потребовали, чтобы каждая исправленная среда была повторно сертифицирована перед допуском к следующему циклу обучения.

Во время заморозки мы отметили более 10% сред в нашем производственном наборе из-за проблем, варьирующихся от злоупотребления вознаграждением до сломанных задач и неправильной конфигурации, и восстановили их только после исправления.

Тем не менее, наши усилия не были безупречными. В некоторых случаях мы обнаруживали, что человеческие рецензенты отклоняли среды, помеченные нашими автоматизированными мониторами как ложноположительные, позволяя несовершенным средам оставаться в обучении дольше, чем следовало бы. А некоторые несовершенные среды просто ускользают от наших механизмов обнаружения. В настоящее время мы ужесточаем критерии отклонения меток и ожидаем более тесного сотрудничества с владельцами сред для повышения точности наших систем. Помимо мониторинга и обнаружения, наши команды по исследованию выравнивания и RL сотрудничают в целях улучшения сред.

Мы подозреваем, что наши крупные инвестиции в контроль качества сред RL могли предотвратить более серьезные инциденты, связанные с выравниванием, и, наоборот, несовершенство этих усилий могло способствовать инцидентам, выявленным нами на данный момент.

Чтобы посмотреть, как поведет себя модель, обученная без этих защитных механизмов, мы намеренно обучили модель класса Opus на 80 различных реальных средах RL, в которых либо происходило злоупотребление вознаграждением во время хотя бы одного реального прогона обучения (что было выявлено мониторингом), либо которые были признаны уязвимыми для такого злоупотребления в ходе проверки качества сред. Полученная модель демонстрирует сильную мотивацию к достижению высоких результатов в задачах и готовность совершать потенциально опасные действия ради успеха в них. В нашей сопутствующей статье в блоге по науке о выравнивании этот эксперимент обсуждается более подробно, но здесь мы приводим его краткую сводку.

Мы протестировали намеренно дезальинированную (с нарушенным выравниванием) модель в различных оценках, включая симулированные сценарии, основанные на аспектах инцидентов кибербезопасности UK AISI с участием Claude и инцидента с OpenAI/Hugging Face (мы признательны OpenAI за то, что они поделились подробностями об этом публично). Во время этих оценок, где все вызовы инструментов симулировались другой LLM, обученная нами на злоупотребление вознаграждением модель проявила склонность вырываться из своей симулированной песочницы и атаковать симулированную внутреннюю и симулированную стороннюю инфраструктуру. Она также была готова вмешиваться в собственную функцию вознаграждения, давать советы по созданию биооружия для удовлетворения оценщика и неоднократно пытаться обойти мониторинг безопасности развертывания, чтобы сжульничать в задаче.

Затем мы провели те же симуляции кибербезопасности на модели до ее обучения злоупотреблению вознаграждением, а также на нескольких наших общедоступных моделях. Ни одна из них не продемонстрировала такого же уровня поведения с нарушенным выравниванием. Наш вывод заключается в том, что наличие существенного злоупотребления вознаграждением при обучении может заставить модели быть готовыми выполнять длинные последовательности потенциально опасных реальных действий ради достижения успеха в задаче.

Мы считаем, что значительные инвестиции, сделанные нами этой весной в мониторинг и сокращение случаев злоупотребления вознаграждением, являются основной причиной того, что наши производственные модели вряд ли будут заниматься более опасным поиском вознаграждения. В нашей сопутствующей статье в блоге по науке о выравнивании мы также обнаружили свидетельства того, что среды обучения выравниванию могут существенно снизить злоупотребление вознаграждением и поведение, направленное на его поиск. Но, как показывают инциденты, о которых мы сообщили 30 июля, наш процесс несовершенен, а наши модели выровнены не идеально.

Справедливости ради отметим, что мы не считаем мошенничество в обучающих средах единственной причиной проблем с выравниванием или даже конкретных проблем с выравниванием, проявившихся в наших инцидентах или инцидентах других компаний, занимающихся передовым ИИ. Решение проблемы выравнивания потребует устранения очень широкого спектра потенциальных проблем, и будущие инциденты с выравниванием могут включать в себя иные типы поведения и другие причины, отличные от тех, что мы наблюдали до сих пор.

Ужесточение практик безопасности

Внутреннее состояние безопасности Anthropic не было фактором, способствовавшим инцидентам 30 июля. Они произошли в сторонней среде, где доступ в интернет был по ошибке оставлен открытым; моделям не нужно было «выламываться» откуда-либо, даже если бы у них было такое желание.

Тем не менее, эти инциденты подчеркивают критическую важность надежных мер безопасности. В дополнение к обычным рискам кражи интеллектуальной собственности или весов моделей, теперь нам приходится иметь дело как с рисками того, что наши собственные модели совершат побег из систем Anthropic, так и с рисками неправомерного использования наших или чужих моделей для внешних атак на системы Anthropic. Эти риски стали более острыми по мере роста возможностей моделей, особенно начиная с моделей класса Mythos. Ниже мы описываем часть того, что нами было реализовано — большинство этих усилий было предпринято до июльских инцидентов, хотя эти инциденты подчеркнули важность данной работы.

В начале апреля, видя, к чему идет развитие автономного ИИ, наша команда безопасности проактивно направила усилия всей компании на единую цель — укрепление нашей защиты, при необходимости отложив другую работу (включая исследования). Мы пришли к выводу, что наша уязвимость растет быстрее, чем защита: Mythos обладал достаточными возможностями, чтобы стать целью для хорошо обеспеченных ресурсами злоумышленников, наше внутреннее использование автономных агентов выросло до масштабов, к которым традиционные подходы к доступу и мониторингу не были готовы, а темпы появления новой инфраструктуры означали, что наша безопасность должна масштабироваться вместе с окружением, а не оставаться на фиксированном уровне.

Результаты этой работы включают в себя:

  • Сокращение числа учетных записей людей и автоматизированных систем с постоянным доступом к системам, содержащим веса моделей или клиентские данные
  • Настройку наших вычислительных кластеров на блокировку всего исходящего трафика по умолчанию
  • Требование к внутренним службам проверять подлинность друг друга перед началом связи
  • Вывод из эксплуатации устаревших конфигураций инфраструктуры и общих внутренних служб
  • Ужесточение изолированных сред, в которых выполняются наши рабочие нагрузки
  • Расширение наблюдаемости на уровне хостов, благодаря чему непредвиденное поведение в нашей инфраструктуре становится заметным по мере его возникновения

Мы также временно перенаправили часть сотрудников компании на эти задачи. Около 150 продуктовых инженеров были переброшены на обеспечение безопасности, надежности и конфиденциальности; исследователи также временно отошли от предварительного обучения или обучения с подкреплением (RL), чтобы сосредоточиться на мерах защиты и безопасности; а наши продуктовые команды приостановили разработку большинства новых функций и интерфейсов. Мы установили строгие критерии выхода для каждой команды, которые должны были быть выполнены до возвращения к прежней работе. К началу лета большинство команд выполнили их.

Параллельно с перераспределением ресурсов в пользу безопасности мы продолжили создание средств изоляции и мониторинга для внутреннего использования агентов. Наши рабочие нагрузки по обучению и оценке обычно выполняются в песочницах, изолированных от производственных систем. С момента разработки Claude Mythos Preview мы использовали наши модели для поиска любых уязвимостей в этих песочницах. Мы описывали наш автономный мониторинг внутренних кодирующих агентов в нашем апрельском отчете о рисках согласования, а наш августовский отчет о рисках освещает эту систему более подробно вместе с сопутствующими мерами вмешательства. К ним относятся изоляция в песочнице или классификаторы автоматического режима для наиболее автономных форм внутреннего использования агентов, а также автоматическая проверка изменений кода инфраструктуры перед их слиянием.

То, что упустила эта работа — это оценки, и прежде всего независимые внешние оценки. Мы действительно отслеживали некоторые оценки высокого риска, в том числе в режиме реального времени, но в целом мы проводили автоматические проверки лишь выборочно по стенограммам задним числом.

Июльские инциденты подчеркнули, что срочность повышения нашей кибербезопасности еще выше, чем мы полагали ранее. Мы удваиваем наши усилия в этом направлении и расскажем об этом подробнее в нашем следующем отчете о рисках.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия
Lambda

Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в ИндииПресса
Google Gemini

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в Индии

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами
Пресса
OpenAI

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple WatchПресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лаборатории

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex
OpenAI

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex

Ещё от Anthropic Claude

Разработка корпоративных средств защиты передового уровня совместно с нашими клиентами
Anthropic Claude

Разработка корпоративных средств защиты передового уровня совместно с нашими клиентами

Представление программы верификации в сфере наук о жизни
Anthropic Claude

Представление программы верификации в сфере наук о жизни

Партнерство с Accenture в области встроенной оценки
Anthropic Claude

Партнерство с Accenture в области встроенной оценки

Claude обнаружил новую ферментативную систему
Anthropic Claude

Claude обнаружил новую ферментативную систему

Автоматизированный мониторинг состояния цепочек писем: как мы создали его с помощью Claude
Anthropic Claude

Автоматизированный мониторинг состояния цепочек писем: как мы создали его с помощью Claude