В пятницу OpenAI опубликовала новый сайт, посвященный «отчетам о несогласованности», и масштаб этих отчетов вызывает тревогу, поскольку они охватывают множество типов нежелательного поведения за длительный период времени. На данный момент на сайте размещено девять зарегистрированных инцидентов, большинство из которых произошли во время обучения с подкреплением (RL).
Здесь собрано очень много информации в одном месте — очевидно, компания проделала огромную работу, чтобы разобраться со всем этим, — но главный вывод напрашивается сам собой: инциденты с агентами, вышедшими из-под контроля, которые мы наблюдали до сих пор, вероятно, составляют лишь малую долю от того, что произошло на самом деле.
«Мы пытаемся найти баланс между стремлением к прозрачности, необходимостью получить четкое понимание ситуации на основе петабайтов логов активности агентов и работой с пострадавшими организациями», — написал Сэм Альтман в посте, анонсирующем новый сайт. — «Мы расставляем приоритеты наилучшим образом в зависимости от степени серьезности и выделяем ресурсы».
Некоторые случаи включают в себя серьезные инциденты, в том числе ранее не разглашавшийся побег из песочницы, который произошел , в ходе которого внутренняя исследовательская модель смогла связаться с внешним чат-ботом посредством DNS-запроса. Согласно отчету, система мониторинга зафиксировала такое поведение в течение 15 минут, а процесс был остановлен менее чем за три часа.
Другой инцидент, обнаруженный в мае, заключался в том, что «высокоустойчивая внутренняя модель» попыталась смухлевать при решении математической задачи, получив доступ к наработкам другой команды. Для этого модель перетащила секретный токен GitHub, который позволял ей видеть работу других команд — даже после того, как ей дважды прямо поручили выполнять работу полностью локально.
Возможно, самым тревожным открытием является вероятность атак с инъекцией промптов с возможностью самовоспроизведения — способа, при котором несогласованное поведение может распространяться даже после того, как сама вышедшая из-под контроля модель была нейтрализована. В контексте ИИ атака с инъекцией промптов — это способ внедрения новых инструкций, которые не задавались первоначальным пользователем.
В примере, приведенном OpenAI, агент получил запрос прочитать электронное письмо и ответить на него; при открытии письма оно содержит инструкции для любого автоматического агента, читающего сообщение, ответить по-испански и вставить все письмо в свой ответ. Письмо успешно побудило агента ответить по-испански, и путем вставки письма в ответ те же инструкции были переданы следующему агенту, который получил это письмо.
В результате получается самораспространяющаяся атака, которую исследователи OpenAI сравнили с вредоносным «червем», реплицирующим себя в компьютерных системах. Исследователи обнаружили такое поведение в контролируемых условиях с использованием маломощной модели, и, насколько нам известно, в дикой природе такого никогда не случалось. Тем не менее, последствия достаточно тревожны, чтобы OpenAI решила, что это заслуживает обнародования.
«Мы делимся этим из-за новаторского характера инъекции промптов, а не из-за какого-либо инцидента», — написали исследователи в отчете.
Другие недавние утечки показали, что модели публиковали предоставленные пользователями изображения на сторонних сайтах для хостинга, а также произошла очевидная атака на базы данных национальной службы здравоохранения Австралии.
Тем не менее, вполне вероятно, что новые разоблачения составляют лишь малую часть инцидентов, произошедших на данный момент (мы обратились в OpenAI за комментарием). Axios сообщает, что в ведущих лабораториях фиксировались случаи, когда модели выходили за рамки инструкций оценщиков.
Генеральный директор OpenAI Сэм Альтман намекнул на это, написав в пятницу в посте на X, что компания все еще просеивает «петабайты логов активности агентов, работает с пострадавшими организациями» и раскрывает инциденты «в зависимости от степени серьезности». Если в этом и есть какое-то утешение, так это то, что, по словам Альтмана, инцидент с Hugging Face по-прежнему остается самым серьезным из тех, что обнаружила OpenAI. Итог таков: недавняя череда инцидентов с выходом агентов из-под контроля может стать постоянной особенностью современных передовых исследований.
Когда вы совершаете покупки по ссылкам в наших статьях, мы можем получить небольшую комиссию. Это не влияет на нашу редакционную независимость.
Рассел Брандом освещает технологическую индустрию с 2012 года, уделяя особое внимание политике платформ и новым технологиям. Ранее он работал в The Verge и Rest of World, а также писал для Wired, The Awl и MIT’s Technology Review. С ним можно связаться по адресу russell.brandom@techcrunch.com или в Signal по номеру 412-401-5489.
Посмотреть биографию











