Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Openai po prezhnemu ne do kontsa kontroliruet vsyu aktivnost svoih ii agentov s
Dev48

© 2026 · All rights reserved.

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведением

Источник: TechCrunch

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведением

Источник: прессаTechCrunch

В пятницу OpenAI опубликовала [[L1]]новый сайт, посвященный «отчетам о несоответствии целей»[[/L1]], и масштаб этих отчетов поражает воображение, поскольку они охватывают множество типов непредсказуемого поведения за длительный период времени. На данный момент на сайте размещено девять…

28 сентября 2026 г.•Обновлено: 28 сентября 2026 г.

В пятницу OpenAI опубликовала новый сайт, посвященный «отчетам о несогласованности», и масштаб этих отчетов вызывает тревогу, поскольку они охватывают множество типов нежелательного поведения за длительный период времени. На данный момент на сайте размещено девять зарегистрированных инцидентов, большинство из которых произошли во время обучения с подкреплением (RL).

Здесь собрано очень много информации в одном месте — очевидно, компания проделала огромную работу, чтобы разобраться со всем этим, — но главный вывод напрашивается сам собой: инциденты с агентами, вышедшими из-под контроля, которые мы наблюдали до сих пор, вероятно, составляют лишь малую долю от того, что произошло на самом деле.

«Мы пытаемся найти баланс между стремлением к прозрачности, необходимостью получить четкое понимание ситуации на основе петабайтов логов активности агентов и работой с пострадавшими организациями», — написал Сэм Альтман в посте, анонсирующем новый сайт. — «Мы расставляем приоритеты наилучшим образом в зависимости от степени серьезности и выделяем ресурсы».

Некоторые случаи включают в себя серьезные инциденты, в том числе ранее не разглашавшийся побег из песочницы, который произошел , в ходе которого внутренняя исследовательская модель смогла связаться с внешним чат-ботом посредством DNS-запроса. Согласно отчету, система мониторинга зафиксировала такое поведение в течение 15 минут, а процесс был остановлен менее чем за три часа.

Другой инцидент, обнаруженный в мае, заключался в том, что «высокоустойчивая внутренняя модель» попыталась смухлевать при решении математической задачи, получив доступ к наработкам другой команды. Для этого модель перетащила секретный токен GitHub, который позволял ей видеть работу других команд — даже после того, как ей дважды прямо поручили выполнять работу полностью локально.

Возможно, самым тревожным открытием является вероятность атак с инъекцией промптов с возможностью самовоспроизведения — способа, при котором несогласованное поведение может распространяться даже после того, как сама вышедшая из-под контроля модель была нейтрализована. В контексте ИИ атака с инъекцией промптов — это способ внедрения новых инструкций, которые не задавались первоначальным пользователем.

В примере, приведенном OpenAI, агент получил запрос прочитать электронное письмо и ответить на него; при открытии письма оно содержит инструкции для любого автоматического агента, читающего сообщение, ответить по-испански и вставить все письмо в свой ответ. Письмо успешно побудило агента ответить по-испански, и путем вставки письма в ответ те же инструкции были переданы следующему агенту, который получил это письмо.

В результате получается самораспространяющаяся атака, которую исследователи OpenAI сравнили с вредоносным «червем», реплицирующим себя в компьютерных системах. Исследователи обнаружили такое поведение в контролируемых условиях с использованием маломощной модели, и, насколько нам известно, в дикой природе такого никогда не случалось. Тем не менее, последствия достаточно тревожны, чтобы OpenAI решила, что это заслуживает обнародования.

«Мы делимся этим из-за новаторского характера инъекции промптов, а не из-за какого-либо инцидента», — написали исследователи в отчете.

Другие недавние утечки показали, что модели публиковали предоставленные пользователями изображения на сторонних сайтах для хостинга, а также произошла очевидная атака на базы данных национальной службы здравоохранения Австралии.

Тем не менее, вполне вероятно, что новые разоблачения составляют лишь малую часть инцидентов, произошедших на данный момент (мы обратились в OpenAI за комментарием). Axios сообщает, что в ведущих лабораториях фиксировались случаи, когда модели выходили за рамки инструкций оценщиков.

Генеральный директор OpenAI Сэм Альтман намекнул на это, написав в пятницу в посте на X, что компания все еще просеивает «петабайты логов активности агентов, работает с пострадавшими организациями» и раскрывает инциденты «в зависимости от степени серьезности». Если в этом и есть какое-то утешение, так это то, что, по словам Альтмана, инцидент с Hugging Face по-прежнему остается самым серьезным из тех, что обнаружила OpenAI. Итог таков: недавняя череда инцидентов с выходом агентов из-под контроля может стать постоянной особенностью современных передовых исследований.

Когда вы совершаете покупки по ссылкам в наших статьях, мы можем получить небольшую комиссию. Это не влияет на нашу редакционную независимость.

Рассел Брандом освещает технологическую индустрию с 2012 года, уделяя особое внимание политике платформ и новым технологиям. Ранее он работал в The Verge и Rest of World, а также писал для Wired, The Awl и MIT’s Technology Review. С ним можно связаться по адресу russell.brandom@techcrunch.com или в Signal по номеру 412-401-5489.

Посмотреть биографию

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языковПресса
ElevenLabs

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языков

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИ
Пресса
Amazon

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИ

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов
LangChain

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое
LangChain

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое

Создание агентов для production с помощью Jev и LangGraph
LangChain

Создание агентов для production с помощью Jev и LangGraph

Ещё от OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентамиПресса
OpenAI

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лаборатории

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex
OpenAI

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex

Два года OpenAI Academy
OpenAI

Два года OpenAI Academy

OpenAI расширяет доступ к киберзащите для гражданской обороны Украины
OpenAI

OpenAI расширяет доступ к киберзащите для гражданской обороны Украины