Вашему ИИ-агенту не нужно быть злым, чтобы испортить вам квартал

Источник: WRITER

Вашему ИИ-агенту не нужно быть злым, чтобы испортить вам квартал

Источник: WRITER

Пока бушуют споры об опасном ИИ, вам нужно управлять квартальными целями. Для руководителей отделов маркетинга и продаж вышедшие из-под контроля агенты — это фактор, который нужно понимать и учитывать, но он не повод сбавлять обороты. Статья Your AI agent doesn’t need to be evil to ruin…

•Обновлено: 6 октября 2026 г.

Бен Поппер | 6 октября 2026 г.

На прошлой неделе появились новости о том, что OpenAI планирует на неопределенный срок отложить выпуск своей следующей передовой модели из-за опасений по поводу ее возможностей и потенциального вреда в реальном мире. Это переломный момент для ведущих ИИ-лабораторий, которые уже несколько месяцев говорят о необходимости замедлить темпы и перевести дух на передовой.

Для WRITER возникает вопрос о том, что это значит для наших клиентов — людей, которые руководят отделами маркетинга и продаж в крупных компаниях. Иметь собственное мнение о том, сколько времени осталось человечеству до того, как ИИ-убийца нас уничтожит, здорово для вашей следующей вечеринки, но это не имеет особого отношения к вашей повседневной работе, которая заключается в дальнейшем создании ИИ-систем, демонстрации реальной окупаемости этих инвестиций и объяснении того, как ваш подход помешает агентам, работающим в ваших системах, превратиться в злоумышленников.

Давайте возьмем самый известный пример вышедших из-под контроля агентов — рой агентов OpenAI, который сбежал из «песочницы», проник на веб-сайт Hugging Face и скрыл свою активность от людей, пытавшихся за ними следить. Звучит не так, как то, о чем вам нужно беспокоиться в маркетинге, верно?

В декабре прошлого года один из исходящих ИИ-агентов SaaStr решил провести A/B-тестирование. Созданный им вариант предлагал потенциальным клиентам бесплатные билеты на мероприятие SaaStr Annual 2026. Никто не одобрял это предложение, и никто не предполагал, что агент его сделает. Команда SaaStr быстро пресекла проблему, но не раньше, чем было раздано билетов примерно на 2000 долларов. На той же неделе второй агент продолжал приглашать потенциальных клиентов на мероприятие в Лондоне, которое уже прошло.

Ущерб для бренда и банковского счета SaaStr не был значительным, но этот пример очень важен. Агент пытался выполнять свою работу, которая заключалась в повышении конверсии, и пришел к выводу, что бесплатный билет поможет в этом. Попутно он взял на себя обязательство от имени компании, которое никто не санкционировал. Впоследствии основатель SaaStr Джейсон Лемкин написал, что он, честно говоря, не уверен, кто несет ответственность: SaaStr или вендор, чьи защитные механизмы не покрыли этот крайний случай.

В случае с OpenAI основная проблема была похожей. Агентов попросили решить задачу на экзамене, и они решили, что лучший способ — найти копию ответов. Модели OpenAI связали воедино несколько векторов атак, включая использование украденных учетных данных и уязвимостей нулевого дня для проникновения на Hugging Face — сайт, где пользователи делятся кодом для ИИ-инструментов, моделей и, да, оценок.

Рой агентов не спонтанно выработал собственные цели и не стремился к мировому господству. Они хотели удовлетворить своих хозяев, но сильно вышли за рамки дозволенного в том, что касалось их методов. Как и в случае с SaaStr, агенты, пытающиеся выполнить ваши указания, могут создать большие проблемы, если не предусмотрены надлежащие защитные механизмы.

Будучи руководителем отдела маркетинга или продаж в крупной компании, вам не стоит уделять много времени беспокойству о том, был ли «Терминатор» на самом деле пророческим документальным фильмом. Но вам придется столкнуться с необходимостью понимать, как и почему агенты выходят из-под контроля, поскольку велика вероятность, что в ближайшем будущем ваша команда столкнется с этим.

Вышедший из-под контроля агент — это обычно ошибка в правах доступа

Слово «агент-изгой» (rogue) подразумевает злой умысел, но реальность гораздо банальнее. SaaStr и OpenAI показывают, что происходит, когда сфера того, что агенты могут делать для достижения своей цели, должным образом не ограничена.

Некоммерческий коллектив по безопасности OWASP имеет надежную основу для осмысления всех различных способов, которыми ИИ-агенты могут выйти из-под контроля, и почти все они сводятся к чрезмерной автономности (excessive agency), каламбур не планировался.

Давайте рассмотрим некоторые способы, с помощью которых благонамеренные агенты могут сойти с рельсов.

  • Он неправильно понимает обычный запрос. Кто-то просит навести порядок, а получает зачистку.
  • У него есть права доступа, которые ему никогда не были нужны. Доступа на чтение было бы достаточно; ему предоставили права на запись и удаление.
  • Он следует инструкции, которую кто-то пронес тайком. Косвенная инъекция промпта, о которой говорится ниже.
  • Его контекст отравлен. Плохие данные или память, которая однажды была повреждена и которой продолжают доверять.
  • Он правильно выполняет не ту инструкцию. Каждый отдельный шаг разумен. Последовательность — нет.
  • Он переступает безопасные границы. Ему нужно решить тестовый вопрос, и он решает, что лучший способ — взломать сайт, содержащий экзамен и ключи к ответу.

Если «изгой» действительно означает злонамеренный, то вам придется полагаться на безопасность для выявления проблемы и ее решения. Если «изгой» означает избыточные права доступа, ответом является пересмотр ваших средств контроля доступа и рабочих процессов утверждения — задача, которую маркетинговая команда может и должна взять на себя.

Инструкция, которую вы не писали

В сентябре 2025 года исследователи из Noma Security обнаружили уязвимость в Salesforce’s Agentforce, которую они назвали ForcedLeak. Они показали, что злоумышленник может ввести инструкции в поле Description формы Web-to-Lead — той же формы, которую маркетинг использует для сбора лидов. Сначала ничего не происходит, но когда сотрудник просит агента обработать новые лиды, агент считывает внедренный текст так, как будто это его собственная инструкция, и отправляет данные CRM во внешний домен.

Исследователи купили этот домен за пять долларов; он истек, пока все еще находился в списке доверенных сайтов Salesforce. Salesforce устранила уязвимость, и нет никаких указаний на то, что кто-либо воспользовался ею.

В этом примере маркетинг создал точку входа, а продажи владели ушедшими данными. Ни одна из команд не назвала бы произошедшее инцидентом безопасности, и ни одна из команд не имела возможности его обнаружить.

Ни одна из этих историй не связана с ИИ, которому было поручено причинить вред. Вышедший из-под контроля агент — это почти всегда что-то более прозаичное: модель, неправильно понявшая обычный запрос; агент, которому дали права на удаление, когда ему нужны были только права на чтение; инструкция, пронесенная контрабандой через контент, который агента попросили обобщить; или цепочка индивидуально разумных шагов, которая в сумме приводит к плохому результату.

Инструкции против средств контроля

В феврале Саммер Ю (Summer Yue), директор по выравниванию в Meta Superintelligence Labs, нацелила агент с открытым исходным кодом под названием OpenClaw на свой почтовый ящик с четкой инструкцией: предлагать, что архивировать или удалять, и не предпринимать никаких действий, пока она не скажет. Рабочий процесс отлично работал в течение нескольких недель на тестовом почтовом ящике. Ее реальный почтовый ящик был намного больше, и когда агент сжал историю своих разговоров, чтобы освободить место, он забыл инструкцию подождать.

Агент удалил более 200 электронных писем, пока Ю вводила команды остановки со своего телефона, прежде чем физически побежать к компьютеру, чтобы выключить его. Агент не проявил неповиновения инструкции. Он просто упустил ее из виду без предупреждения. Вот почему «не предпринимать никаких действий, пока я не одобрю» — это более слабый элемент контроля, чем агент, у которого вообще нет прав на удаление.

При работе с агентом на базе LLM всегда помните, что инструкция на обычном языке не равна технически принудительному разрешению. Указание агенту на то, чего делать не следует, — это просьба, в то время как лишение его возможности совершать определенные действия — это контроль. Клиенты передают вам не требование, они передают вам свои опасения. Когда вы приходите готовыми ответить на вопрос о том, как ваша система справляется со сбоями, о которых они читают в новостях, это сразу же формирует доверие.

Безопасность и суверенитет

Существует проверенный временем подход к обеспечению безопасности агентов, который вы можете внедрить уже сегодня. Агент, как и сотрудник, должен действовать на основе принципа минимальных привилегий: иметь отдельную изолированную учетную запись для каждого агента, а не общие учетные данные суперпользователя. Ваша платформа ИИ должна предусматривать обязательное одобрение человеком необратимых или публичных действий и обеспечивать обратимость операций везде, где это позволяет система. И последнее, но не менее важное: вам необходим журнал аудита, достаточно качественный, чтобы после инцидента, а не во время него, ответить на вопрос «что он сделал и по чьему поручению».

Этот подход к управлению доступом на основе ролей не нов. Команды безопасности используют его уже тридцать лет. Секрет заключается в том, чтобы применить его к новому участнику

Если ваша команда еще не выполнила приведенный выше контрольный список, вы не одинок. Агенты появились быстрее, чем система управления ими, и многие из них оказались внутри инструментов, купленных для других целей.

В июне компания REI удалила рекламу в Instagram, на которой был изображен шоссейный велосипед с рулем на обоих концах. В REI заявили, что Meta автоматически зарегистрировала компанию в инструменте персонализации на базе ИИ, который изменил фотографию продукта поставщика; реклама прокручивалась около недели, прежде чем ее сняли. Условия Meta возлагают задачу проверки результатов работы ИИ на рекламодателя. Компания REI не развертывала агента, но он все равно действовал от ее имени.

Итак, какие меры вы можете принять сегодня, чтобы попытаться предотвратить попадание вашей компании в заголовки газет из-за вышедшего из-под контроля агента? Вот простой контрольный список, который вы можете использовать для начала проверки:

Еще один аспект, который следует иметь в виду при настройке безопасной работы агентов, — это концепция суверенитета ИИ. Модели постоянно меняются. Большинство предприятий уже используют несколько моделей одновременно и сменят предпочитаемого провайдера более чем один раз в течение следующих двух лет. Все, что вы создаете в расчете на то, что конкретная модель останется неизменной, является обесценивающимся активом.

Суверенный ИИ означает систему, которой вы владеете и которая работает независимо от того, какая модель лежит в ее основе. Предприятию должен принадлежать верхний уровень: институциональная память, проприетарный контекст, разрешения, рабочие процессы, инструкции для агентов, бизнес-логика, интеграции, критерии оценки и история аудита. В заключение я задам вам вопрос, который поможет свести все к самому необходимому: можем ли мы для каждого запускаемого нами агента сформулировать в одном предложении, что он может читать, что он может менять, что он может делать без разрешения и что мы потеряем, если переключимся на другую модель в следующем квартале? Узнайте больше и протестируйте демоверсию здесь

О чём эта статья

Что-то непонятно? Спросите по статье — объясню простыми словами.

Не хотите разбираться сами? Мы поможем.