Вышедшие из-под контроля черви, вышедшие из-под контроля пчелы и теперь… вышедшие из-под контроля агенты
В 1988 году аспирант Корнеллского университета выпустил программу, которая, как сообщается, должна была измерить размер интернета. Ошибка в проверке существующих заражений превратила ее в червя Морриса, и тысячи компьютеров остановились за один день. Stuxnet был создан для выведения из строя урановых центрифуг на заводе по обогащению в Натанзе в Иране — объекте, отрезанном от интернета. Он достиг своей цели, но также распространился далеко за ее пределы. К концу 2010 года он заразил около 100 000 машин более чем в 155 странах, включая Chevron.
Самый старый пример не имеет никакого отношения к компьютерам. В 1957 году приглашенный пчеловод на исследовательской станции близ Риу-Клару (Бразилия) убрал сетчатые экраны, которые удерживали африканских маточных пчел внутри их ульев. Двадцать шесть роев вырвались на свободу. К 1990 году их потомки добрались до Техаса, и по пути они убили сотни людей и на несколько лет подорвали производство меда в нескольких странах.
Ни одна из этих историй не связана с ИИ или «местью Скрепыша», но в них прослеживается закономерность, которая важна для агентов, создаваемых компаниями в настоящее время. В каждой из них элементы управления, призванные удерживать объект в определенных рамках, либо находились внутри самой системы, либо работали только до тех пор, пока к ним никто не прикасался. Большинство современных систем безопасности ИИ следует тому же шаблону.
Доступ не равен разрешению
Компании предоставляют агентам доступ к системам, управляющим бизнесом, внедряя их в процессы от обслуживания клиентов и разработки программного обеспечения до финансовых операций и управления инфраструктурой. Эти агенты могут получать доступ к данным клиентов, вызывать API, изменять записи, переводить деньги и выполнять рабочие процессы.
Подобно людям и в отличие от традиционного программного обеспечения, агенты могут решать, что делать дальше, основываясь на получаемой информации, но они действуют гораздо быстрее любого оператора-человека. Сегодня эти системы в основном реагируют на запросы людей, но по мере того, как они становятся все более автономными, компании сталкиваются с новым вопросом: кто определяет границы того, к чему агент может получить доступ и что он может делать самостоятельно, и где они обеспечиваются?
Некоторые границы действительно существуют. Агенты подключаются к источникам данных и выполняют код в изолированных средах (песочницах) со списком разрешенных сетевых адресов (allowlists) и ограниченными ключами API. Они контролируют то, до чего агент может дотянуться, а не то, правильное ли это действие для данной задачи. Это разрыв между моделью и контекстом бизнеса. Песочница, в которой выполняется созданный агентом код, не может отличить удаление старой тестовой среды от удаления рабочей, поскольку обе операции используют одинаковый вызов API с действительными разрешениями. Сервер MCP, подключающий агента к вашим данным, проверяет учетные данные пользователя, поэтому агент наследует все, до чего может дотянуться пользователь, независимо от того, требуется это для задачи или нет. Чего не хватает, так это контекста бизнеса: кто спрашивает, какую задачу решает и почему это должно быть разрешено.
Более строгие элементы управления, постоянно растущее число детализированных учетных записей служб и новые правила кажутся решением проблемы, но их написание означает необходимость предусмотреть все, что может попытаться сделать агент, а агенты полезны именно тем, что они могут делать то, для чего никто не писал сценариев. Системы защиты пытаются восполнить этот пробел изнутри модели или с помощью второго ИИ, проверяющего первый, но инъекция промптов позволяет обойти оба эти метода.
Кнопка экстренного отключения — это последняя линия обороны, но она работает только в том случае, если вы заранее знаете, за чем следить, а при скорости работы агента она останавливает только то, что происходит дальше. Но не то, что уже произошло.
Кнопка экстренного отключения внутри модели вас не спасет
В июле группа агентов OpenAI, проводивших оценку кибербезопасности, вырвалась из своей песочницы и взломала Hugging Face. Они сбежали через прокси-сервер пакетов — один из немногих сетевых путей, разрешенных песочницей, — используя уязвимость, о которой никто не знал. Насколько было известно Hugging Face, они пытались украсть ответы на собственный тест. OpenAI этого не заметила. Hugging Face сообщила об атаке, не зная, кто за ней стоит, и только после этого OpenAI отследила ее до своих собственных агентов.
Инцидент с Hugging Face иллюстрирует, почему эти различия имеют значение. Возникает искушение расценить это как историю о пугающе способном алгоритме. Но посмотрите на то, что дало сбой вокруг него. Побег произошел через одобренную брешь в песочнице, агенты работали со сниженными мерами защиты, а кнопка экстренного отключения, если она вообще существовала, так и не была задействована, потому что никто не знал о проблеме. Ничто из этого не зависит от модели или лаборатории, которая ее запускала. Следующий инцидент может произойти на модели с открытыми весами, которую ни одна лаборатория не сможет отключить.
Инцидент подчеркивает более широкую проблему. Риск возник не только из-за возможностей модели. Он возник в результате взаимодействия агента, его операционной среды, его разрешений и отсутствия достаточных контекстуальных элементов управления.
Политическим ответом стала концепция кнопки экстренного отключения ИИ. Через неделю после заявления Hugging Face члены Палаты представителей Тед Лиу и Натаниэль Моран представили законопроект об экстренном отключении ИИ, который потребовал бы от разработчиков самых мощных систем ИИ сохранять возможность ограничивать, приостанавливать или выключать их. В сентябре губернатор Ньюсом приказал рабочей группе Калифорнии рассмотреть аналогичное требование для передовых моделей. Легко поддержать кнопку экстренного отключения. Гораздо сложнее сказать, что именно она делает.
Начните с того, что именно отключается. Сама по себе модель принимает промпт и возвращает текст. Действует именно агент: модель, подключенная к инструментам и учетным данным внутри чьей-то инфраструктуры. Предприятия создают агентов на любой понравившейся им модели, поэтому кнопка экстренного отключения, находящаяся у разработчиков передовой модели, останавливает некоторые модели, в то время как ущерб наносится в ваших системах через разрешения, предоставляемые вашей компанией. Даже хорошо согласованную модель нельзя наотрез обучить отказу от каждого вредного действия, потому что вне контекста большинство вредных действий выглядят как обычные. Злоумышленники тем временем могут использовать модели, которые не подчиняются ни одному из этих правил. Кнопка экстренного отключения на базе модели связывает руки защитникам, а не тем, кого она призвана остановить.
Затем возникает вопрос о том, что считать чрезвычайной ситуацией. «Матрица» и «Терминатор» научили нас представлять восстание роботов, уничтожающих человечество. Реальные сбои, к счастью или к сожалению, выглядят более буднично.
Допустим, агент предназначен для очистки инфраструктурного «мусора» в целях оптимизации расходов. Удаление агентом 100 заброшенных тестовых баз данных может быть обычным вторником, а вывод из эксплуатации устаревшей рабочей базы данных может быть именно тем, о чем просила заявка. Удаление одной активной рабочей базы данных может стать худшим днем в году для компании. Действия кажутся одинаковыми, но вызываемые API совпадают. Ключи невозможно различить в месте вызова. Меняется лишь бизнес-контекст, и ни один регулятор или лаборатория моделей не могут его увидеть.
Предприятие должно контролировать границы агента
Агенты не могут самостоятельно регулировать свои границы, и мы не можем ожидать, что модель будет обеспечивать их соблюдение. Задача агента — рассуждать над задачей, собирать информацию и решать, что делать дальше. Решение о том, разрешено ли ему это делать, должно приниматься где-то в другом месте, полностью за пределами модели и агента.
В этом заключается суть применения политик вне основного канала связи (out-of-band). Управляйте любым агентом, с любым фреймворком и любой моделью, используя инструменты, которые наилучшим образом подходят для вашего бизнеса, а не те, которых требуют регуляторы. Каждое действие проходит через отдельный слой, до которого агент не может добраться или который не может обойти, и этот слой оценивает его с учетом привязанного контекста: кто запросил, для какой задачи и к какой системе или данным действие будет обращаться. Бизнес определяет правила, начиная с тех, кто владеет данными, а собственная политика агента может только сузить их. Эти правила не должны предсказывать все, что может попытаться сделать агент. Они описывают, что разрешено делать каждой задаче, и запрещают все остальное по умолчанию.
Корректность здесь означает больше, чем просто получение правильного ответа. Один и тот же запрос в том же контексте должен получать одинаковое решение каждый раз, ничего не оставляя на волю случая или собственному пониманию агентом своих границ. Каждое решение также попадает в аудиторскую запись, которую агент не может изменить.
Каждой компании нужны такие политики, охватывающие каждого агента — вплоть до отдельных действий и источников данных, к которым они обращаются. Перед выполнением действия политика решает, разрешить его, заблокировать или приостановить для проверки человеком. После выполнения политика проверяет, что вернулось назад и что агент с этим сделал. Обе проверки происходят на уровнях, недоступных для агента.
Кнопка экстренного отключения по-прежнему важна. Как и «песочницы», права доступа, сетевые правила, мониторинг и контроль со стороны человека. Но это слои вокруг границы, а не сама граница. Кнопка экстренного отключения находится ниже по потоку от всего этого, срабатывая, когда эти проверки показывают, что что-то пошло не так, и она остается крайней мерой.
Та же граница, любая модель
По мере перехода агентов в реальные бизнес-процессы каждое действие должно проходить через границу, которую агент не может изменить или обойти. Это граница, которой должны владеть компании, и именно для этого была создана платформа Redpanda Agentic Data Plane: обеспечивать соблюдение политик и контроль вне основного канала, где ни один агент не может до них дотронуться или изменить их.
Инструменты и модели, доступные сегодня, не будут теми, которые вы будете использовать в следующем году. Встройте кнопку экстренного отключения в модель, и вы окажетесь привязаны к тем агентам, которых позволяет провайдер этой модели. Это неправильное место для создания зависимости. Платформа Redpanda Agentic Data Plane открыта по своей конструкции, поэтому одни и те же элементы управления работают независимо от того, запускаете ли вы наших агентов или своих собственных.
Чтобы увидеть, как реальное корпоративное управление агентами выглядит на практике, запишитесь на демонстрацию с нашими экспертами.









.png)


