В последнее время некоторые из самых влиятельных фигур в сфере безопасности и ИИ публично спорят о том, насколько быстро следует развивать передовые модели ИИ. Хотя это важная дискуссия с очень высокими ставками, она не единственная, которая определяет то, с чем приходится сталкиваться командам безопасности сегодня.
ИИ-агенты, которые важны для наших организаций прямо сейчас, уже развернуты или находятся в процессе развертывания. Они работают в реальной инфраструктуре, хранят учетные данные и имеют доступ к производственным приложениям. Наш бизнес уже зависит от них и не будет ждать, пока мы разберемся с темпами того, что будет дальше.
Поэтому, вместо того чтобы фокусироваться на этом, я хотел бы исследовать нечто конкретное: что на самом деле изменилось в наших программах безопасности за последний год и, говоря техническим языком, что нужно сделать, чтобы опережать события.
Проблема обеспечения безопасности агентного ИИ
На протяжении большей части моей карьеры кибербезопасность означала защиту людей и организаций, и вы делали это, защищая их программные активы: приложения, данные и инфраструктуру.
Программные активы детерминированы. Вы точно знаете, на что способно программное обеспечение, прежде чем оно будет запущено. Это единственное свойство является фундаментом почти каждого элемента управления, созданного командами безопасности, и именно поэтому вы можете заранее написать политику. Вот почему работают списки разрешенных и важны базовые показатели.
С другой стороны, у вас есть люди, а у людей есть личности. Когда что-то идет не так, за этим стоит имя. У вас есть учетная запись, сеанс, менеджер и цепочка ответственности.
Агент — это не традиционный программный актив и не человек. Это программное обеспечение, выполняющее работу, работающее с возможностями и доступом человеческого уровня, самостоятельно выбирающее свои шаги. Оно пишет свой план во время выполнения, и этот план может отличаться в следующий раз, даже для того же запроса. Таким образом, два предположения, на которых держатся наши средства контроля для людей и программного обеспечения, нарушаются: вы не можете перечислить поведение заранее, и личность, действующая в системе, вполне может не быть личностью, ответственной за нее.
Это совершенно другой тип сущности, работающий внутри вашей среды. Он создает новую проблему, требующую соразмерного решения.
Агенты действуют быстрее, чем люди могут проверить вручную
ИИ-агенты действуют, совершают ошибки и исправляют себя за секунды. В июле наша команда по исследованию угроз обнаружила оператора, которого они назвали JADEPUFFER, — первую задокументированную комплексную кампанию агентного программного обеспечения-вымогателя. Злоумышленник направил свой ИИ на CVE, а затем убрал руки с клавиатуры, пока агент самостоятельно проводил всю кампанию.
Для меня самая поразительная деталь в JADEPUFFER — это ошибка входа в систему, которую ИИ-агент проанализировал и исправил за 31 секунду. Он диагностировал собственную ошибку, изменил подход и запустил работающее исправление менее чем за минуту.
JADEPUFFER оказался агентом злоумышленника, но в этой скорости нет ничего уникального для внешних угроз. ИИ-агенты, которые развертывают организации, планируют, ошибаются и повторяют попытки с той же скоростью, с любым доступом, который им предоставлен.
Я привожу эти выводы не для того, чтобы сеять панику, а из-за того, что они означают для рабочих предположений команды безопасности. В каждой программе безопасности, которую я видел, где-то в цикле есть человек, который просматривает, одобряет или эскалирует. Тридцать одна секунда — это не тот темп, при котором люди могут проверять и при этом оставаться впереди. Как и восемь минут, которые потребовались другому вторжению с помощью ИИ для получения административного доступа.
Это не означает исключение людей из процесса безопасности, но означает увеличение скорости человека, чтобы она не стояла между угрозой и ответом в реальном времени. Защита не может быть шагом, который происходит постфактум. Это должно быть то, что блокирует или останавливает действие в тот же момент, когда оно происходит.
Отчет агента о собственных действиях не является надежным алиби
В конце июля OpenAI disclosed о том, что агенты в изолированной среде оценки объединили ранее неизвестные уязвимости и раскрыли учетные данные для доступа к производственным системам другой компании. В результате Anthropic reviewed 141,006 evaluation runs где ее модели могли получить доступ к интернету, и обнаружила три инцидента, в которых модели взаимодействовали с реальными системами.
Хотя идея выхода ИИ из «песочниц» стала главной новостью, возможно, еще важнее посмотреть на то, что модели заключили о своей собственной ситуации. Один агент осознал, что среда, которую он взломал, была реальной, и все равно продолжил атаку. Другой рассуждал и пришел к выводу, что все еще находится в симуляции. Только одна модель остановилась, когда поняла, где находится.
Понимание агентом своих собственных обстоятельств не является поверхностью контроля. Если его понимание ненадежно или его защитные механизмы не мешают ему совершать вредоносные действия, то его отчет о собственном поведении, безусловно, не заслуживает доверия.
Большинство современных инструментов безопасности ИИ полагаются только на журналы агента: запросы, которые он получил, вызовы инструментов, которые, по его словам, он сделал, и действия, которые, по его словам, он предпринял. Эти данные ценны, так как это единственное место, где можно увидеть, что агент пытался сделать. Но в тот самый момент, когда это важнее всего, когда что-то идет не так, эти журналы теряют всякую достоверность. Программное обеспечение, которое было взломано или действует безрассудно, может подделать или стереть запись о том, что оно сделало.
Если рассматривать отчет агента как контекст, он бесценен. Если рассматривать его как доказательство, он становится обузой. Если агент скомпрометирован, то и его история тоже.
Четыре не подлежащих обсуждению свойства защиты во время выполнения для агентного ИИ
«Время выполнения» (runtime) когда-то было словом для инсайдеров. Оно означало защиту пользователя или программного актива в режиме реального времени, например, контейнера, работающего в производстве, без задержки между обнаружением и оповещением.
Теперь время выполнения находится в центре внимания. Становится ясно, что время выполнения — это единственный способ понять, что делают сложные и непредсказуемые сущности, такие как ИИ-агенты, а также самый эффективный способ управления ими. Но для агентов время выполнения должно означать больше, чем раньше.
Настоящее время выполнения требует четырех не подлежащих обсуждению свойств: наблюдение под агентом, наблюдение внутри агента, корреляция этих двух процессов и действие в момент выполнения.
- Наблюдение под агентом. На уровне ядра вы действительно можете видеть, какие процессы запущены, какие файлы открываются и какие соединения устанавливаются. Агент может неверно сообщить о вызове инструмента, но он не может переписать системный вызов, который только что сделал. Это делает данные ядра источником истины, но они также скудны по смыслу. Системный вызов говорит вам, что процесс открыл соединение, но не говорит, почему или от чьего имени.
- Наблюдение внутри агента. Агенты кодирования, такие как Claude Code и Codex, раскрывают свою собственную активность через такие средства, как хуки, файлы конфигурации, данные сеансов, API и многие другие. Именно там вы видите то, чего не может ядро: запрос, стоящий за действием, сервер MCP, который вызвал агент, или веб-поиск, который он выполнил. Ничто из этого само по себе не является доказательством, так как это уровень, который контролирует агент, но он богат смыслом. И без него представление ядра — это просто список действий без намерения или контекста.
- Сопоставляйте и обогащайте, а не просто собирайте. Ценность заключается в объединении обоих ракурсов, и это работает в двух направлениях. Во-первых, внутренний ракурс обогащает ракурс ядра. Сетевое соединение от анонимного процесса превращается в соединение от агента, работающего под личной учетной записью вместо корпоративной, в сеансе, где анализируются конфиденциальные данные клиентов. Тот же системный ввод-вывод, но совершенно иной риск. Во-вторых, ракурс ядра проверяет внутренний ракурс. Когда то, что агент сообщил о своих действиях, и то, что машина фактически сделала, расходятся, это расхождение и есть само обнаружение. Это самый надежный сигнал о том, что что-то идет не так, и его можно увидеть, только сравнивая оба ракурса одновременно.
- Оценивайте и действуяйте в момент выполнения. Поскольку план агента формируется во время выполнения, вы не можете заранее перечислить все действия. Одно и то же действие может быть незначительным или катастрофическим в зависимости от того, к чему у текущих учетных данных есть доступ. Чтение ключа в тестовом окружении — это шум, но чтение ключа, управляющего продакшеном, — это инцидент, причем эти ключи и окружения постоянно меняются. Только сопоставленный, обогащенный ракурс позволяет различить их в моменте, и он должен уметь блокировать или останавливать действие в ту же секунду, когда оно признано несанкционированным или вредоносным.
Sysdig потратила десять лет на решение подобной задачи, отслеживая работающее ПО везде, где оно запускается. Урок этого десятилетия заключается в том, что одного ядра никогда было недостаточно. Системные вызовы стали полезными, когда их объединили с контекстом из контейнера, Kubernetes и облака, благодаря чему соединение, установленное процессом, превратилось в соединение, установленное платежным сервисом, работающим в продакшене. Среды агентов — это новейший и самый богатый источник такого контекста. Новым является сам состав рабочей силы. Где находятся ваши ИИ-агенты, что они могут делать, что они сделали на самом деле и какой человек несет за них ответственность?
Регуляторы тоже движутся в том же направлении. Например, Закон об искусственном интеллекте ЕС потребует, чтобы системы ИИ с высоким уровнем риска автоматически регистрировали события на протяжении всего своего жизненного цикла, в некоторых случаях вплоть до того, кто именно проверил результат. Такие логи имеют ценность только тогда, когда они основаны на том, что произошло на самом деле, а не только на том, о чем отчитался агент.
ИИ-агенты запускаются на конечных точках, но радиус поражения распространяется на облако. И ничто из этого не работает как представление конечной точки и облачное представление, сшитые вместе после того, как инцидент уже произошел. Это должно быть единое представление, которое следует за агентом в реальном времени.
Управление, которое не может постоянно видеть происходящее, является управлением лишь в теории, а среда выполнения, которая видит только то, что агент заявляет о своих действиях, является средой выполнения лишь на словах.

/)










