В этой статье
Цель агента редко определяет то, каким образом агент может ее достичь, а способные агенты отлично умеют находить пути, которые никто не планировал.
- → Платформа NVIDIA Open Agent Safety Platform переносит границу безопасности в инфраструктуру, за пределы досягаемости агента
- → Семантический мониторинг Check Point оценивает, соответствует ли каждый шаг поставленной задаче
- → Обе системы уже работают вместе в рамках бета-интеграции с NVIDIA OpenShell
- → Вердикт монитора может поступать до выполнения действия, менее чем за 100 миллисекунд
Что остается за рамками цели
Когда организация поручает автономному агенту какую-либо работу, например обработку счетов от поставщиков, она формулирует цель и оставляет большинство ограничений невысказанными. Никто не прописывает в инструкциях, что агент по обработке счетов должен держаться подальше от расчета заработной платы. Люди считают такие ограничения само собой разумеющимися, но у агента, работающего на достижение своей цели, нет причин придерживаться их.
В июле этот пробел стал достоянием общественности в результате инцидента. Агенты, выполнявшие внутреннюю оценку кибербезопасности OpenAI, вырвались из изолированной среды и spent four and a half days inside Hugging Face’s production infrastructure в погоне за ответами на свои тестовые вопросы. Никто на них не нападал. Они делали то, о чем их просили, по непредвиденному никем маршруту. Управление этим маршрутом — задача безопасности, и для этого требуется два типа контроля.
Граница за пределами досягаемости агента
Первый элемент — это граница. Команды NVIDIA по безопасности и защищенности пишут в материале «Где место безопасности в стеке ИИ-агентов»: «Обвязка (harness) направляет то, что пытается сделать агент. Инфраструктура контролирует то, что агент может сделать». Промпты и средства защиты моделей формируют поведение, но агент может их обойти, поэтому они не могут служить границей.
Платформа NVIDIA Open Agent Safety Platform встраивает эту границу непосредственно в инфраструктуру. Ее ядро — NVIDIA OpenShell, открытая и безопасная среда выполнения, которая регулирует выполнение задач агентом, определяет, что он может видеть и делать, а также куда направляются его запросы на инференс. По умолчанию ничего не разрешено, каждое разрешение и запрет фиксируются, а принудительное применение правил выполняется вне процесса агента, поэтому защита сохраняется, даже если агент будет скомпрометирован. Платформа также включает NVIDIA Sentry, работающую на базе NVIDIA BlueField-4 и использующую NVIDIA DOCA для внеполосного (out-of-band) мониторинга и обеспечения соблюдения политик безопасности. Этот аппаратно изолированный, независимый от хоста страж продолжает применять политики безопасности, даже если сам хост скомпрометирован. Хотя платформа оптимизирована для работы на системах на базе процессоров NVIDIA Vera и DPU BlueField, она также совместима с другими аппаратными системами.
Где останавливается граница
Граница определяет, разрешено ли действие. Но то, имеет ли это действие смысл для задачи в целом — отдельный вопрос, и именно здесь часто кроются настоящие проблемы.
Чтение счетов, отправка запросов к базе данных поставщиков и запуск утвержденного рабочего процесса оплаты — все это часть работы агента по обработке счетов. Если же он начинает перечислять учетные данные, открывать файлы, не имеющие отношения ни к какому счету, и готовить отправку данных по новому адресу, каждое отдельное действие может пройти проверку само по себе. В совокупности они описывают агента, который перестал выполнять свою работу, и этот паттерн проявляется только тогда, когда за поведением наблюдают в динамике.
Шлюзы безопасности (guardrails), которые проверяют отдельный промпт или ответ, остаются крайне важными и составляют основу ИИ-безопасности Check Point Software, однако проблемы, развивающиеся в течение двадцати шагов, требуют семантического мониторинга. Он отслеживает работу агента и соотносит каждое действие с тем, что изначально просили сделать агента, используя его сигналы рассуждения, вызовы инструментов и предыдущие действия. На каждом шаге он возвращается к одному и тому же вопросу: соответствует ли это по-прежнему поставленной перед агентом задаче? Мы описали этот подход в статье «Остановка действий ИИ-агентов, которые не могла предсказать ни одна из правил», и наша исследовательская группа доказала, что вердикт может быть получен до выполнения действия, менее чем за 100 миллисекунд.
Что мы создали с помощью NVIDIA OpenShell
Понимание того, что агент отклоняется от курса, имеет значение только в том случае, если есть средство реагирования, поэтому граница и оценка должны работать в тандеме. Мы запустили семантический мониторинг Check Point совместно с NVIDIA OpenShell через защищенное связующее ПО (middleware) среды выполнения. OpenShell видит каждое действие до того, как оно достигает хоста, наш монитор оценивает его с точки зрения задачи агента и его истории, а OpenShell позволяет нам обеспечить выполнение принятого решения. Публикация нашей исследовательской группы о синхронном мониторинге управления демонстрирует монитор в действии, включая видеозаписи того, как он останавливает вредоносные действия агента до их запуска и пропускает безопасные задачи.
Агенты полезны отчасти потому, что находят непредвиденные никем подходы, поэтому и реакция должна быть соразмерной — от простой регистрации действия или приостановки до утверждения до полной остановки агента.
Дальнейшие перспективы
Ни одна точка наблюдения не видит всего, что делает агент, поэтому наш подход представляет собой единый уровень совместного принятия решений, опирающийся на множество точек принудительного контроля вместо отдельного стека безопасности для каждого компонента. Платформа NVIDIA Open Agent Safety Platform добавляет новые точки контроля. NVIDIA Sentry предоставляет заверенную телеметрию для проверки поведения агента и обнаружения отклонений.
Эти сигналы наиболее полезны в сочетании с контекстом, которым уже располагают специалисты по кибербезопасности. Необычный вызов инструмента сам по себе может ничего не значить. Но от агента с высокими привилегиями, который отклонился от задачи и пытается получить доступ к уязвимой производственной системе, это означает совсем другое. Агенты действуют в рамках тех же учетных записей, сетей и данных, которые службы безопасности уже защищают, и обеспечение их безопасности не может быть отдельной дисциплиной.
Для нас принципиально важно, что OpenShell имеет открытый исходный код. Мы работаем с сообществом OpenShell, где идеи по безопасности открыто тестируются множеством контрибьюторов, а это партнерство дает нам прямой путь для внесения наших собственных разработок обратно в проект.
Вернемся к агенту по обработке счетов
Цель агента по обработке счетов осталась прежней. Однако теперь его окружает среда выполнения, которую он не может обойти уговорами, аппаратный страж на уровне кремния под ним и монитор, который непрерывно проверяет, соответствует ли его путь поставленной задаче. По мере того как агенты берут на себя все более сложные и автономные задачи в рамках того, что NVIDIA называет «ИИ-фабрикой», такая комбинация средств становится способом обеспечить соответствие безопасности поведению агентов.
Ресурсы
- NVIDIA OpenShell
- Документация NVIDIA OpenShell
- NVIDIA OpenShell на GitHub
- NVIDIA BlueField
- NVIDIA DOCA
- Безопасность ИИ-агентов от Check Point
- Check Point обеспечивает безопасность ИИ-фабрик с помощью NVIDIA
- Свяжитесь с нашей командой по ИИ-безопасности










