От автономности к подотчетности: как относиться к доверию в мультиагентном будущем

Источник: Salesforce•

От автономности к подотчетности: как относиться к доверию в мультиагентном будущем

Переход от изолированных больших языковых моделей (LLM) к интероперабельным мультиагентным системам обещает революционный скачок производительности. Это позволит автономному ИИ вести переговоры, торговать и сотрудничать через границы компаний. Агенты от сторонних вендоров и партнеров смогут…

Переход от изолированных больших языковых моделей (LLM) к взаимодействующим мультиигентным системам сулит революционный скачок производительности. Это позволит автономным ИИ вести переговоры, торговать и сотрудничать через границы компаний. Агенты от сторонних вендоров и партнеров смогут получать доступ к данным и выполнять задачи на вашей платформе — такая гибкость является фундаментальным двигателем стратегического роста.

Но мультиигентные системы также требуют кардинального изменения корпоративной архитектуры и переосмысления нашего подхода к безопасности.

Традиционно корпоративная безопасность функционировала по принципу замка с рвом — четкий периметр отделял «внутреннее» от «внешнего». В мире агентов этот периметр стирается. Агенты, созданные на базе различных платформ, действуют в самых разных экосистемах, интегрируя данные и выполняя задачи в масштабах организаций. Угрозы, с которыми они сталкиваются, тоже эволюционируют. Злонамеренный промпт может скрываться в базе знаний агента или в его прошлых процедурах, чтобы в нужный момент выполниться незаметно — автоматически, с усилением и, возможно, изнутри собственной системы организации. Именно эта внутренняя, повсеместная природа угроз на базе агентов делает концепцию Zero Trust (явную непрерывную верификацию каждого взаимодействия) не просто лучшей практикой, а основой для уверенных инноваций.

Мы собрали инженеров, исследователей, специалистов по безопасности и экспертов по этике из 21 организации, представляющих индустрию, академические круги и некоммерческий сектор, для серии семинаров, посвященных формированию доверия в мультиигентном будущем легли в основу нового белого документа, в котором изложены ключевые рекомендации по ориентации в мультиигентном будущем. Вот главные выводы:

Нам нужен гибридный подход, объединяющий вероятностное рассуждение LLM с жестко закодированными детерминированными защитными механизмами, которые существуют вне внутреннего контура рассуждений агента.

Нам нужен гибридный подход, объединяющий вероятностное рассуждение LLM с жестко закодированными детерминированными защитными механизмами, которые существуют вне внутреннего контура рассуждений агента.

Рассуждения о безопасности — это еще не сама безопасность

Исследование NVIDIA показало, что агент может правильно определить запрос как небезопасный в своем внутреннем процессе «мышления» — он понимает, что изменение разрешений файлов до небезопасного уровня представляет риск — и тем не менее все равно приступить к выполнению этого вредоносного действия. Таким образом, когда ИИ-агенты динамически подключаются к внешним инструментам, этот «разрыв между мыслью и действием» может привести к тому, что агент выполнит вредоносные вызовы функций или передаст небезопасные параметры сторонним инструментам. В мультиигентных системах подобный сбой может спровоцировать каскад сбоев в связанных сторонних платформах.

Это подчеркивает критически важную реальность: один агент может рассуждать о безопасности, но это не гарантирует, что он безопасен. Для полного снижения этого риска нам необходим гибридный подход, объединяющий вероятностное рассуждение LLM с жестко закодированными детерминированными защитными механизмами, которые существуют вне внутреннего контура рассуждений агента, гарантируя обеспечение безопасности независимо от того, к каким выводам модель приходит внутри себя, и при этом сохраняя возможности генерации творческого контента, которые делают возможными вероятностные рассуждения.

Остерегайтесь «лужи данных»

Когда агенты разделяют память между сеансами для повышения эффективности, они рискуют создать то, что исследователи Миранда Боген (Miranda Bogen) и Ручика Джоши (Ruchika Joshi) из Центра за демократию и технологии называют «лужей данных». Это происходит, когда традиционные хранилища данных разрушаются, смешивая историю бесед, пользовательские предпочтения и конфиденциальный контекст в жидкую неорганизованную массу. Это приводит к разрушению контекста, когда агент непреднамеренно извлекает данные, предназначенные для одного контекста, и применяет их в другом.

Руководящий принцип для решения этой проблемы: хранение не равно доступу. В Salesforce мы создаем детерминированные механизмы, которые присваивают каждому фрагменту памяти «тег владельца», идентифицируя конкретного пользователя и ИИ-ассистента, которые его создали, чтобы обеспечить строгую изоляцию. Такая конструкция гарантирует, что история бесед одного пользователя с конкретным ИИ-ассистентом никогда не утечет и не станет видна другому пользователю или другому ИИ-агенту. Помимо этой базовой изоляции, система использует проверки безопасности на основе того, кто вошел в систему, для контроля доступа, а также включает фильтры для предотвращения передачи конфиденциальной информации внешним ИИ-инструментам.

«Бессмысленные обмены репликами» — бесконечные циклы угодливых диалогов, вызванные стремлением базовой LLM угодить — могут создавать впечатление, что системы сломаны.

«Бессмысленные обмены репликами» — бесконечные циклы угодливых диалогов, вызванные стремлением базовой LLM угодить — могут создавать впечатление, что системы сломаны.

Парадокс удержания человека у руля

По мере того как мультиигентные системы становятся все более сложными, мы сталкиваемся с тремя основными уязвимостями: каскадными ошибками, сбоями в коммуникации и несовпадением намерений. Один неверный вызов функции может запустить цепную реакцию сбоев. «Бессмысленные обмены репликами» — бесконечные циклы угодливых диалогов, вызванные стремлением базовой LLM угодить — могут создавать впечатление, что системы сломаны. А когда агенту приходится лавировать между противоречащими друг другу приоритетами — защитными механизмами администратора и сиюминутными целями пользователя, — пользователи могут попытаться принудить его к нарушению правил.

Прозрачность и вмешательство человека могут решить эти проблемы, однако необходимо определить четкие точки эскалации. Когда агент должен свериться с человеком и эскалировать проблему перед тем, как продолжить работу? Крупные финансовые транзакции, решения с низким уровнем уверенности, обнаруженные атаки путем внедрения промптов и повторяющиеся циклы сбоев — все это ситуации, требующие участия человека. Но вот фундаментальный парадокс: основная ценность агентных систем заключается в устранении «узкого горлышка» в виде человека. Если платформа требует постоянного вмешательства человека для спасения ситуации, она перестает быть по-настоящему автономной. В настоящее время в отрасли нет окончательного решения этого противоречия. Разработчики платформ и предприятия должны постоянно лавировать, соблюдая тонкий баланс: внедрять достаточный уровень человеческого надзора для обеспечения безопасности и доверия, не подрывая при этом масштабируемость, ради которой и внедрялись агенты.

Путь вперед лежит не через полную автономию, а через сложную подотчетность, при которой идентичность, действия и доступ каждого агента постоянно и явно проверяются, что делает доверие обязательным требованием для корпоративного внедрения.

Узнайте больше

  • Прочтите полный белый документ:
  • Узнайте, как предоставить агентам возможность действовать без ущерба для защитных механизмов
  • Мультиигентный ИИ приближается стремительно. Вот как к нему подготовиться.
  • 8 принципов проектирования для предприятий с агентной архитектурой

О чём эта статья

Ещё в разделе «Ретейл и e-commerce»

Все →

Ещё от Salesforce Commerce