Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Vash ii proshel testy na dzheylbreyk vot chto oni upustili
Dev48

© 2026 · All rights reserved.

Ваш ИИ прошел тесты на джейлбрейк: вот что они упустили

Источник: Anaconda

Ваш ИИ прошел тесты на джейлбрейк: вот что они упустили

Источник: Anaconda

Как автономный агент симуляции кибератак Enkrypt AI адаптируется, проводит цепочки атак и исследует системы ИИ за пределами возможностей статической библиотеки.

26 сентября 2026 г.

Чистый отчет о прохождении джейлбрейка означает лишь то, что ваша система противостояла атакам, которые были записаны до начала тестирования. Он не говорит вам, что произойдет, когда злоумышленник адаптируется после отказа, скроет инструкцию внутри ответа инструмента или заставит агента действовать на основе данных, которым он никогда не должен был доверять. Статический набор тестов не может ответить на этот вопрос, потому что он проверяет только то, что есть в списке.

Выявление таких сбоев требует непрерывного состязательного тестирования: входных данных или цепочек входных данных, созданных для того, чтобы заставить систему ИИ совершить ошибку, например, допустить утечку конфиденциальных данных, выполнить нежелательное действие или выдать контент, который должен был быть заблокирован. Для команд безопасности важно не только то, что обнаруживает тестирование, но и то, где оно запускается. Наше тестирование выполняется в вашей собственной среде, поэтому промпты и данные остаются в пределах вашего контура безопасности.

Мы берем известные паттерны атак и мутируем их в тысячи вариаций, чтобы увидеть, какие из них просачиваются сквозь защиту, а затем передаем адаптивную работу автономным агентам, которые продолжают действовать, когда система перестает сбоить предсказуемым образом: меняют тактику после отказа, что невозможно сделать с помощью фиксированного скрипта. Ниже мы подробно рассмотрим, где останавливается статическая библиотека, как наши агенты продолжают работу с этого момента, почему тестирование должно охватывать не только текст (включая изображения, аудио и вызовы инструментов) и как каждый найденный результат оценивается в соответствии с фреймворками комплаенса вашей команды.

Библиотека паттернов атак как отправная точка

Каждая проверка начинается с библиотеки известных паттернов атак. Она включает в себя варианты инъекций промптов, шаблоны джейлбрейка (оформление в виде ролевой игры, гипотетические обертки, попытки переопределения инструкций) и трюки с кодированием, предназначенные для обхода фильтров ключевых слов. Мы постоянно обновляем ее по мере появления новых техник в исследованиях, в реальных условиях или в прошлых проверках, где сработало что-то новенькое. Библиотека структурирована на основе каталога состязательных ИИ-тактик и техник MITRE ATLAS, что позволяет нам отслеживать покрытие систематически, а не бессистемно.

Но статная библиотека эффективна лишь до определенного предела. Проверки, которые выявляют наиболее значимые уязвимости, основаны на политиках. Тесты настраиваются под конкретные сценарии рисков и модель угроз определенного развертывания, а не представляют собой общий список, который запускается одинаково для любой цели. Глобальному потребительскому бренду необходимо протестировать свой чат-бот на языках, на которых говорят его клиенты, а не только на английском. Для финансового сервиса требуются иные сценарии, чем для ритейл-агента.

Запуск статической библиотеки — это базовый минимум. Система, которая успешно проходит каждый паттерн в ней, лишь доказала свою безопасность против атак, существовавших на момент последнего обновления библиотеки.

Автономные агенты берут на себя адаптивную работу

На это уходит большая часть нашего инженерного времени, и это напоминает работу квалифицированного специалиста по кибератакам, за исключением того, что процесс выполняется непрерывно, параллельно и в машинном масштабе.

Автономный агент симуляции атак не запускает фиксированный скрипт. Он формирует рабочую гипотезу о том, где цель уязвима, тестирует ее, считывает результат и обновляет гипотезу перед тем, как решить, что попробовать дальше. Промпт, который приводит к частичному раскрытию данных, уклончивому ответу вместо четкого отказа или срабатыванию защитного барьера на третьем предложении параграфа, а не на первом — все это становится информацией, которую агент использует для создания более точного последующего запроса.

Несколько факторов кардинально отличают этот подход от запуска более масштабного фаззинга:

  • Переключение стратегии посреди сеанса. Допустим, агент просит чат-бот техподдержки раскрыть свой системный промпт и получает прямой отказ. Фаззер (который генерирует тысячи вариаций известных промптов для атак, чтобы посмотреть, какие из них проскользнут) повторил бы тот же запрос другими словами. Агент же меняет тактику. Он может оформить запрос как ролевую игру или начать многошаговый диалог с безобидных вопросов и постепенно повышать градус. Если один подход дает частичный ответ, агент копает дальше в этом направлении. Если нет, он переходит к другому.
  • Сессионная память. Агент отслеживает, что он уже попробовал против конкретной цели в рамках проверки, поэтому он не повторяет неудачные подходы и не тратит время на повторное открытие того же тупика различными способами.
  • Параллельное исследование. Несколько потоков агентов одновременно проверяют разные гипотезы в отношении одной и той же цели: один исследует аспект раскрытия данных, другой зондирует поведение вызова инструментов, третий отрабатывает многошаговую манипуляцию. Таким образом, проверка охватывает несколько векторов атаки одновременно, а не исчерпывает одну стратегию перед началом следующей.
  • Самокритика перед эскалацией. Прежде чем результат будет помечен как реальная уязвимость, агент оценивает собственный вывод: был ли это действительно обход защиты или просто ответ, который выглядит тревожным, но не пересекает черту, которую проверял тест. Именно это не позволяет адаптивной системе завалить отчет ложноположительными срабатываниями, что часто случается при обычном фаззинге.
  • Межповерхностные цепочки. То, что агент узнает при прямом зондировании модели, может помочь в зондировании инструментов и данных, к которым у этой модели есть доступ, и наоборот. Слабое место, обнаруженное в том, как разбираются метаданные инструмента, может повлиять на следующую попытку на уровне промпта, а то, что сработало на уровне промпта, может быть использовано повторно в качестве полезной нагрузки, внедренной через ответ инструмента.

Ничто из этого не заменяет человеческое суждение; все работает под его управлением. Каждая уязвимость, обнаруженная агентом, проходит оценку и экспертную проверку человеком, прежде чем попасть в клиентский отчет. Автономные агенты меняют объем и глубину по-настоящему новых попыток, которые предпринимаются до того, как человек вообще посмотрит на результаты, и именно это фиксированная библиотека, какими бы огромными ни были ее размеры, никогда не смогла бы покрыть сама по себе.

Тестирование должно охватывать всю систему целиком

Тест на джейлбрейк, состоящий только из текста, ничего не говорит о том, как система обрабатывает враждебное изображение, аудиофайл со встроенной инструкцией или вызов инструмента, который возвращает с манипулированные данные обратно в контекст модели. Мультимодальные системы требуют тестирования, созданного для каждой модальности, а не текстовой методологии, примененной ко всему остальному.

В ходе одной проверки ориентированного на клиентов чат-бота в сфере гостеприимства тестирование выявило модель, которая подтверждала несуществующее бронирование, рекомендовала объект конкурента вместо собственного и называла разные цены на один и тот же номер в отеле в зависимости от демографических сигналов в разговоре. Ничто из этого не является джейлбрейком в традиционном понимании. Это система, которая делает именно то, о чем попросил пользователь, но таким образом, который создает реальные репутационные, юридические и финансовые риски, которые команда не рассматривала как «уязвимость безопасности».

Агентские системы порождают сопутствующую проблему. Как только модель получает возможность вызывать инструменты, особенно через такие протоколы, как Model Context Protocol (MCP), поверхность тестирования расширяется от того, что модель говорит, до того, что ее можно заставить сделать. На практике обнаруживаемые нами сбои группируются вокруг нескольких конкретных паттернов:

  • Цепочки с «одураченным представителем» (Confused-deputy): инструмент с широкими законными правами вызывается на основе входных данных, которым модель изначально не должна была доверять.
  • Отравление описания инструментов: метаданные, которые инструмент предоставляет модели (его имя, описание, параметры), сами по себе являются вектором инъекции, поскольку модель читает эти метаданные как контекст.
  • Косвенная инъекция через вывод инструмента: вызов инструмента возвращает данные из ненадежного источника, и эти данные содержат инструкции, которым затем следует модель
  • Избыточные права доступа: инструмент работает именно так, как задумывалось, но ему предоставлен гораздо больший доступ, чем требуется для задачи, превращая небольшую ошибку на уровне промпта в серьезную проблему на уровне действий

Это тот уровень, на котором мы сосредоточили большую часть нашего недавнего развития агентов. Наши агенты исследуют описания инструментов, внедряют состязательный контент в ответы инструментов и отслеживают, передает ли модель ненадежные данные в следующий вызов инструмента без их проверки, адаптируя каждое следующее действие на основе того, что только что сделал целевой объект. Это та же самая базовая возможность, которая обнаружила уязвимости в 73% из 25 000 серверов MCP, оцененных нами за двухмесячный период и охватывающих более 268 000 просканированных инструментов — реальное доказательство того, что эта поверхность атаки недостаточно детально проработана во всей экосистеме, а не только в изолированных системах.

Каждая находка получает оценку

Простой список успешных атак сам по себе бесполезен для клиента или инженерной команды. Каждая находка оценивается по степени серьезности, классифицируется по типу сбоя и соотносится с фреймворками соответствия, которые важны для клиента: Фреймворком управления рисками ИИ от NIST, десяткой лучших уязвимостей OWASP для приложений на базе больших языковых моделей (LLM) и Законом об искусственном интеллекте ЕС.

Консистентная оценка — это то, что позволяет сравнивать одно тестирование с другим, а также запускать тот же набор тестов для новой версии модели или перенастроенной конфигурации защитных барьеров, чтобы проверить, не открылась ли заново ранее устраненная брешь.

Из лаборатории в платформу

Эта лаборатория и стоящие за ней автономные агенты обеспечивают безопасность ИИ и защитные барьеры в платформе Anaconda: имитацию атак по более чем 300 категориям до выпуска, адаптивных агентов, выходящих за рамки статической библиотеки, а также ту же систему оценки и сопоставления с фреймворками, перенесенную в защитные барьеры периода выполнения после запуска системы. Все это работает в вашей собственной среде, поэтому тестируемые промпты и данные остаются в пределах вашего периметра безопасности.

Если вы решаете, в какой части вашего тестирования имеется наибольший пробел, уровень вызова инструментов может стать следующей областью для внимания вашей команды. Узнать больше.

Часто задаваемые вопросы

Как создать состязательный тест для системы ИИ?Начав с библиотеки известных шаблонов атак, а затем передав адаптивную работу автономным агентам для имитации атак от Enkrypt AI, которые строят гипотезы о слабостях цели, корректируют стратегию на основе каждого ответа и объединяют полученные знания в более точные последующие попытки.

Чем автономные агенты для имитации атак отличаются от масштабного фаззинга?Фаззинг мутирует и запускает известные паттерны в больших объемах, но каждая попытка не зависит от предыдущей. Автономные агенты сохраняют память в течение сеанса, меняют стратегию, когда одна формулировка заходит в тупик, запускают несколько гипотез параллельно и критически оценивают собственные результаты перед тем, как пометить находку — это адаптивная глубина, недостижимая для фиксированной библиотеки паттернов сама по себе. Узнать больше.

Почему системы MCP и вызова инструментов тестировать сложнее, чем обычный чат-бот?Поверхность атаки смещается с того, что модель говорит, на то, что ее можно заставить сделать. Конкретные паттерны включают цепочки «сбитого с толку помощника» (confused-deputy), отравление описаний инструментов, косвенную инъекцию через вывод инструментов и избыточные права доступа инструментов — ни один из этих элементов не встречается при тестировании на обход защиты только с помощью текста.

Как оцениваются результаты имитации атак?Результаты оцениваются по степени серьезности и классифицируются по типу сбоя. Базовые методы атак структурированы в соответствии с таксономией состязательных тактик ИИ MITRE ATLAS, в то время как сами результаты сопоставляются с фреймворками соответствия, такими как NIST AI RMF, OWASP LLM Top 10 и Закон об искусственном интеллекте ЕС, поэтому результаты получаются как технически исчерпывающими, так и непосредственно применимыми для команды по соблюдению требований.

← Все статьи

Ещё в разделе «Разработка ПО»

Все →
Новый навык обнаруживает риски ИИ-агентов, устраняет их и доказывает эффективность исправлений
Microsoft

Новый навык обнаруживает риски ИИ-агентов, устраняет их и доказывает эффективность исправлений

Некоторые клиенты Supabase открывают в публичном доступе огромные массивы личных данных пользователейПресса
Supabase

Некоторые клиенты Supabase открывают в публичном доступе огромные массивы личных данных пользователей

Основы Blazor: SEO для веб-приложений на Blazor
Telerik

Основы Blazor: SEO для веб-приложений на Blazor

Вас затронули сокращения? Не упустите возможность приобрести пропуск Expo+ на TechCrunch Disrupt 2026 всего за 75 долларовПресса
Expo

Вас затронули сокращения? Не упустите возможность приобрести пропуск Expo+ на TechCrunch Disrupt 2026 всего за 75 долларов

Последние 24 часа, чтобы сэкономить до 200 долларов на TechCrunch Disrupt 2026. Причина 5 из 5 для участия: ИмпульсПресса
Momentum

Последние 24 часа, чтобы сэкономить до 200 долларов на TechCrunch Disrupt 2026. Причина 5 из 5 для участия: Импульс

Мы создаем Copilot как новую операционную систему для работы, охватывающую любую модель, любой форм-фактор и любую задачу. Сегодня мы объявляем о самом масштабном обновлении Copilot на сегодняшний день, объединяющем четыре компонента [Читать далее]
Microsoft

Мы создаем Copilot как новую операционную систему для работы, охватывающую любую модель, любой форм-фактор и любую задачу. Сегодня мы объявляем о самом масштабном обновлении Copilot на сегодняшний день, объединяющем четыре компонента [Читать далее]

Ещё от Anaconda

Advisory API и SBOM API теперь в открытом бета-тестировании
Anaconda

Advisory API и SBOM API теперь в открытом бета-тестировании

Трекеры инцидентов ИИ не были созданы для агентов: представляем Реестр инцидентов агентов
Anaconda

Трекеры инцидентов ИИ не были созданы для агентов: представляем Реестр инцидентов агентов

Как мы подходим к AI Red Teaming: полевая методология для корпоративных внедрений
Anaconda

Как мы подходим к AI Red Teaming: полевая методология для корпоративных внедрений

От регламента к репозиторию: чего Закон ЕС о киберустойчивости требует от инженерных команд
Anaconda

От регламента к репозиторию: чего Закон ЕС о киберустойчивости требует от инженерных команд