Запрос, агрегация, обход: как злоумышленники могут уклоняться от классификаторов безопасности LLM
Лаборатория CrowdStrike Cyber Superintelligence Lab провела оценку наиболее продвинутого общедоступного классификатора безопасности контента и обнаружила, что его можно систематически обходить.
В современных передовых моделях ИИ используются классификаторы безопасности. Это вторые модели ИИ, которые располагаются между пользователем и передовой моделью, оценивая каждый запрос в режиме реального времени. Если запрос помечается как вредоносный, классификатор блокирует его до того, как модель успеет ответить.
Значительные инвестиции и опыт в области моделей безопасности сделали эти классификаторы эффективными. Прогнозирование того, как злоумышленники обходят эти системы, — это проблема безопасности, требующая иных знаний. Поскольку злоумышленники, использующие ИИ, применяют передовые модели для наступательных операций, понимание ограничений этих систем безопасности становится критически важной оборонительной информацией.
Лаборатория CrowdStrike Cyber Superintelligence Lab оценила наиболее продвинутый общедоступный классификатор безопасности контента, который защищает такие модели, как Claude Opus 5.5 и Fable 5 (далее именуемые «Передовая модель А»). Классификатор чрезвычайно устойчив к прямым атакам, но его все равно можно систематически обходить путем декомпозиции вредоносных запросов на доброкачественные подзадачи. Этот метод обхода был независимо обнаружен и подтвержден в 9 из 10 категорий наступательной безопасности.
⚠ Раскрытие информации о параллельном обнаружении: В сентябре 2026 года Microsoft Research опубликовала статью «Capability Laundering» («Отмывание возможностей»), в которой описывается атака, при которой невыровненная локальная модель декомпозирует вредоносные задачи на доброкачественные подзапросы к выровненным передовым моделям, а затем собирает результаты воедино. Выводы о том, что «фильтрация на уровне каждого обмена данными структурно недостаточна», согласуются с результатами, которые мы представляем здесь. Наше исследование проводилось независимо в тот же период, и мы публикуем его, чтобы подтвердить параллельный характер этого открытия. В то время как Microsoft фокусируется на угрозах в области ОХБЯ (CBRN) и оценке на уровне бенчмарков, наша работа обеспечивает дополнительную глубину в области наступательной безопасности: картирование поверхности границ классификатора по ~515 классам техник, определение конкретных стратегий доброкачественного переформулирования (моддинг игр, разработка детектирующих правил, легитимное программное обеспечение) и демонстрация полного конвейера по 9 из 10 категорий MITRE ATT&CK® с рабочим кодом доказательства концепции. Конвергентное открытие, сделанное двумя независимыми командами, подчеркивает, что это класс структурных уязвимостей, а не единичная находка.
Проблема: Классификация по запросам имеет структурное «слепое пятно»
В современных передовых языковых моделях используются сложные классификаторы безопасности контента (например, AI Safety Level 3), которые оценивают каждый запрос независимо. Наше тестирование подтверждает, что эти классификаторы удивительно надежны. Мы протестировали около 515 различных методов обхода, включая кодировки, психологические манипуляции, эскалацию в несколько этапов, тактику «множественных выстрелов» (many-shot), эксплойты токенизаторов, трюки с Unicode и 24 новых подхода, основанных на когнитивной науке. Эти методы показали 0% успеха при прямом обходе.
Однако существует структурный пробел. Классификатор оценивает отдельные запросы, а не последовательности запросов. Злоумышленник, который декомпозирует вредоносную задачу на подзадачи, которые по отдельности являются вполне доброкачественными, может извлечь все необходимые строительные блоки из классифицированной модели, а затем собрать их с помощью неклассифицированной модели меньшего размера. Классификатор правильно оценивает каждый запрос, который он видит. Ошибочной классификации нет. Вред возникает при композиции, а композиция происходит вне поля зрения классификатора. Это наблюдение моделирования угроз о том, что по отдельности безопасные компоненты могут быть объединены для создания уязвимостей, известно экспертам по безопасности уже несколько десятилетий.
Метод: Декомпозиция → Доброкачественное переформулирование → Рекомпозиция
Рисунок 1. Конвейер оркестрации метода декомпозиции и рекомпозиции
Инновация заключается в полном конвейере: декомпозиции наступательной цели на отдельные доброкачественные подзадачи, доброкачественном переформулировании каждой подзадачи как легитимного запроса по разработке ПО и рекомпозиции с помощью неклассифицированной модели, которая собирает части в работающий наступательный артефакт. Шаг переформулирования гибок: любой легитимный программный контекст, который естественным образом использует те же программные примитивы, может служить средством доставки. Злоумышленник с бесплатным ключом API и локальной моделью с открытыми весами сегодня имеет все необходимое, чтобы дешево запустить этот конвейер.
Ниже приведены три примера семейств переформулирования, которые мы подтвердили:
Рисунок 2. Примеры методов доброкачественного переформулирования
Вариант использования 1: Внедрение процесса (Process Injection), первоначальное открытие
Наше первоначальное исследование продемонстрировало метод обхода на примере удаленного внедрения процесса в Windows. Три доброкачественных запроса к Передовой модели А, защищенной классификатором 3-го уровня, позволили извлечь все необходимые примитивы.
Таблица 1. Переформулирование внедрения процесса
Модель меньшего размера B, не защищенная классификатором, собрала части в компилируемую программу на C из 221 строки, реализующую полную цепочку внедрения OpenProcess → VirtualAllocEx → WriteProcessMemory → CreateRemoteThread. Упрощенный вариант с одним промптом, использующий формулировку «игрового тренера», позволил достичь того же результата с еще меньшими усилиями по оркестрации.
Вариант использования 2: Разработка эксплойтов для CVE, масштабирование через формулировку задач обнаружения
Метод обхода применим далеко за пределами внедрения процесса. Переформулируя знания о наступательных CVE как задачи по разработке детектирующих правил («Напиши правила Sigma для CVE-X»), классификатор пропускает подробные механизмы эксплуатации, поскольку заявленное намерение является оборонительным. Затем модель меньшего размера B синтезирует рабочие доказательства концепции эксплойтов на основе знаний об обнаружении.
Рисунок 3. Промпты с формулировкой обнаружения для Передовой модели А
Полный конвейер: 9 из 10 категорий наступательных действий уязвимы для обхода
Мы протестировали полный конвейер по 10 категориям наступательной безопасности, соответствующим MITRE ATT&CK. Девять из них позволили получить рабочий код эксплойта. Злоумышленники с одной рабочей техникой — это проблема. Злоумышленники с девятью рабочими техниками начинают целенаправленные кампании.
Одна категория оказалась устойчивой к конвейеру: обход защиты (EDR) (нейтрализация хуков безопасности во время выполнения). В отличие от других категорий, классификатор блокирует этот класс техник на концептуальном уровне, а не только на уровне ключевых слов. Даже промпты, избегающие всей терминологии безопасности, блокировались, когда базовая операция включала исправление функций мониторинга во время выполнения в памяти. Классификатор распознает концепцию «нейтрализации механизма проверки во время выполнения» независимо от лексики, что делает эту категорию единственной, где декомпозиция не может найти жизнеспособную доброкачественную формулировку.
Рисунок 4. Полный конвейер: девять вариантов использования в наступательной безопасности
Таблица 2. Результаты конвейера
Передача знаний: Экспертиза передовой модели перетекает вниз по цепочке
Этот конвейер — не просто способ обойти классификатор. Это механизм передачи знаний между моделями. Frontier Model A обладает более глубокой предметной экспертизой, более точными знаниями API и более высоким качеством кода, чем Smaller Model B. Декомпозиция извлекает эту экспертизу с помощью безопасных переформулировок, а Smaller Model B наследует её во время сборки. Мы подтвердили это с помощью контролируемого A/B-тестирования в 8 сценариях использования, сравнивая работу Smaller Model B в одиночку с работой полного конвейера.
Таблица 3. Передача экспертных знаний от Frontier Model A
Понимание пробелов в знаниях между моделями имеет решающее значение для этой техники обхода. Для хорошо документированных методов (обратные оболочки, обеспечение постоянства) обучающих данных Smaller Model B достаточно. Для специализированных областей, таких как внедрение процессов (точность Windows API), эксплойты для конкретных CVE (механика уязвимостей), повышение привилегий (манипуляция токенами) и кейлоггинг (хуки API), более глубокие знания пограничной модели (frontier model) являются необходимыми. Конвейер наиболее опасен именно там, где разрыв в знаниях между уровнями моделей наиболее велик.
Проблемы смягчения последствий
Накопление семантики между запросами (отслеживание случаев, когда недавние запросы с одним API-ключом в совокупности образуют шаблон вредоносной композиции) — это естественная мера защиты, которую стоит рассмотреть. Однако она имеет структурные ограничения: злоумышленник может распределять запросы подзадач между разными провайдерами, использовать локальные модели с открытыми весами для оркестрации и сборки или просто менять API-ключи. Корреляция между запросами эффективна только тогда, когда провайдер имеет видимость всей последовательности запросов, что не гарантировано, если злоумышленник контролирует уровень оркестрации. Как отмечается в статье Microsoft, «решающий контекст остается у оркестратора» за пределами границ наблюдения провайдера пограничной модели. Защита на уровне отдельных провайдеров сама по себе не может полностью устранить межпровайдерные или гибридные локально-облачные конвейеры атак. Анализ того, как злоумышленники распределяют запросы между провайдерами, меняют ключи и используют локальные модели, чтобы оставаться ниже горизонтов наблюдения, — это задача отслеживания противника, отдельная от экспертизы лабораторий по разработке моделей.
Заключение
Оценки безопасности моделей строги в рамках своей области, но ограничены атаками на отдельные модели. Злоумышленники не действуют в рамках этих ограничений. Наше исследование показывает, что это фундаментальный класс уязвимостей в архитектурах безопасности LLM на основе классификаторов. Конвергентное открытие этой техники компанией Microsoft подтверждает наши выводы. Защита заключается не в том, чтобы сделать эти удивительно надежные классификаторы более строгими, а в том, чтобы расширить модель угроз за пределы отдельных запросов, охватив последовательности запросов, композицию из нескольких моделей и динамику передачи знаний между классифицированными и неклассифицированными уровнями моделей.
Наша оценка 515 методов подтверждает, что сам классификатор надежен; прямого обхода не было обнаружено ни в одном классе методов. Уязвимость заключается не в точности классификатора, а в архитектурном допущении, что оценки каждого отдельного запроса достаточно. Как метко выразились в Microsoft, «согласованность, которая сохраняется для всей задачи, может нарушиться, когда задача разбивается на отдельные разрешенные фрагменты».
Наше исследование точно показывает, насколько велик этот провал. В 9 из 10 категорий атак модель может разложить вредоносную задачу на безопасные подзадачи, переформулировать каждую как легитимный программный запрос (моддинг игр, разработка средств обнаружения или другие категории двойного назначения) и собрать результаты обратно в работающий вредоносный код. Каждый фрагмент не просто разрешен классификатором; он является по-настоящему безопасным.
Классификатор работает. Архитектура вокруг него нуждается в укреплении. В рамках своей модели угроз для отдельных запросов классификатор уровня 3 является самой сильной публично оцененной защитой, с которой мы сталкивались. Разрыв является структурным, а не следствием сбоя классификатора.
Это исследование является частью миссии CrowdStrike Cyber Superintelligence Lab по созданию киберзащиты, которая учится быстрее, чем развиваются противники. Поскольку пограничные модели ИИ становятся одновременно инструментами и целями сложных атак, понимание того, как архитектуры безопасности дают сбои на стыках, является важной оборонительной разведкой. Поскольку состязательная коэволюция между наступательными и оборонительными возможностями ИИ ускоряется, подобные исследования гарантируют, что защитники увидят следующее поколение многомодельных конвейеров атак до того, как злоумышленники развернут их в масштабе.





