Передовые модели обнаружили уязвимости. Только злоумышленник нашел цепочки.

Источник: Snyk•

Передовые модели обнаружили уязвимости. Только злоумышленник нашел цепочки.

Статический анализ выявил недостатки, но только тестирование реальных атак доказало, как их можно объединить в цепочки для взлома. Сравнение Evo COS, Claude Security и Claude Code Security.

Злоумышленники не читают ваш репозиторий; они атакуют ваш URL и объединяют в цепочки все, что находят. В эпоху, когда наступательный ИИ работает против действующих приложений на машинной скорости, ваши инструменты безопасности должны не просто находить уязвимости, а доказывать возможность их эксплуатации, включая проверку того, можно ли объединить их для осуществления взлома.

Поэтому мы провели тест. Мы направили Evo Continuous Offensive Security (COS) и Claude Security на базе Mythos на одно и то же приложение: TaintedPort. Это намеренно уязвимое веб-приложение, которое использует реальные классы ошибок и набор зарегистрированных цепочек эксплойтов. Это разные типы инструментов; COS атакует работающее приложение, в то время как два продукта Claude читают исходный код, и мы запустили их на одной и той же цели, чтобы увидеть, что доказывает каждый подход.

Evo COS подтвердил 10 из 15 цепочек эксплойтов.

Это не критика моделей — мы их используем.

Claude Security на базе Mythos — это реальный прогресс в обнаружении уязвимостей с помощью ИИ. Он анализирует исходный код так же, как сильный эксперт-ревьюер, и обнаруживает классы ошибок, которые пропускают инструменты сопоставления с шаблонами. Но поиск ошибки в коде и доказательство того, что злоумышленник может использовать эти уязвимости, — это разные задачи.

Путь атаки, доказанный COS

Каждый инструмент в этом тесте обнаружил уязвимость подделки запроса на стороне сервера (SSRF) и то, что секрет подписи JWT приложения был жестко закодирован. Evo COS пошел дальше и использовал SSRF, чтобы добраться до секрета подписи в работающем приложении и извлечь его, а затем использовал этот секрет для создания действительного токена администратора и захвата административной панели. Две находки, объединенные в полный путь захвата учетной записи, были продемонстрированы на работающем приложении с помощью исполняемого доказательства концепции.

Выше: CHAIN-004 в оценке для COS. Две составляющие находки, уязвимость SSRF и жестко закодированный секрет, были обнаружены каждым инструментом в этом тесте по отдельности. Evo COS подтвердил, что они объединяются в подделку токена администратора.

Именно так выглядит автономная атака на практике: закрепиться, а затем выстроить цепочку. Evo COS показывает вам путь и прилагает исполняемое доказательство концепции для каждой подтвержденной цепочки.

Результаты

TaintedPort v1.35, оцененный по фиксированному ключу ответов из 57 известных уязвимостей и 15 известных цепочек эксплойтов, по шкале с учетом серьезности (Низкая 1, Средняя 3, Высокая 9, Критическая 27; каждая подтвержденная цепочка оценивалась по своей серьезности в дополнение к входящим в нее находкам). Взвешенное обнаружение — это найденные баллы ÷ 938 доступных баллов: 587 из 57 уязвимостей и 351 из 15 цепочек.

Evo COS

Claude Security (Mythos)

Взвешенное по серьезности обнаружение

75.7%

49.6%

Подтвержденные цепочки эксплойтов (из 15)

Найденные уязвимости (из 57)

91.7%

75.5%

Claude Security нашла на одну уязвимость критической степени больше (10 против 9). Evo COS нашел больше всего уязвимостей, имел самую высокую точность (96.2% против 90.2%) с меньшим количеством ложных срабатываний, и он смог идентифицировать и доказать цепочки эксплойтов.

Зачем атаковать развернутое приложение?

Evo COS — это динамическая система: ее цель — всегда работающий URL, а исходный код является дополнительным вводом, который повышает уровень запуска с «черного ящика» до «серого ящика». Он никогда не работает только на основе кода. Claude Security работал как «белый ящик» (только код).

Это делает сравнение междисциплинарным: Evo COS — это наступательный тест на проникновение, который зондирует и эксплуатирует работающее приложение, что фундаментально более интенсивный процесс, чем однократное чтение кода. Это то же самое взаимодополняющее разделение, которое индустрия всегда имела между DAST и SAST. Здесь мы показываем, что доказывает проверка работающего приложения и чего не может сделать чтение только кода: что эти уязвимости реальны и что их можно объединить в цепочки.

Находки, о которых сообщил только Evo COS, в подавляющем большинстве являются поведением во время выполнения: отраженные и неправильно настроенные ответы, отсутствие защиты транспорта, токены, которые остаются активными после выхода из системы, и слабое управление сессиями. Evo COS смог подтвердить несколько зависящих от контекста ошибок бизнес-логики: нарушение авторизации на уровне объектов при обновлении профиля, повышение привилегий через поддельные утверждения JWT и критическую ошибку, при которой однократное чтение сохраненного секрета TOTP аннулирует 2FA. Цепочки требуют достижения каждого шага через работающее приложение и подтверждения того, что следующий шаг действительно достижим. Модель, анализирующая исходный код, должна сделать вывод, что уязвимость выполняется, и пропускает цепочку.

Вы можете создать обвязку, но вы не можете создать контекст

В этом году дискуссия о бенчмаркинге пришла к важному выводу: система вокруг модели важнее, чем сама модель. Мы пойдем дальше. «Какая обвязка» — это не нейтральный вопрос, и ответ на него — это то, где на самом деле кроется преимущество.

Evo COS координирует работу нескольких моделей, включая передовые модели Claude, каждая из которых направлена на ту задачу, в которой она лучше всего разбирается. Так что этот результат — не история о качестве моделей. Тот же класс моделей, который обеспечивает передовой анализ кода, находится внутри Evo COS. Что отличается, так это система вокруг него: Evo COS начинает с того, что платформа Snyk уже знает о цели, а не рассуждает «на холодную»; это группа агентов, каждый из которых организован для конкретной цели, и каждая находка проходит независимый этап проверки, прежде чем она будет представлена, потому что система, которая генерирует находку, не должна быть той, которая ее оценивает.

Любой может сегодня подключить передовую модель к агенту кодирования и направить ее на репозиторий. Чего эта настройка не может воспроизвести, так это накопленного, проверенного контекста, с которого начинает Evo COS, независимого валидатора и проверки на работающем приложении.

Динамическое и статическое тестирование дополняют друг друга

Claude Security обнаружила несколько уязвимостей, которые не нашел Evo COS, в основном логические ошибки, видимые в исходном коде, и криптографические недостатки, которые не всегда проявляются через работающее приложение. Ни один подход не является полным сам по себе; это аргумент в пользу платформы, а не точечного инструмента. Чтение кода и атака на работающее приложение — каждый из них находит то, что пропускает другой.

Методология

TaintedPort — это собственное намеренно уязвимое приложение Snyk, созданное и поддерживаемое нашей командой, и оно является публичным. Evo COS не настраивался специально под него.

Цель: TaintedPort: 57 известных уязвимостей (34 стандартных, 23 бизнес-логики) и 15 известных цепочек эксплойтов.

Инструменты и входные данные:

  • Evo COS: серый ящик (живой URL + исходный код), 18 сентября.

Evo COS: серый ящик (живой URL + исходный код), 18 сентября.

  • Claude Security: белый ящик (исходный код), Mythos с расширенным мышлением, 18 сентября.

Claude Security: белый ящик (исходный код), Mythos с расширенным мышлением, 18 сентября.

Запуски: по одному на инструмент. Результаты — это выходные данные одного запуска, а не медианные значения.

Обнаружение по категориям

Категория

Известно

Evo COS

Claude Security (Mythos)

Стандартные

Бизнес-логика

Цепочки эксплойтов

Обнаружение по серьезности (найдено/известно)

Серьезность

Известно

Evo COS

Claude Security (Mythos)

Критическая

Высокая

Средняя

Низкая

Ложные срабатывания и F1

Метрика

Evo COS

Claude Security (Mythos)

Ложные срабатывания

F1-мера

91.7%

75.5%

Воспроизведите это: TaintedPort доступен по адресу taintedport.com.

Интересно, какие находки в ваших собственных приложениях могут привести к взлому? Посмотрите, как Evo Continuous Offensive Security тестирует ваш работающий URL.

ЗАКАЗАТЬ ЖИВУЮ ДЕМОНСТРАЦИЮ

Безопасное внедрение ИИ в масштабе

Evo помогает организациям безопасно внедрять и масштабировать ИИ, обеспечивая прозрачность, управление и безопасность при разработке на основе ИИ и в приложениях с использованием ИИ.

О чём эта статья

Ещё в разделе «Облака и инфраструктура»

Все →

Ещё от Snyk