Злоумышленники не читают ваш репозиторий; они атакуют ваш URL и объединяют в цепочки все, что находят. В эпоху, когда наступательный ИИ работает против действующих приложений на машинной скорости, ваши инструменты безопасности должны не просто находить уязвимости, а доказывать возможность их эксплуатации, включая проверку того, можно ли объединить их для осуществления взлома.
Поэтому мы провели тест. Мы направили Evo Continuous Offensive Security (COS) и Claude Security на базе Mythos на одно и то же приложение: TaintedPort. Это намеренно уязвимое веб-приложение, которое использует реальные классы ошибок и набор зарегистрированных цепочек эксплойтов. Это разные типы инструментов; COS атакует работающее приложение, в то время как два продукта Claude читают исходный код, и мы запустили их на одной и той же цели, чтобы увидеть, что доказывает каждый подход.
Evo COS подтвердил 10 из 15 цепочек эксплойтов.
Это не критика моделей — мы их используем.
Claude Security на базе Mythos — это реальный прогресс в обнаружении уязвимостей с помощью ИИ. Он анализирует исходный код так же, как сильный эксперт-ревьюер, и обнаруживает классы ошибок, которые пропускают инструменты сопоставления с шаблонами. Но поиск ошибки в коде и доказательство того, что злоумышленник может использовать эти уязвимости, — это разные задачи.
Путь атаки, доказанный COS
Каждый инструмент в этом тесте обнаружил уязвимость подделки запроса на стороне сервера (SSRF) и то, что секрет подписи JWT приложения был жестко закодирован. Evo COS пошел дальше и использовал SSRF, чтобы добраться до секрета подписи в работающем приложении и извлечь его, а затем использовал этот секрет для создания действительного токена администратора и захвата административной панели. Две находки, объединенные в полный путь захвата учетной записи, были продемонстрированы на работающем приложении с помощью исполняемого доказательства концепции.
Выше: CHAIN-004 в оценке для COS. Две составляющие находки, уязвимость SSRF и жестко закодированный секрет, были обнаружены каждым инструментом в этом тесте по отдельности. Evo COS подтвердил, что они объединяются в подделку токена администратора.
Именно так выглядит автономная атака на практике: закрепиться, а затем выстроить цепочку. Evo COS показывает вам путь и прилагает исполняемое доказательство концепции для каждой подтвержденной цепочки.
Результаты
TaintedPort v1.35, оцененный по фиксированному ключу ответов из 57 известных уязвимостей и 15 известных цепочек эксплойтов, по шкале с учетом серьезности (Низкая 1, Средняя 3, Высокая 9, Критическая 27; каждая подтвержденная цепочка оценивалась по своей серьезности в дополнение к входящим в нее находкам). Взвешенное обнаружение — это найденные баллы ÷ 938 доступных баллов: 587 из 57 уязвимостей и 351 из 15 цепочек.
Evo COS
Claude Security (Mythos)
Взвешенное по серьезности обнаружение
75.7%
49.6%
Подтвержденные цепочки эксплойтов (из 15)
Найденные уязвимости (из 57)
91.7%
75.5%
Claude Security нашла на одну уязвимость критической степени больше (10 против 9). Evo COS нашел больше всего уязвимостей, имел самую высокую точность (96.2% против 90.2%) с меньшим количеством ложных срабатываний, и он смог идентифицировать и доказать цепочки эксплойтов.
Зачем атаковать развернутое приложение?
Evo COS — это динамическая система: ее цель — всегда работающий URL, а исходный код является дополнительным вводом, который повышает уровень запуска с «черного ящика» до «серого ящика». Он никогда не работает только на основе кода. Claude Security работал как «белый ящик» (только код).
Это делает сравнение междисциплинарным: Evo COS — это наступательный тест на проникновение, который зондирует и эксплуатирует работающее приложение, что фундаментально более интенсивный процесс, чем однократное чтение кода. Это то же самое взаимодополняющее разделение, которое индустрия всегда имела между DAST и SAST. Здесь мы показываем, что доказывает проверка работающего приложения и чего не может сделать чтение только кода: что эти уязвимости реальны и что их можно объединить в цепочки.
Находки, о которых сообщил только Evo COS, в подавляющем большинстве являются поведением во время выполнения: отраженные и неправильно настроенные ответы, отсутствие защиты транспорта, токены, которые остаются активными после выхода из системы, и слабое управление сессиями. Evo COS смог подтвердить несколько зависящих от контекста ошибок бизнес-логики: нарушение авторизации на уровне объектов при обновлении профиля, повышение привилегий через поддельные утверждения JWT и критическую ошибку, при которой однократное чтение сохраненного секрета TOTP аннулирует 2FA. Цепочки требуют достижения каждого шага через работающее приложение и подтверждения того, что следующий шаг действительно достижим. Модель, анализирующая исходный код, должна сделать вывод, что уязвимость выполняется, и пропускает цепочку.
Вы можете создать обвязку, но вы не можете создать контекст
В этом году дискуссия о бенчмаркинге пришла к важному выводу: система вокруг модели важнее, чем сама модель. Мы пойдем дальше. «Какая обвязка» — это не нейтральный вопрос, и ответ на него — это то, где на самом деле кроется преимущество.
Evo COS координирует работу нескольких моделей, включая передовые модели Claude, каждая из которых направлена на ту задачу, в которой она лучше всего разбирается. Так что этот результат — не история о качестве моделей. Тот же класс моделей, который обеспечивает передовой анализ кода, находится внутри Evo COS. Что отличается, так это система вокруг него: Evo COS начинает с того, что платформа Snyk уже знает о цели, а не рассуждает «на холодную»; это группа агентов, каждый из которых организован для конкретной цели, и каждая находка проходит независимый этап проверки, прежде чем она будет представлена, потому что система, которая генерирует находку, не должна быть той, которая ее оценивает.
Любой может сегодня подключить передовую модель к агенту кодирования и направить ее на репозиторий. Чего эта настройка не может воспроизвести, так это накопленного, проверенного контекста, с которого начинает Evo COS, независимого валидатора и проверки на работающем приложении.
Динамическое и статическое тестирование дополняют друг друга
Claude Security обнаружила несколько уязвимостей, которые не нашел Evo COS, в основном логические ошибки, видимые в исходном коде, и криптографические недостатки, которые не всегда проявляются через работающее приложение. Ни один подход не является полным сам по себе; это аргумент в пользу платформы, а не точечного инструмента. Чтение кода и атака на работающее приложение — каждый из них находит то, что пропускает другой.
Методология
TaintedPort — это собственное намеренно уязвимое приложение Snyk, созданное и поддерживаемое нашей командой, и оно является публичным. Evo COS не настраивался специально под него.
Цель: TaintedPort: 57 известных уязвимостей (34 стандартных, 23 бизнес-логики) и 15 известных цепочек эксплойтов.
Инструменты и входные данные:
- Evo COS: серый ящик (живой URL + исходный код), 18 сентября.
Evo COS: серый ящик (живой URL + исходный код), 18 сентября.
- Claude Security: белый ящик (исходный код), Mythos с расширенным мышлением, 18 сентября.
Claude Security: белый ящик (исходный код), Mythos с расширенным мышлением, 18 сентября.
Запуски: по одному на инструмент. Результаты — это выходные данные одного запуска, а не медианные значения.
Обнаружение по категориям
Категория
Известно
Evo COS
Claude Security (Mythos)
Стандартные
Бизнес-логика
Цепочки эксплойтов
Обнаружение по серьезности (найдено/известно)
Серьезность
Известно
Evo COS
Claude Security (Mythos)
Критическая
Высокая
Средняя
Низкая
Ложные срабатывания и F1
Метрика
Evo COS
Claude Security (Mythos)
Ложные срабатывания
F1-мера
91.7%
75.5%
Воспроизведите это: TaintedPort доступен по адресу taintedport.com.
Интересно, какие находки в ваших собственных приложениях могут привести к взлому? Посмотрите, как Evo Continuous Offensive Security тестирует ваш работающий URL.
ЗАКАЗАТЬ ЖИВУЮ ДЕМОНСТРАЦИЮ
Безопасное внедрение ИИ в масштабе
Evo помогает организациям безопасно внедрять и масштабировать ИИ, обеспечивая прозрачность, управление и безопасность при разработке на основе ИИ и в приложениях с использованием ИИ.







