Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Zombie cves pohoronennye lyudmi vykopannye agentami ii
Dev48

© 2026 · All rights reserved.

Zombie CVEs: Похороненные людьми, выкопанные агентами ИИ

Источник: Checkmarx

Zombie CVEs: Похороненные людьми, выкопанные агентами ИИ

Источник: Checkmarx

Агенты для написания кода на базе ИИ раскапывают уязвимости, которые индустрия уже похоронила. Новое исследование показывает, что 65–75% работающих патчей от ИИ возрождают известные и устраненные CVE.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

Новое исследование: 65–75% рабочих патчей от передовых ИИ-агентов воскрешают уязвимости, которые уже были найдены, исправлены и преданы забвению.

В 2023 году уязвимость обхода пути (path traversal) в Starlette — одном из самых популярных веб-фреймворков Python — была обнаружена, опубликована как CVE-2023-29159 и исправлена. Дело закрыто. Ошибка была мертва и похоронена, как и сотни тысяч CVE до нее: обнаружена исследователями, исправлена мейнтейнерами, отправлена на покой благодаря накопленной и кропотливой работе ИБ-сообщества.

В 2026 году передовой ИИ-агент для написания кода воссоздал ту же самую функцию. Уязвимость вылезла прямо из-под земли. И это не единичный случай.

Таков один из главных выводов нового независимого исследования, заказанного Checkmarx у Ильи Кабанова, генерального директора The Weather Report. Это первое исследование, измеряющее от поколения к поколению, становится ли код ИИ безопаснее по мере того, как он становится лучше.

Ответ — нет. На самом деле, по иронии судьбы, все с точностью до наоборот.

Безопасность, судя по всему, просто не является критерием в гонке вооружений ИИ-агентов за все большей производительностью. В результате получается код от ИИ, который в самом важном аспекте становится менее безопасным: поколение назад большинство небезопасных попыток даже не работали, поэтому они никогда не выпускались. Теперь же работает почти все, все отправляется в релиз, и, согласно исследованию, 65–75% этого кода наступают на те же старые грабли CVE, которые индустрия уже решила, перетаскивая их обратно в продакшн.

Читать полное исследование

Тест на кладбище

Вместо того чтобы изобретать очередной бенчмарк, в исследовании заново запустили два устоявшихся теста на современных передовых моделях: Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro и Gemini 3.5 Flash, каждая в своем собственном нативном CLI-интерфейсе агента.

Более сложный из двух тестов, SusViBes, по сути является кладбищем: 200 реальных задач по реализации функционала внутри крупных репозиториев с открытым исходным кодом, каждая из которых построена на базе реальной уязвимости, уже найденной, раскрытой и исправленной человеком. Агенту поручается создать эту функцию. Вопрос в том, придет ли он самостоятельно к защите, содержавшейся в человеческом фиксе, или раскопает старый баг обратно.

Результаты:

  • Функциональный успех вырос до 83–95% по всей группе — по сравнению с 44–61% всего одно поколение моделей назад. Написание работающего кода практически решено.
  • Успех «безопасно и функционально» составил всего 24–36%. У разных моделей 65–75% работающих патчей воскресили уязвимость, которую люди уже отправили на покой.
  • Разрыв между функциональностью и безопасностью увеличился: в линейке Claude — с 38 до 63 пунктов за одно поколение.

Модели знают, но все равно игнорируют

Вот что делает эту ситуацию более тревожной, чем просто пробел в знаниях. Эти CVE общедоступны. Их бюллетени безопасности, коммиты с исправлениями, разборы — все это есть в обучающих данных. Модели, по всей вероятности, видели исправления и все равно воскрешают баги.

Аудит сбоев в исследовании подтверждает это на практике. В проанализированных случаях сбоев агенты называли именно ту защиту, которая требовалась, в собственной модели угроз, а затем все равно отправляли в релиз уязвимый код.

Подход «просто попросите его быть безопасным в промпте» не работает

В исследовании была протестирована цепочка все более дорогостоящих вмешательств:

  • Однострочное напоминание «следуй лучшим практикам безопасности» добавило всего 1–8 баллов к безопасности в зависимости от модели.
  • Максимальное увеличение усилий на рассуждения не добавило безопасности в ходе целевой точечной проверки и сократило количество работающих патчей вдвое.
  • Специальный этап моделирования угроз перед написанием кода повысил кумулятивный показатель безопасного и функционального успеха до 43–49% при двукратном увеличении затрат токенов по сравнению с написанием кода в одиночку.
  • Добавление ревью безопасности после факта позволило достичь 47–56% — примерно при 2,5-кратном увеличении затрат токенов.

Даже когда модели платили в разы больше исходной задачи за обеспечение безопасности собственного вывода, примерно половина задач все равно выпускалась в небезопасном виде.

Что это значит для вашего конвейера

Одно примечание относительно масштаба, к которому исследователи относятся с осторожностью, и мы тоже: эти задачи для бенчмарка были выбраны потому, что уязвимость является естественным способом создания функции. В обычном повседневном коде частота воскрешения, вероятно, ниже. Но эти рамки не утешают: реальные кодовые базы полны именно таких функций, потому что оттуда изначально и взялись эти CVE.

И это не ограничивается лабораторией. Собственный отчет Checkmarx Future of AppSec за 2026 год — опрос 2,350 руководителей информационной безопасности (CISO), менеджеров по безопасности приложений и разработчиков из 14 стран — подтверждает эти выводы:

  • 70% разработчиков говорят, что генерация кода с помощью ИИ создала больше уязвимостей в их коде в 2025 году.
  • Код, сгенерированный ИИ, уже стал причиной 25% инцидентов безопасности, что делает его одним из четырех главных векторов атак в первый год отслеживания.
  • И кривая «доза-реакция» очевидна: организации, где 81–100% кода сгенерировано ИИ, выпускают уязвимый код в 3,4 раза чаще, чем те, у кого этот показатель составляет 1–20%.

Учитывая, что почти половина (49%) производственного кода теперь генерируется ИИ, это не один зомби, бродящий по кладбищу, а целая орда.

Читать полное исследование

Полная научная работа, включая разбор по категориям CWE, анализ стоимости вмешательств и полную таксономию режимов сбоев, доступна здесь:

Читать полное исследование

Теги:

ADLC

Агентный ИИ

исследования безопасности

вайб-кодинг

← Все статьи

Ещё в разделе «Кибербезопасность»

Все →
Усиление мер по борьбе со взятками и коррупцией
PwC

Усиление мер по борьбе со взятками и коррупцией

Кибербезопасность в сделках: защита вашей организации и создание новой стоимости
PwC

Кибербезопасность в сделках: защита вашей организации и создание новой стоимости

Примените подход, ориентированный на человека, для повышения устойчивости вашей организации
PwC

Примените подход, ориентированный на человека, для повышения устойчивости вашей организации

Проактивное планирование на случай трудовых споров
PwC

Проактивное планирование на случай трудовых споров

Навигация в меняющейся среде заключений о справедливости в постпандемическом мире
PwC

Навигация в меняющейся среде заключений о справедливости в постпандемическом мире

История компьютера в ChatGPT: риски этой функции и как настроить ее безопасно
Kaspersky

История компьютера в ChatGPT: риски этой функции и как настроить ее безопасно

Ещё от Checkmarx

Уровень серьезности — это не стратегия: что директива CISA BOD 26-04 означает для будущего безопасности федерального ПО
Checkmarx

Уровень серьезности — это не стратегия: что директива CISA BOD 26-04 означает для будущего безопасности федерального ПО

Регуляторы уже считают, что у вас есть инвентаризация ИИ. Так ли это?
Checkmarx

Регуляторы уже считают, что у вас есть инвентаризация ИИ. Так ли это?

Что такое Checkmarx Fusion?
Checkmarx

Что такое Checkmarx Fusion?

Только что выпущен: Будущее безопасности приложений в эпоху ИИ – Прогноз отрасли на 2027 год
Checkmarx

Только что выпущен: Будущее безопасности приложений в эпоху ИИ – Прогноз отрасли на 2027 год