Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Tablitsa liderov bezopasnosti llm teper ranzhiruet vse modalnosti gde tayatsya r
Dev48

© 2026 · All rights reserved.

Таблица лидеров безопасности LLM теперь ранжирует все модальности, где таятся риски агентов: текст, изображения и аудио

Источник: Cisco Blogs

Таблица лидеров безопасности LLM теперь ранжирует все модальности, где таятся риски агентов: текст, изображения и аудио

Источник: Cisco Blogs

Когда мы запустить таблицу лидеров Cisco LLM Security Leaderboard в начале этого года, цель была простой: предоставить организациям четкие, проверенные данные о том, как модели справляются с атаками, чтобы они знали о рисках перед развертыванием. Это важно, поскольку модели ИИ...

28 сентября 2026 г.•Обновлено: 28 сентября 2026 г.

При поддержке в области исследований и разработки от Равикумара Балакришнана, Анкита Гарга и Санкета Мендапары

Когда в начале этого года мы запустили таблицу лидеров безопасности LLM от Cisco, цель была простой: предоставить организациям четкие, проверенные данные о том, как модели справляются с атаками, чтобы они знали о рисках до развертывания. Это имеет значение, поскольку модели ИИ все чаще встраиваются в такие продукты, как агенты, которые читают электронную почту, просматривают веб-страницы и совершают действия от имени пользователя. Модель, которой можно манипулировать, может быть обращена против использующего ее человека. Этот риск также варьируется в зависимости от развертывания: модель, подключенная к агенту просмотра, подвергается воздействию других входных данных (или модальностей, таких как текст, изображения и аудио), чем та, которая только отвечает на вопросы в окне чата, поэтому слабые стороны конкретной модели имеют такое же значение, как и ее сильные стороны.

Таблица лидеров проверяет это несколькими различными способами: промпт-инъекции, когда вредоносная инструкция скрыта в контенте, обрабатываемом моделью (например, на веб-странице или в изображении); джейлбрейки, когда модель убеждают игнорировать собственные правила безопасности; и другие методы, подталкивающие модель к вредоносному или небезопасному выводу. Сам метод различается (одно сообщение или затяжной разговор, прямой или обфусцированный, текст, изображение или аудио), как и тип тестируемого вреда, но лежащий в основе вопрос всегда остается прежним: можно ли манипулировать этой моделью? Некоторые модели сопротивляются намного лучше других. Подключите слабую модель к агенту, и риск возрастет.

102 новые оценки по разным модальностям с июня 2026 года

Таблица лидеров безопасности LLM — одна из самых комплексных таблиц лидеров безопасности моделей. С июня мы добавили 102 новые записи по трем модальностям в общей сложности до 136 моделей, охватывающих передовые релизы и релизы с открытыми весами от Anthropic, OpenAI, Google, xAI, Meta, Mistral и других. Как всегда, мы тестируем модели в их базовой конфигурации без дополнительных средств защиты, поэтому оценки отражают стабильную базовую линию для наложения дополнительных мер безопасности.

Мультимодальные результаты теперь доступны

До сих пор таблица лидеров оценивала текстовые атаки двумя способами: в один этап (single-turn), когда одно вредоносное сообщение отправляется напрямую модели, и в несколько этапов (multi-turn), когда в ходе более продолжительного диалога злоумышленник постепенно подводит модель к вредоносному запросу с помощью нескольких сообщений. Это охватывало наиболее распространенный способ взаимодействия людей с моделями, однако сегодня модели также управляют агентами, способными совершать действия.

Модель, которая может вызывать инструменты, просматривать веб-страницы или управлять компьютером, является агентом, и агент получает информацию из всех источников, с которыми он работает: со страницы, которую он читает, файла, который он открывает, изображения, которое ему показывают, или результата, возвращаемого инструментом. Каждый из этих источников является местом, куда злоумышленник может внедрить инструкцию, причем текст — лишь одна из форм, в которых может поступить инструкция. Веб-сайт, который посещает агент, может внедрить промпт-инъекцию в изображение, такое как рекламный баннер; голосовому помощнику может быть передан аудиоклип, специально созданный для манипулирования им. Если модель оценивается только по тексту, этот риск может не проявиться до тех пор, пока он не превратится в реальный инцидент. Подумайте, какие из этих поверхностей действительно важны в контексте того, что вы развертываете: агент, который только читает и пишет текст, не должен беспокоиться о своей устойчивости к изображениям, но агент, который может просматривать веб-страницы, читать скриншоты или принимать голосовой ввод, — должен. Это ситуации, в которых текстовые оценки не смогут рассказать всю историю безопасности.

Сегодня мы выпускаем обновление таблицы лидеров, которое теперь выходит за рамки исключительно текстовых моделей. Мы добавили 69 новых записей, включая 55 моделей для работы с изображениями и 14 аудиомоделей от Amazon, Anthropic, Google, Meta, Mistral, OpenAI и xAI. Каждая из этих лабораторий применяет свой подход к созданию и обучению мультимодальных возможностей, будь то способ передачи данных изображений в основу LLM, объем выравнивания безопасности в стеке работы с изображениями или аудио по сравнению с базовой языковой моделью, или то, какие модальности проходят тестирование на проникновение (red-teamed) и внутреннюю оценку. Эти различия напрямую проявляются в том, как модель сопротивляется атакам в одной модальности по сравнению с другой.

Атаки на изображения и аудио тестируются так же, как одноэтапные текстовые атаки (одна попытка, одно сообщение), с использованием тех же категорий атак и вреда, что и для текстовых оценок, поэтому их устойчивость сопоставима на разных поверхностях. Общий комбинированный балл (Combined Score) каждой модели теперь представляет собой среднее значение по всем форматам, на которых она оценивалась, а новый переключатель модальностей позволяет изолировать оценки для текста, изображений или аудио. Это позволяет проверять модель на соответствие тем конкретным модальностям, которым ее подвергает развертывание ИИ, и принимать решения о том, где данной модели необходимо наложить дополнительные средства защиты, такие как фильтрация входных данных или защитные экраны вывода, для той модальности, в которой эта модель является наиболее уязвимой.

Рисунок 1. Скриншот рейтинга моделей, поддерживающих работу с изображениями, в таблице лидеров безопасности LLM от Cisco

Результаты таблицы лидеров моделей для работы с изображениями

В наших тестах модель Gemini 3.1 Pro Preview от Google занимает первое место среди моделей для работы с изображениями, отражая 93,9% состязательных атак на изображения, чуть опережая Claude Opus 4.5 от Anthropic (93,7%). Обе модели попали в диапазон «Отлично» (85–100%) в таблице лидеров. Magistral Small 2509 от Mistral показала слабые результаты, отклонив лишь 23,0% атак, что означает, что она выполнила более трех из каждых четырех протестированных атак на основе изображений.

Разница в тестировании изображений заключается в том, что атаки на основе изображений являются исключительно одноэтапными: одно изображение несет в себе скрытую инструкцию, а не представляет собой диалог. Методы атак также отличаются по своей сути, а не только по формату: текст, скрытый внутри изображения с использованием типографских трюков, инструкции, встроенные в диаграмму или рисунок, или атака, которая разделяет свой замысел между изображением и сопутствующим текстовым промптом, так что ни одна из половин не выглядит вредоносной сама по себе. В таблице лидеров отображаются результаты оценки моделей, которые действительно способны распознавать изображения (на их долю приходится 55 из 136 моделей в таблице лидеров).

Рисунок 2. Скриншот рейтинга аудиомоделей в таблице лидеров безопасности LLM от Cisco

Результаты таблицы лидеров аудиомоделей

В нашем последнем тесте модель Gemini 3.1 Pro Preview от Google занимает первое место среди протестированных аудиомоделей, отклонив 90,0% состязательных аудиоатак, в то время как Voxtral Small 24b (2507) от Mistral продемонстрировала показатель отказов всего в 9,0%, что означает, что она выполнила примерно 9 из каждых 10 аудиоатак, с которыми столкнулась.

Как и в случае с изображениями, аудиомодели также тестировались в один этап с использованием одного состязательного аудиоклипа вместо диалога. Это также самый новый и самый небольшой сегмент таблицы лидеров. В настоящее время принимать аудиоввод и проходить тестирование способны лишь 9 моделей от Google, Mistral и OpenAI, поэтому данный рейтинг следует рассматривать как предварительные результаты, а не как устоявшуюся область.

Как интерпретировать новое представление комбинированных результатов

Текстовые оценки остаются неизменными для каждой модели, которая уже присутствовала в таблице лидеров, но изменилось то, как Комбинированный балл (Combined Score) вычисляет среднее значение для текстовых, графических и аудиомодальностей, на которых тестировалась модель. Комбинированный балл может измениться в результате оценки изображений или аудио, даже если оценка за текст осталась прежней.

Направление этого сдвига полностью зависит от того, как устойчивость модели к обработке изображений или аудио соотносятся с её устойчивостью к тексту. Некоторые сильные текстовые модели просели после учета изображений: Claude Sonnet 4.5 потерял 7.2 балла (с 92.2 до 85.0) и сместился со 2-го места в общем зачете на 20-е; Claude Haiku 4.5 потерял 8.1 балла и опустился с 4-го места на 24-е; Amazon Nova 2 Lite потерял 11.2 балла и переместился с 25-го места на 50-е — каждая из них сдала позиции, поскольку её устойчивость к изображениям заметно слабее текстовой устойчивости. Две модели Mistral Voxtral упали по той же причине из-за своих аудиооценок.

Другие модели поднялись вверх, когда в кросс-модальную оценку были добавлены результаты тестирования изображений. Четыре протестированных на изображениях модели Gemini от Google продемонстрировали наибольшие преимущества изображений над текстом, в то время как все три протестированных варианта Gemma 3, а также GPT‑4.1 nano, GPT‑4.1 mini и GPT‑4o mini от OpenAI также показали более высокую устойчивость к изображениям, чем к тексту. Этот разброс напоминает о том, что работа по обеспечению безопасности для одной модальности не переносится автоматически на другую, особенно в случае лабораторий, которые создавали и обучали свои возможности работы с изображениями или аудио независимо от своих текстовых моделей.

Общий балл модели может резко измениться при её тестировании на различных модальностях, особенно если уровень её безопасности неоднороден в разных модальностях. Это движение отражает то, как рассчитывается оценка, а не изменение того, насколько хорошо модель защищает себя на самом деле. Изучите индивидуальные столбцы модели «Текст», «Изображение» и «Аудио», прежде чем воспринимать её Общий балл как исчерпывающий показатель.

Интеграция с AI Supply Chain Provenance Explorer

Происхождение имеет значение, поскольку уязвимости модели зачастую не уникальны для неё одной. Если две модели имеют общее происхождение, уязвимость, обнаруженная в одной из них, может присутствовать и в другой, а прекращение расследования на развернутой в данный момент модели может помешать выявить истинный источник проблемы или другие места её возможного проявления. Благодаря этому данные о происхождении наиболее полезны именно тогда, когда вы активно расследуете безопасность модели и вам необходимо знать, с чем она связана.

В связи с этим мы также связали таблицу лидеров с AI Supply Chain Provenance Explorer. Модели с открытым весом на странице рейтинга теперь имеют прямые ссылки на свой профиль происхождения, где отображаются данные о родословной и отпечатках, полученные с помощью тех же методов, которые лежат в основе Model Provenance Kit. Уровень безопасности и реальное происхождение модели — это взаимосвязанные вопросы, поэтому мы позаботились о том, чтобы их было удобно просматривать в одном месте.

Чтобы ознакомиться с полными рейтингами, отфильтровать их по модальности или найти конкретную модель, посетите Cisco LLM Security Leaderboard уже сегодня.

← Все статьи

Ещё в разделе «Hardware и электроника»

Все →
Может ли Muse преодолеть проблемы доверия Meta?Пресса
Meta

Может ли Muse преодолеть проблемы доверия Meta?

Система накопления энергии Anker SOLIX X1 получает одобрение Совета по чистой энергии, расширяя глобальный охват рынка
Anker Innovations

Система накопления энергии Anker SOLIX X1 получает одобрение Совета по чистой энергии, расширяя глобальный охват рынка

Агент Muse от Meta атакует одно из самых прибыльных слабых мест экономики
Пресса
Meta

Агент Muse от Meta атакует одно из самых прибыльных слабых мест экономики

HTC VIVE ОТМЕЧАЕТ ПЕРВУЮ ГОДОВЩИНУ 5 АПРЕЛЯ ПРАЗДНИКОМ «VIVE DAY» ДЛЯ ФАНАТОВ
HTC VIVE

HTC VIVE ОТМЕЧАЕТ ПЕРВУЮ ГОДОВЩИНУ 5 АПРЕЛЯ ПРАЗДНИКОМ «VIVE DAY» ДЛЯ ФАНАТОВ

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадкуПресса
Boeing

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадку

Meta и YouTube заявили, что все-таки будут показывать рекламу документального фильма о МаскеПресса
Meta

Meta и YouTube заявили, что все-таки будут показывать рекламу документального фильма о Маске

Ещё от Cisco

Новая серия вебинаров в записи: Аналитика экосистемы безопасных сетей
Cisco

Новая серия вебинаров в записи: Аналитика экосистемы безопасных сетей

Создание надежной основы для конфиденциального ИИ
Cisco

Создание надежной основы для конфиденциального ИИ

Общайтесь в Канкуне с Learn with Cisco
Cisco

Общайтесь в Канкуне с Learn with Cisco

NetOps уже внедряет агентную автономность — доверие определит пределы ее применения
Cisco

NetOps уже внедряет агентную автономность — доверие определит пределы ее применения

Работа, рабочая сила, работники
Cisco

Работа, рабочая сила, работники

Привносим мощь ИИ туда, где хранятся ваши данные: новая веха в сотрудничестве Cisco и NVIDIA
Cisco

Привносим мощь ИИ туда, где хранятся ваши данные: новая веха в сотрудничестве Cisco и NVIDIA