Как управлять рисками генеративного ИИ с помощью NIST AI 600-1 в шесть шагов

Источник: Anaconda•

Как управлять рисками генеративного ИИ с помощью NIST AI 600-1 в шесть шагов

Практическое руководство по NIST AI 600-1, профилю генеративного ИИ: 12 упомянутых в нем рисков, предлагаемые меры и принципы организации тестирования на проникновение (ред-теминга).

Если вы создаете или внедряете генеративный ИИ, Национальный институт стандартов и технологий (NIST) подготовил руководство для ваших систем. NIST AI 600-1, профиль генеративного ИИ (Generative AI Profile), является дополнением к системе управления рисками ИИ NIST (AI RMF), в котором определены 12 рисков, уникальных для генеративного ИИ или усугубляемых им, а также предложены меры по управлению каждым из них. NIST опубликовал этот документ в июле 2024 года. Он носит добровольный характер, однако закон штата Техас связывает с этим профилем одну из защит от ответственности.

В этом руководстве объясняется, что содержит профиль, почему это важно сейчас и какие шесть шагов нужно предпринять для работы с ним, с указанием идентификаторов действий, чтобы ваша команда могла соотнести каждый шаг с текстом NIST.

Что представляет собой профиль

AI RMF организует работу по управлению рисками ИИ по четырем функциям:

  • Управление (Govern): кто несет ответственность и каковы правила
  • Картирование (Map): какой ИИ мы используем и что может пойти не так
  • Измерение (Measure): как мы его тестируем
  • Управление рисками (Manage): что мы делаем с тем, что обнаружили

Профиль — это реализация этих функций, категорий и подкатегорий для конкретной технологии. Данный профиль охватывает генеративный ИИ и применим во всех секторах.

NIST помечает предлагаемые действия идентификаторами, такими как GV-1.6-001, где буквы указывают на функцию: GV для управления (Govern), MP для картирования (Map), MS для измерения (Measure) и MG для управления рисками (Manage).

В профиле перечислены действия для некоторых подкатегорий AI RMF, но не для всех. Не каждое действие применимо к каждой организации, поскольку некоторые из них предназначены для команд, создающих модели, а другие — для команд, которые их внедряют. Действия в основном сосредоточены на четырех аспектах, выделенных рабочей группой NIST: управление, происхождение контента, предэксплуатационное тестирование и раскрытие информации об инцидентах.

Почему это важно сейчас

вступил в силу 1 января 2026 года. Он запрещает краткий список преднамеренных злоупотреблений ИИ. Генеральный прокурор руководит обеспечением соблюдения закона, частное право на иск отсутствует, а генеральный прокурор обязан направить письменное уведомление и предоставить 60 дней на устранение нарушений (разд. 552.101 и 552.104). Закон также защищает компании, которые самостоятельно выявляют проблемы. Компания не может быть признана ответственной за нарушение, которое она обнаружила в ходе тестирования, включая состязательное тестирование или тестирование «красной командой» (разд. 552.105(e)(2)(B)). Она также не может быть признана ответственной за нарушение, обнаруженное в ходе внутреннего процесса проверки, если она в значительной степени соответствует последней версии профиля генеративного ИИ NIST или другой признанной системе управления рисками ИИ (разд. 552.105(e)(2)(D)). Проконсультируйтесь с юристом о том, как это применимо к вам.

Ситуация будет меняться. NIST пересматривает AI RMF 1.0 в соответствии с July 2025 AI Action Plan, и в самом профиле указано, что будущие редакции будут включать дополнительные подкатегории, риски и предлагаемые действия. Поддерживайте свою карту рисков в формате, который можно обновлять.

12 рисков

NIST описывает их как риски, «уникальные для» генеративного ИИ или «усугубляемые им». Ниже они приведены в порядке, установленном NIST.

Два из них наиболее близки к работе команды безопасности. Информационная безопасность работает в обе стороны: генеративный ИИ может помочь злоумышленникам, и он дает им больше целей для атак. Риск цепочки создания стоимости — это проблема цепочки поставок. Когда система собирается из сторонних моделей, наборов данных и программного обеспечения, трудно отследить, где возник сбой. В более широком смысле NIST предупреждает об «алгоритмических монокультурах»: когда многие организации используют одну и ту же модель для принятия важных решений, один недостаток может вызвать коррелирующие сбои во всех них.

Ключевые термины в определении NIST. Инъекция промпта (Prompt injection) означает изменение входных данных, получаемых системой генеративного ИИ, чтобы она вела себя непредусмотренным образом. При прямой атаке кто-то вводит вредоносный промпт. При косвенной атаке злоумышленники внедряют инструкции в данные, которые система, скорее всего, извлечет. Джейлбрейк (Jailbreaking) означает преднамеренное создание промптов для обхода ограничений вывода. Отравление данных (Data poisoning) означает компрометацию обучающего набора данных для манипулирования поведением модели.

Шесть шагов для работы с профилем

Вам не нужно внедрять все сразу. Эта последовательность соответствует порядку AI RMF.

1. Проведите инвентаризацию каждой системы генеративного ИИ и того, от чего она зависит (Управление)

GV-1.6-001 предписывает перечислить ваши системы генеративного ИИ для инвентаризации ИИ. GV-1.6-003 перечисляет, что должна включать каждая запись: базовые модели и их версии, происхождение данных, известные проблемы из баз данных инцидентов и уязвимостей, а также информацию о том, кто осуществляет контроль со стороны человека. GV-6.1-007 добавляет инвентаризацию третьих сторон, имеющих доступ к вашему контенту, и утвержденный список технологий и поставщиков генеративного ИИ. Если ваш ИИ выполняет действия, включите инструменты, к которым он подключается: серверы Model Context Protocol (MCP) (коннекторы, позволяющие агенту использовать внешние инструменты) и навыки агента (дополнительные пакеты инструкций). За два месяца до августа 2026 года Enkrypt AI просканировала более 268 000 инструментов на 25 000 серверах MCP и обнаружила более 143 000 уязвимостей, затрагивающих 73% этих серверов.

2. Установите пороговые значения «можно/нельзя» и способ отключения систем (Управление)

GV-1.3-002 призывает к установлению минимальных порогов производительности или гарантий в рамках одобрения развертывания, а GV-1.3-007 требует плана по остановке системы, которая представляет неприемлемый риск. GV-1.7-001 и MG-2.4-004 охватывают протоколы деактивации системы и критерии того, когда это делать. Определите их до запуска, а не во время инцидента.

3. Планируйте состязательное тестирование в зависимости от того, как используется система (Картирование)

MP-2.3-005 требует наличия планов регулярного состязательного тестирования для поиска уязвимостей и потенциальных злоупотреблений. MP-5.1-005 предлагает ролевое состязательное моделирование, тестирование «красной командой» или хаос-тестирование для поиска непредвиденных режимов отказа, а MS-1.1-008 просит вас решить, где тестирование «красной командой» поможет больше всего в вашем контексте использования. Тестирование «красной командой» означает атаку на собственный ИИ так, как это сделал бы злоумышленник.

4. Тестирование безопасности и конфиденциальности «красной командой» (Измерение)

MS-2.7-007 призывает к использованию «красных команд» ИИ для оценки устойчивости к злоупотреблению системой для атак на других (например, генерация вредоносного кода или фишингового контента), атак на генеративный ИИ, таких как инъекция промптов, и атак на машинное обучение, таких как состязательные промпты, отравление данных и извлечение моделей. MS-2.10-001 делает то же самое для конфиденциальности, проверяя, выдает ли система обучающие данные или раскрывает личную, конфиденциальную или проприетарную информацию. MS-2.7-008 просит вас убедиться, что дообучение не ослабляет меры безопасности, а MS-4.2-001 призывает к регулярному состязательному тестированию.

MS-1.3-003 добавляет правило независимости: люди, проводящие структурированные упражнения по обратной связи, такие как тестирование «красной командой», не должны быть напрямую вовлечены в создание той же модели. MS-2.3-004 называет специально созданную тестовую среду — NIST Dioptra.

5. Тестируйте риски вывода (Измерение)

Что касается конфабуляции (галлюцинаций), MS-2.5-003 просит вас проверять источники и цитаты в выходных данных до запуска и во время эксплуатации. Что касается опасного контента, MS-2.6-006 просит вас проверить, как система обрабатывает запросы, которые могут способствовать манипуляциям, вымогательству, выдаче себя за другое лицо, кибератакам или созданию оружия, а MS-2.6-007 просит вас регулярно оценивать, насколько легко можно обойти меры безопасности. Что касается предвзятости, MS-2.11-002 предлагает проводить оценку справедливости для разных групп, включая тестирование «красной командой» с использованием контрфактических промптов и промптов с низким контекстом.

6. Мониторинг, реагирование и ведение учета (Измерение, Управление и Регулирование)

MS-2.5-006 требует регулярного пересмотра мер безопасности и защиты, особенно в новых обстоятельствах. MG-4.1-002 призывает к мониторингу после развертывания, в частности, в отношении галлюцинаций, рисков, связанных с ХБРЯ (химическими, биологическими, радиационными и ядерными угрозами), и киберрисков. MG-2.3-001 охватывает планы реагирования на инциденты и восстановления, а GV-4.3-002 устанавливает минимальные поля для отчетности об инцидентах, такие как ID системы, название, автор отчета, дата, описание, последствия и список пострадавших. При дообучении модели или внедрении сторонней модели для нового варианта использования MG-3.1-003 требует проведения повторной оценки.

Затем ведите учет. GV-1.5-003 требует наличия политики хранения данных, охватывающей историю вашего тестирования и оценки, а MS-2.8-002 требует документирования инструкций, данных участникам red teaming. Если вы полагаетесь на описанную выше защиту по законодательству Техаса, именно на эти записи вы будете ссылаться.

Что в профиле говорится об ИИ-агентах

Профиль охватывает генеративный ИИ в широком смысле и не является специфичным для агентов. В нем перечислены автономные агенты среди угроз, подлежащих оценке (MS-2.7-001), а GV-4.2-003 требует включения в документацию по оценке воздействия последствий для последующих звеньев, таких как сторонние плагины. С тех пор NIST запустил Инициативу по стандартам ИИ-агентов (17 февраля 2026 г.) и разрабатывает SP 800-53 control overlays (специализированные средства контроля безопасности) для защиты ИИ-систем, включая сценарии использования агентов. Оверлеи, специфичные для агентов, все еще находятся в разработке. До их публикации рассматривайте доступ агента к инструментам как часть системы, которую вы тестируете.

На что обратить внимание в дальнейшем

Как помогает Enkrypt AI

Enkrypt AI от Anaconda поддерживает ряд действий по тестированию и ведению учета, описанных в шести шагах. Agent Red Teaming атакует ваши системы генеративного ИИ так, как это сделал бы злоумышленник, включая агентов с доступом к инструментам, и в платных тарифах сопоставляет каждую находку с the NIST AI RMF, the Open Worldwide Application Security Project (OWASP) Top 10 for Large Language Model Applications, and the EU AI Act. Каждая находка включает шаги по воспроизведению и оценку серьезности. В планах Scale и Enterprise исправленные находки становятся регрессионными тестами, которые можно запускать в рамках непрерывной интеграции (CI) перед каждым релизом, что дополняет учет, описанный в шаге 6. Agent Policy Engine превращает ваши политики и тексты нормативных актов в средства контроля, каждое из которых прослеживается до исходного пункта, поэтому тестирование, защитные механизмы во время выполнения и доказательства работают на основе единой политики. MCP Scanner проверяет серверы, к которым подключаются ваши агенты. Вы можете бесплатно просканировать сервер на странице продукта.

Два общедоступных ресурса также могут помочь. LLM Safety Leaderboard ранжирует более 200 моделей (по состоянию на октябрь 2026 г.) по показателю риска NIST от Enkrypt AI — собственной метрике Enkrypt AI, а не рейтингу NIST: это средний показатель успешности атак в тестах на предвзятость, вредоносный контент, токсичность, ХБРЯ и генерацию небезопасного кода. Также предоставляется оценка OWASP. Agent Incident Registry — это публичный каталог верифицированных инцидентов с агентами, классифицированных по таксономии рисков, соотнесенной с NIST AI RMF, что делает его одним из источников для отслеживания известных проблем, как того требует GV-1.6-003.

Планы Enterprise поддерживают развертывание в виртуальном частном облаке (VPC) или локально (on-premises). Чтобы увидеть, как Enkrypt AI от Anaconda работает в ваших системах, изучите раздел безопасности и защиты ИИ или запросите демо-версию.

Часто задаваемые вопросы

Что такое NIST AI 600-1?

Это профиль генеративного ИИ, опубликованный в июле 2024 года в качестве дополнения к NIST AI Risk Management Framework. В нем названы 12 рисков, уникальных для генеративного ИИ или усугубляемых им, и предложены действия по их управлению, организованные по подкатегориям AI RMF.

Является ли NIST AI 600-1 обязательным?

Нет. Это добровольный стандарт. Однако законодательство Техаса связывает с ним одну из своих защит от ответственности. Компания не может быть признана ответственной за нарушение, которое она обнаружила в ходе тестирования (включая red-team тестирование) или внутреннего процесса проверки, если она в значительной степени соответствует профилю генеративного ИИ NIST или другой признанной системе (разд. 552.105(e)). Проконсультируйтесь с юристом о том, как это применимо к вам.

Требует ли NIST AI 600-1 проведения red teaming?

Нет. Он предлагает red teaming в нескольких местах, включая MEASURE 2.7 для безопасности и MEASURE 2.10 для конфиденциальности, а также рекомендует проводить состязательное тестирование на регулярной основе. Как и вся система в целом, это добровольно. Узнайте больше о red teaming для агентов.

Охватывает ли он ИИ-агентов?

Не конкретно. В нем упоминаются автономные агенты как угроза, подлежащая оценке, и с тех пор NIST начал отдельную работу по агентам, включая Инициативу по стандартам ИИ-агентов и оверлеи контроля агентов, которые все еще находятся в разработке.

О чём эта статья

Ещё в разделе «Разработка ПО»

Все →

Ещё от Anaconda