Управление реагированием на инциденты в вашей среде FedRAMP High

Источник: Datadog•

Управление реагированием на инциденты в вашей среде FedRAMP High

Организуйте оповещение, координацию инцидентов и автоматизацию реагирования для критически важных федеральных рабочих нагрузок с помощью Datadog Incident Response.

Ранее в этом году Datadog for Government получил сертификацию FedRAMP® High, расширив возможности нашей среды GovCloud (US1-FED) для наиболее конфиденциальных гражданских рабочих нагрузок федерального правительства. Эта сертификация теперь распространяется на Datadog Incident Response, добавляя в US1-FED функции оповещения, координации инцидентов, автоматизации и рабочих процессов постмортем.

Когда государственная система выходит из строя, специалистам по реагированию необходимо связаться с нужными людьми, скоординировать исправление и держать заинтересованные стороны в курсе событий. Процесс реагирования также может генерировать конфиденциальные операционные данные, которые должны оставаться в соответствующей среде.

Благодаря Datadog Incident Response в US1-FED команды могут управлять реагированием в среде, сертифицированной по стандарту FedRAMP High, сохраняя при этом свои существующие инструменты мониторинга и расследования. На момент публикации этой статьи это единственная платформа для реагирования на инциденты с сертификацией FedRAMP High.

В этой статье мы расскажем, как вы можете:

  • Хранить данные об инцидентах в вашей среде, сертифицированной по стандарту FedRAMP High

Хранить данные об инцидентах в вашей среде, сертифицированной по стандарту FedRAMP High

  • Координировать реагирование на инциденты в Datadog

Координировать реагирование на инциденты в Datadog

  • Маршрутизировать оповещения из ваших существующих систем мониторинга

Маршрутизировать оповещения из ваших существующих систем мониторинга

  • Расследовать инциденты с помощью телеметрических данных Datadog

Расследовать инциденты с помощью телеметрических данных Datadog

  • Сократить инфраструктуру, которую вы эксплуатируете во время сбоя

Сократить инфраструктуру, которую вы эксплуатируете во время сбоя

Хранить данные об инцидентах в вашей среде, сертифицированной по стандарту FedRAMP High

Стандарт FedRAMP High применяется к системам, где потеря конфиденциальности, целостности или доступности может серьезно повлиять на государственные операции или общественное доверие. Инструменты реагирования на инциденты относятся к этой категории: данные об инцидентах часто включают полезные нагрузки оповещений, журналы, скриншоты, детали архитектуры и заметки специалистов о том, что сломалось и почему.

Когда ваша платформа для реагирования на инциденты находится вне сертифицированной среды, командам, возможно, придется ограничивать контекст инцидента, который может сопровождать его. Это может означать хранение конфиденциальных деталей в другом месте, что создает пробелы в хронологии инцидента. Datadog Incident Response работает внутри сертифицированного периметра, поэтому информация, необходимая для координации реагирования, может оставаться вместе с самим процессом реагирования.

Координировать реагирование на инциденты в Datadog

Datadog Incident Response объединяет функции оповещения, координации инцидентов, автоматизации и рабочих процессов постмортем, работая вместе с инструментами, которые уже есть в вашем стеке. Во время инцидента вы можете использовать эти возможности для:

  • Автоматического оповещения команды, отвечающей за неисправный сервис: Datadog On-Call поддерживает многоуровневые графики для сложных ротаций, политики эскалации для неотвеченных вызовов и переопределения. Он также поддерживает индивидуальные часы тишины для учета отпусков и часовых поясов без необходимости перестраивать базовую ротацию. Специалисты по реагированию выбирают способ связи (например, push-уведомление, SMS или голосовой вызов) и могут подтвердить получение, эскалировать или объявить об инциденте со своего телефона.

Автоматического оповещения команды, отвечающей за неисправный сервис: Datadog On-Call поддерживает многоуровневые графики для сложных ротаций, политики эскалации для неотвеченных вызовов и переопределения. Он также поддерживает индивидуальные часы тишины для учета отпусков и часовых поясов без необходимости перестраивать базовую ротацию. Специалисты по реагированию выбирают способ связи (например, push-уведомление, SMS или голосовой вызов) и могут подтвердить получение, эскалировать или объявить об инциденте со своего телефона.

  • Координации там, где уже работает ваша команда: Когда вы объявляете об инциденте, Datadog открывает канал, оповещает дополнительных специалистов и запускает мост связи в один шаг. Назначайте роли, фиксируйте серьезность и влияние, а также публикуйте обновления из рабочего пространства инцидента или непосредственно из Slack или Microsoft Teams.

Координации там, где уже работает ваша команда: Когда вы объявляете об инциденте, Datadog открывает канал, оповещает дополнительных специалистов и запускает мост связи в один шаг. Назначайте роли, фиксируйте серьезность и влияние, а также публикуйте обновления из рабочего пространства инцидента или непосредственно из Slack или Microsoft Teams.

  • Информирования заинтересованных сторон во время инцидентов: Правила уведомлений отправляют изменения серьезности и статуса руководству, программным и партнерским группам, которым это необходимо, по заданному вами графику. Это позволяет держать обновления для заинтересованных сторон внутри рабочего процесса инцидента, вместо того чтобы требовать от специалистов по реагированию управления отдельным процессом коммуникации.

Информирования заинтересованных сторон во время инцидентов: Правила уведомлений отправляют изменения серьезности и статуса руководству, программным и партнерским группам, которым это необходимо, по заданному вами графику. Это позволяет держать обновления для заинтересованных сторон внутри рабочего процесса инцидента, вместо того чтобы требовать от специалистов по реагированию управления отдельным процессом коммуникации.

  • Ведения подробной хронологии инцидента: Datadog записывает активность по инциденту по мере развития событий. Datadog добавляет изменения статуса, активность в чате, транскрипты мостов связи и сигналы от подключенных систем в хронологию инцидента. Это дает командам более полную запись для анализа после инцидента и аудита, не требуя восстановления событий по памяти и скриншотам.

Ведения подробной хронологии инцидента: Datadog записывает активность по инциденту по мере развития событий. Datadog добавляет изменения статуса, активность в чате, транскрипты мостов связи и сигналы от подключенных систем в хронологию инцидента. Это дает командам более полную запись для анализа после инцидента и аудита, не требуя восстановления событий по памяти и скриншотам.

  • Автоматизации повторяющихся шагов реагирования: Datadog Workflow Automation позволяет командам автоматизировать повторяющиеся шаги реагирования. Вы можете использовать его для сбора контекста инцидента, выполнения утвержденных процедур устранения неполадок, создания или обновления тикетов и уведомления заинтересованных сторон через подключенные системы. Эти автоматизированные рабочие процессы сокращают ручную координацию, необходимую во время инцидента, давая специалистам больше времени на расследование и устранение основной проблемы.

Автоматизации повторяющихся шагов реагирования: Datadog Workflow Automation позволяет командам автоматизировать повторяющиеся шаги реагирования. Вы можете использовать его для сбора контекста инцидента, выполнения утвержденных процедур устранения неполадок, создания или обновления тикетов и уведомления заинтересованных сторон через подключенные системы. Эти автоматизированные рабочие процессы сокращают ручную координацию, необходимую во время инцидента, давая специалистам больше времени на расследование и устранение основной проблемы.

  • Документирования инцидентов и отслеживания последующей работы: Datadog заполняет отчеты постмортем данными из записи об инциденте и позволяет командам экспортировать последующие задачи в такие системы, как Jira. On-Call и аналитика инцидентов дают вам представление о метриках реагирования и повторяющихся закономерностях в инцидентах.

Документирования инцидентов и отслеживания последующей работы: Datadog заполняет отчеты постмортем данными из записи об инциденте и позволяет командам экспортировать последующие задачи в такие системы, как Jira. On-Call и аналитика инцидентов дают вам представление о метриках реагирования и повторяющихся закономерностях в инцидентах.

Маршрутизировать оповещения из ваших существующих систем мониторинга

Datadog Incident Response может работать с системами мониторинга, безопасности и управления услугами, которые уже используют ваши команды. В зависимости от систем в вашей среде вы можете:

  • Направлять оповещения из существующих инструментов мониторинга в эскалацию On-Call

Направлять оповещения из существующих инструментов мониторинга в эскалацию On-Call

  • Объявлять об инцидентах с платформ мониторинга или безопасности

Объявлять об инцидентах с платформ мониторинга или безопасности

  • Прикреплять данные расследования к инциденту

Прикреплять данные расследования к инциденту

  • Синхронизировать последующие задачи с вашей системой управления работой

Синхронизировать последующие задачи с вашей системой управления работой

Это позволяет командам внедрять Incident Response в свои существующие процессы, не заменяя системы, которые генерируют оповещения и данные расследования. Вы также можете управлять владением сервисами в Catalog или подключать существующие данные о владении, что помогает поддерживать логику эскалации в актуальном состоянии по мере изменения команд и сервисов.

Расследование инцидентов с помощью телеметрических данных Datadog

Для агентств, которые уже используют Datadog в US1-FED, специалисты по реагированию могут расследовать инциденты параллельно с метриками, трассировками и логами, которые обеспечивают контекст для реагирования. Страница может перенаправлять специалистов к соответствующим данным и дашбордам Datadog, сокращая необходимость воссоздавать контекст расследования на другой платформе.

Datadog Synthetic Monitoring может помочь специалистам проверить, восстановились ли критические пользовательские сценарии, в то время как сигналы безопасности могут предоставить контекст о подозрительной активности, связанной со сбоем. В постмортеме Incident Response автоматически включает телеметрические данные, использованные во время расследования.

Команды, уже использующие Datadog for Government, могут применять те же дашборды, мониторы, средства контроля доступа и рабочие процессы расследования при реагировании на инциденты в US1-FED. Это снижает необходимость создания отдельного процесса реагирования для рабочих нагрузок уровня FedRAMP High.

Сокращение инфраструктуры, которую вы обслуживаете во время сбоя

Инструменты реагирования, размещенные на собственных серверах, дают вам контроль, но также создают еще одну производственную систему для запуска. Она требует исправлений, резервного копирования, мониторинга, управления доступом, высокой доступности и доказательств аудита. Система реагирования также должна оставаться доступной, когда другие системы деградируют или недоступны.

Datadog Incident Response полностью управляется в сертифицированной по стандарту FedRAMP High среде US1-FED. NIST SP 800-61 Rev. 3 рекомендует документировать действия по реагированию на инциденты, координировать роли и действия специалистов, а также защищать информацию об инцидентах. Datadog Incident Response может помочь командам поддерживать эти практики путем отслеживания активности по инцидентам, назначения специалистов, координации рабочих процессов реагирования и ведения записей об инцидентах в рамках US1-FED.

Запуск реагирования на инциденты в US1-FED

Datadog Incident Response предоставляет командам государственного сектора управляемый способ оповещения специалистов, координации инцидентов, автоматизации этапов реагирования и ведения записей об инцидентах в сертифицированной по стандарту FedRAMP High среде US1-FED. Команды могут подключать свои существующие системы мониторинга и реагирования, сохраняя при этом реагирование на инциденты в рамках одной и той же сертифицированной среды.

Чтобы узнать больше, прочитайте документацию Datadog Incident Response, ознакомьтесь с сертификацией FedRAMP High для Datadog for Government и посетите страницу Datadog for Government в маркетплейсе FedRAMP. Чтобы начать работу с Datadog Incident Response для вашей среды FedRAMP High, запросите демонстрацию Datadog for Government у наших экспертов по государственному сектору или начните бесплатную пробную версию Datadog Incident Response.

Если вы еще не являетесь клиентом Datadog, подпишитесь на 14-дневную бесплатную пробную версию.

О чём эта статья

Ещё в разделе «Данные и аналитика»

Все →

Ещё от Datadog