Ключевая роль платформ наблюдаемости заключается в том, чтобы помочь вам достичь бизнес- и технических целей по обеспечению непрерывной работы бизнеса по требованию, сохраняя при этом низкие затраты. За последнее десятилетие сложность эксплуатации корпоративной инфраструктуры и приложений многократно возросла.
Появление генеративного ИИ в технологическом ландшафте увеличило сложность систем, непреднамеренно усилив нагрузку на команды DevOps и SRE. Корпоративная наблюдаемость генерирует огромное количество MELT (метрик, событий, трассировок и логов), что приводит к множеству оповещений и условий, а этот объем является основным драйвером операционной рутины. Стремление к доступности 99,999% требует видимости на каждом уровне — от оборудования до приложений, — но это достигается ценой значительной усталости от оповещений.
До сих пор традиционный подход заключался в следующем: отслеживать все, вручную устанавливать условия оповещения, а когда оповещение срабатывает, вызывать человека, и процесс сортировки начинается с изучения дашбордов наблюдаемости. Этот подход больше не является устойчивым в текущем технологическом ландшафте.
Чтобы справиться с этой ситуацией, многие компании запустили AI SRE — виртуального агента инженера по надежности сайта. На первый взгляд, многие агенты выглядят одинаково, так как они действуют как первая линия обороны, перехватывая оповещение до того, как оно попадет к человеку, просеивая логи и используя LLM для поиска первопричины (RCA) и рекомендации шагов по устранению.
Но в реальности во многих случаях опыт разработчика сводится к потере времени, галлюцинациям результатов, увеличению стоимости токенов и все тому же просеиванию множества дашбордов, выполнению запросов в различных системах для поиска первопричины и устранения неисправностей.
Создание SRE-агента, который обеспечивает высокую точность, низкую задержку и отсутствие галлюцинаций, не выходя за рамки бюджета на ИИ-токены. Система, которая содержит актуальную карту того, как сервисы, функциональные флаги и командные зависимости связаны друг с другом, требует глубокого понимания основных компонентов стека ИИ-технологий и создания ключевых модулей/компонентов SRE-платформы, включая память, RAG-знания, доступ к репозиториям кода, деревья решений и нативные интеграции в экосистему разработчиков.
Создание SRE-агента, который обеспечивает высокую точность и низкую задержку без галлюцинаций — и все это без превышения бюджета на ИИ-токены — является сложной инженерной задачей. Она требует системы, которая поддерживает актуальную карту взаимосвязей сервисов, функциональных флагов и командных зависимостей.
Для этого требуется глубокое понимание стека ИИ-технологий для создания основных компонентов SRE-платформы, включая:
- Управление памятью и состоянием
- Извлечение знаний на основе RAG
- Прямой доступ к репозиториям кода
- Нативные интеграции в экосистему разработчиков
Память: Подобно тому, как LLM является мозгом агентных рабочих процессов, память — это их сердцебиение. Память предоставляет своевременную контекстную информацию для каждого запроса, что значительно повышает точность результатов. Создание высокоэффективного многоагентного рабочего процесса требует архитектуры памяти, состоящей из нескольких подкатегорий, каждая из которых разработана с нуля для решения конкретного варианта использования. Существуют кратковременная, долговременная, процедурная, эпизодическая и фактическая память. Затем следует разработка контроллера, который управляет жизненным циклом памяти: от получения данных из различных взаимодействий пользователя и системной обработки до их хранения, извлечения, ранжирования и, что самое важное, очистки.
Извлечение знаний на основе RAG: Это критически важный компонент агентного рабочего процесса, который позволяет хранить и извлекать предметно-ориентированные знания, необходимые для повышения точности и производительности. В случае с SRE-агентами они имеют доступ к предыдущим инцидентам, документам по их разбору (ретроспективам), руководствам (runbooks), например, как выполнить последовательную перезагрузку кластера или выполнить определенную системную процедуру. Эта информация постоянно развивается и
Нативная интеграция в экосистему разработчиков: Чтобы обеспечить бесперебойную и продуктивную работу, SRE-агент должен встречать инженеров там, где они работают. Когда происходит инцидент, сортировка обычно происходит на корпоративных платформах для совместной работы, таких как Slack. Поскольку обсуждение уже ведется там, для SRE-агента крайне эффективно вмешаться в качестве еще одного виртуального сотрудника — участвуя в дискуссии, предоставляя ответы и поддерживая контекст в режиме реального времени.
Эффективный SRE-агент не должен быть изолированным приложением, а должен быть глубоко интегрирован и вплетен в ткань жизненного цикла разработки программного обеспечения.
Попробуйте New Relic Autopilot.












