Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Kak sozdat sre agent kotoryy deystvitelno rabotaet i ne razoryaet byudzhet na to
Dev48

© 2026 · All rights reserved.

Как создать SRE-агент, который действительно работает (и не разоряет бюджет на токены)

Источник: New Relic

Как создать SRE-агент, который действительно работает (и не разоряет бюджет на токены)

Источник: New Relic

Узнайте, как создать SRE-агент, который обеспечивает точную и низкозадержечную сортировку инцидентов с помощью многоуровневой памяти и RAG — и при этом не выходит за рамки бюджета на токены.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

Ключевая роль платформ наблюдаемости заключается в том, чтобы помочь вам достичь бизнес- и технических целей по обеспечению непрерывной работы бизнеса по требованию, сохраняя при этом низкие затраты. За последнее десятилетие сложность эксплуатации корпоративной инфраструктуры и приложений многократно возросла.

Появление генеративного ИИ в технологическом ландшафте увеличило сложность систем, непреднамеренно усилив нагрузку на команды DevOps и SRE. Корпоративная наблюдаемость генерирует огромное количество MELT (метрик, событий, трассировок и логов), что приводит к множеству оповещений и условий, а этот объем является основным драйвером операционной рутины. Стремление к доступности 99,999% требует видимости на каждом уровне — от оборудования до приложений, — но это достигается ценой значительной усталости от оповещений.

До сих пор традиционный подход заключался в следующем: отслеживать все, вручную устанавливать условия оповещения, а когда оповещение срабатывает, вызывать человека, и процесс сортировки начинается с изучения дашбордов наблюдаемости. Этот подход больше не является устойчивым в текущем технологическом ландшафте.

Чтобы справиться с этой ситуацией, многие компании запустили AI SRE — виртуального агента инженера по надежности сайта. На первый взгляд, многие агенты выглядят одинаково, так как они действуют как первая линия обороны, перехватывая оповещение до того, как оно попадет к человеку, просеивая логи и используя LLM для поиска первопричины (RCA) и рекомендации шагов по устранению.

Но в реальности во многих случаях опыт разработчика сводится к потере времени, галлюцинациям результатов, увеличению стоимости токенов и все тому же просеиванию множества дашбордов, выполнению запросов в различных системах для поиска первопричины и устранения неисправностей.

Создание SRE-агента, который обеспечивает высокую точность, низкую задержку и отсутствие галлюцинаций, не выходя за рамки бюджета на ИИ-токены. Система, которая содержит актуальную карту того, как сервисы, функциональные флаги и командные зависимости связаны друг с другом, требует глубокого понимания основных компонентов стека ИИ-технологий и создания ключевых модулей/компонентов SRE-платформы, включая память, RAG-знания, доступ к репозиториям кода, деревья решений и нативные интеграции в экосистему разработчиков.

Создание SRE-агента, который обеспечивает высокую точность и низкую задержку без галлюцинаций — и все это без превышения бюджета на ИИ-токены — является сложной инженерной задачей. Она требует системы, которая поддерживает актуальную карту взаимосвязей сервисов, функциональных флагов и командных зависимостей.

Для этого требуется глубокое понимание стека ИИ-технологий для создания основных компонентов SRE-платформы, включая:

  • Управление памятью и состоянием
  • Извлечение знаний на основе RAG
  • Прямой доступ к репозиториям кода
  • Нативные интеграции в экосистему разработчиков

Память: Подобно тому, как LLM является мозгом агентных рабочих процессов, память — это их сердцебиение. Память предоставляет своевременную контекстную информацию для каждого запроса, что значительно повышает точность результатов. Создание высокоэффективного многоагентного рабочего процесса требует архитектуры памяти, состоящей из нескольких подкатегорий, каждая из которых разработана с нуля для решения конкретного варианта использования. Существуют кратковременная, долговременная, процедурная, эпизодическая и фактическая память. Затем следует разработка контроллера, который управляет жизненным циклом памяти: от получения данных из различных взаимодействий пользователя и системной обработки до их хранения, извлечения, ранжирования и, что самое важное, очистки.

Извлечение знаний на основе RAG: Это критически важный компонент агентного рабочего процесса, который позволяет хранить и извлекать предметно-ориентированные знания, необходимые для повышения точности и производительности. В случае с SRE-агентами они имеют доступ к предыдущим инцидентам, документам по их разбору (ретроспективам), руководствам (runbooks), например, как выполнить последовательную перезагрузку кластера или выполнить определенную системную процедуру. Эта информация постоянно развивается и

Нативная интеграция в экосистему разработчиков: Чтобы обеспечить бесперебойную и продуктивную работу, SRE-агент должен встречать инженеров там, где они работают. Когда происходит инцидент, сортировка обычно происходит на корпоративных платформах для совместной работы, таких как Slack. Поскольку обсуждение уже ведется там, для SRE-агента крайне эффективно вмешаться в качестве еще одного виртуального сотрудника — участвуя в дискуссии, предоставляя ответы и поддерживая контекст в режиме реального времени.

Эффективный SRE-агент не должен быть изолированным приложением, а должен быть глубоко интегрирован и вплетен в ткань жизненного цикла разработки программного обеспечения.

Попробуйте New Relic Autopilot.

← Все статьи

Ещё в разделе «Данные и аналитика»

Все →
Освещение глобальных катастроф в прессе | Planet
Planet Labs

Освещение глобальных катастроф в прессе | Planet

Официальный SDK FastAPI Redis уже доступен
Redis

Официальный SDK FastAPI Redis уже доступен

Dynatrace получила сертификат ISO/IEC 42001
Dynatrace

Dynatrace получила сертификат ISO/IEC 42001

Массовый параллельный импорт в Neo4j без взаимных блокировок и конфликтов блокировок
Neo4j

Массовый параллельный импорт в Neo4j без взаимных блокировок и конфликтов блокировок

Глобальный индекс принятия криптовалют 2026: мировая криптоэкономика устояла в период медвежьего рынка
Chainalysis

Глобальный индекс принятия криптовалют 2026: мировая криптоэкономика устояла в период медвежьего рынка

Латинская Америка: Бразилия лидирует в мире по внедрению на фоне роста криптоэкономики региона
Chainalysis

Латинская Америка: Бразилия лидирует в мире по внедрению на фоне роста криптоэкономики региона

Ещё от New Relic

Централизованное управление логами: полное руководство для инженеров
New Relic

Централизованное управление логами: полное руководство для инженеров

Наблюдаемость LLM: 8 лучших инструментов для производственных систем ИИ
New Relic

Наблюдаемость LLM: 8 лучших инструментов для производственных систем ИИ

Представляем New Relic Compound Alerts
New Relic

Представляем New Relic Compound Alerts

Анонс прогноза по наблюдаемости на 2026 год
New Relic

Анонс прогноза по наблюдаемости на 2026 год

Центralлизованное управление логами: исчерпывающий руководящий материал для инженеров
New Relic

Центralлизованное управление логами: исчерпывающий руководящий материал для инженеров

Наблюдаемость LLM: 8 лучших инструментов для производственных систем ИИ
New Relic

Наблюдаемость LLM: 8 лучших инструментов для производственных систем ИИ