Представляем Cortex XCOR: наблюдаемость на базе ИИ, обеспечивающая автономное реагирование с помощью AI SRE
Я занимаюсь проблемой наблюдаемости уже более десяти лет, еще с тех пор, как этот термин даже не был придуман. От создания внутренней системы мониторинга для EC2 в AWS до разработки платформы наблюдаемости для Uber — «святым граалем» всегда было создание решения, которое автоматически сообщало бы вам о проблемах и помогало их устранять, а не просто служило инструментом для отображения дашбордов. Но на пути стояли фундаментальные проблемы масштабируемости и стоимости облачных архитектур, которые мы с моим соучредителем Робом Скиллингтоном решили, создав Chronosphere.
Благодаря возможности эффективно управлять данными наблюдаемости в масштабе и по мере того, как мы переживаем очередной серьезный сдвиг в отрасли, связанный с ИИ, мы наконец достигли того момента, когда доступные технологии позволяют сделать этот «святой грааль» достижимым. Спустя шесть месяцев после присоединения к Palo Alto Networks мы делаем большой шаг вперед, запуская Cortex XCOR — платформу наблюдаемости с «родным» ИИ, которая выполняет давнее обещание автоматически находить первопричины проблем.
Переосмысление наблюдаемости для современного SDLC
Для достижения этого потребовался фундаментальный скачок в интеллектуальных возможностях моделей. Когда в конце 2022 года генеративный ИИ стал широко доступен, LLM были интригующими, но их способности к рассуждению оставались рудиментарными. Хотя мы видели ограниченные возможности применения чат-ботов и помощников в наблюдаемости, эти ранние модели могли лишь помогать конечному пользователю, но не могли окончательно решить проблему. Они помогали в расследованиях, обобщая логи или переводя запросы, но не были трансформационными. Все изменилось в конце 2025 года с появлением передовых моделей, таких как GPT-5 от OpenAI и Claude Sonnet и Opus от Anthropic.
Мой собственный «момент ИИ» в наблюдаемости наступил пару месяцев назад, когда наш чат-функционал превратился из помощника в автономного эксперта, который давал мне ответ и показывал, как он к нему пришел. По мере того как я нагружал наших агентов все более сложными сценариями, они начинали рассуждать над проблемами, выходя далеко за рамки своих первоначальных возможностей. Подобно тому, как LLM заменили мне необходимость в веб-поиске, наш чат теперь является моим основным интерфейсом в продукте, полностью меняя то, как я с ним взаимодействую.
Этот сдвиг в наблюдаемости необходим сейчас больше, чем когда-либо, поскольку операционные команды изо всех сил пытаются угнаться за всплеском разработки программного обеспечения на базе ИИ, вызванным тем же скачком в способностях к рассуждению, произошедшим в конце 2025 года. Исследования показывают, что 42% of developers теперь сообщают, что ИИ пишет не менее половины их кода, по сравнению с 12% в прошлом году. Быстрый выпуск кода постоянно расширяет поверхность для сбоев в продакшене и увеличивает нагрузку на разработчиков и SRE, которым приходится вручную выявлять первопричины. Чтобы соответствовать этой скорости, наблюдаемость должна модернизироваться прямо сейчас, чтобы не стать «узким местом» для инноваций продукта.
Представляем Cortex XCOR, платформу наблюдаемости нового поколения с «родным» ИИ
Именно поэтому мы запускаем XCOR. Мы разработали ее, чтобы превратить наблюдаемость из статических дашбордов и ручного устранения неполадок в опыт, ориентированный на ИИ, который автоматизирует как рутинные, так и сложные расследования.
В основе лежит наш XCOR Operator — ИИ-помощник, встроенный во всю платформу, который помогает операционным командам соответствовать скорости написания кода с помощью ИИ. Что делает XCOR Operator особенно мощным, так это то, что он понимает намерения пользователя и служит разговорным интерфейсом для наших специализированных агентов, работающих в фоновом режиме. Пользователь платформы наблюдаемости играет множество ролей в зависимости от ситуации: расследование инцидентов, настройка алертов и дашбордов, оптимизация объемов данных и так далее. Каждая из этих ролей дублируется специализированными ИИ-агентами, которые были оптимизированы для выполнения этих специфических рабочих процессов от начала до конца.
Самая сложная роль — это AI SRE: расследование инцидента для поиска первопричины и определения мер по устранению. Агент AI SRE, автоматически запускаемый при срабатывании алерта, автономно анализирует основные проблемы и рекомендует действия и меры по смягчению последствий в среднем менее чем за три минуты, с 75% успехом в анализе первопричин в сложных производственных средах и еще 19% инцидентов, где анализ был признан полезным. Для сравнения, ручное реагирование может занять 20 минут только на то, чтобы найти соответствующие проблемы, собрать начальный контекст и найти нужного инженера, находящегося на дежурстве.
Ни одно из этих автоматизированных рассуждений невозможно без полной сквозной видимости и контекста. Благодаря недавнему приобретению Embrace мы теперь объединяем фронтенд-мониторинг реальных пользователей (XCOR RUM) и проактивные синтетические тесты XCOR с нашей наблюдаемостью бэкенда и инфраструктуры, чтобы создать настоящую полностековую платформу. RUM фиксирует каждую веб- и мобильную сессию с полной точностью без сэмплирования, связывая сбои и медленную загрузку непосредственно с таймлайнами сессий, в то время как синтетические тесты имитируют глобальный пользовательский трафик для проактивного обнаружения регрессий до того, как они попадут в продакшен.
В основе этой полностековой видимости лежит XCOR Fabric, которую мы разработали, чтобы предоставить нашим агентам богатый, контекст реального времени об организации, приложениях и инфраструктуре, опираясь на:
- Граф знаний: детализированная модель в реальном времени, включающая вашу инфраструктуру, приложения и бизнес-логику. В отличие от многих других решений, она нормализует и включает пользовательскую телеметрию для обеспечения наиболее полного контекста.
- Оперативная память: организационные знания и исторический контекст, полученные из прошлых расследований инцидентов.
- Поведение пользователей: паттерны, показывающие, на какие конкретные запросы и дашборды полагаются старшие инженеры во время активного устранения неполадок.
- Человеческие знания: контекст, извлеченный непосредственно из ранбуков, документации и операционных файлов.
Обеспечивая полную видимость и опираясь на этот глубокий операционный контекст, XCOR обеспечивает быстрый анализ первопричин и рекомендует шаги по устранению неполадок.
Автоматизированная оптимизация продолжает обеспечивать самую экономически эффективную платформу на рынке
Тем не менее, наблюдаемость без контроля затрат похожа на недрессированного щенка: очаровательна, пока не сгрызет вашу мебель, обувь и бюджет. Управление расходами на наблюдаемость остается постоянной проблемой, поскольку современные облачные и ИИ-архитектуры производят огромные объемы телеметрических данных. Мы разработали Chronosphere для решения именно этой проблемы, и она остается важным столпом XCOR.
Мы помогаем клиентам оптимизировать данные в среднем на 89% без ущерба для видимости, завоевывая высшие рейтинги в отрасли по экономической эффективности и доверие таких лидеров индустрии, как OpenAI, DoorDash и Compass. Теперь, благодаря расширенным моделям ценообразования на основе потребления по всей платформе XCOR и детализированным бюджетам потребления, которые автоматически адаптируются к паттернам использования с течением времени, мы устраняем компромисс между критически важной видимостью и растущими затратами.
Поиски «святого грааля» наблюдаемости наконец-то увенчались успехом. В то время как инженерные команды стремятся не отставать от скорости и масштабов разработки на базе ИИ, XCOR переводит операции с уровня статических панелей мониторинга и ручного устранения неполадок к полноценному автономному исправлению. Это момент истины для ИИ в сфере наблюдаемости.










