Программное обеспечение изменилось. Наблюдаемость должна меняться вместе с ним.
Каждый крупный сдвиг в разработке программного обеспечения заставлял операционные команды переосмысливать то, как они понимают производственную среду. Виртуализация абстрагировала инфраструктуру. Облачные вычисления привнесли беспрецедентную эластичность. Контейнеры и Kubernetes значительно увеличили скорость развертывания, в то время как микросервисы превратили одно приложение в десятки или даже сотни взаимосвязанных сервисов. Каждый шаг приносил огромную бизнес-ценность, но также делал производственные среды более динамичными, распределенными и значительно более сложными для понимания.
Наблюдаемость развивалась в ответ на эти изменения. То, что начиналось как способ сбора операционных данных, постепенно стало одной из определяющих дисциплин современной разработки ПО. Метрики помогали командам выявлять тенденции производительности до того, как их замечали клиенты. Логи показывали, что на самом деле делают приложения, а распределенная трассировка связывала запросы в рамках все более сложных архитектур. Вместе эти возможности дали инженерным организациям то, чего у них никогда не было раньше: способность наблюдать за высокораспределенными системами с достаточной ясностью, чтобы уверенно ими управлять.
Тем не менее, на протяжении всей этой эволюции одно предположение оставалось удивительно неизменным. Наблюдаемость существовала для того, чтобы помогать людям понимать системы. Инженеры собирали телеметрию, сопоставляли сигналы, расследовали инциденты и в конечном итоге принимали решения о том, какие действия предпринять. По мере того как среды становились сложнее, платформы наблюдаемости также становились более совершенными. Они собирали больше данных, связывали больше сигналов и сокращали время, необходимое для расследования проблем. Однако потребителем этой операционной информации по-прежнему оставался человек-оператор.
Искусственный интеллект меняет это предположение. ИИ выходит за рамки экспериментов и становится активным участником доставки ПО и операционной деятельности. Разработчики полагаются на него при написании кода, платформенные команды используют его для оптимизации инфраструктуры, а операционные команды все чаще ожидают, что интеллектуальные системы помогут в расследовании инцидентов, объяснении аномалий, оценке возможных ответных мер и помощи в рутинной операционной работе. Дискуссия смещается от вопроса о том, может ли ИИ помочь, к тому, где и как он должен участвовать.
Впервые наблюдаемость должна одновременно обслуживать две очень разные аудитории. Она должна продолжать помогать инженерам понимать производственную среду, одновременно предоставляя операционный контекст, необходимый интеллектуальным системам для эффективного анализа этой же среды. Люди и ИИ становятся сотрудниками, каждый из которых привносит свои сильные стороны, но оба зависят от одной и той же операционной реальности.
Это меняет саму цель наблюдаемости. Следующая эра будет определяться не просто тем, сколько телеметрии собирают организации. Она будет определяться тем, насколько эффективно они преобразуют эту телеметрию в доверенное, общее понимание производственной среды.
Видимость никогда не была конечной целью
Представьте, что сейчас 2:17 ночи.
Сервис оформления заказов глобального ритейлера начал давать сбои. Транзакции клиентов прерываются, выручка теряется с каждой минутой, и инженеры из нескольких команд подключаются к каналу реагирования на инциденты. Через несколько мгновений ИИ-системы начинают работать вместе с ними. Одна из них выявляет недавнее развертывание, коррелирующее со сбоем. Другая определяет вышестоящую зависимость, которая изменилась ранее в тот же день. Тем временем дашборды продолжают транслировать метрики, трассировки, логи, алерты и телеметрию инфраструктуры из каждого уголка среды.
Ни один из этих сигналов не является обязательно неверным. На самом деле, каждая рекомендация может быть подкреплена достоверными операционными данными. И все же руководитель инцидента по-прежнему сталкивается с вопросом, который всегда делал сложные инциденты трудными: как эти части складываются в единое целое?
Это различие подчеркивает важное ограничение в том, как организации традиционно мыслили о наблюдаемости. Инженерные команды вложили огромные средства в видимость, и эти инвестиции были чрезвычайно успешными. Современные платформы наблюдаемости обеспечивают беспрецедентное понимание производительности приложений, состояния инфраструктуры, развертываний и распределенных архитектур. Инженеры имеют доступ к большему объему операционной информации, чем они могли бы разумно представить всего несколько лет назад.
Но видимость и понимание — это не одно и то же. Самые сложные вопросы во время критического инцидента редко начинаются со слов: «Где данные?». Они начинаются с вопросов вроде: почему этот сервис вышел из строя? Что изменилось? Какие системы затронуты? Связаны ли эти алерты? Какие доказательства наиболее важны? Эти ответы не существуют внутри какого-то одного потока телеметрии. Они возникают, когда операционная информация связывается в последовательное понимание того, как среда ведет себя в данный момент.
Исторически сложилось так, что опытные инженеры сами обеспечивали большую часть этого понимания. Они сочетали телеметрию со знаниями об архитектуре, предыдущими инцидентами, беседами с коллегами, информацией о владельцах сервисов и годами операционного опыта, чтобы построить ментальную модель производства. У ИИ нет эквивалентной накопленной интуиции. Он рассуждает на основе доступного ему операционного контекста. Когда этот контекст фрагментирован, неполный или противоречив, даже сложный ИИ может рассуждать на основе неполного представления о реальности.
Следовательно, задача больше не заключается просто в сборе операционных данных. Она заключается в создании доверенного операционного понимания, на которое инженеры и ИИ могут полагаться вместе.
От телеметрии к доверенной операционной аналитике
На протяжении большей части истории наблюдаемости успех измерялся видимостью. Каждое поколение инструментов помогало командам собирать больше операционных данных, более эффективно сопоставлять сигналы и сокращать время, необходимое для расследования инцидентов. Эти инновации остаются незаменимыми, но видимость никогда не была конечной целью. Настоящей целью всегда было понимание.
Инженеры не открывают дашборды, потому что хотят посмотреть на телеметрию. Они открывают их, потому что пытаются ответить на вопросы. Почему этот сервис вышел из строя? Что изменилось? Какие системы затронуты? Является ли это изолированной проблемой или частью чего-то большего? Телеметрия ценна тем, что помогает ответить на эти вопросы, а не тем, что сами данные обладают внутренней ценностью.
Это различие становится гораздо более значимым, когда ИИ входит в операционный рабочий процесс. Каждая рекомендация, которую дает интеллектуальная система, основана на контексте, доступном в данный момент. Если телеметрия не связана с владением сервисами, историей развертываний, топологией, зависимостями и историческими операционными знаниями, ИИ может рассуждать только на основе части картины. Одни лишь более мощные модели не могут решить проблему отсутствующего операционного контекста.
Именно поэтому мы считаем, что следующая эволюция наблюдаемости — это не просто очередной прорыв в сборе телеметрии. Следующий прорыв заключается в преобразовании операционных данных в надежную операционную аналитику: объединение сигналов, взаимосвязей, изменений, ответственности и исторического контекста в развивающееся представление о производственной среде.
Телеметрия говорит нам, что произошло. Надежная операционная аналитика помогает объяснить, что это значит.
Что еще важнее, она создает общее операционное понимание, которое как инженеры, так и ИИ могут использовать в качестве основы для расследований, рекомендаций и принятия решений. Такое общее понимание может фундаментально изменить экономику и эффективность операций. Команды могут тратить меньше времени на восстановление хода инцидентов, снизить зависимость от неформальных знаний, более эффективно сотрудничать между отделами и быстрее расследовать проблемы. Рекомендации ИИ могут стать более последовательными, объяснимыми и легкими для проверки инженерами, поскольку и люди, и интеллектуальные системы рассуждают, опираясь на одну и ту же операционную базу. В конечном итоге это поможет организациям повысить надежность, снизить операционные риски и защитить клиентский опыт и бизнес-результаты, которые зависят от их программного обеспечения.
Именно для решения этой задачи был создан New Relic Ground Truth.
Ground Truth разработан для создания надежной операционной аналитики путем объединения телеметрии с контекстом, необходимым для понимания производственной среды. Вместо того чтобы рассматривать метрики, логи, трассировки, развертывания, зависимости, топологию, ответственность и операционные знания как независимые источники информации, Ground Truth объединяет контекст и доказательства, чтобы инженеры и системы ИИ могли начинать работу с более согласованным пониманием среды.
Это меняет то, как команды взаимодействуют с наблюдаемостью. Вместо того чтобы тратить драгоценное время на сбор информации из нескольких инструментов и мысленное восстановление картины среды во время каждого расследования, команды могут начинать работу, уже имея операционный контекст. Новые инженеры могут наследовать контекст, вместо того чтобы полагаться исключительно на неформальные знания. Опытные инженеры могут тратить больше времени на проверку гипотез и принятие решений, а не на сбор доказательств. Системы ИИ могут проводить расследования, опираясь на ту же надежную операционную базу, на которую полагаются операторы-люди.
ИИ может быть настолько эффективным, насколько эффективен операционный контекст, который он получает. Ground Truth разработан на основе этого принципа: обеспечить надежное операционное понимание, которое помогает как инженерам, так и интеллектуальным системам исследовать сложные среды с большей уверенностью.
Как только появляется такое общее понимание, естественным образом возникает еще одна возможность.
Понимание больше не должно быть конечной целью. Оно может стать отправной точкой для интеллектуальных действий.
Когда понимание становится действием
На протяжении большей части истории наблюдаемости работа фактически заканчивалась, когда инженеры понимали проблему. Как только инцидент был расследован и его вероятная причина определена, ответственность переходила от платформы наблюдаемости к команде инженеров. Изучались инструкции (runbooks), профильные эксперты подключались к устранению инцидентов, изменения проверялись, открывались тикеты, заинтересованные стороны получали обновления, и в конечном итоге кто-то выполнял действия по исправлению, которые восстанавливали сервис.
ИИ начинает менять эту границу. Когда инженеры и интеллектуальные системы разделяют надежное операционное понимание, ИИ может делать больше, чем просто обобщать дашборды или выделять аномалии. Он может помогать в расследованиях в контексте, объяснять, почему важны конкретные условия, оценивать потенциальные пути решения и помогать инженерным командам координировать последующую операционную работу. Возможность заключается не в том, чтобы исключить инженеров из операций. Она в том, чтобы сократить дистанцию между пониманием проблемы и уверенным реагированием на нее.
Именно здесь New Relic Autopilot расширяет более широкое видение автономных операций (Autonomous Operations). Autopilot разработан, чтобы помочь командам исследовать и рассуждать на основе операционной информации, привносить соответствующие агентные возможности в рабочий процесс и помогать инженерам определять, что должно произойти дальше. Ground Truth и Autopilot играют разные, но дополняющие друг друга роли: надежная операционная аналитика обеспечивает более прочную основу для понимания, в то время как агентные возможности помогают командам применять интеллект в операционной работе.
Человеческое суждение остается необходимым. Производственные системы формируются техническими соображениями, бизнес-приоритетами, требованиями соответствия, политиками безопасности и обязательствами перед клиентами. ИИ должен усиливать это принятие решений, а не обходить его. Инженеры остаются ответственными за результаты, в то время как интеллектуальные системы вносят вклад в виде скорости, масштаба, последовательности и операционного контекста.
Этот принцип становится все более важным по мере того, как организации движутся к автономным операциям. Цель — не неконтролируемая автоматизация. Это операционная модель, в которой организации могут определять, где участвует ИИ, где требуется проверка или одобрение человека, и как поддерживаются управление и подотчетность по мере того, как интеллектуальные системы все глубже вовлекаются в операции.
Будущее, к которому движется наблюдаемость
Каждое значительное достижение в области наблюдаемости отражало более широкие изменения в разработке программного обеспечения. Виртуализация, облачные вычисления, микросервисы и Kubernetes — каждое из них привносило новые формы сложности, и наблюдаемость развивалась, чтобы помочь инженерным командам понять их.
Искусственный интеллект привносит принципиально иное изменение, поскольку он трансформирует не только наблюдаемые системы, но и потребителей операционной информации. Впервые от наблюдаемости требуется обслуживать как инженеров-людей, так и интеллектуальные системы, которые исследуют, рассуждают и все чаще участвуют в принятии операционных решений.
Это меняет роль, которую наблюдаемость играет внутри современных инженерных организаций. Следующее поколение будет определяться не только тем, насколько эффективно оно собирает телеметрию или визуализирует поведение системы. Эти возможности остаются важными, но сами по себе их уже недостаточно. Наблюдаемость эволюционирует в сторону уровня операционной аналитики, который позволяет людям и ИИ понимать производство через одну и ту же надежную операционную реальность.
Такое общее понимание создает возможности, выходящие далеко за рамки реагирования на инциденты. Новые инженеры могут наследовать операционный контекст, вместо того чтобы полагаться исключительно на неформальные знания. Команды разработки, платформенной инженерии, безопасности и операций могут сотрудничать, опираясь на более согласованную картину производства. Рекомендации ИИ могут стать легче для понимания и проверки, поскольку их можно проследить до надежной операционной основы. Уверенность растет не потому, что инженеры передают контроль автоматизации, а потому, что люди и ИИ начинают работу с общего понимания среды.
Это будущее, которое мы называем автономными операциями (Autonomous Operations).
Автономные операции не означают, что организация работает без участия людей. Человеческий опыт становится более ценным, поскольку инженеры тратят меньше времени на восстановление операционной реальности и больше времени на принятие решений, управление рисками, повышение надежности и улучшение качества обслуживания клиентов. ИИ обеспечивает скорость, масштабируемость и согласованность. Люди привносят опыт, ответственность, управление и принятие стратегических решений. Вместе они создают операционную модель, которую ни одна из сторон не смогла бы достичь самостоятельно.
Вспомните инцидент, с которого началось это обсуждение. Все еще 2:17 ночи. Клиенты по-прежнему страдают, а инженерам все еще приходится принимать трудные решения под давлением. Меняется не просто интеллект ИИ. Меняется качество понимания, разделяемого всеми участниками реагирования. Вместо того чтобы начинать со сборки фрагментов телеметрии в общую картину производства, инженеры и ИИ могут начать с общей операционной базы, оценивать доказательства на основе этого понимания и принимать решения с большей уверенностью.
Вот почему мы считаем, что ИИ переопределяет наблюдаемость.
Будущее наблюдаемости — это не просто сбор большего количества данных или развертывание более интеллектуальных систем. Это создание надежного операционного понимания, которое позволяет людям и ИИ исследовать, рассуждать и работать вместе с большей уверенностью.
Это и есть фундамент для автономных операций.
Даг Браун — менеджер по продуктовому маркетингу в New Relic, специализирующийся на AIOps и агентной наблюдаемости. Он тесно сотрудничает с командами по продуктам и разработке, помогая организациям повышать надежность, снижать операционную сложность и превращать данные наблюдаемости в практические результаты. Даг обладает глубоким опытом в области кибербезопасности, облачных платформ и операций на базе ИИ, а также стремится переводить сложные технологии на понятный язык, ориентированный на клиента.
Мнения, выраженные в этом блоге, принадлежат автору и не обязательно отражают взгляды New Relic. Любые решения, предложенные автором, зависят от конкретной среды и не являются частью коммерческих решений или поддержки, предлагаемых New Relic. Пожалуйста, обращайтесь исключительно в Explorers Hub (support.newrelic.com) по вопросам и поддержке, связанным с этой публикацией в блоге. Этот блог может содержать ссылки на контент сторонних сайтов. Предоставляя такие ссылки, New Relic не принимает, не гарантирует, не одобряет и не поддерживает информацию, взгляды или продукты, доступные на таких сайтах.











