Момент, который меняет всё в работе сети, не выглядит драматично. Что-то начинает отклоняться от нормы. Порог пропускной способности оказывается превышен. Хвост распределения задержек начинает расти. К тому моменту, когда открывается тикет, ситуация уже негативно повлияла на операции, клиентов и, возможно, на выручку.
Это тот разрыв, который автоматизация не может устранить — не потому, что автоматизация неэффективна, а потому, что операционная среда фундаментально изменилась. Десятилетиями автоматизация давала нам скрипты, рабочие процессы, оркестрацию, автоматическую подготовку к работе (zero-touch provisioning), замкнутые циклы и все более интеллектуальные средства обеспечения качества. Это помогло операторам сократить ручной труд, ускорить выполнение повторяющихся задач и повысить согласованность в крупных сложных сетях. Эта работа остается важной. Но в эпоху суперцикла ИИ — текущего периода, определяемого быстрой индустриализацией ИИ в инфраструктуре, на предприятиях и в физических системах, — автоматизация больше не является пределом амбиций.
ИИ не просто добавляет еще одну кривую трафика в сеть. Он меняет саму форму трафика, а вместе с ней и требования, предъявляемые к сети. Трафик становится более интерактивным, пульсирующим и ориентированным на исходящие каналы (uplink-heavy), что обусловлено выводом данных в реальном времени на периферии (edge inference) и моделями взаимодействия «агент-агент», которые совершенно не похожи на профили рабочих нагрузок прошлого. Вывод данных становится распределенным; размещение моделей, периферийные вычисления и координация агентов теперь являются частью операционной нагрузки, а не просто приложениями, работающими поверх сети. И роль самой сети меняется: из пассивного носителя информации она превращается в активный хост, координатор и генератор этой информации.
ИИ не просто будет работать в сетях. Он будет определяться ими.
Как только это происходит, центральный вопрос меняется. Он больше не звучит как «какие задачи может автоматизировать сеть?». Он становится таким: «какие решения может принимать сеть; насколько качественно, насколько быстро, в каких системах, с какими полномочиями, с каким управлением и с какой способностью объяснять, защищать, ограничивать и отменять результат?»
Ответ на этот вопрос и делает сеть автономной.
Автономия — это не выбор
Автономия становится обязательной, потому что операционная среда опередила операционную модель, созданную для управления ею.
Первый фактор — это скорость. Условия в сети все чаще меняются быстрее, чем человеческие операционные циклы. Автоматизация может выполнить заранее заданный ответ, но она не может рассуждать об условиях, которые не были предусмотрены при ее проектировании.
Второй фактор — это масштаб. Сложность сети сейчас выходит за рамки возможностей ручного вмешательства. Корреляция данных вручную через панели мониторинга не позволяет угнаться за количеством доменов, устройств, сервисов, политик, потоков телеметрии и зависимостей, влияющих на клиентов, которые необходимо учитывать одновременно.
Третий фактор — это взаимосвязанность. Последствия все чаще охватывают разные системы. Локальная оптимизация может создать нестабильность в другом месте. Изолированные действия могут решить текущую проблему, одновременно усиливая системную. Событие, затрагивающее клиента, может начаться на уровне доступа, проявиться в качестве обслуживания, зависеть от условий передачи данных, усугубиться решениями по размещению в облаке и потребовать скоординированных действий в нескольких операционных системах, ни одна из которых не имеет общего представления о проблеме.
Вопрос не в том, станут ли сети более автономными. Они станут. Более сложный вопрос заключается в том, что на самом деле означает автономия и что необходимо создать, чтобы воплотить ее в жизнь.
Автоматизация была путем. Решения — это пункт назначения
Различие между автоматизацией и автономией имеет значение, и его часто стирают таким образом, что это скрывает реальные потребности. Автоматизация выполняет известную задачу. Она следует предопределенной логике. Она снижает усилия человека в рамках известного операционного контура. Это чрезвычайно ценно, но это не то же самое, что автономия. Автономия начинается тогда, когда система может адаптироваться к меняющимся условиям, рассуждать о непредвиденных событиях и определять правильный курс действий в рамках заданных целей и ограничений. Сеть может автоматизировать подготовку сервиса, рабочий процесс обработки аварийных сигналов, отправку конфигурации или замкнутый цикл в рамках определенной операционной области. Но автономная сеть должна делать больше.
Она должна понимать намерения. Она должна рассуждать на уровне систем. Она должна оценивать компромиссы. Она должна решать, когда действовать, когда ждать, когда эскалировать, когда откатывать изменения и когда локальная оптимизация создает более широкий системный риск.
Вот почему более высокие уровни автономии нельзя свести к «большей автоматизации». Более высокая автономия означает, что система может принимать больше решений качественно — быстрее, в большем количестве систем, с управлением, которому операторы могут доверять. Это переосмысление важно с архитектурной точки зрения. Автономные сети не следует рассматривать только как лестницу зрелости, хотя лестница важна как общий язык для прогресса от ручного управления к полной автономии. Лестница описывает пункт назначения. Она сама по себе не определяет, что нужно построить, чтобы туда добраться. Операционная система — это дорога.
Операционная система для сети, созданной на базе ИИ
Когда мы говорим «операционная система», мы не имеем в виду ОС устройства или программный продукт в традиционном смысле. Мы имеем в виду архитектурный контракт, посредством которого взаимодействуют люди, системы, агенты, модели, данные, политики и операционные инструменты. Каждый крупный переход в вычислительной технике создавал новую абстракцию операционной системы, и каждая из них меняла контракт оператора. Переход от мейнфреймов к персональным компьютерам изменил контракт от отправки пакетных заданий к прямому взаимодействию с приложениями. Переход от физических серверов к облачной инфраструктуре изменил контракт от управления отдельными машинами к декларированию желаемого состояния в кластерах. В интеллектуальной работе мы сейчас переходим от управления отдельными приложениями для каждой задачи к выражению намерений системам ИИ, которые действуют в рамках различных задач.
В сетевых операциях текущая модель по-прежнему в значительной степени организована вокруг управления отдельными системами: EMS, контроллерами доменов, OSS/BSS и операционными инструментами, которые предлагают разные контракты для разных частей сети. Автономные сети фундаментально меняют этот контракт. Оператор больше не перемещается от устройства к устройству, от панели к панели, от системы к системе. Оператор выражает намерения, определяет результаты, устанавливает границы политик и управляет автономными решениями по всему стеку сети. Предыдущая операционная система становится подложкой. В этом заключается архитектурная значимость автономных сетей. Это не набор сценариев автоматизации. Это операционная система сети, созданной на базе ИИ.
Единицей ценности является решение
Во всех областях, движущихся к автономии, единица ценности одна и та же. Это не продукт данных, модель, агент, рабочий процесс или замкнутый цикл в отдельности. Это решение. Решение — это то, где контекст, намерение, данные, политика, авторизация, уверенность, доверие и действие объединяются.
Именно поэтому AI-native сеть не может быть просто ИИ-помощником, надстроенным над устаревшими панелями мониторинга. Это может помочь с обобщением данных или устранением неполадок, но не создает автономности. Автономность требует операционной системы, в которой решения формулируются, оцениваются, координируются, исполняются, защищаются и регулируются.
Восемь показателей операционной автономности
Если решение является единицей ценности, то для операционной автономности нужны новые показатели.
Скорость принятия решений — это количество решений, которые операционная система может принять за единицу времени. AI-native сети будут работать в темпе, недоступном для человеческих операционных циклов.
Качество решений — это то, как часто выбранное решение оказывается верным. Быстрое, но неверное решение — это не автономность, а автоматизированная нестабильность.
Радиус поражения решения — это ограниченная область воздействия в случае, если решение оказалось неверным. Он определяет, на какие ресурсы, сервисы, клиентов и смежные результаты решение может повлиять, а также то, как быстро можно локализовать или обратить последствия.
Обратимость решения — это возможность безопасного отката принятого решения. Автономность без обратимости не завоюет операционного доверия.
Прослеживаемость решения — это способность системы отследить, почему было принято решение, используя какие данные, какую модель, какого агента, какую политику, какую авторизацию и какое намерение.
Связность решений — это то, остается ли решение согласованным в рамках связанных систем. Оптимизация радиосети может повлиять на транспортную сеть. Действие в транспортной сети может повлиять на качество обслуживания. Решение о размещении в облаке может повлиять на задержку, энергопотребление и суверенитет. В AI-native сети локальные решения все чаще создают более масштабные последствия.
Безопасность решений — это то, является ли решение авторизованным, защищенным от несанкционированного изменения и исполненным в рамках принципа минимальных привилегий. В автономных операциях безопасность заключается не только в защите сети от внешних атак, но и в обеспечении того, чтобы само автономное действие не выходило за рамки своих полномочий.
Достоверность решений — это откалиброванная уверенность системы в принятом решении. Это не смутная вера в то, что система «умная». Это дисциплинированная способность понимать, когда решение обладает высокой степенью уверенности, когда оно требует моделирования, когда необходимо одобрение человека и когда его вообще не следует принимать. Быстрое решение, которому нельзя доверять, может быть более разрушительным, чем медленное решение, которое является обоснованным, авторизованным, ограниченным и обратимым.
Зрелость автономной сети — это не показатель того, насколько развита автоматизация. Это показатель того, насколько эффективно операционная система принимает, защищает, регулирует и улучшает решения.
Телекоммуникации — самый сложный пример этой модели
Телекоммуникационная отрасль отстает в вопросах автономности не из-за отсутствия амбиций. Это сложно, потому что отрасль сочетает в себе ограничения, с которыми большинство других индустрий сталкиваются лишь частично.
Рассмотрим типичный сценарий: деградация, влияющая на клиента, начинается как аномалия емкости на уровне радиодоступа. В мониторинге качества обслуживания она проявляется как повышенная задержка. Она частично маскируется транспортным путем, который уже работает на пределе своих возможностей. И ее невозможно устранить силами одного домена. Требуются скоординированные действия в радиосети, транспортной сети и операциях по обслуживанию, каждое из которых регулируется разными поставщиками, разными политиками и разными операционными контрактами.
Локальный замкнутый контур может принять верное решение в рамках своего домена, но при этом привести к неверному результату для клиента. В этом суть проблемы автономных сетей: принятие решений в динамически меняющихся, глубоко связанных системах при соблюдении гарантий операторского класса.
Автономность операторского класса означает, что сеть должна соответствовать требованиям доступности, детерминизма, устойчивости, регуляторной ответственности, законности операций и доверия клиентов не как желаемым свойствам, а как не подлежащим обсуждению ограничениям для каждого автономного решения.
Открытый рубеж — это не увеличение автоматизации внутри существующих «силосов». Это решения, которые работают во всех «силосах» при соблюдении этих ограничений и в темпе, требуемом AI-native операциями.
Внутри операционной системы
Операционная система для автономных сетей требует сочетания нескольких ключевых возможностей. Она начинается с общей основы: данных, вычислительных мощностей, обслуживания моделей, среды выполнения агентов и примитивов управления, которые работают в разных системах и у разных поставщиков. На этой основе необходима онтология: семантическое и операционное представление сети, которое охватывает не только топологию, но и сервисы, клиентов, намерения, SLO, сбои, политики, конфигурации и зависимости. Нужны агенты, способные рассуждать в контексте, вызывать инструменты и действовать в четких границах: наблюдатели, советники, исполнители и координаторы. Нужны экспертные модели, понимающие последствия решений во всем стеке сети. И нужно намерение как контракт решения: определение желаемых результатов и ограничений, в рамках которых системе разрешено действовать.
Для всего этого необходимо управление по принципу «прозрачного ящика» (Glass Box). В то время как ИИ «черного ящика» выдает результат без объяснений, система «прозрачного ящика» может показать, какие данные вызвали решение, какая политика его ограничила, какая авторизация его одобрила и какой откат доступен, если условия изменятся. Управление «прозрачного ящика» делает решения достаточно безопасными для развертывания, достаточно точными для аудита и достаточно ограниченными для доверия. Доверие — это не чувство, которое операторы испытывают к автономности. Это свойство, которое система должна постоянно доказывать.
От сетевых операций к операциям принятия решений
Этот сдвиг меняет наше представление о сетевых операциях как о дисциплине. Традиционные сетевые операции строились вокруг аварийных сигналов, заявок, панелей мониторинга, рабочих процессов и ручной эскалации. Автономные сети строятся вокруг решений. И задача операционного проектирования состоит в том, чтобы знать, какие решения к какому уровню относятся. Какие решения должны оставаться под контролем человека, потому что радиус поражения слишком велик, граница безопасности чувствительна или регуляторная ответственность требует участия человека? Какие решения могут быть рекомендованы системой с одобрением оператора перед исполнением? Какие могут исполняться системой в рамках политики при человеческом надзоре на уровне управления? А какие решения вообще не следует принимать, потому что уверенность системы еще не откалибрована?
Цель состоит не в том, чтобы исключить людей из сети. Цель — переключить внимание человека на нужный уровень: от оператора каждой задачи к архитектору и управляющему системы принятия решений.
Полигон для AI-native инфраструктуры
Автономные сети — это больше, чем просто вызов для телекома. Это полигон для более широкого сдвига в том, как управляется AI-native инфраструктура.
ИИ-сетям (AI-Grids) потребуются решения в области энергетики, вычислений, памяти, размещения рабочих нагрузок, перемещения данных и связности. ИИ-фабрикам (AI-Factories) потребуются решения в области вычислений, питания, охлаждения, сетевого взаимодействия, хранения, конвейеров данных, жизненного цикла моделей, безопасности и операционной устойчивости. Суверенным ИИ-структурам потребуются решения в области инфраструктуры национального масштаба, управления данными, моделей, юрисдикций, безопасности и операционной ответственности.
Различные домены потребуют различных экспертных моделей, различных политик и различных ограничений безопасности. Однако архитектурная форма останется привычной: онтология, продукты данных, экспертные модели, агенты, намерения, замкнутые циклы и управление. Решение этой задачи в телекоммуникационной сфере, где сеть уже охватывает домены, поставщиков, географические регионы, клиентов, услуги и нормативно-правовые режимы, создает операционную логику для смежной инфраструктуры, изначально созданной для ИИ.
Сети будут конкурировать на основе принимаемых решений
Следующий этап конкуренции сетей будет определяться не только скоростью, покрытием, емкостью или стоимостью. Эти факторы остаются важными, но их будет недостаточно. По мере того как сети становятся более динамичными, интеллектуальными, распределенными и тесно связанными с физическим миром, дифференциация будет все больше зависеть от качества решений, которые может принимать сеть. Может ли сеть обнаруживать проблемы раньше? Может ли она рассуждать в рамках различных систем? Может ли она действовать быстрее? Может ли она ограничивать ошибки? Может ли она обеспечить безопасность автономных действий? Может ли она объяснить, что произошло? Может ли она безопасно изменить курс? Может ли она знать, когда она уверена, а когда нет? Может ли она учиться на каждом решении? Может ли она координировать локальные действия для достижения глобальных результатов?
Операторы и обслуживающие их поставщики, которые освоят науку и управление принятием решений, определят, на что сеть будет способна в будущем. Сети по-прежнему будут конкурировать по производительности. Но все чаще они будут конкурировать и по качеству принимаемых решений. В Nokia мы создаем именно такую операционную систему совместно с обслуживаемыми нами операторами: систему, которая превращает автономию из простой автоматизации в доверенные, управляемые решения.
