*Блог Беджоя Панкайакшана, исполнительного вице-президента, директора по технологиям и стратегии Mavenir
Ключевые возможности платформы
Маршрутизатор моделей (оркестратор LLM): направляет запросы на инференс к оптимальной модели на основе политик, стоимости, задержки и сложности задачи. Маршрутизатор моделей работает в трех уровнях моделей: локальные SLM (малые языковые модели), созданные и дообученные оператором для рутинных рабочих нагрузок; открытые базовые модели, работающие на инфраструктуре графических процессоров оператора для задач общего назначения; и облачные передовые (frontier) модели для задач, требующих продвинутых рассуждений, мультимодальных возможностей или специальных знаний. Решения о маршрутизации регулируются политиками оператора для каждого тарифного плана, каждого сегмента абонентов и каждого типа рабочей нагрузки. Доступ к передовым моделям тарифицируется через ту же инфраструктуру взимания платы за токены, что и локальный инференс, обеспечивая единый контроль затрат и выставление счетов независимо от того, где работает модель. Маршрутизатор моделей устраняет неконтролируемые расходы на облачный ИИ, сохраняя при этом доступ к передовым возможностям там, где они действительно добавляют ценность.
Оптимизатор токенов: сокращает потребление токенов перед вызовами LLM за счет сокращения контекста, сжатия логов, выравнивания кэша и удаления метаданных. Операторам, развертывающим ИИ-сервисы в потребительском масштабе, требуется прогнозируемая экономика графических процессоров. Оптимизатор токенов преобразует переменную облачную стоимость каждого токена в управляемую локальную модель емкости.
Конструктор SLM: создает дообученные малые языковые модели на основе данных оператора, включая агентов требований, модели обслуживания клиентов, ассистентов сетевых операций и модели рассуждений для конкретных доменов. SLM работают полностью локально на инфраструктуре графических процессоров оператора, устраняя затраты на облачное лицензирование из расчета на одно рабочее место и на один токен при масштабировании. Конструктор SLM интегрируется с конвейерами MLOps и реестра моделей Red Hat AI.
Тарификация токенов через Mavenir Digital Enablement (MDE): движок данных Mavenir (MDE) предоставляет слой интеграции для измерения, тарификации и выставления счетов за токены для монетизации ИИ оператором. MDE подсчитывает входные и выходные токены с точностью биллингового класса, применяет квоты тарифных планов и правила превышения лимитов, генерирует детализированные записи по сеансам и департаментам, а также интегрируется с системами BSS и медиации оператора. MDE позволяет операторам включать потребление ИИ в счет за телефон, точно так же, как сегодня тарифицируются тарифные планы на передачу данных. Жесткие ограничения, оповещения о пороговых значениях и обнаружение аномалий защищают как операторов, так и абонентов от неконтролируемых расходов на ИИ.
Обеспечение качества обслуживания (Service Assurance) для рабочих нагрузок ИИ: замкнутое обеспечение качества обслуживания отслеживает работоспособность ИИ-сервисов с полной поддержкой SLA, разграничивая критически важный для бизнеса инференс ИИ и фоновые рабочие нагрузки и соответствующим образом расставляя приоритеты ресурсов. Автоматизированное обнаружение сбоев, предиктивное устранение неполадок и управление SLA гарантируют, что операторы смогут брать на себя договорные обязательства по уровню обслуживания для собственных ИИ-предложений, управляемых оператором. Для корпоративных клиентов, разрабатывающих собственные приложения на платформе, или для сторонних рабочих нагрузок, размещенных в развертываниях AI Grid, обеспечение качества обслуживания регулирует доступность платформы и гарантии ресурсов; ответственность за SLA на уровне приложений несет владелец приложения, если оператор явно не предлагает приложение в качестве управляемой услуги.
Оптимизация политик ИИ: управление политиками на основе намерений охватывает поведение моделей, QoS сети и распределение вычислений из единой плоскости управления. Операторы определяют намерения высокого уровня («абоненты премиального тарифного плана получают приоритетную маршрутизацию моделей с гарантированной задержкой <200 мс»), а платформа преобразует эти намерения в скоординированную политику для шлюза ИИ, маршрутизатора моделей, сетевого слайса и системы тарификации. Обновления политик распространяются в режиме реального времени без ручной переконфигурации на всех уровнях платформы.
Архитектура «Сначала суверенная, готовая к гибридной среде»: платформа по умолчанию и в качестве основного варианта развертывания работает на контролируемой оператором инфраструктуре. Промпты, веса моделей и данные абонентов остаются в пределах сетевой границы оператора при нормальной работе. Там, где конкретные варианты использования требуют возможностей передовых моделей, маршрутизатор моделей обеспечивает защищенную политиками зашифрованную связь с внешними API моделей. Операторы настраивают, какие рабочие нагрузки могут обращаться к внешним моделям, какие категории абонентов имеют на это право и какие пороговые значения стоимости применяются. Все вызовы внешних моделей измеряются и тарифицируются через MDE в рамках той же инфраструктуры тарификации токенов. Соблюдение требований суверенитета данных, GDPR и национальных структур управления ИИ поддерживается с помощью настраиваемых элементов управления местонахождением данных, а не за счет закрытой по умолчанию архитектуры.
Безопасность ИИ и Zero Trust: платформа предоставляет службы идентификации, аутентификации, доверия и авторизации, создавая основу Zero Trust для ИИ-приложений и агентов. Проверяемые удостоверения, строгая аутентификация, делегированные полномочия и контроль доступа на основе политик гарантируют, что каждая модель, агент, инструмент и источник данных работают в рамках явно определенных разрешений. Уровень безопасности ИИ обеспечивает комплексную защиту от специфических угроз ИИ: безопасный контроль доступа к инструментам и внешним API, встроенные защитные механизмы на шлюзе моделей, непрерывный мониторинг поведения агентов, обнаружение угроз, настроенное на состязательные паттерны промптов и попытки извлечения моделей, а также элементы управления, которые поддерживают журналы аудита для каждого взаимодействия с ИИ. В совокупности уровни Zero Trust и безопасности позволяют операторам уверенно развертывать и масштабировать агентские ИИ-решения, удовлетворяя требования соответствия и рисков в регулируемых средах связи без ущерба для операционной гибкости.
Читайте первый блог в этой серии: Как операторы могут превратить токены ИИ в прибыльный бизнес
Платформа разработана для достижения измеримых результатов оператора: новые потоки доходов от ИИ за счет пакетных планов токенов — от базовых потребительских тарифов до безлимитных корпоративных квот; предсказуемая экономика ИИ за счет перенаправления большей части трафика на локальные модели с жесткими ограничениями расходов на любое использование передовых моделей; суверенитет данных по умолчанию, при котором все данные абонентов и веса моделей остаются на инфраструктуре оператора при нормальной работе; договорные SLA для управляемых оператором ИИ-сервисов, поддерживаемые замкнутым обеспечением качества обслуживания, с гарантиями доступности на уровне платформы, распространяющимися на корпоративные рабочие нагрузки и рабочие нагрузки AI Grid; быстрый путь к получению дохода благодаря предварительно проверенным сценариям развертывания, где собственное производственное развертывание Mavenir служит эталонной архитектурой; а также безопасность корпоративного класса благодаря средствам контроля идентификации Zero Trust и защите от специфических угроз ИИ, отвечающим требованиям соответствия регулируемых сред связи.







