Anyscale on Azure теперь общедоступен: позволяя предприятиям владеть полным циклом ИИ, а не только выводом

Источник: Anyscale•

Anyscale on Azure теперь общедоступен: позволяя предприятиям владеть полным циклом ИИ, а не только выводом

Запускайте Ray на Azure с помощью Anyscale, который теперь стал общедоступным. Управляемый Ray на AKS в вашей собственной подписке Azure с нативной для Azure системой управления и биллингом.

Сегодня Anyscale on Azure стал общедоступным, поэтому предприятия могут запускать свои собственные циклы ИИ — от обработки данных, обучения, пост-обучения и оценки до вывода — с той простотой использования, которую они ожидают от размещенного вывода моделей.

Аренда интеллекта с оплатой за токен — это самый быстрый способ доказать эффективность сценария использования ИИ. ИИ-ориентированные компании сначала строили бизнес именно так, быстро собирая продукты на базе API передовых моделей, и те же API помогали им масштабироваться. Но по пути они отказались от контроля над тремя вещами: моделью, своими данными и расходами. Модель и дорожная карта её развития принадлежали кому-то другому. Данные, которые делали сценарий использования ценным, должны были покинуть среду компании, чтобы достичь модели. А счета росли прямо пропорционально использованию, поэтому масштабирование никогда не приводило к снижению удельной стоимости. Любой, кто арендует, идет на один и тот же компромисс.

ИИ-ориентированные компании первыми столкнулись с этими ограничениями. Как только сценарий использования доказывал свою ценность, проблемами становились стоимость и раскрытие данных. Чтобы смягчить это, они перешли на более мелкие, специализированные модели, настроенные на собственных данных и работающие на собственных графических процессорах, что обеспечило им более быстрые ответы при меньших затратах. Еще большее преимущество дало постоянное улучшение этих моделей: владение циклом обучения, который превращает производственные данные в запуски обучения и пост-обучения, а обновленные модели — в развертывания для вывода, обеспечивающие работу их ИИ-приложений.

Этот цикл заменяет конвейер, предназначенный только для вывода, набором рабочих нагрузок ИИ — обработкой данных, обучением и дообучением, пост-обучением и выводом, — которые должны совместно использовать кластеры GPU. Чтобы запускать множество рабочих нагрузок на множестве GPU, Ray стал общим уровнем выполнения и оркестрации для ИИ-ориентированных команд. Предприятия хотят того же пути, распространяя управление Azure, которому они уже доверяют, на каждый этап цикла.

Anyscale превращает Ray из распределенного вычислительного движка в платформу корпоративного уровня: команды создают и масштабируют каждый этап цикла, пока Anyscale управляет операциями кластера, и все это в рамках безопасности и управления, которые они уже выстроили в Azure. Клиенты Azure развертывают его через портал Azure, запускают производственный ИИ в Azure Kubernetes Service (AKS) в своей собственной подписке и оплачивают его как любую другую службу Azure, при этом расходы засчитываются в счет их существующего обязательства по потреблению Microsoft Azure (MACC).

С Anyscale on Azure вы можете:

  • Владеть своим ИИ. Anyscale работает на базе Ray с открытым исходным кодом под управлением PyTorch Foundation. Ваши конвейеры данных, код обучения и логика обслуживания работают на открытом исходном коде на каждом уровне стека.

Владеть своим ИИ. Anyscale работает на базе Ray с открытым исходным кодом под управлением PyTorch Foundation. Ваши конвейеры данных, код обучения и логика обслуживания работают на открытом исходном коде на каждом уровне стека.

  • Обеспечить безопасность ваших данных, оценок и моделей. Ваши рабочие нагрузки выполняются в AKS в вашей собственной подписке Azure, связанной с клиентом Microsoft Entra вашей организации. Существующие элементы управления Azure RBAC и Azure Policy вашей платформенной команды применяются без изменений.

Обеспечить безопасность ваших данных, оценок и моделей. Ваши рабочие нагрузки выполняются в AKS в вашей собственной подписке Azure, связанной с клиентом Microsoft Entra вашей организации. Существующие элементы управления Azure RBAC и Azure Policy вашей платформенной команды применяются без изменений.

  • Увеличить производительность на GPU для снижения затрат. Совместное использование мощностей GPU обеспечивает эффективность масштабирования, а пост-обучение на собственных данных позволяет командам переходить на более мелкие, специализированные модели, обслуживание которых обходится дешевле.

Увеличить производительность на GPU для снижения затрат. Совместное использование мощностей GPU обеспечивает эффективность масштабирования, а пост-обучение на собственных данных позволяет командам переходить на более мелкие, специализированные модели, обслуживание которых обходится дешевле.

Владеть своим ИИ

Сатья Наделла обосновал это ранее в этом году:

«Крайне важно, чтобы мы распространили инфраструктуру обучения на каждую фирму, чтобы они могли контролировать свой собственный цикл обучения… компания должна иметь возможность использовать модель, не отказываясь от знаний, которые делают ее уникальной». – Сатья Наделла, председатель и генеральный директор Microsoft

«Крайне важно, чтобы мы распространили инфраструктуру обучения на каждую фирму, чтобы они могли контролировать свой собственный цикл обучения… компания должна иметь возможность использовать модель, не отказываясь от знаний, которые делают ее уникальной».

– Сатья Наделла, председатель и генеральный директор Microsoft

Владеть своим ИИ означает владеть циклом, который его улучшает. Результаты производства подпитывают курирование данных, курированные данные подпитывают обучение, а следующая версия модели возвращается в эксплуатацию. Anyscale on Azure запускает весь этот цикл на одной платформе. Он позволяет вам курировать ваши мультимодальные (текст, изображения, видео, документы и т. д.) данные, масштабировать дообучение моделей и другие методы пост-обучения, такие как обучение с подкреплением (RL), поддерживает пост-обучение и дообучение, а также обеспечивает работу моделей в процессе обновлений и колебаний спроса. Для каждого из них Anyscale оркестрирует вычисления в соответствии с требованиями каждой рабочей нагрузки. Например, для развертывания LLM и других моделей в качестве конечных точек, службы Anyscale развертываются с обновлениями без простоя, масштабируются до нуля при простое и уплотняют реплики для поддержания высокой загрузки GPU при реальном трафике.

Каждый этап этого цикла выполняется на Ray, который масштабирует код Python. Это означает, что он работает с фреймворками ИИ с открытым исходным кодом, которые ваши команды уже используют, такими как PyTorch и vLLM, а также с новыми по мере их появления. Ваши конвейеры и приложения остаются переносимыми, поскольку они полностью совместимы с API с открытым исходным кодом. Ваши команды остаются гибкими, поскольку они могут внедрять новые фреймворки, не меняя способы масштабирования.

Поскольку один движок запускает все рабочие нагрузки ИИ, команды могут получить выгоду двумя способами. Они могут оптимизировать использование передовых методов, таких как обучение с подкреплением (RL), которые объединяют вывод и обучение в одном цикле. На Ray Summit 2026 Microsoft AI поделилась тем, что MAI-Thinking-1, ее передовая модель рассуждений, была обучена с использованием Ray (посмотрите сессию здесь). Или они могут начать с одной рабочей нагрузки и без проблем перейти к следующей. BMW начала использовать Ray для обучения моделей, а когда пришло время обслуживать LLM, интегрировала его в свой AI Gateway для запуска вывода моделей с открытым исходным кодом по всему предприятию.

Обеспечить безопасность ваших данных, оценок и моделей

Anyscale on Azure делает Ray готовым к производству, масштабируемым и надежным в вашем собственном клиенте Azure при поддержке инженеров, которые создают Ray. Это означает, что ваши данные, оценки, модели и образы контейнеров остаются в вашей подписке. Поскольку суверенитет и дифференциация становятся центральными элементами стратегии ИИ, это станет требованием для каждой компании, а не только для тех, у кого есть строгие нормативные требования.

Сетевая модель работает только на исходящий трафик. Каждое соединение инициируется оператором Anyscale и кластерами Ray в вашем кластере AKS, исходящим потоком к плоскости управления Anyscale, без открытия входящих правил брандмауэра. Полная архитектура развертывания, от плоскости данных AKS в вашей подписке до плоскости управления, размещенной в Anyscale, представлена на схеме в анонсе предварительной версии.

Ресурсы Anyscale являются нативными для Azure, управляются с помощью Azure RBAC и Azure Policy и оплачиваются через Azure с использованием MACC.

Снизить затраты

API с оплатой за токен взимает одинаковую плату независимо от того, запускаете ли вы одну рабочую нагрузку или пятьдесят. При использовании собственных GPU каждое повышение уровня утилизации снижает стоимость каждой единицы работы. Средняя утилизация GPU в традиционной инфраструктуре машинного обучения на типичном предприятии составляет менее 30%. Эти потери начинаются в рамках одной рабочей нагрузки и накапливаются по мере масштабирования на уровне команд, и Anyscale решает эту проблему на каждом этапе.

Оптимизируя планирование и оркестрацию как для отдельных рабочих нагрузок, так и для команд в целом, Anyscale обеспечивает среднюю утилизацию GPU на уровне 80% и выше. Это означает выполнение в 2–3 раза большего объема работы на том же парке GPU.

На уровне рабочих нагрузок GPU часто простаивают в ожидании данных: несколько CPU не могут загрузить и предварительно обработать следующую порцию данных достаточно быстро, чтобы обеспечить их работой. Anyscale решает эту проблему, запуская столько CPU-воркеров, сколько необходимо для параллельной загрузки данных и их прямой потоковой передачи на GPU, чтобы следующая порция была готова в тот момент, когда GPU завершит обработку предыдущей. Задания также часто резервируют целые GPU, используя их лишь частично, поэтому дробное использование GPU позволяет размещать больше рабочих нагрузок или моделей на каждом устройстве. Автомасштабирование корректирует ресурсы до того, как в задании закончится память, а контрольные точки позволяют перезапустить неудачное задание с последнего завершенного шага, а не с самого начала, поэтому вытеснение спотового инстанса или «отстающий» GPU больше не приводят к пустой трате оплаченных мощностей на повторные запуски.

В масштабах команд потери возникают из-за изолированных кластеров. Каждая команда резервирует достаточно мощностей для пиковых нагрузок, использует их лишь часть времени и оставляет простаивать, пока другие команды ожидают вычислительные ресурсы, к которым у них нет доступа. Anyscale объединяет эти кластеры в общую вычислительную среду, управляемую из единой панели, используя спотовые, зарезервированные и доступные по требованию мощности по мере их появления. Планирование учитывает приоритеты, поэтому очереди следуют бизнес-приоритетам, и когда поступает срочное задание, работа с низким приоритетом приостанавливается, а не завершается принудительно, после чего возобновляется с того места, где была прервана.

Три команды совместно используют резервирование H100. Когда поступает высокоприоритетное задание на обучение, планировщик вытесняет низкоприоритетное задание оценки и возобновляет его после завершения обучения, поддерживая резервирование на уровне, близком к полной утилизации.

В масштабах кластеров и регионов этот пул ведет себя как единое целое. Спрос на GPU везде превышает предложение, поэтому команды, запускающие крупнейшие рабочие нагрузки ИИ, планируют мощности как портфель. Планировщик Anyscale распределяет рабочие нагрузки по кластерам и регионам Azure, при этом Azure выступает в качестве контрольной точки для идентификации и политик. Та же модель распространяется на мощности GPU, которые клиент подключает вне Azure, при этом Azure остается центром для идентификации, управления и администрирования.

Утилизация GPU — это один из рычагов. Другой — сама модель. Дообучение и тонкая настройка открытых моделей на собственных данных позволяют командам заменить большие универсальные модели на меньшие, специализированные, обслуживание которых обходится дешевле. Но реальная стоимость включает также создание модели, а запуск обработки данных и дообучение на отдельной инфраструктуре добавляет операционные накладные расходы, которые могут свести на нет экономию на инференсе. Anyscale выполняет каждый шаг на одной платформе, поэтому меньшая модель не означает необходимость создания или поддержки нового стека для разных этапов жизненного цикла ИИ.

Ссылка: Что клиенты делают с помощью Anyscale в Azure

Xoople обрабатывает спутниковые снимки планетарного масштаба, превращая их в готовую для принятия решений информацию о Земле. Узнайте об их развертывании Anyscale в Azure от вице-президента по инжинирингу Xoople.

Ссылка: Начало работы с Anyscale в Azure

Разверните Anyscale из портала Azure и запустите свою первую рабочую нагрузку Ray в AKS с использованием существующих механизмов идентификации и сети. Краткие руководства по развертыванию на Microsoft Learn охватывают весь процесс настройки. Навыки агента Anyscale (Anyscale Agent Skills) дают вашему агенту по написанию кода знания для развертывания, запуска, отладки и настройки рабочих нагрузок Ray в Anyscale.

Посмотрите демонстрацию здесь.

Ссылка: Ресурсы

Ссылка: Связаться с нами

  • Узнайте больше. Посетите веб-страницу продукта Anyscale в Azure.

Узнайте больше. Посетите веб-страницу продукта Anyscale в Azure.

  • Начните работу. Ознакомьтесь с документацией по Anyscale в AKS.

Начните работу. Ознакомьтесь с документацией по Anyscale в AKS.

  • Свяжитесь с нами. Запросите демонстрацию или поддержку FDE.

Свяжитесь с нами. Запросите демонстрацию или поддержку FDE.

Ссылка: Читать далее

  • Anyscale в Azure переходит в стадию публичного предварительного просмотра

Anyscale в Azure переходит в стадию публичного предварительного просмотра

  • Анонс и бенчмарки Anyscale Runtime

Анонс и бенчмарки Anyscale Runtime

  • Документация по Anyscale в Azure на Microsoft Learn

Документация по Anyscale в Azure на Microsoft Learn

О чём эта статья

Ещё в разделе «Разработка ПО»

Все →

Ещё от Anyscale