Конференция Ray Summit 2026, прошедшая 24–26 августа, собрала более 2000 участников в отеле San Francisco Marriott Marquis. В течение двух дней проводились основные доклады, тематические сессии и практические тренинги, объединенные одной главной темой: обучение с подкреплением (RL) переросло из исследовательской дисциплины в инженерную задачу промышленного масштаба, а инфраструктура, обеспечивающая работу RL-конвейеров, теперь так же важна, как и модели, которые она обучает.
Роберт Нишихара, соавтор Ray и соучредитель Anyscale, открыл первый день конференции, закрепив этот тезис в качестве основы мероприятия. Рабочие нагрузки, определяющие современный передовой ИИ, включают непрерывные циклы обучения с подкреплением, развертывание агентов и физическое моделирование в больших масштабах. Все это требует вычислительных сред, которые охватывают гетерогенное оборудование, координируют работу CPU-воркеров и GPU-пулов, а также восстанавливаются после сбоев, не заставляя исследователей перестраивать уровень оркестрации с нуля.
Основной доклад первого дня
Создание масштабируемого верификатора для науки в Lila Sciences
Докладчик: Эндрю Бим, технический директор Lila Sciences
Эндрю Бим начал с проблемы верификатора, лежащей в основе научного RL. Метод RLVR (RL from Verifiable Rewards) успешно применялся в программировании и математике, поскольку в этих областях существуют дешевые автоматические верификаторы. Однако лишь около 5% литературы по биологии, химии и материаловедению содержит утверждения, которые можно полностью проверить in silico. Решение, созданное Lila, — это «Фабрика ИИ-науки»: объект площадью 15 000 квадратных футов в Кембридже, объединяющий ИИ-модели, программное обеспечение, которое связывает каждый прибор через единый API, и робототехнику, проводящую эксперименты круглосуточно, благодаря чему физическая рабочая ячейка становится сигналом вознаграждения. Их модель IRIS обучается на белках, РНК, малых молекулах, катализаторах и покрытиях, при этом RL разрабатывается совместно с командой SkyRL на базе Ray. Результаты на сегодняшний день включают программу CAR-T, достигшую эффективности на приматах при затратах примерно в 30 раз ниже обычных сроков, более миллиона мРНК, разработанных и протестированных in vivo по ведущим клиническим стандартам, и 719 сплавов для защитных покрытий, отобранных за пять недель вместо семи месяцев.
Создание AV 3.0 в Torc Robotics
Докладчик: Феликс Хайде, руководитель отдела ИИ, Torc Robotics
Феликс Хайде представил AV 3.0 — подход Torc к безопасному автономному вождению грузовиков, в котором восприятие и планирование обучаются по принципу end-to-end, а обучение с подкреплением в замкнутом цикле в симуляции способствует улучшению политики. Бенчмарки городского вождения близки к насыщению, и фокус сместился на более сложные задачи: грузоперевозки требуют обнаружения объектов на сверхдальних дистанциях, высоких скоростей движения и длинных траекторий, которые существующие наборы данных не были рассчитаны покрывать. TruckDrive, набор данных, разработанный Torc, заполняет этот пробел. Их модель планирования Alpamayo достигает средней ошибки смещения (ADE) 5,84 метра при горизонте 6,4 секунды в режиме zero-shot, которая снижается до 0,87 метра при использовании логического вывода физического ИИ. Каждый этап конвейера работает на одном кластере Ray с использованием Ray Data, Ray Train, Ray Serve и Ray Actors, координирующих работу между CPU-узлами, GPU Kepler и GPU Blackwell на платформе Anyscale. Результат консолидации пяти отдельных систем обучения на одном движке: в 20 раз больше данных на одну задачу обучения, эпохи в 3–3,4 раза быстрее на более дешевых вычислительных мощностях, использование GPU выросло с 30–40% до примерно 90%, и один миллиард миль симуляции в неделю.
Inferact и сообщество vLLM
Докладчик: Саймон Мо, соучредитель и генеральный директор Inferact, vLLM
Проблема инференса превратилась в комбинаторную задачу. Сообщество vLLM сейчас работает с более чем 1000 конфигураций оборудования, более чем 5000 моделей и расширяющимся набором шаблонов рабочих нагрузок, которые сместились от простых ответов на один запрос к многоходовым агентным взаимодействиям. Команда Inferact и сопровождающие vLLM рассказали, куда проект инвестирует ресурсы: поддержка оборудования «нулевого дня» для NVIDIA Blackwell и Vera Rubin, AMD MI355X и MI455X, а также Google Ironwood и будущих поколений TPU. Техническая дорожная карта включает Model Runner V2 с унифицированным интерфейсом моделей, llm-d и Dynamo для дезагрегированного обслуживания, а также фронтенд на Rust для снижения накладных расходов на уровне приема запросов. Имея более 3000 участников, vLLM стал одной из центральных открытых сред для инференса в экосистеме, а выделенный трек vLLM в зале Nob Hill работал в течение обоих дней конференции.
Основной доклад второго дня
Создание и пост-обучение открытых моделей с помощью Ray: уроки NVIDIA Nemotron
Докладчик: Брайан Катанзаро, вице-президент по прикладным исследованиям глубокого обучения, NVIDIA
Брайан Катанзаро переосмыслил, что значит создавать открытую модель. Nemotron — это полноценный комплекс: чекпоинты моделей от Lightning до Ultra, наборы данных объемом 9 триллионов токенов, опубликованные на Hugging Face, и открытые библиотеки для RL-выравнивания (NeMo-RL), сжатия моделей (Minitron) и поиска архитектуры, разработанные так, чтобы любая организация могла создавать ИИ, специализирующийся на собственных данных. Техническим ядром стало RL в масштабе: обучение Nemotron 3 Ultra (550 миллиардов параметров всего, 55 миллиардов активных, более 20 триллионов токенов предварительного обучения) потребовало координации движков развертывания, воркеров среды и обучения политик на более чем 3000 GPU одновременно с помощью Ray Core. Конкретный вывод: размещение с учетом топологии на оборудовании GB300, которое удерживало взаимодействующие акторы в пределах одного домена NVLink, повысило пропускную способность итераций RL на 13% без изменений в оборудовании или модели. В результате CrowdStrike сообщила о завершении расследований безопасности до пяти раз быстрее, Synopsys — до 50 раз быстрее по времени до валидированного RTL, а CodeRabbit улучшил точность маршрутизации, сократив при этом расчетную стоимость обслуживания вдвое.
Продвинутая автономность для строительной сферы в Bedrock Robotics
Докладчик: Винсент Гонге, руководитель технических основ, Bedrock Robotics
Bedrock создает автономность для строительной техники — среды, где камеры, лидары, GNSS, IMU и телеметрия CAN генерируют непрерывные потоки данных, но где метка для любого конкретного момента не определена заранее. Их ключевое понимание заключается в том, что данные со строительной площадки фундаментально отличаются от данных робототехники с четко определенными задачами: в системе «захват-и-перемещение» задача устанавливается до начала сбора данных, но на стройплощадке выяснение того, что произошло (какое действие оператора, какое взаимодействие с ландшафтом, какой режим отказа), само по себе является результатом распределенного вычислительного графа, и Ray управляет этим графом. Каждый этап конвейера, от декодирования датчиков через агентную разметку до обучения восприятию и политике, а также прогонов симуляции, по-разному сочетает нагрузки на CPU и GPU. Их полностековый симулятор каждую ночь запускает реальный стек автономности, генерируя ландшафт, физику, потоки данных с датчиков и метрики в масштабе, поэтому каждое изменение модели тестируется в симуляции, прежде чем попасть на машину в полевых условиях.
Замыкая цикл: создание ИИ-ученого в Periodic Labs
Докладчик: Лиам Федус, соучредитель и со-генеральный директор Periodic Labs
Компания Periodic Labs провела различие между ИИ, который «знает» науку, и ИИ, который «умеет заниматься» наукой, и построила свою инфраструктуру вокруг этого различия. Их модель обучается на самом научном процессе (гипотезы, планы экспериментов, вызовы инструментов, измерения и обновления, которые эти измерения порождают), а не на готовых записях опубликованных результатов. Запуск обучения с подкреплением (RL) в физическом мире сложнее, чем в цифровом: развертывание занимает дни, а не минуты, параллельно работает меньше агентов, а сигналы вознаграждения более зашумлены. Ответ Periodic — это стек, построенный на Ray для оркестрации, Megatron для обучения и SGLang для вывода, с проприетарными уровнями для цикла RL, песочницами, размещенными на GPU, и обслуживанием. Их показатели по сравнению с open-source аналогами: пропускная способность вывода в 3 раза выше, синхронизация весов в 10 раз быстрее, преобразование весов в 30 раз быстрее, общее обучение в 4,5 раза быстрее, а локальная P2P-плоскость данных работает в 50 раз быстрее, чем у сопоставимых современных провайдеров.
Секционные заседания
Масштабирование рабочих нагрузок LLM на TPU с помощью Ray: от предварительного обучения до вывода в Google Kubernetes Engine
Представлено Райаном О'Лири, инженером-программистом Google Kubernetes Engine; Лехуи Лю, инженером-программистом Anyscale, Ray Train
Райан и Лехуи представили текущее состояние поддержки TPU как первоклассного ускорителя в Ray на GKE. Два новых API делают управление топологией TPU управляемым в масштабе: SlicePlacementGroup для резервирования и оркестрации целых выделенных сегментов TPU и SubslicePlacementGroup для динамического разделения крупных физических топологий на меньшие подмножества без физической реконфигурации кластера. Ray Train поддерживает как JAX, так и PyTorch в конфигурациях с несколькими сегментами, с встроенной эластичной обработкой сбоев рабочих узлов и сигналов вытеснения. Что касается стороны обслуживания, Ray Serve с vllm-tpu теперь поддерживает вывод на TPU как на одном, так и на нескольких хостах с автоматическим масштабированием, а профилирование TPU интегрируется непосредственно в панель управления Ray, выявляя взаимные блокировки компиляции, задержки устройств и фрагментацию памяти без необходимости использования внешних инструментов.
Lightning об агентских системах с vLLM, Verda, Novita и Anyscale
Представлено Таном Тун Цзянем, главным инженером-программистом, Embedded LLM и мейнтейнером vLLM; Джеффри Вангом, инженером-программистом Anyscale; Анантом Махадеваном, инженером MLOps, Verda; Дэнни Аном, старшим инженером по разработке ядра, Novita
Тан Тун Цзянь и его команда представили Agentic API — уровень обслуживания на языке Rust, который заполняет конкретный пробел: vLLM выполняет вывод модели, но агентский цикл также требует восстановления истории разговоров, выполнения циклов инструментов через несколько вызовов модели и сохранения состояния, чтобы следующий запрос мог продолжиться с того места, где остановился предыдущий. Без дополнительного уровня каждый агентский клиент создает эту инфраструктуру независимо. Agentic API предоставляет ее как общий сервис с поддержкой как OpenAI Responses API, так и Anthropic Messages API, что означает, что Codex и Claude Code могут обращаться к открытым моделям, обслуживаемым vLLM, без необходимости для каждого клиента управлять своим собственным уровнем состояния. MCP и веб-поиск работают внутри шлюза; вызовы функций возвращаются клиенту для выполнения и продолжаются с использованием идентификатора продолжения. Agentic API v0.1.0 был выпущен на Ray Summit и доступен на crates.io.
Масштабирование Ray в Microsoft AI
Представлено Чэн Лю, Павлом Бензой и Шаовэй Су, сотрудниками технического отдела Microsoft AI
Команда Microsoft AI запускает генерацию данных, предварительное обучение и RL на общей базе Ray, охватывающей как планировщики Kubernetes, так и Slurm в едином парке GPU. Их основным вкладом стал RELAY — пакетный прокси для Ray GCS, разработанный для устранения узкого места в прокси-сервере Ray Client, которое становится критическим при масштабах, на которых работает MAI. В устаревшем стеке время создания актора увеличивалось с 42,6 секунд при 8 000 рабочих узлах до 89,4 секунд при 32 000, а установившийся RPC на уровне P99 вырос с 18,3 до 55,3 секунд в том же диапазоне. RELAY сглаживает обе кривые: время создания удерживается в диапазоне от 32,7 до 34,5 секунд во всем диапазоне (в 2,85 раза быстрее при 32 000 рабочих узлах), а установившийся RPC составляет примерно 3,6 секунды (в 16,4 раза быстрее при 32 000), при этом иерархическое дерево ретрансляции дополнительно снижает затраты на стороне драйвера с O(K умножить на S) до O(S).
Создание платформы виртуальной биологии на Ray: движок мультимодального поиска лекарств Recursion
Представлено Александром Джуричем и Айлой Хан, инженерами по машинному обучению, Recursion
Recursion показали, как Ray лежит в основе всего их научного цикла. Кросс-модальные конвейеры встраивания объединяют данные экспрессии генов, феномики и транскриптомики; задания по предиктивной химии обучают модели свойств малых молекул и выполняют обратное заполнение оценки соединений; а производственный онлайн-сервис для Boltz-2, построенный на FastAPI и Ray Serve, работающий на Anyscale, предсказывает структуру белка и аффинность связывания лиганда на основе последовательности белка и химической структуры лиганда. Их работа «Виртуальные клетки», которая обучает модели предсказывать феномические и транскрипционные профили для невидимых клеточных возмущений, использует Ray для распределенных серий обучения, параллельных оценок по контрольным точкам и типам клеток, а также параллельной загрузки данных по ускорителям. Ключевой архитектурный принцип, к которому они пришли, — это рассмотрение рабочих нагрузок, а не кластеров, как единицы работы, при этом решения о маршрутизации принимаются на основе стоимости, доступности и локальности данных.
Ray в производстве: инженерные уроки платформы Hendrix компании Spotify
Представлено Аамиром Анваром, инженером платформы, и Шоном Лином, штатным инженером по машинному обучению, Spotify
Hendrix — это ML-платформа Spotify для полного жизненного цикла моделей, работающая на мультиарендном парке GPU, охватывающем несколько кластеров GKE и регионов, где команды изолированы в своих собственных пространствах имен. За последний год платформа выросла в 2,5 раза по количеству поддерживаемых команд и в 30 раз по вычислительной мощности GPU, достигнув более одного миллиона часов работы GPU в месяц при выполнении примерно 21 000 пакетных заданий LLM ежемесячно. Аамир и Шон рассказали о компонуемом рабочем процессе обучения на Ray: Ray Data обрабатывает этап набора данных без сохранения состояния и безопасный для pickle; Ray Train оборачивает пользовательские циклы внутри TorchTrainer, в то время как цикл владеет прямым проходом; а конвейеры оценки связывают процессоры Ray Data на рабочих узлах CPU, отправляя асинхронные запросы в группы рабочих узлов vLLM и SGLang. Они также представили два шаблона проектирования кластеров: один кластер с несколькими средами выполнения, где каждый пул рабочих узлов поставляет свой собственный образ контейнера вместе с легким сайдкаром Ray, и эластичность с учетом рабочего процесса для масштабирования ресурсов в рамках одного запуска обучения.
Масштабирование массового обучения трансформеров с помощью унифицированной инфраструктуры KubeRay в Capital One
Представлено Молином Пателем, управляющим вице-президентом, и Раджой Чаватом и Ифэй Вангом, инженерами по машинному обучению, Capital One
Команда ML в Capital One создала трансформер для табличных последовательностей финансовых событий и столкнулась с классической проблемой масштабирования: при наличии более 500 миллионов записей и 3,5 терабайт данных, распределенных по 512 временным шагам и сотням признаков для каждого, одна эпоха обучения занимала 32 часа, причем «узким местом» была загрузка данных, а не вычислительные мощности. Решением стал унифицированный стек KubeRay, объединяющий Ray Data (ленивая распределенная загрузка Parquet с передачей шардов без копирования), Ray Train (TorchTrainer на 64 GPU-воркерах с автоматическим восстановлением после сбоев) и Ray Tune с использованием сэмплера TPE из Optuna и прунинга ASHA для 200 одновременных экспериментов по подбору гиперпараметров. Время выполнения HPO сократилось с трех-пяти дней до примерно четырех часов, что означает ускорение в 16 раз, при этом все 3,5 терабайта данных прошли через конвейер от начала до конца без единой передачи через S3 между этапами.
LinkTraining
Обучение на Ray Summit 2026 стало самым масштабным за всю историю. За два дня мы задействовали почти 3200 GPU и более 36 000 CPU в 830 одновременных облачных средах и рабочих пространствах, а затем полностью свернули и развернули инфраструктуру за время обеденного перерыва. Число участников выросло с примерно 515 человек в прошлом году до более чем 800, и в какой-то момент одна из дневных сессий заполнила основной зал, дополнительный зал и половину второго дополнительного зала, где более 400 участников одновременно работали с материалом.
LinkNext Stops
Команда Ray и Anyscale будет присутствовать на нескольких предстоящих мероприятиях, если вы захотите продолжить обсуждения, начатые на этой неделе. Приходите к нам на:
- Fully Connected, Сан-Франциско (29 сентября – 1 октября)
Fully Connected, Сан-Франциско (29 сентября – 1 октября)
- Long Horizon, Сан-Франциско (20–21 октября)
Long Horizon, Сан-Франциско (20–21 октября)
- Конференция Pytorch, Сан-Хосе (20–21 октября)
Конференция Pytorch, Сан-Хосе (20–21 октября)
- Саммит по ИИ в разработке и создании лекарственных препаратов (27–29 октября)
Саммит по ИИ в разработке и создании лекарственных препаратов (27–29 октября)









