ИИ переписывает уравнение ценности для компаний. Мы выходим из эпохи «максимизации токенов» в будущее дифференцированного интеллекта.
Компании меняют стратегию, стремясь сделать интеллект устойчивым конкурентным преимуществом для своего бизнеса. В результате мы видим одни и те же три слова на каждом рекламном щите, автобусе и поезде в технологических хабах по всему миру: «Владей своим интеллектом» (Own Your Intelligence). Но что это на самом деле означает? Что нужно сделать, чтобы этого достичь?
В этом блоге мы представляем то, что считаем ответом на вопрос о владении собственным интеллектом: циклы обучения. Мы расскажем, что такое цикл обучения, о кривой зрелости, которую, по нашему мнению, пройдет большинство компаний при их создании, об инженерных инвестициях, необходимых для воплощения этого в жизнь, и о том, какое место в этой картине занимают Ray и Anyscale.
Что такое цикл обучения?
Цикл обучения — это самоподдерживающийся маховик, соединяющий курирование данных, обучение пользовательских моделей и логический вывод, работающий на основе ваших проприетарных данных. Эта концепция не нова. Однако в эпоху LLM и агентных систем масштаб, сложность и инвестиции в инфраструктуру, необходимые для создания цикла обучения, экспоненциально выше, а цена промедления для вашего бизнеса растет с каждым месяцем.
Компании сталкиваются с тремя проблемами при создании цикла обучения:
- Курирование крупномасштабных (ТБ-ПБ) проприетарных наборов данных, многие из которых являются мультимодальными
Курирование крупномасштабных (ТБ-ПБ) проприетарных наборов данных, многие из которых являются мультимодальными
- Обучение пользовательских моделей сталкивается с нехваткой вычислительных мощностей, их разрастанием и проблемами с надежностью, поскольку задачи могут занимать несколько узлов GPU в течение недель
Обучение пользовательских моделей сталкивается с нехваткой вычислительных мощностей, их разрастанием и проблемами с надежностью, поскольку задачи могут занимать несколько узлов GPU в течение недель
- Масштабирование логического вывода для соответствия требованиям к задержке требует эластичности и настройки производительности на нескольких уровнях стека
Масштабирование логического вывода для соответствия требованиям к задержке требует эластичности и настройки производительности на нескольких уровнях стека
После развертывания циклы обучения создают кумулятивный эффект: интерфейс конечного пользователя собирает данные, эти данные обрабатываются и курируются, используются для обучения улучшенной пользовательской модели или агента, тестируются с помощью оценок и развертываются для логического вывода. Каждый оборот этого цикла создает для бизнеса более производительную, эффективную или экономически выгодную дифференциацию.
Кривая зрелости
Из-за высокой первоначальной сложности и стоимости развертывания все более дифференцированных циклов обучения мы наблюдаем появление кривой зрелости.
Шаг 1: Владейте промптами: арендуйте модель и инвестируйте время в свои собственные промпты и оценки. Докажите окупаемость инвестиций (ROI), прежде чем вкладывать больше средств в базовую инфраструктуру.
Ожидайте, что расходы будут расти линейно или быстрее по мере использования, поскольку каждый токен — это отдельная статья расходов в длинной цепочке арендованного интеллекта, времени выполнения и инфраструктуры. Когда вы используете модель и интеллект, к которым может получить доступ кто угодно, ваша дифференциация также опирается на более тонкий слой промптов и рабочих процессов.
Шаг 2: Владейте весами и средой выполнения: когда стоимость, производительность и надежность становятся ключом к дифференциации, пора инвестировать в инфраструктуру, чтобы перестать обращаться к проприетарным моделям и начать использовать свои данные для дифференциации на уровне весов модели.
Этот уровень начинает требовать конвейеров курирования данных и обучения. Вы не хотите, чтобы они оплачивались за токен. Курирование и обучение — это стабильные, тяжелые рабочие нагрузки, и оплата их за токен означает переплату за работу, которую вы могли бы планировать самостоятельно. Именно здесь начинаются инвестиции в среду выполнения. Теперь вы контролируете выполнение рабочих нагрузок, что оптимизирует затраты, производительность и надежность по сравнению с вашими инвестициями в инфраструктуру.
Помимо стоимости и производительности, безопасность и суверенитет данных становятся еще одним уровнем дифференциации на этом этапе. Эти системы перемещают, преобразуют и активируют проприетарные данные с конечной целью превращения этих данных в токен. Когда команды инвестируют десятки или сотни миллионов капитальных затрат в инфраструктуру GPU, вам нужен контроль над этими данными и токенами, которые они приносят.
Шаг 3: Владейте циклом: как только у вас развернуты основы данных, обучения и логического вывода, вы можете начать путь к владению и оптимизации цикла для создания более глубоких барьеров в сфере интеллекта.
Вы хотите, чтобы каждый цикл был быстрее, а каждое выполнение — более экономичным. Ментальная модель затрат в организации также начнет меняться со стоимости за токен на стоимость за единицу работы (например, стоимость за обработанное изображение).
Вы будете оптимизировать ресурсы для выполнения большего объема работы и получения большей дифференциации от каждого оборота цикла.
Архитектура
С каждым шагом между этими этапами вы создаете дифференциацию, но также берете на себя владение большим количеством уровней стека. При этом критически важным становится то, как каждый из этих уровней работает вместе, чтобы предоставлять интеллект экономически эффективно в масштабе.
Каждый из этих циклов — это на самом деле несколько рабочих нагрузок. Обработка данных, обучение, симуляция, логический вывод — каждая из них имеет разные требования к оборудованию и оркестрации. Проблемы этих рабочих нагрузок сталкиваются с платформенными проблемами масштабирования этого процесса на множество пользователей, запускающих множество нагрузок в разных облаках и на разных ускорителях.
Мы видим появление новой архитектуры, которая позволяет командам масштабироваться от одной рабочей нагрузки до множества, обладая возможностями управления обширным парком вычислительных мощностей.
Эта архитектура использует Ray в качестве основы распределенных вычислений для масштабируемого и отказоустойчивого планирования рабочих нагрузок, а также оркестраторы рабочих нагрузок, такие как Kueue, Kai, Volcano и Yunikorn, для приоритизации конкурирующих задач.
Этот стек увенчан глобальной плоскостью управления (control plane), объединяющей информацию и доступ с каждого уровня — от инфраструктуры до плоскости управления и всего, что между ними, — для создания единого стека. Плоскость управления предназначена для предоставления правильных интерфейсов, правильного доступа и правильной наблюдаемости как разработчикам, ТАК И агентам. Это включает в себя управление задачами, размещение, приоритизацию и вытеснение на глобальном уровне, что, конечно, должно выполняться в тесной координации с уровнем отдельного кластера и рабочей нагрузки.
Когда рабочая нагрузка пользователя запрашивает сотню GPU, Ray и Kubernetes координируют размещение, часто требуя учета топологии, в то время как Ray и такие инструменты, как Kueue, оценивают емкость, приоритет и влияние на другие запущенные задачи. Именно на стыках между этими компонентами задачи либо преуспевают, либо терпят неудачу, использование GPU улучшается или стагнирует, а ваша команда либо получает уведомления об ошибках, либо спокойно спит по ночам.
В итоге вы получаете стек, который дает вам «золотой путь» — упрощает выполнение правильных действий по умолчанию в любом облаке и на любой платформе — по мере того, как вы строите циклы обучения.
Эти проблемы и этот стек — это именно то, над чем мы работали в Anyscale и Ray.
Более подробную информацию можно найти здесь.









