Как агентный ИИ расширяет роль DPU

Источник: AMD•

Как агентный ИИ расширяет роль DPU

Поскольку агентный ИИ стимулирует рост числа рабочих нагрузок с сохранением состояния, DPU становятся критически важными для сетевого взаимодействия, хранения данных, управления KV-кэшем и повышения эффективности инфраструктуры.

С каждым новым поколением рабочих нагрузок ИИ возникают новые задачи, требования и стандарты, которые закладывают основу для новых инфраструктурных потребностей. Обучение требует масштабных GPU-кластеров с сотнями тысяч графических процессоров и высокоскоростных сетей для их соединения. Инференс добавляет чувствительность к задержкам при больших объемах запросов, создавая значительную нагрузку на фронтенд-сетевые службы, необходимые для маршрутизации и балансировки трафика между развернутыми моделями. Теперь агентный ИИ провоцирует очередной сдвиг, привнося новый уровень сложности в инфраструктуру.

В то время как инференс по большей части не имеет состояния, агентные рабочие процессы являются итеративными и постоянными. Один запрос пользователя может инициировать цепочку вызовов моделей, обращений к инструментам и операций поиска. По мере масштабирования агентных развертываний объем состояния (в форме контекста), который необходимо создавать, хранить и перемещать, растет вместе с рабочими нагрузками.

Результатом становится увеличение трафика фронтенд-инфраструктуры, более интенсивное перемещение данных между памятью ускорителя и хранилищем, а также растущая нагрузка на ресурсы CPU. В то же время эти ресурсы востребованы как никогда для оркестрации рабочих процессов агентного ИИ. Именно здесь блок обработки данных (DPU) становится более значимым, поскольку он разгружает CPU от критически важных инфраструктурных служб. Гиперскейлеры развертывают DPU на границе сети для создания выделенного домена обработки инфраструктуры, отделенного от рабочих нагрузок приложений, для сетевых задач, безопасности, хранения данных и телеметрии. Это обеспечивает изоляцию арендаторов, повышает эффективность и сохраняет ресурсы CPU для тех рабочих нагрузок, которым они необходимы.

Агентный ИИ расширяет роль DPU двумя конкретными способами:

1. Спрос на фронтенд-сети растет быстрее, чем организации могут обеспечить его с помощью CPU; и

2. DPU становятся центральным элементом того, как данные рабочих нагрузок ИИ перемещаются между памятью ускорителя и дезагрегированным хранилищем по сети.

1. Инфраструктурный налог на агентный ИИ

Согласно Gartner, агентный ИИ потребляет в 5–30 раз больше токенов на задачу, чем стандартный запрос к чат-боту, и этот рост спроса напрямую влияет на сеть. Фронтенд-сетевая среда, которую это создает, кардинально отличается от того, что требовалось только для инференса: больше соединений, больше решений по балансировке нагрузки и больше принудительного применения политик безопасности. Все это требует инфраструктурной обработки, которая традиционно потребляла циклы CPU. Те же самые ядра теперь пользуются большим спросом для оркестрации агентов, логики приложений и поиска данных. Перенаправление этих ядер на обслуживание сетевых накладных расходов — это компромисс, который становится все более затратным по мере масштабирования развертываний агентов.

Ценность DPU для агентного ИИ уже доказана на уровне гиперскейлеров. В одном из развертываний у клиента разгрузка с помощью DPU высвободила 22 ядра CPU на сервер, которые ранее потреблялись одной инфраструктурной службой. По мере масштабирования агентных рабочих нагрузок и роста фронтенд-трафика эта высвобожденная емкость становится все более значимой не только для эффективности, но и для способности обслуживать больше агентов и пользователей в промышленном масштабе.

2. Когда контекст становится «узким местом»

Агентные рабочие нагрузки генерируют и зависят от растущего объема контекста, и эффективное обслуживание этого контекста стало одной из самых сложных инфраструктурных проблем. Недавние исследования указывают на поразительное следствие: при агентном инференсе по мере роста контекста объем KV-кэша в памяти увеличивается, что становится серьезным ограничением для GPU. «Узкое место» переместилось.

Память GPU быстрая, но ограниченная, если пытаться постоянно хранить полный контекст каждого агента в локальной HBM, что непрактично при масштабировании. Отрасль движется к иерархическим архитектурам памяти, где активный контекст находится в HBM, а более «холодный» KV-кэш — в более дешевой памяти и флэш-хранилищах. NVMe-over-Fabrics делает это возможным, позволяя хранилищу стать дезагрегированным общим пулом, доступным по сети с низкой задержкой. DPU находится в центре этого процесса, обрабатывая передачу, перемещение данных, шифрование и изоляцию арендаторов, чтобы CPU и GPU не приходилось этого делать. Вычисления остаются сосредоточенными на работе агентов и инференсе, а DPU берет на себя прием входящих данных, разгрузку и балансировку нагрузки на сервер.

Именно здесь роль DPU выходит за рамки простой разгрузки. В системе агентного ИИ DPU фактически становится инфраструктурным процессором, отвечающим за управление контекстом во всей этой иерархии — разгружая CPU от задач оркестрации KV-кэша, управления протоколами хранения и перемещения данных, чтобы он мог оставаться сосредоточенным на инференсе и агентных рабочих нагрузках, которые действительно важны.

Более широкая возможность заключается не просто в снижении задержки хранения; это совершенно иной масштаб инфраструктуры ИИ. Храня, совместно используя и извлекая контекст из распределенного уровня хранения, провайдеры ИИ могут поддерживать гораздо больше одновременных агентов, чем позволила бы только локальная память GPU. Контекст можно повторно использовать в разных сессиях и совместно использовать в разных движках инференса, что означает меньше повторных вычислений и лучшее использование GPU, выполняющих работу.

Рисунок 1 — AMD Pensando™ Salina DPU

AMD Pensando™ Salina DPU создан именно для этой роли. Он поддерживает хранение KV-кэша для контекстов, превышающих один миллион токенов, в сотнях тысяч одновременных сессий. Это один из немногих полностью P4-программируемых DPU на рынке, обеспечивающий одновременные сетевые службы, службы безопасности и хранения данных. Это дает операторам облачных сред уникальную гибкость для адаптации по мере того, как требования к контексту и агентные архитектуры продолжают развиваться.

Создание фундамента для будущего

Агентный ИИ привел к масштабным изменениям в отрасли за короткий период времени; однако эти архитектуры все еще развиваются. В результате шаблоны трафика, требования к хранению данных и политики безопасности будут продолжать меняться по мере созревания развертываний. Полностью программируемый DPU позволяет операторам внедрять новые службы, адаптировать новые пути передачи данных и реализовывать новые протоколы по мере изменения рабочих нагрузок. Такая программируемость продлевает срок полезного использования инфраструктуры без необходимости ее замены.

То, что начиналось как критически важный компонент облачных сетей, превратилось в нечто более фундаментальное для инфраструктуры ИИ в эпоху агентного ИИ. В развертывании стоечного масштаба один программируемый DPU может обрабатывать фронтенд-сетевой трафик, соединения между узлами GPU и путь к хранилищу, который расширяет контекст за пределы памяти GPU. Одно устройство, управляющее потоком информации во всей системе. Это направление, в котором движется AMD.

По мере того как ИИ становится более распределенным, многоагентным и зависимым от состояния, инфраструктура, управляющая потоком информации, будет оказывать такое же влияние на производительность системы, как и вычислительные мощности, которые ее обрабатывают. Программируемая архитектура DPU ставит его в центр этой инфраструктуры — не как периферийное устройство, а как основной элемент.

О чём эта статья

Ещё в разделе «Hardware и электроника»

Все →

Ещё от AMD