Введение
На мероприятии Advancing AI 2026 были представлены две совершенно разные версии масштабирования ИИ, объединенные под одной крышей. С одной стороны, это AMD Helios™, наше первое стоечное решение для ИИ, созданное для передовых систем искусственного интеллекта и рассчитанное на развертывание гигаваттного масштаба. Я работаю в сфере клиентских устройств и графики, поэтому в Сан-Франциско мое внимание привлекло то, насколько быстро серьезные возможности ИИ масштабируются как в дата-центрах, так и на рабочем столе перед вами.
В день AAI разработчики продемонстрировали гибридные мультиагентные системы, которые распределяют работу между ПК с поддержкой агентов на базе AMD Ryzen™ AI и инфраструктурой AMD Instinct™. AMD и Cisco обсудили, как предприятия могут осуществлять управление локальными агентами и контроль над ними. Платформа ROCm.AI представила более унифицированный программный путь для оборудования AMD Ryzen, Radeon™ и Instinct, позволяя разработчикам переносить привычные инструменты и рабочие процессы с локальных систем на гораздо более масштабные развертывания.
По моему мнению, именно здесь агентный ИИ становится особенно интересным. ПК с поддержкой агентов может стать частью более широкой стратегии развертывания корпоративного ИИ за счет запуска моделей локально. Это повышает уровень безопасности в условиях ограничений или опасений по поводу передачи данных облачному сервису. Передовые облачные модели по-прежнему доступны, когда менее чувствительные, но более сложные рабочие нагрузки оправдывают затраты на их использование. По мере того как ИИ превращается из ассистента, отвечающего на вопросы, в агента, совершающего действия, вычислительная мощность, находящаяся перед пользователем, приобретает все большее значение.
От ассистента к исполнителю
Генеративный ИИ уже доказал, что предоставление модели правильного контекста может сделать ее значительно более полезной. Загрузите в нее стенограмму встречи, и она извлеките ключевые детали. Предоставьте ей набор электронных писем, и она обобщит то, что изменилось в ваше время отсутствия. Передайте нужные документы, и она поможет составить отчет на основе информации, разбросанной по ним.
Агентный ИИ развивает эту идею дальше, поскольку контекст теперь может приводить к действию. Агент может прочитать тикет техподдержки, определить потребности клиента, обратиться к доступным ему инструментам и информации, а затем решить, что делать дальше. Вместо того чтобы выдавать единственный ответ, агент выполняет задачу самостоятельно. Разница может показаться незначительной — всего лишь несколько дополнительных шагов, сделанных от вашего имени, — но потенциальное влияние на производительность и ИТ-бюджеты может оказаться существенным.
Какими бы замечательными ни были агенты, обеспечение каждого сотрудника соответствующим облачным сервисом может быстро стать дорогостоящим. Каждая задача, выполняемая облачным агентом, превращает часть человеческого рабочего процесса в тарифицируемые токены, а затраты могут существенно варьироваться в зависимости от выбора модели и того, как агент решает поставленную задачу. Goldman Sachs ожидает, что в долгосрочной перспективе потребление токенов потребительскими и корпоративными агентами значительно превзойдет неагентные рабочие нагрузки:
В этом году уже появилось множество историй о компаниях, которые широко внедрили облачные агенты, но затем были вынуждены отступить, когда расходы выросли гораздо быстрее, чем ожидалось.
Выход из этой ситуации заключается в сопоставлении рабочих нагрузок ИИ с моделями и системами, наиболее подходящими для конкретной задачи. Локальные модели быстро совершенствовались; некоторые из них теперь способны справляться с нагрузками, для которых 3-4 года назад требовались передовые модели. Работа, которая раньше выполнялась только в дата-центре, теперь может запускаться на ПК на вашем рабочем столе.
Но перенос всех преимуществ ИИ в локальные среды — это не просто запуск модели. Чат-бот, обобщающий документ, нуждается в доступе к этому документу. Агент, которому поручено решить проблему, также может нуждаться в доступе к приложениям, учетным данным, клиентским базам, средствам коммуникации и другим системам, необходимым для выполнения работы. Чем полезнее становится агент, тем более значительными становятся его разрешения. Ошибка может выйти далеко за рамки одного неудачного ответа, если агент ИИ не снабжен соответствующими средствами защиты.
На мероприятии AAI Day я продемонстрировал сценарий клиентской поддержки, в котором тикеты поступали непрерывно, а агенты ИИ обрабатывали их по мере появления. Claude Code обеспечил агентный уровень за счет сортировки каждого тикета, анализа того, что для него требуется, вызова соответствующих инструментов и либо решения проблемы, либо ее эскалации. Некоторые рутинные запросы обрабатывались автоматически, но другие тикеты содержали конфиденциальную информацию, оскорбительный контент и атаки через внедрение промптов.
Наша демонстрация предоставила ИИ контекст и полномочия, необходимые для совершения надлежащих действий, а также упомянутые выше средства защиты.
Компонент Policy Guard отвечал за допуск. Он оценивал команды и вызовы инструментов на соответствие заявленным правилам и мог либо блокировать нарушения, либо контролировать и записывать их. AXIS управлял самим выполнением посредством песочницы на уровне ядра, построенной на базе Landlock, seccomp и сетевых пространств имен. Таким образом, Policy Guard мог решить, что запрос является допустимым, в то время как AXIS все равно ограничивал место и способ выполнения результирующего действия. Когда запрос пытался получить доступ к учетным данным AWS, Policy Guard мог остановить его при допуске, либо AXIS мог предотвратить его выполнение, если Policy Guard работал в режиме мониторинга.
Эта эшелонированная защита критически важна именно потому, что полезные агенты будут запускаться в ситуациях, которые их разработчики не смогли предвидеть. Корпоративные политики могут определять известные границы, но автономная система ценна отчасти тем, что может реагировать на изменяющиеся входные данные без предварительного описания каждого действия. Изоляция выполнения дает ИТ-специалистам дополнительную границу защиты, когда агент сталкивается с чем-то, чего нет в своде правил.
Та же архитектура позволила нам решить вопрос локального и облачного выполнения. Lemonade обслуживала модели локально на системе Ryzen AI и принимала решение о маршрутизации для отдельных запросов. Рутинная работа оставалась локальной, в то время как запросы, требующие более глубокого анализа, могли отправляться в передовую облачную модель. В ходе демонстрации 69% рабочей нагрузки по обработке токенов было выполнено локально, и лишь 31% было перенесено в облако.
Как избежать ловушки токеномики
Наша демонстрация показала, как локальный и облачный вывод могут сосуществовать в рамках одного агентного рабочего процесса. Запросы, которые подходят для способной локальной модели, не должны генерировать расходы на облачный API только потому, что другая часть рабочего процесса требует рассуждений передового уровня. Подходящее разделение будет различаться в зависимости от приложения, но решение о размещении может приниматься на уровне отдельного запроса, а не принудительно переносить всю рабочую нагрузку в одну среду.
Локальное выполнение также может изменить пути перемещения корпоративного контекста. Когда модель и ее источники данных остаются на устройстве, проприетарные входные данные и контекст также могут оставаться там. Локальный вывод позволяет избежать сетевых задержек для таких запросов и может продолжать работу без подключения к интернету. Облачный вывод остается доступным, когда лучшим выбором является более крупная модель или иной ресурс. Гибридный ИИ, объединяющий локальные и облачные ресурсы, позволяет этим требованиям сосуществовать.
Полупроводниковые технологии для эпохи агентов
Для выполнения значимой агентной работы локально требуются достаточные вычислительные мощности и объем памяти. Агентные ПК на базе процессоров AMD Ryzen™ AI PRO 400 Series обеспечивают до 60 TOPS производительности NPU для повседневных задач ИИ. Более крупные локальные модели и постоянные агенты могут требовать значительно большего объема памяти, и именно здесь на сцену выходят конфигурации Agent Computer с более высокой производительностью.
Платформа Ryzen AI Max PRO предоставляет разработчикам большой пул унифицированной памяти для требовательных локальных задач ИИ, в общей сложности до 192 ГБ оперативной памяти, 160 ГБ из которых могут быть выделены для GPU. Этого достаточно для запуска локальных моделей с количеством параметров до 300 млрд, что значительно превосходит возможности ноутбуков или настольных компьютеров с 32–64 ГБ оперативной памяти. Вместе эти решения помогают выполнять нужные задачи локально и использовать облачный вывод только тогда, когда это необходимо.
Мы также применяем агентный ИИ к самой разработке ИИ. ROCm.ai включает новые навыки AMD Skills, которые подключаются к Claude, Codex, Cursor и Gemini, поэтому рекомендации, предоставляемые этими агентами, адаптированы для оборудования AMD. AMD ROCm™ Hyperloom, комплексный оптимизатор вывода для хост-кода и ядер GPU, может обнаруживать узкие места, применять исправления и проверять собственные улучшения, сокращая время, которое инженеры тратят на ручную оптимизацию производительности. Эти возможности дополняют поддержку Ryzen AI PRO 400 и более широкую совместимость с Windows и Linux, представленную нами в ROCm 7.2. Разработчики могут начать работу с открытыми моделями на системах AMD Ryzen AI Max PRO и использовать привычные инструменты при переходе на рабочие станции AMD Radeon или GPU AMD Instinct по мере роста проекта.
Заключение
Я работаю с конечными точками, поэтому мое убеждение в том, что наибольшее влияние ИИ будет ощущаться за рабочим столом, продиктовано спецификой моей работы, но инфраструктура, лежащая в основе возможностей, редко является тем, с чем сталкиваются пользователи. Облачная и локальная стороны ИИ одинаково важны, поэтому AMD создала портфель вычислительных решений, охватывающий весь рынок. Работа, которую мы сегодня проводим в центрах обработки данных, улучшает то, что завтра будет работать на вашем ПК; программное обеспечение ROCm и оптимизации ROCm.ai развиваются до уровня Helios и распространяются на наши разработки в области робототехники и физического ИИ.
На конференции AAI мы продемонстрировали одну конечную точку Ryzen AI, самостоятельно запускающую агентов, с учетом затрат и ограниченную по своей архитектуре. Теперь представьте десять тысяч таких устройств в масштабах предприятия, каждое из которых является доверенной машиной и вносит свой вклад в общую стратегию ИИ предприятия. Это будущее, к которому мы стремимся — будущее, в котором локальные устройства и облачные возможности управляются совместно, с интеллектуальной маршрутизацией рабочих нагрузок, гарантирующей, что обе стороны работают максимально эффективно.









