На конференции Hot Chips 2026 индустрия пришла к общему мнению относительно нового «узкого места»: ИИ переходит от разовых ответов к агентам, которые рассуждают, вызывают инструменты и продолжают работать. Это означает гораздо большее количество генерируемых токенов и гораздо больше времени, затрачиваемого на декодирование.
Кратко
- Агентный ИИ генерирует больше токенов и проводит большую часть времени вывода в ограниченном пропускной способностью памяти процессе декодирования, поэтому системная пропускная способность важнее пиковой вычислительной мощности.
- Согласно анализу SambaNova для шести конфигураций передовых моделей, декодирование занимало от 75% до 97% времени вывода модели.
- Коэффициент использования пропускной способности модели (MBU) измеряет, какая часть установленной пропускной способности действительно используется для перемещения весов и KV-кэша: установленная пропускная способность, умноженная на MBU, дает количество токенов в секунду.
- SN50 RDU сочетает в себе модель выполнения потоков данных (dataflow) и 432 МБ встроенной SRAM с масштабируемым Ethernet (scale-up и scale-out), чтобы поддерживать эффективную пропускную способность между чипами.
- Масштабирование модели DeepSeek-R1 с 64 до 256 RDU увеличивает скорость для пользователя с 200 до 500 токенов в секунду (TPS), при этом MBU удерживается в диапазоне от 44% до 51%.
Этот сдвиг делает задачу проектирования оборудования гораздо более интересной. Следующее поколение вывода не будет выиграно за счет одного большого чипа. Передовые модели уже охватывают несколько чипов, и их скорость зависит от того, насколько эффективно процессоры, память и сети работают как единая система. Быстрый чип важен. Быстрая система — важнее.
Наш доклад на Hot Chips «Dataflow в масштабе: SN50 RDU» был посвящен этой проблеме всей системы: какая часть установленной пропускной способности достигает модели; как потоки данных поддерживают работу внутри RDU; и как сеть сохраняет эту эффективность по мере масштабирования моделей между чипами, узлами и стойками.
Рагху Прабхакар, главный архитектор SambaNova, представляет SN50 RDU на Hot Chips 2026.
От пиковой пропускной способности к полезной пропускной способности модели
В предыдущих блогах SambaNova объяснялось «узкое место» декодирования и то, почему дезагрегированный вывод распределяет вычислительно емкое префильное заполнение (prefill) на GPU, а ограниченное памятью декодирование — на RDU. Наш доклад начался с метрики, которая связывает эту архитектуру с фактической скоростью генерации токенов: коэффициентом использования пропускной способности модели (MBU).
Эта концепция хорошо известна, она не нова. Инженерная команда MosaicML в Databricks представила MBU как достигнутую пропускную способность данных модели, деленную на пиковую пропускную способность памяти системы. Пиковая пропускная способность HBM показывает, что оборудование может передать теоретически. MBU показывает, какая часть этой пропускной способности действительно перемещает веса модели и данные кэша ключей-значений (KV-кэш) во время генерации токенов. Для декодирования, ограниченного пропускной способностью, установленная пропускная способность, умноженная на MBU, дает эффективную пропускную способность модели, которая и преобразуется в токены в секунду.
В шести конфигурациях передовых моделей, проанализированных SambaNova, декодирование составляло от 75% до 97% времени вывода модели. В крайнем случае, для DeepSeek-V3 (8 тыс. входных токенов, 1 тыс. выходных, B300 FP4 и один активный запрос) 97% времени вывода модели уходило на декодирование. Точное распределение зависит от модели, контекста, точности и параллелизма, но системный урок остается неизменным: одна лишь пиковая вычислительная мощность не предсказывает скорость, которую пользователь ощутит при работе с агентом.
MBU связывает пиковую пропускную способность HBM с перемещением данных модели, которое управляет генерацией токенов. Источник: Рагху Прабхакар, Hot Chips 2026. Ссылка на концепцию: MosaicML/Databricks.
Это различие становится тем важнее, чем больше становятся системы. Добавление ускорителей увеличивает теоретическую пропускную способность, но скорость токенов на пользователя не вырастет вместе с ней, если синхронизация, трафик памяти или накладные расходы на связь снижают коэффициент использования. Цель состоит не просто в увеличении пропускной способности. Цель — в увеличении пропускной способности, которую модель может использовать.
Как потоки данных превращают пропускную способность в токены
SN50 RDU использует модель выполнения потоков данных (dataflow), а не последовательность отдельно запускаемых ядер. Компилятор отображает модель на мозаичную сетку вычислительных блоков и блоков памяти. 432 МБ распределенной встроенной SRAM в SN50 удерживают часто используемые данные рядом с вычислительными мощностями и позволяют промежуточным значениям перемещаться между операциями без повторных обращений к HBM.
Постоянное выполнение декодера и слияние операторов позволяют модели непрерывно работать на этапах генерации токенов, вместо того чтобы постоянно останавливать и возобновлять работу на границах ядер. Двухбуферные блоки памяти начинают перемещать следующий фрагмент модели, пока выполняются текущие вычисления. Коллективные коммуникации могут завершаться в SRAM, избегая ненужного трафика HBM и позволяя совмещать вычисления, доступ к памяти и коммуникации.
Это совмещение — связующее звено между MBU и масштабированием. Полезная пропускная способность — это не только свойство памяти; это результат поддержания продуктивности всего конвейера выполнения. Как только модель охватывает несколько RDU, сеть становится частью этого конвейера.
Вывод в масштабе требует масштабирования вверх (scale-up) и наружу (scale-out)
Плотные передовые модели и модели «смеси экспертов» (MoE) охватывают множество ускорителей. Их фабрики должны поддерживать частые коллективные операции и динамическое перемещение токенов, не превращая коммуникацию в новое «узкое место».
SambaNova SN50 использует три подключенных сетевых домена. Внутри восьмисокетного узла семь интегрированных каналов 800G Ethernet образуют полносвязную топологию, что дает каждому RDU прямой путь к другим RDU в узле. За пределами узла два дополнительных порта 800G на каждый RDU подключаются к фабрике масштабирования между узлами. В этих доменах SN50 объединяет десять портов 800G Ethernet с совокупной пропускной способностью 2 ТБ/с на RDU. В примере с 64 сокетами два 64-портовых коммутатора 800G соединяют каждый узел с обоими коммутаторами, при этом по одной линии от каждого RDU идет к каждому коммутатору.
Масштабирование наружу (scale-out) выполняет другую задачу. Каждый SN50 RDU использует сетевую карту 400G RoCEv2 для соединения доменов масштабирования вверх через оптимизированную для стоек сеть Ethernet. Этот уровень поддерживает дезагрегированный вывод и передачу KV-кэша между доменами масштабирования. Отдельная фронтенд-сеть центра обработки данных остается доступной для хостов, хранения и управления.
SN50 сочетает в себе полносвязный восьмисокетный узел, межпроцессорное масштабирование 800G и путь масштабирования наружу 400G RoCEv2 между доменами масштабирования. Источник: Рагху Прабхакар, Hot Chips 2026.
Это разделение важно, потому что трафик различается. Масштабирование вверх (scale-up) обеспечивает тесно связанную коммуникацию, необходимую для разделения одной модели между RDU. Масштабирование наружу (scale-out) соединяет более крупные домены и гетерогенные этапы вывода. Каждый уровень построен вокруг того шаблона коммуникации, который он должен поддерживать.
Почему тензорный параллелизм и параллелизм экспертов требуют разного поведения сети
Тензорный параллелизм разделяет крупные тензорные операции между RDU. Каждый шаг зависит от коллективных операций, таких как reduce-scatter, all-gather и all-reduce, поэтому коммуникация должна идти в ногу с матричными вычислениями. Бенчмарк тензорно-параллельного умножения матриц (GEMM) на кристалле, представленный на Hot Chips, достиг как минимум 70% использования TFLOPs — доли доступных вычислений с плавающей запятой, поддерживаемых в продуктивном состоянии, — на 8, 16 и 32 сокетах SN50. На 32 сокетах бенчмарк достиг полного совмещения вычислений и коммуникации. Это результат для отдельного ядра, а не производительность модели в целом, но он демонстрирует поведение, которое призвана сохранить фабрика масштабирования.
Тест производительности тензорно-параллельного GEMM на кристалле SN50 показал использование TFLOPs не менее 70% на 8, 16 и 32 сокетах при полном перекрытии вычислений и передачи данных на 32 сокетах. Источник: измерение на кристалле SambaNova, представленное Рагху Прабхакаром на Hot Chips 2026, слайд 28.
Параллелизм экспертов создает иную проблему. В модели «смесь экспертов» (mixture-of-experts) маршрутизатор выбирает разных экспертов для разных токенов. Таким образом, операции распределения (dispatch) и объединения (combine) создают динамический трафик, пункты назначения которого меняются с каждым пакетом. SN50 поддерживает как подход «все-ко-всем» (all-to-all), так и «широковещание с фильтрацией» (broadcast-and-filter). Подход «все-ко-всем» фильтрует данные на источнике и позволяет избежать лишнего трафика, но создает неравномерные потоки. «Широковещание с фильтрацией» создает более равномерный трафик и может начинаться одновременно с вычислениями маршрутизатора, ценой передачи дополнительных данных.
В 64-сокетной экспертно-параллельной конфигурации SambaNova более 70% пропускной способности было использовано для загрузки экспертов. Как при тензорном, так и при экспертном параллелизме пропускная способность превращается в производительность, когда модель выполнения может перекрывать передачу данных и согласовывать поведение сети с трафиком, который модель фактически генерирует.
Поддержание высокого уровня MBU по мере роста системы
Вопрос масштабирования прост: могут ли дополнительные чипы обеспечить большую скорость, не теряя при этом полезную пропускную способность, которая делала каждый чип быстрым?
Согласно смоделированным рабочим точкам SambaNova для DeepSeek-R1 с 8 тыс. входных и 1 тыс. выходных токенов, прогнозируемая скорость на пользователя возрастает с 200 до 300 и 500 токенов в секунду по мере масштабирования конфигурации с 64 до 128 и 256 RDU SN50. Показатель MBU остается на уровне 51%, 44% и 45% соответственно. Это смоделированные рабочие точки, а не измеренные производственные результаты, и показатели будут варьироваться в зависимости от рабочей нагрузки. Они иллюстрируют цель проектирования: увеличить емкость декодирования, сохраняя при этом значительную долю полезной пропускной способности модели.
Больше RDU увеличивают совокупную пропускную способность, в то время как потоковая передача данных (dataflow) с использованием масштабируемой фабрики спроектирована так, чтобы поддерживать достаточную продуктивность этой пропускной способности для повышения скорости обработки токенов. Масштабирование — это не только размещение более крупной модели, это поддержание движения модели.
Выводы Hot Chips
Вывод из Hot Chips 2026 прост: агентный вывод — это системная проблема. GPU остаются отличным решением для обучения и предварительного заполнения (prefill), ограниченного вычислительными мощностями. RDU специально созданы для декодирования, ограниченного пропускной способностью памяти. CPU координируют инструменты, API, векторные базы данных и действия вокруг модели. Сеть позволяет множеству процессоров работать как единая платформа вывода.
SambaNova уже показала, на что способна такая гибридная архитектура. На RAISE Summit 2026 предварительная система, использующая четыре GPU NVIDIA H200 для предварительного заполнения и 16 RDU SN50 для декодирования, достигла скорости 763 выходных токена в секунду на модели MiniMax M2.7 с 10 000 входных токенов в ходе тестирования Artificial Analysis. Позже SemiAnalysis провела тестирование SambaRack SN50 на той же модели в двух тензорно-параллельных конфигурациях. Эти результаты освещены в блоге RAISE MiniMax и обзоре тестов SemiAnalysis.
Пиковая пропускная способность описывает возможности. MBU показывает, какая часть этих возможностей доходит до модели. Наша архитектура потоков данных (Dataflow Architecture) поддерживает движение данных модели внутри RDU. Масштабируемый Ethernet передает тензорно-параллельный и экспертно-параллельный трафик; масштабируемый Ethernet (scale-out) передает данные KV-кэша и трафик дезагрегированного вывода между доменами. Если собрать эти части вместе, архитектура спроектирована так, чтобы обеспечить агентному ИИ быстрые токены, сохраняя при этом полезную пропускную способность по мере масштабирования моделей.










