Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Za predelami prefilla i dekodirovaniya dezagregatsiya perehodit ot tokenov k kad
Dev48

© 2026 · All rights reserved.

За пределами префилла и декодирования: дезагрегация переходит от токенов к кадрам

Источник: Intel

За пределами префилла и декодирования: дезагрегация переходит от токенов к кадрам

Источник: Intel

Дезагрегация — это принцип, а не просто разделение префилла и декодирования

28 сентября 2026 г.•Обновлено: 28 сентября 2026 г.
  • Мои инструменты
  • Недавние

Недавние

Автор: Киран Атмакури (Kiran Atmakuri)

Соавторы: Паллави Джайни (Pallavi Jaini), Брайан Лю (Brian Liu), Сергей Плотников и Дэниел Сосек (Daniel Socek)

Измеренная производительность генерации видео на графических процессорах Intel® Arc™ Pro B70 с использованием Dynamo и vLLM-Omni выше на величину до 28% при том же количестве графических процессоров.

Следующая возможность для оптимизации инференса — это не просто более быстрая модель. Это лучший способ организации работы, которую эта модель выполняет.

Наша реализация применяет такой системный подход к потоковой диффузионной генерации видео. Разделяя генерацию латентных представлений и декодирование пикселей на графических процессорах Intel Arc Pro B70, она обеспечивает измеренную пропускную способность генерации видео на 28% выше, чем лучшая объединенная конфигурация в наших тестах, при том же количестве графических процессоров.

Архитектурная возможность заключается в том, чтобы выйти за рамки эффективности генерации токенов и перейти к эффективности генерации и доставки фреймов.

Для языковых моделей дезагрегация отделяет обработку промптов от авторегрессионной генерации токенов. Эти фазы предъявляют разные требования к вычислениям и памяти, поэтому их разделение позволяет использовать разные стратегии выполнения и масштабирования. Мультимодальный инференс распространяет этот принцип на кодирование входных данных, позволяя медиаобработке выполняться независимо от языковой модели. [1]

Потоковая диффузия представляет собой другой конвейер, но тот же архитектурный вопрос: какие этапы должны выполняться вместе, а какие извлекают выгоду из независимых ресурсов?

Реализация потокового видео отделяет диффузионный трансформер (DiT) от декодера вариационного автокодировщика (VAE). DiT генерирует латентные представления (сжатое представление видео модели), а VAE преобразует эти латентные представления в кадры RGB. Кодирование текста остается за DiT; для кодирования видео H.264 используется медиа-движок на существующем графическом процессоре B70.

Таким образом, граница проходит между генерацией латентных представлений и декодированием пикселей, а не между последовательными шагами диффузионного шумоподавления на разных графических процессорах. Кроме того, этот пример не требует различных архитектур графических процессоров: независимого распределения ресурсов между графическими процессорами B70 достаточно для получения измеримой выгоды.

Потоковая передача меняет место возникновения узкого места

Модели потокового видео с ИИ генерируют видео постепенно, по одному латентному блоку за раз, а не создают весь клип целиком до отправки каких-либо кадров. Это требует причинно-следственного (каузального) процесса генерации, в котором каждый новый блок зависит только от ранее сгенерированного контента, а не от будущих латентных представлений.

Обычные модели видеодиффузии, такие как Wan от Alibaba, генерируют последовательность видео-латентных представлений с помощью нескольких двунаправленных шагов шумоподавления перед декодированием завершенной последовательности латентных представлений в пиксели. Causal Forcing преобразует этот шаблон выполнения для потоковой генерации. Эта технология превращает многоэтапную двунаправленную модель в быстрый авторегрессионный аналог, который может генерировать каждый новый латентный блок причинно-следственным образом, используя только ранее сгенерированный контент [1].

Процесс дистилляции служит двум целям. Он снижает количество шагов шумоподавления, необходимых для каждого сгенерированного блока, и обучает авторегрессионную модель оставаться стабильной по мере генерации. Это помогает смягчить накопление ошибок и смещение воздействия, которые в противном случае могут привести к ухудшению качества изображения при длительной авторегрессионной генерации видео.

В нашей реализации дистиллированная модель выполняет одношаговое развертывание DiT для каждого латентного блока. Затем VAE немедленно декодирует этот блок в кадры RGB до того, как генерация продолжится со следующим блоком. Каузальное внимание делает возможным такое инкрементное выполнение, поскольку модель больше не зависит от будущих латентных блоков.

Это существенно меняет системную архитектуру. Вместо того чтобы декодирование VAE происходило в основном один раз в конце генерации видео, генерация латентных представлений DiT и декодирование пикселей VAE становятся повторяющимися этапами потокового конвейера. Эта повторяющаяся передача данных от DiT к VAE создает естественную границу для дезагрегации.

Различным этапам требуются разные стратегии масштабирования

DiT может использовать репликацию и тензорный параллелизм. Однако в этой реализации VAE временной кэш является состоянием на уровне модуля, поэтому рабочий процесс декодирует один сеанс за раз, а не просто объединяет независимые сеансы в пакеты. Реализация ускоряет декодирование VAE посредством пространственного шардирования: разделения латентного представления по высоте между графическими процессорами и обмена граничными строками, необходимыми для свертки.

Это разные способы использования дополнительного оборудования. Разделение этапов позволяет каждому из них использовать подход, соответствующий его характеристикам выполнения.

Масштабируйте выявленное узкое место, а не каждый этап в равной степени

Профилирование показывает, что декодирование VAE является более медленным этапом в этом потоковом конвейере. Пространственное шардирование декодирования VAE на дополнительные графические процессоры уменьшает это узкое место и приближает скорость его выполнения к этапу DiT.

Это побуждает выделить дополнительные ресурсы графического процессора для декодирования VAE, сохранив выполнение DiT на меньшем пуле графических процессоров. Распределение ресурсов соответствует характеристикам каждого этапа, а не требует одинакового масштабирования всех этапов.

Разделение бюджетов памяти и параллельное выполнение

Только DiT занимает примерно 25,9 ГБ из 32 ГБ памяти графического процессора B70 в заявленной конфигурации. Разделение VAE и ее активаций создает больше свободного пространства для роста кэша, буферов кодирования и других выделений памяти во время выполнения.

Разделение также позволяет организовать конвейер: DiT может генерировать латентный блок N+1, пока VAE декодирует блок N. В установившемся режиме интервал завершения может приближаться ко времени выполнения более медленного этапа, а не к сумме обоих этапов (с учетом накладных расходов на передачу и синхронизацию). Это улучшает ритмичность выдачи последовательных результатов, но не устраняет зависимости, определяющие задержку первого вывода.

В совокупности эти характеристики обосновывают дезагрегацию диффузии: независимое масштабирование, раздельные бюджеты памяти и перекрывающееся выполнение.

Чтобы оценить преимущества дезагрегации DiT/VAE, мы сравниваем агрегированные и дезагрегированные конфигурации, сохраняя общее количество графических процессоров Intel Arc Pro B70 постоянным. Это важно, поскольку позволяет отделить выгоду от разделения этапов и независимого распределения ресурсов от простого эффекта добавления дополнительного оборудования.

В инженерной оценке используется Causal Forcing Wan 2.1-1.3B T2V с трехсценарной рабочей нагрузкой из 243 кадров при разрешении 832 x 480. Программный стек использует Dynamo с бэкендом vLLM-Omni, а кодирование H.264 выгружается через VA-API на аппаратный медиа-движок B70.

В агрегированной конфигурации один и тот же пул графических процессоров используется как для выполнения DiT, так и для декодирования VAE. Таким образом, масштабирование конфигурации связывает ресурсы, доступные для обоих этапов. В дезагрегированной конфигурации DiT и VAE работают на отдельных пулах графических процессоров, что позволяет распределять доступные графические процессоры в соответствии с характеристиками выполнения каждого этапа.

TP обозначает степень тензорного параллелизма DiT; в первом столбце указано общее количество физических GPU. Преимущества сравнивают измеренную пропускную способность генерации видео с лучшей агрегированной конфигурацией в протестированных тестах и округлены. ПРИМЕЧАНИЕ: В агрегированных конфигурациях DiT и VAE выполняются на одном и том же пуле физических GPU; количество VAE не представляет собой дополнительные GPU.

С двумя GPU раздельная конфигурация обеспечивает на 14% более высокую измеренную пропускную способность генерации видео по сравнению с лучшей агрегированной конфигурацией при том же количестве GPU. С четырьмя GPU это преимущество возрастает до 28%.

Важный момент заключается в том, что эти приросты достигаются не за счет использования большего количества GPU. Улучшение происходит благодаря тому, что этапы DiT и VAE могут масштабироваться независимо в соответствии со своими рабочими нагрузками. Размещая их на отдельных пулах GPU, раздельная конфигурация позволяет избежать борьбы за ресурсы между двумя этапами и направить большую часть доступной емкости GPU на тот этап, который получает наибольшую выгоду от дополнительных ресурсов.

Результатом является повышение производительности при том же количестве GPU, а не просто повышение производительности за счет увеличения аппаратных средств.

Чтобы сделать архитектуру пригодной для сквозного использования, наша реализация объединяет четыре инженерные задачи: портирование модели Causal Forcing Wan на vLLM-Omni, разделение выполнения DiT и VAE, включение аппаратного кодирования видео и добавление поддержки потоковой передачи Common Media Application Format (CMAF) в структуру оркестрации Dynamo.

Интерфейс Dynamo принимает HTTP-запросы и обслуживает конечную точку потоковой передачи фрагментированного MP4, пересылая фрагменты видео клиенту по мере их создания. Клиент отправляет запрос, совместимый с OpenAI, содержащий либо одну подсказку, либо раскадровку из нескольких сцен, без необходимости управлять размещением этапов модели.

Воркер DiT выполняет кодирование текста и авторегрессионную генерацию латентных представлений. Воркеры VAE преобразуют эти латентные представления в кадры RGB. В проиллюстрированной трехсторонней конфигурации VAE воркеры разделяют каждое латентное представление по высоте и обмениваются граничными строками при каждой свертке.

Маршрутизатор Omni управляет жизненным циклом запроса и выполняет кодирование H.264 и фрагментацию CMAF через дочерний процесс FFmpeg. Сжатие H.264 перекладывается на аппаратный мультимедийный движок B70, в то время как сопутствующее программное обеспечение координирует процесс кодирования, фрагментации и доставки.

Это связывает оптимизацию на уровне этапов со службой, ориентированной на приложения: запросы поступают через интерфейс, воркеры моделей создают кадры, а путь потоковой передачи постепенно доставляет воспроизводимые фрагменты видео.

Инженерная реализация представлена в ветках cf_wan_pipe репозиториев vLLM-Omni и Dynamo в разделе Ссылки [2]. Эти ветки определяют реализацию, использованную для данной работы; их не следует воспринимать как утверждение о том, что каждая возможность включена в выпущенную версию вышестоящего репозитория (upstream).

Опираясь на работу Intel в области разделенного вывода

Эта работа продолжает текущие усилия Intel по повышению практичности разделенного вывода с помощью открытого программного обеспечения.

В июле 2025 года в материале «Оптимизация вывода LLM на ускорителях Intel® Gaudi® с помощью разделения llm-d» было продемонстрировано разделение этапов префилла и генерации (prefill/decode) на ускорителях Intel Gaudi с использованием llm-d и vLLM. Работа показала, как этапы могут планироваться и масштабироваться независимо, обеспечивая более стабильную задержку между токенами в проведенных тестах.

Наша статья за март 2026 года «От моделей к системам: Обеспечение гетерогенного вывода ИИ с помощью открытой оркестрации» расширила это обсуждение на конвейеры prefill/decode и encode/prefill/decode наряду с вкладом Intel в открытую оркестрацию через Dynamo. Основное внимание уделялось сопоставлению ресурсов с потребностями выполнения каждого этапа.

В июне 2026 года в статье «Снижение стоимости мультимодального вывода с помощью гетерогенного разделения E/PD» эта же идея была распространена на гетерогенный мультимодальный вывод, показав, как независимое размещение этапов кодирования и префилла/генерации на разных ресурсах ускорителей может повысить эффективность и экономичность вывода.

Эта реализация диффузии переносит тот же принцип на новую рабочую нагрузку: генерацию латентных представлений DiT и пиксельное декодирование VAE на графических процессорах Intel Arc Pro B70 Graphics, связанных через Dynamo и vLLM-Omni. Прогресс идет от этапов обслуживания токенов к этапам генерации кадров с той же целью: независимо оптимизировать работу, определяющую производительность службы.

Архитектура + B70 + открытое ПО = ценность для клиента

Ценность разделения заключается не в разделении ради самого разделения. Это возможность распределять ресурсы там, где они улучшают обслуживание клиентов.

Здесь элементы подкрепляют друг друга. Разделение DiT/VAE позволяет независимо масштабировать этапы и совмещать их выполнение. Графические процессоры Intel Arc Pro B70 Graphics обеспечивают вычисления, память и аппаратное кодирование видео, используемые конвейером. Dynamo и vLLM-Omni объединяют эти компоненты в сквозную реализацию потоковой передачи.

В совокупности они обеспечивают на 28% более высокую измеренную пропускную способность генерации видео при том же количестве GPU в сравнениях, представленных в отчетах. Это означает более высокую пропускную способность генерации видео при эквивалентных инвестициях в GPU, если предположить ту же стоимость приобретения GPU.

Это конкретный шаг к улучшению экономики вывода. Количественная оценка совокупной стоимости владения по-прежнему требует учета затрат на электроэнергию, хост и инфраструктуру, измерений коэффициента использования и качества обслуживания. Измеренное преимущество в пропускной способности не является эквивалентным измеренным снижением совокупной стоимости владения (TCO).

От токенов к кадрам принцип остается прежним: масштабируйте работу, которая имеет значение, а не каждый этап в равной степени.

[1] Min Zhao et al., Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation, arXiv, June 1, 2026.

[2] Implementation branches: vLLM-Omni: cf_wan_pipe and Dynamo: cf_wan_pipe. These links are source-provided implementation references, not a verification of upstream release status.

[3] Kiran Atmakuri and coauthors, Optimizing LLM Inference on Intel® Gaudi® Accelerators with llm-d Decoupling, Intel Community, July 28, 2025.

[4] Kiran Atmakuri, From Models to Systems: Enabling Heterogeneous AI Inference with Open Orchestration, Intel Community, March 30, 2026.

[5] Kiran Atmakuri, Pallavi Jaini, Sergey Plotnikov, Daniel Socek, Lowering Multimodal Inference Cost with Heterogeneous E/PD Disaggregation, Intel Community, June 26, 2026.

Intel, the Intel logo, and Arc are trademarks of Intel Corporation or its subsidiaries.

← Все статьи

Ещё в разделе «Hardware и электроника»

Все →
Meta нанимает CEO MongoDB CJ Desai для руководства корпоративным подразделением. Акции MongoDB падаютПресса
Meta

Meta нанимает CEO MongoDB CJ Desai для руководства корпоративным подразделением. Акции MongoDB падают

Может ли Muse преодолеть проблемы доверия Meta?Пресса
Meta

Может ли Muse преодолеть проблемы доверия Meta?

Система накопления энергии Anker SOLIX X1 получает одобрение Совета по чистой энергии, расширяя глобальный охват рынка
Anker Innovations

Система накопления энергии Anker SOLIX X1 получает одобрение Совета по чистой энергии, расширяя глобальный охват рынка

Агент Muse от Meta атакует одно из самых прибыльных слабых мест экономикиПресса
Meta

Агент Muse от Meta атакует одно из самых прибыльных слабых мест экономики

HTC VIVE ОТМЕЧАЕТ ПЕРВУЮ ГОДОВЩИНУ 5 АПРЕЛЯ ПРАЗДНИКОМ «VIVE DAY» ДЛЯ ФАНАТОВ
HTC VIVE

HTC VIVE ОТМЕЧАЕТ ПЕРВУЮ ГОДОВЩИНУ 5 АПРЕЛЯ ПРАЗДНИКОМ «VIVE DAY» ДЛЯ ФАНАТОВ

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадкуПресса
Boeing

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадку

Ещё от Intel

Программные оптимизации Intel повышают производительность инференса ИИ в MLPerf v6.1
Intel

Программные оптимизации Intel повышают производительность инференса ИИ в MLPerf v6.1

Intel на полях саммита AI Infra Summit
Intel

Intel на полях саммита AI Infra Summit

Googlebook запущен с процессорами Intel Core Ultra Series 3
Intel

Googlebook запущен с процессорами Intel Core Ultra Series 3