Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Za predelami prefillinga i dekodirovaniya dezagregatsiya perehodit ot tokenov k
Dev48

© 2026 · All rights reserved.

За пределами префиллинга и декодирования: дезагрегация переходит от токенов к кадрам

Источник: Intel

За пределами префиллинга и декодирования: дезагрегация переходит от токенов к кадрам

Источник: Intel

Дезагрегация — это принцип, а не просто разделение префиллинга и декодирования.

25 сентября 2026 г.
  • Мои инструменты
  • Недавнее

Недавнее

Автор: Киран Атмакури

Соавторы: Паллави Джайни, Брайан Лю, Сергей Плотников и Дэниел Сочек

Увеличение измеренной пропускной способности генерации видео до 28% при том же количестве графических процессоров Intel® Arc™ Pro B70 с использованием Dynamo и vLLM-Omni.

Следующая возможность в оптимизации вывода — это не просто более быстрая модель. Это лучший способ организации работы, которую выполняет эта модель.

Наша реализация применяет этот системный подход к потоковой диффузионной генерации видео. Разделяя генерацию латентных представлений и декодирование пикселей на графических процессорах Intel Arc Pro B70, она обеспечивает до 28% более высокую измеренную пропускную способность генерации видео по сравнению с лучшей агрегированной конфигурацией в наших отчетных тестах при том же количестве GPU.

Архитектурная возможность заключается в том, чтобы выйти за рамки того, насколько эффективно мы генерируем токены, и перейти к тому, насколько эффективно мы генерируем и доставляем кадры.

Для языковых моделей дезагрегация отделяет обработку промпта от авторегрессионной генерации токенов. Эти фазы предъявляют разные требования к вычислениям и памяти, поэтому их разделение позволяет применять различные стратегии выполнения и масштабирования. Мультимодальный вывод расширяет этот принцип на кодирование входных данных, позволяя медиаобработке выполняться независимо от языковой модели. [1]

Потоковая диффузия представляет собой другой конвейер, но тот же архитектурный вопрос: какие этапы должны выполняться вместе, а какие выигрывают от независимых ресурсов?

Реализация потокового видео отделяет диффузионный трансформер (DiT) от декодера вариационного автокодировщика (VAE). DiT генерирует латентные представления — сжатое видеопредставление модели, а VAE преобразует эти представления в RGB-кадры. Текстовое кодирование остается за DiT; кодирование видео H.264 использует медиадвижок на существующем GPU B70.

Таким образом, граница проходит между генерацией латентных представлений и декодированием пикселей, а не между разделением последовательных шагов диффузионного шумоподавления между GPU. Этот пример также не требует разных архитектур GPU: независимого распределения между GPU B70 достаточно для получения измеримого преимущества.

Потоковая передача меняет место возникновения узкого места

Модели потоковой генерации видео с ИИ создают видео постепенно, по одному латентному блоку за раз, вместо того чтобы создавать весь клип целиком до того, как можно будет доставить какие-либо кадры. Это требует причинно-следственного процесса генерации, в котором каждый новый блок зависит только от ранее сгенерированного контента, а не от будущих латентных представлений.

Обычные модели диффузии видео, такие как Wan от Alibaba, генерируют последовательность латентных представлений видео с помощью нескольких двунаправленных шагов шумоподавления, прежде чем декодировать завершенную последовательность в пиксели. Causal Forcing преобразует этот шаблон выполнения для потоковой генерации. Он дистиллирует многошаговую двунаправленную модель в быстрый авторегрессионный «студент», который может генерировать каждый новый латентный блок причинно-следственным образом, используя только ранее сгенерированный контент [1].

Процесс дистилляции служит двум целям. Он сокращает количество шагов шумоподавления, необходимых для каждого сгенерированного блока, и обучает авторегрессионного «студента» сохранять стабильность по мере продвижения генерации. Это помогает смягчить накопление ошибок и предвзятость воздействия, которые в противном случае могут привести к визуальной деградации во время длительной авторегрессионной генерации видео.

В нашей реализации дистиллированная модель выполняет одношаговый прогон DiT для каждого латентного блока. Затем VAE немедленно декодирует этот блок в RGB-кадры, прежде чем генерация продолжится со следующим блоком. Причинно-следственное внимание (causal attention) обеспечивает такое инкрементальное выполнение, поскольку модель больше не зависит от будущих латентных блоков.

Это существенно меняет системную архитектуру. Вместо того чтобы декодирование VAE происходило преимущественно один раз в конце генерации видео, генерация латентных представлений DiT и декодирование пикселей VAE становятся повторяющимися этапами потокового конвейера. Эта повторяющаяся передача от DiT к VAE создает естественную границу для дезагрегации.

Разным этапам нужны разные стратегии масштабирования

DiT может использовать репликацию и тензорный параллелизм. Однако в этой реализации VAE временной кэш является состоянием на уровне модуля, поэтому рабочий процесс декодирует одну сессию за раз, а не просто объединяет независимые сессии в пакеты. Реализация ускоряет декодирование VAE за счет пространственного шардирования: разделения латентного представления по высоте между GPU и обмена граничными строками, необходимыми для свертки.

Это разные способы использования дополнительного оборудования. Разделение этапов позволяет каждому из них использовать подход, соответствующий его характеристикам выполнения.

Масштабируйте измеренное узкое место, а не каждый этап в равной степени

Профилирование показывает, что декодирование VAE является более медленным этапом в этом потоковом конвейере. Пространственное шардирование декодирования VAE между дополнительными GPU уменьшает это узкое место и приближает скорость его выполнения к этапу DiT.

Это мотивирует выделение дополнительных ресурсов GPU для декодирования VAE при сохранении выполнения DiT на меньшем пуле GPU. Распределение ресурсов следует характеристикам каждого этапа, а не требует идентичного масштабирования для всех этапов.

Раздельные бюджеты памяти и перекрытие выполнения

Только DiT занимает около 25,9 ГБ из 32 ГБ GPU B70 в отчетной конфигурации. Отделение VAE и его активаций создает больше пространства для роста кэша, буферов кодирования и других выделений памяти во время выполнения.

Разделение также позволяет организовать конвейер: DiT может генерировать латентный блок N+1, пока VAE декодирует блок N. В установившемся режиме интервал завершения может приближаться к времени выполнения более медленного этапа, а не к сумме обоих этапов, с учетом накладных расходов на передачу и синхронизацию. Это улучшает ритм последовательных выводов; это не устраняет зависимости, определяющие задержку первого вывода. [1]

В совокупности эти характеристики обосновывают дезагрегацию диффузии: независимое масштабирование, раздельные бюджеты памяти и перекрытие выполнения.

Чтобы оценить преимущество дезагрегации DiT/VAE, мы сравниваем агрегированные и дезагрегированные конфигурации, сохраняя общее количество графических процессоров Intel Arc Pro B70 неизменным. Это важно, поскольку позволяет изолировать преимущество разделения этапов и независимого распределения ресурсов от простого эффекта добавления дополнительного оборудования.

В инженерной оценке используется Causal Forcing Wan 2.1-1.3B T2V с рабочей нагрузкой из трех сцен и 243 кадров в разрешении 832 x 480. Программный стек использует Dynamo с бэкендом vLLM-Omni, а кодирование H.264 выгружается через VA-API на аппаратный медиадвижок B70.

В агрегированной конфигурации один и тот же пул GPU используется как для выполнения DiT, так и для декодирования VAE. Таким образом, масштабирование конфигурации связывает ресурсы, доступные для обоих этапов. В дезагрегированной конфигурации DiT и VAE работают на отдельных пулах GPU, что позволяет распределять доступные GPU в соответствии с характеристиками выполнения каждого этапа.

TP обозначает степень тензорного параллелизма DiT; в первом столбце указано общее количество физических GPU. Преимущества сравниваются с измеренной пропускной способностью генерации видео при наилучшей агрегированной конфигурации в представленных тестах и округлены. ПРИМЕЧАНИЕ: В агрегированных конфигурациях DiT и VAE выполняются на одном и том же пуле физических GPU; количество VAE не означает использование дополнительных GPU.

При использовании двух GPU дезагрегированная конфигурация обеспечивает на 14% более высокую измеренную пропускную способность генерации видео, чем лучшая агрегированная конфигурация при том же количестве GPU. При использовании четырех GPU преимущество возрастает до 28%.

Важно отметить, что этот прирост достигается не за счет использования большего количества GPU. Улучшение происходит благодаря возможности независимого масштабирования этапов DiT и VAE в соответствии с их рабочей нагрузкой. Размещая их в отдельных пулах GPU, дезагрегированная конфигурация позволяет избежать конкуренции за ресурсы между двумя этапами и направить большую часть доступной мощности GPU на тот этап, который получает наибольшую выгоду от дополнительных ресурсов.

Результатом является более высокая производительность при том же количестве GPU, а не просто повышение производительности за счет увеличения аппаратного обеспечения.

Чтобы сделать архитектуру пригодной для сквозного использования, наша реализация объединяет четыре инженерные задачи: перенос модели Causal Forcing Wan в vLLM-Omni, разделение выполнения DiT и VAE, включение аппаратного кодирования видео и добавление поддержки потоковой передачи Common Media Application Format (CMAF) в инфраструктуру оркестрации Dynamo.

Фронтенд Dynamo принимает HTTP-запросы и обслуживает конечную точку потоковой передачи фрагментированного MP4, пересылая фрагменты видео клиенту по мере их создания. Клиент отправляет запрос, совместимый с OpenAI, содержащий либо один промпт, либо раскадровку из нескольких сцен, без необходимости управлять размещением этапов модели.

Воркер DiT выполняет кодирование текста и авторегрессионное развертывание латентных представлений. Воркеры VAE преобразуют эти латентные представления в RGB-кадры. В представленной конфигурации VAE с тремя путями воркеры разделяют каждое латентное представление по высоте и обмениваются граничными строками при каждой свертке.

Маршрутизатор Omni управляет жизненным циклом запроса и запускает кодирование H.264 и фрагментацию CMAF через дочерний процесс FFmpeg. Сжатие H.264 переносится на аппаратный медиа-движок B70, в то время как окружающее программное обеспечение координирует процесс кодирования, фрагментации и доставки.

Это связывает оптимизацию на уровне этапов с сервисом, ориентированным на приложения: запросы поступают через фронтенд, воркеры модели создают кадры, а путь потоковой передачи доставляет воспроизводимые фрагменты видео по мере их готовности.

Инженерная реализация представлена в ветках cf_wan_pipe репозиториев vLLM-Omni и Dynamo в разделе «Ссылки» [2]. Эти ветки определяют реализацию, использованную для данной работы; их не следует рассматривать как утверждение о том, что все возможности включены в выпущенную версию вышестоящего репозитория.

Развивая работу Intel по дезагрегированному выводу

Эта работа расширяет текущие усилия Intel по практическому внедрению дезагрегированного вывода с помощью открытого программного обеспечения.

В июле 2025 года в статье «Оптимизация вывода LLM на ускорителях Intel® Gaudi® с помощью дезагрегации llm-d» была продемонстрирована возможность разделения этапов prefill/decode на ускорителях Intel Gaudi с использованием llm-d и vLLM. Работа показала, как этапы могут планироваться и масштабироваться независимо, обеспечивая более стабильную задержку между токенами в представленных тестах. [3]

Наша статья от марта 2026 года «От моделей к системам: обеспечение гетерогенного вывода ИИ с помощью открытой оркестрации» расширила это обсуждение до конвейеров prefill/decode и encode/prefill/decode, наряду с вкладом Intel в открытую оркестрацию через Dynamo. Основное внимание было уделено приведению ресурсов в соответствие с потребностями выполнения каждого этапа. [4]

В июне 2026 года в статье «Снижение стоимости мультимодального вывода с помощью гетерогенной дезагрегации E/PD» эта же идея была распространена на гетерогенный мультимодальный вывод, показав, как независимое размещение этапов кодирования и prefill/decode на различных аппаратных ресурсах может повысить эффективность и экономичность вывода. [5]

Эта реализация диффузии переносит тот же принцип на новую рабочую нагрузку: генерацию латентных представлений DiT и декодирование пикселей VAE на графических процессорах Intel Arc Pro B70, соединенных через Dynamo и vLLM-Omni. Прогресс идет от этапов обслуживания токенов к этапам генерации кадров с той же целью: независимо оптимизировать работу, которая определяет производительность сервиса.

Архитектура + B70 + открытое ПО = ценность для клиента

Ценность дезагрегации заключается не в разделении ради самого разделения. Это способность распределять ресурсы там, где они улучшают обслуживание клиентов.

Здесь компоненты усиливают друг друга. Дезагрегация DiT/VAE позволяет независимо масштабировать этапы и перекрывать их выполнение. Графические процессоры Intel Arc Pro B70 обеспечивают вычислительную мощность, память и аппаратное кодирование видео, используемые конвейером. Dynamo и vLLM-Omni объединяют эти компоненты в сквозную реализацию потоковой передачи.

Вместе они обеспечивают до 28% более высокую измеренную пропускную способность генерации видео при том же количестве GPU в представленных сравнениях. Это означает более высокую пропускную способность генерации видео при эквивалентных инвестициях в GPU, исходя из одинаковой стоимости приобретения GPU.

Это конкретный шаг к улучшению экономики вывода. Количественная оценка совокупной стоимости владения (TCO) по-прежнему требует учета затрат на электроэнергию, хост и инфраструктуру, а также измерений использования и качества обслуживания. Измеренное преимущество в пропускной способности не является эквивалентным измеренным снижением TCO.

От токенов к кадрам принцип остается прежним: масштабируйте работу, которая имеет значение, а не каждый этап в равной степени.

[1] Min Zhao et al., Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation, arXiv, 1 июня 2026 г.

[2] Ветки реализации: vLLM-Omni: cf_wan_pipe и Dynamo: cf_wan_pipe. Эти ссылки являются предоставленными источниками реализации, а не подтверждением статуса выпуска вышестоящей версии.

[3] Kiran Atmakuri и соавторы, Optimizing LLM Inference on Intel® Gaudi® Accelerators with llm-d Decoupling, Intel Community, 28 июля 2025 г.

[4] Kiran Atmakuri, From Models to Systems: Enabling Heterogeneous AI Inference with Open Orchestration, Intel Community, 30 марта 2026 г.

[5] Kiran Atmakuri, Pallavi Jaini, Sergey Plotnikov, Daniel Socek, Lowering Multimodal Inference Cost with Heterogeneous E/PD Disaggregation, Intel Community, 26 июня 2026 г.

[6] Intel, логотип Intel и Arc являются товарными знаками корпорации Intel или ее дочерних компаний.

← Все статьи

Ещё в разделе «Hardware и электроника»

Все →
HTC VIVE ОТМЕЧАЕТ ПЕРВУЮ ГОДОВЩИНУ 5 АПРЕЛЯ ПРАЗДНИКОМ «VIVE DAY» ДЛЯ ФАНАТОВ
HTC VIVE

HTC VIVE ОТМЕЧАЕТ ПЕРВУЮ ГОДОВЩИНУ 5 АПРЕЛЯ ПРАЗДНИКОМ «VIVE DAY» ДЛЯ ФАНАТОВ

Meta открывает программу раннего доступа к новым функциям MuseПресса
Meta

Meta открывает программу раннего доступа к новым функциям Muse

«Мощный прорыв» Meta создает уникальную торговую стратегию, считает Майк Хау
Пресса
Meta

«Мощный прорыв» Meta создает уникальную торговую стратегию, считает Майк Хау

Meta делает ставку на Muse, популярность которой стремительно растетПресса
Meta

Meta делает ставку на Muse, популярность которой стремительно растет

Марк Цукерберг представил VR-очки Meta за 1299 долларов и кулон Muse Charm в рамках продвижения ИИ-агентовПресса
Meta

Марк Цукерберг представил VR-очки Meta за 1299 долларов и кулон Muse Charm в рамках продвижения ИИ-агентов

Factorio появился на Printables
Prusa Research

Factorio появился на Printables

Ещё от Intel

Программные оптимизации Intel повышают производительность ИИ-инференса в MLPerf v6.1
Intel

Программные оптимизации Intel повышают производительность ИИ-инференса в MLPerf v6.1

Intel на саммите AI Infra Summit
Intel

Intel на саммите AI Infra Summit

Googlebook выходит с процессорами Intel Core Ultra Series 3
Intel

Googlebook выходит с процессорами Intel Core Ultra Series 3