Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Uskorenie video vae minimax h3 v 2 raza
Dev48

© 2026 · All rights reserved.

Ускорение видео VAE MiniMax H3 в 2 раза

Источник: Comfy Org

Ускорение видео VAE MiniMax H3 в 2 раза

Источник: Comfy Org

Видео VAE MiniMax H3 теперь кодирует до ~2,2 раза быстрее и декодирует в 1,4–2,7 раза быстрее на графических процессорах Nvidia.

26 сентября 2026 г.•Обновлено: 26 сентября 2026 г.

Видео VAE MiniMax H3 теперь кодирует примерно в ~2.2 раза быстрее и декодирует в ~1.4–2.7 раза быстрее. В сумме это позволяет примерно вдвое сократить время, затрачиваемое видеопроцессом на VAE: полный цикл кодирования и декодирования для разрешения 1344x768 и 129 кадров сокращается с 24.3 до 12.7 секунд.

  • Объединенный ядро энкодера, включенное по умолчанию. Между свёртками энкодер нормализовывал каждый кадр, применял активацию и дополнял границы нулями (падинг), причем каждое действие выполнялось за отдельный проход по сотням мегабайт. Теперь это один проход, записывающий данные прямо в структуру памяти, необходимую для следующей свёртки. Ускорение составляет ~1.5 раза при идентичном качестве вывода.

Объединенный ядро энкодера, включенное по умолчанию. Между свёртками энкодер нормализовывал каждый кадр, применял активацию и дополнял границы нулями (падинг), причем каждое действие выполнялось за отдельный проход по сотням мегабайт. Теперь это один проход, записывающий данные прямо в структуру памяти, необходимую для следующей свёртки. Ускорение составляет ~1.5 раза при идентичном качестве вывода.

  • Свёртки, поддерживающие --fast fp16_accumulation. PyTorch отправляет свёртки в cuDNN, библиотеку NVIDIA, и в ней нет возможности запросить накопление в fp16, поэтому данный флаг раньше применялся только к матричным умножениям, а энкодер от него ничего не получал. Новая пользовательская свёртка поддерживает его, причем смещение и пропускное соединение (skip connection) встроены в нее. Это ускоряет энкодер примерно до ~2.2 раза.

Свёртки, поддерживающие --fast fp16_accumulation. PyTorch отправляет свёртки в cuDNN, библиотеку NVIDIA, и в ней нет возможности запросить накопление в fp16, поэтому данный флаг раньше применялся только к матричным умножениям, а энкодер от него ничего не получал. Новая пользовательская свёртка поддерживает его, причем смещение и пропускное соединение (skip connection) встроены в нее. Это ускоряет энкодер примерно до ~2.2 раза.

  • Декодер int8. В файле int8 VAE веса декодера имеют 8-битную разрядность, а нормализация, активация и пропускное соединение встроены в матричные умножения, поэтому промежуточные результаты никогда не попадают в память. Механизм внимания (attention) также работает в 8-битном режиме. Это на 1.4 раза быстрее по сравнению с предыдущей реализацией int8 VAE.

Декодер int8. В файле int8 VAE веса декодера имеют 8-битную разрядность, а нормализация, активация и пропускное соединение встроены в матричные умножения, поэтому промежуточные результаты никогда не попадают в память. Механизм внимания (attention) также работает в 8-битном режиме. Это на 1.4 раза быстрее по сравнению с предыдущей реализацией int8 VAE.

Измерения проводились на RTX 5090 при разрешении 1344x768 и 129 кадрах путем сравнения каждой конфигурации с ее состоянием до этого обновления. Ничто здесь не привязано конкретно к этой видеокарте: объединенное ядро энкодера снижает нагрузку на трафик памяти, что идет на пользу любому GPU от NVIDIA.

Режим --fast fp16_accumulation помогает на потребительских видеокартах, где накопление в fp16 выполняется с удвоенной скоростью.

Скорее всего, вы не заметите разницы визуально.

Любой VAE теряет немного деталей при сжатии видео и его восстановлении, и эта потеря присутствует всегда. Дополнительные потери от ускоренных путей int8 примерно в 30 раз меньше, что намного ниже порога видимости на кадре.

Кодирование по-прежнему выполняется в fp16 даже при использовании int8 VAE, а объединенное ядро работает без потерь — оно просто вычисляет те же значения в другом порядке.

В технических терминах: декодер int8 соответствует стандартному декодеру на уровне 67.7 дБ PSNR, а ускоренный энкодер — примерно на 68 дБ, по сравнению с примерно 38 дБ для собственной реконструкции реальных кадров с помощью VAE.

  • Обновите ComfyUI до версии v0.36.0 или выше. Объединенному ядру энкодера больше ничего не требуется.

Обновите ComfyUI до версии v0.36.0 или выше. Объединенному ядру энкодера больше ничего не требуется.

  • Запустите ComfyUI с параметром --fast fp16_accumulation для ускорения работы энкодера и декодера.

Запустите ComfyUI с параметром --fast fp16_accumulation для ускорения работы энкодера и декодера.

  • Скачайте рабочие процессы ниже или найдите их в библиотеке шаблонов.

Скачайте рабочие процессы ниже или найдите их в библиотеке шаблонов.

  • Загрузите файл int8 MiniMax-H3 VAE для максимально быстрого декодирования. Это прямая замена стандартного файла.

Загрузите файл для максимально быстрого декодирования. Это прямая замена стандартного файла.

Все показатели получены в результате тех же измерений методом A/B по сравнению со сборкой до внесения изменений, выполненных через узлы VAE Encode и VAE Decode.

Нет записей

← Все статьи

Ещё в разделе «Разработка ПО»

Все →
У Automattic появился новый совет директоров после неудачной попытки отправить генерального директора в отпускПресса
Automattic

У Automattic появился новый совет директоров после неудачной попытки отправить генерального директора в отпуск

Новый навык обнаруживает риски ИИ-агентов, устраняет их и доказывает эффективность исправлений
Microsoft

Новый навык обнаруживает риски ИИ-агентов, устраняет их и доказывает эффективность исправлений

Некоторые клиенты Supabase открывают в публичном доступе огромные массивы личных данных пользователей
Пресса
Supabase

Некоторые клиенты Supabase открывают в публичном доступе огромные массивы личных данных пользователей

Основы Blazor: SEO для веб-приложений на Blazor
Telerik

Основы Blazor: SEO для веб-приложений на Blazor

Вас затронули сокращения? Не упустите возможность приобрести пропуск Expo+ на TechCrunch Disrupt 2026 всего за 75 долларовПресса
Expo

Вас затронули сокращения? Не упустите возможность приобрести пропуск Expo+ на TechCrunch Disrupt 2026 всего за 75 долларов

Последние 24 часа, чтобы сэкономить до 200 долларов на TechCrunch Disrupt 2026. Причина 5 из 5 для участия: ИмпульсПресса
Momentum

Последние 24 часа, чтобы сэкономить до 200 долларов на TechCrunch Disrupt 2026. Причина 5 из 5 для участия: Импульс

Ещё от Comfy Org

Представляем Comfy Router: единый API для передовых медиамоделей
Comfy Org

Представляем Comfy Router: единый API для передовых медиамоделей

Qwen-Image-2.1 в ComfyUI: генерация и редактирование изображений с открытыми весами, теперь с поддержкой прозрачности
Comfy Org

Qwen-Image-2.1 в ComfyUI: генерация и редактирование изображений с открытыми весами, теперь с поддержкой прозрачности

Развернутые креативы
Comfy Org

Развернутые креативы

Конкурс Comfy H3 Sync Sound: Победители
Comfy Org

Конкурс Comfy H3 Sync Sound: Победители