Анонсируем H3 Max,версию MiniMax H3 после дообучения, разработанную fal Research и оптимизированную для максимальной скорости командой инференса fal.
В наших оценках предпочтений пользователей H3 Max занимает 1-е место по общему качеству, пониманию промптов и эстетике среди ведущих видеомоделей. При этом он генерирует 5-секундное видео менее чем за 3 секунды, что примерно в 35 раз превышает пропускную способность официального эндпоинта MiniMax H3 и в среднем в 15 раз быстрее любой другой модели с сопоставимым качеством.
Эти результаты бросают вызов распространенному компромиссу в генеративном видео: что более высокое качество должно достигаться ценой более медленного инференса.
H3 Max — это результат работы над обеими сторонами этой проблемы одновременно. Мы оптимизировали модель для более высокой производительности в реальных условиях, одновременно проектируя систему инференса вокруг нее, чтобы гарантировать, что скорость выше реального времени остается возможной. Это потребовало двух компетенций, которые редко встречаются под одной крышей: исследования передовых моделей и глубокой оптимизации инференса/работы с ядрами.
Дообучение H3 Max
Мы начали с модели MiniMax H3 с открытыми весами и внедрили значительный объем новых данных в процессе дообучения, уделив особое внимание следованию промптам и визуальному качеству. Мы стремились получить лучшую модель с гораздо более высокой скоростью, и после нашей работы основные возможности базовой модели остались нетронутыми при крайне низкой задержке.
Команда MiniMax H3 поделилась своим взглядом на H3 Max:
H3 Max сочетает в себе SOTA-качество видео со скачкообразным увеличением скорости генерации, что делает высококачественную генерацию видео практичной для гораздо более широкого спектра реальных приложений. Мы тесно сотрудничали с fal с первого дня, и их опыт в инфраструктуре генеративного ИИ и быстром и надежном выводе передовых моделей в продакшн делает их естественным партнером для H3 Max.
На протяжении всего процесса дообучения мы непрерывно оценивали чекпоинты с помощью сравнительных исследований предпочтений по трем измерениям: общее качество, понимание промптов и эстетика. Оценка этих измерений независимо друг от друга дала нам гораздо более четкий сигнал, чем оптимизация по одному совокупному баллу.
Результатом стала модель, которая значительно превосходит оригинальный H3 по качествам, которые люди действительно замечают при генерации видео: понимание того, что вы просили, и создание того, что вы хотите использовать.
Совместное проектирование движка инференса
В H3 Max исследовательская работа и работа над инференсом были глубоко связаны. Наша команда инференса последние четыре года занималась оптимизацией рабочих нагрузок диффузионных и генеративных медиа. Для H3 Max мы применили эти системные методы, пока сама модель еще находилась в разработке, что позволило решениям по стеку обучения и инференса дополнять друг друга. H3 Max обучался и обслуживался полностью на NVIDIA GB200 NVL72 systems.GB200. В расчете на один чип GB200 обеспечивают до 2 раз большую производительность по сравнению с ускорителями предыдущего поколения, которые мы использовали для обучения и обслуживания наших моделей.
Целью была не просто более быстрая модель, наша команда также работала над максимизацией пропускной способности при сохранении прироста качества, полученного в результате дообучения. Это различие определило весь процесс оптимизации.
Существуют способы сделать видеомодель быстрее: уменьшить точность, сократить количество шагов сэмплирования или аппроксимировать дорогостоящие операции. Некоторые из них дают впечатляющее ускорение, но ухудшают результат. Для H3 Max оптимизация сохранялась только в том случае, если результирующая модель продолжала удерживать свои позиции в наших внутренних оценках качества.
Измерение качества
Оценка генеративного видео по своей сути сложна. Автоматизированные метрики фиксируют лишь часть того, что делает одну генерацию лучше другой, поэтому наша основная оценка использует сравнительные предпочтения людей.
Мы сравнили H3 Max с двенадцатью ведущими видеомоделями, включая официальный эндпоинт MiniMax H3, Gemini Omni Flash, Wan 3.0, Seedance 2.5, Kling 3 и Veo 3.1.
Оценщики сравнивали генерации по трем измерениям:
- Общее предпочтение: какому видео они отдали предпочтение в целом
- Понимание промпта: какая генерация более точно следовала инструкции
- Эстетика: какая генерация была визуально сильнее
Мы агрегировали эти сравнения, используя рейтинги Эло с байесовскими доверительными интервалами 95%.
H3 Max занимает 1-е место по всем трем измерениям и выигрывает большинство очных сравнений против каждой модели, которую мы тестировали, включая оригинальный H3.
Результаты подтверждаются и за пределами наших собственных оценок. В независимых бенчмарках от Artificial Analysis и Design Arena H3 Max также занимает 1-е место среди других видеомоделей.
О H3 Max в Design Arena отметили:
MiniMax H3 Max от fal обеспечивает качество MiniMax H3 на скорости, превышающей в 50 раз, согласно независимым бенчмаркам Design Arena, устанавливая новую границу Парето «скорость-предпочтение».
Качество без компромисса в задержке
Более интересный результат получается, когда мы рассматриваем качество и скорость вместе.
H3 Max генерирует 5-секундное видео примерно за 3 секунды. Это примерно в 35 раз выше пропускной способности официального эндпоинта H3 и быстрее, чем любая другая модель в нашем сравнении.
Обычно передовые технологии заставляют делать выбор: более быстрые модели занимают один конец кривой, а более качественные — другой.
H3 Max сдвигает эту границу.
Он достигает самого высокого балла по предпочтениям пользователей в нашей оценке, одновременно обеспечивая самую высокую пропускную способность.
В этом преимущество рассмотрения исследования модели и оптимизации инференса как одной и той же проблемы. Дообучение дает нам контроль над качеством модели. Системная работа дает нам контроль над тем, насколько эффективно эта модель выполняется. Совместное проектирование означает, что улучшения не должны происходить за счет друг друга.
Для генеративных медиа это будет становиться все более важным. Модели становятся все больше и требовательнее к вычислительным ресурсам, в то же время генерация видео переходит в интерактивные и высокопроизводительные рабочие нагрузки.
Модель не полезна в продакшене только потому, что она возглавляет бенчмарк в изоляции. Важна граница между качеством, задержкой и стоимостью.
Наша цель в fal — продвигать все три показателя.
Попробуйте H3 Max
H3 Max доступен уже сегодня на fal. Попробуйте его в Playground, через fal Agent или вызовите его через API.
В течение первой недели мы предлагаем H3 Max со скидкой 50%.
Попробуйте сейчас:
- Текст в видео
- Изображение в видео
H3 Max был обучен на fal Serverless, той же инфраструктуре, которая доступна разработчикам и командам, создающим свои собственные модели. Узнайте больше о fal Serverless.










