Введение
Мы рады представить исследовательскую версию Mochi 1, нашу новейшую модель генерации видео с открытым исходным кодом. Mochi 1 демонстрирует значительные улучшения в качестве передачи движения, а также крайне точное следование текстовым запросам. Предварительная версия Mochi 1 распространяется по лицензии Apache 2.0 и доступна для бесплатного личного и коммерческого использования.
Помимо выпуска самой модели, мы рады представить нашу игровую площадку (playground), где вы можете бесплатно протестировать Mochi 1 уже сегодня по адресу genmo.ai/play. Веса и архитектура Mochi 1 открыты и доступны на HuggingFace. Сегодня мы выпускаем базовую модель с разрешением 480p, а версия Mochi 1 HD выйдет позднее в этом году.
Мы также рады сообщить, что компания Genmo привлекла 28,4 миллиона долларов в рамках раунда финансирования серии А под руководством NEA (Рик Янг) при участии The House Fund, Gold House Ventures, WndrCo, Eastlink Capital Partners и Essence VC, а также бизнес-ангелов Абхая Парсаниса (генеральный директор Typespace), Амджада Масада (генеральный директор Replit), Сабрины Хан, Бониты Стюарт и Микеле Катаста.
Миссия Genmo — раскрыть потенциал правого полушария искусственного общего интеллекта. Mochi 1 — это первый шаг к созданию симуляторов мира, способных вообразить что угодно, будь то возможное или невозможное.
В нашу команду входят ключевые участники таких проектов, как DDPM (вероятностные модели диффузии с шумоподавлением), DreamFusion и Emu Video. Консультантами Genmo выступают ведущие технические эксперты, включая Иона Стойку (исполнительный председатель и соучредитель Databricks и Anyscale), Питера Аббила (соучредитель Covariant и один из первых сотрудников OpenAI) и Джои Гонсалеса (пионер в области систем языковых моделей и соучредитель Turi).
Оценка
Сегодня существует огромный разрыв между моделями генерации видео и реальностью. Качество движения и следование запросу — две наиболее важные возможности, которых до сих пор не хватало моделям генерации видео.
Mochi 1 устанавливает новый стандарт качества для генерации видео с открытым исходным кодом. Она также демонстрирует очень конкурентоспособные результаты по сравнению с ведущими закрытыми моделями. В частности, наша версия 480p обладает следующими сильными сторонами:
- Следование запросу: демонстрирует исключительное соответствие текстовым подсказкам, гарантируя, что сгенерированные видео точно отражают заданные инструкции. Это позволяет пользователям детально управлять персонажами, обстановкой и действиями. Мы оцениваем следование запросу с помощью автоматизированной метрики, используя языковую модель зрения в качестве судьи, следуя протоколу OpenAI DALL-E 3. Мы оцениваем сгенерированные видео с помощью Gemini-1.5-Pro-002.
- Качество движения: Mochi 1 генерирует плавные видео со скоростью 30 кадров в секунду длительностью до 5,4 секунды с высокой временной связностью и реалистичной динамикой движения. Mochi имитирует физические процессы, такие как динамика жидкостей, симуляция меха и волос, а также выражает последовательные, плавные действия человека, которые начинают преодолевать «зловещую долину». Оценщикам было предложено сосредоточиться на движении, а не на эстетике уровня кадра (критерии включают интересность движения, физическую правдоподобность и плавность). Очки Эло вычисляются по протоколу LMSYS Chatbot Arena.
Следование запросу
Измеряет, насколько точно сгенерированные видео следуют предоставленным текстовым инструкциям, обеспечивая высокую точность передачи замысла пользователя.
Оценка Эло
Оценивает как плавность движения, так и пространственный реализм, гарантируя, что сгенерированные видео являются плавными и визуально захватывающими.
Ограничения
В рамках исследовательской версии Mochi 1 является развивающейся контрольной точкой. Существует несколько известных ограничений. Начальная версия генерирует видео в разрешении 480p. В некоторых крайних случаях с экстремальным движением могут возникать незначительные искажения и деформации. Mochi 1 также оптимизирована для фотореалистичных стилей, поэтому плохо работает с анимированным контентом. Мы также ожидаем, что сообщество будет дообучать модель в соответствии с различными эстетическими предпочтениями. Кроме того, мы внедрили надежные протоколы модерации безопасности на нашей площадке, чтобы гарантировать, что все сгенерированные видео остаются безопасными и соответствуют этическим нормам.
Архитектура модели
Mochi 1 представляет собой значительный прогресс в области генерации видео с открытым исходным кодом, включая диффузионную модель с 10 миллиардами параметров, построенную на нашей новой архитектуре Asymmetric Diffusion Transformer (AsymmDiT). Обученная полностью с нуля, это самая большая генеративная модель видео, когда-либо выпущенная в открытый доступ. И, что самое приятное, это простая и доступная для модификации архитектура.
Эффективность имеет решающее значение для того, чтобы сообщество могло запускать наши модели. Наряду с Mochi мы открываем исходный код нашего видео VAE. Наш VAE причинно сжимает видео до размера, который в 96 раз меньше исходного, с пространственным сжатием 8x8 и временным сжатием 6x до 12-канального латентного пространства.
AsymmDiT эффективно обрабатывает пользовательские запросы вместе со сжатыми видеотокенами за счет оптимизации обработки текста и концентрации вычислительной мощности нейронной сети на визуальном мышлении. AsymmDiT совместно обрабатывает текстовые и визуальные токены с помощью мультимодального self-attention и изучает отдельные слои MLP для каждой модальности, подобно Stable Diffusion 3. Однако наш визуальный поток имеет почти в 4 раза больше параметров, чем текстовый поток, за счет большей размерности скрытого слоя. Чтобы объединить модальности в self-attention, мы используем неквадратные слои QKV и выходные проекционные слои. Такая асимметричная конструкция снижает требования к памяти при выводе.
Многие современные диффузионные модели используют несколько предварительно обученных языковых моделей для представления пользовательских запросов. В отличие от них, Mochi 1 просто кодирует запросы с помощью одной языковой модели T5-XXL.
Mochi 1 совместно анализирует контекстное окно из 44 520 видеотокенов с полным 3D-вниманием. Чтобы локализовать каждый токен, мы расширяем обучаемые вращательные позиционные эмбеддинги (RoPE) до 3 измерений. Сеть сквозным образом изучает частоты смешивания для пространственных и временных осей.
Mochi использует некоторые из последних улучшений в масштабировании языковых моделей, включая слои SwiGLU feedforward, нормализацию query-key для повышенной стабильности и сэндвич-нормализацию для контроля внутренних активаций.
Вскоре будет опубликована техническая статья с дополнительными подробностями, чтобы способствовать прогрессу в области генерации видео.
Выпуск с открытым исходным кодом
Мы выпускаем Mochi 1 по лицензии Apache 2.0. Критически важно, чтобы вокруг генерации видео существовала открытая исследовательская экосистема. Мы считаем, что модели с открытым исходным кодом стимулируют прогресс и демократизируют доступ к передовым возможностям ИИ.
Ресурсы для разработчиков
Мы сотрудничаем с ведущими платформами, чтобы сделать Mochi 1 легкодоступной:
- Открытые веса: скачайте веса по адресу huggingface.co/genmo или через magnet-ссылку.
- Репозиторий GitHub: получите доступ к исходному коду по адресу github.com/genmoai/models.
- API-партнеры: легко интегрируйте Mochi 1 в свои приложения, используя API наших партнеров.
Приложения
Наша исследовательская версия Mochi 1 открывает новые возможности в различных областях:
- Исследования и разработки: продвижение области генерации видео и изучение новых методологий.
- Разработка продуктов: создание инновационных приложений в сфере развлечений, рекламы, образования и других.
- Творческое самовыражение: расширение возможностей художников и создателей контента для воплощения их идей в жизнь с помощью видео, созданных ИИ.
- Робототехника: генерация синтетических данных для обучения моделей ИИ в робототехнике, автономных транспортных средствах и виртуальных средах.






