Введение
Мы рады объявить о предварительном исследовании Mochi 1 — нашей новейшей модели генерации видео с открытым исходным кодом. Mochi 1 демонстрирует значительное улучшение качества движения, а также чрезвычайно высокую точность следования инструкциям. Предварительная версия Mochi 1, лицензированная по лицензии Apache 2.0, доступна бесплатно для личного и коммерческого использования.
Помимо релиза модели, мы рады представить нашу хостинговую площадку, где вы можете попробовать Mochi 1 бесплатно уже сегодня по адресу genmo.ai/play. Веса и архитектура Mochi 1 открыты и доступны на HuggingFace. Сегодня мы выпускаем базовую модель 480p, а Mochi 1 HD выйдет позже в этом году.
Мы также рады сообщить, что Genmo привлекла 28,4 миллиона долларов в рамках раунда финансирования серии A под руководством NEA во главе с Риком Янгом с участием The House Fund, Gold House Ventures, WndrCo, Eastlink Capital Partners и Essence VC, а также ангельских инвесторов Абхая Парансниса (гендиректора Typespace), Амжда Масада (гендиректора Replit), Сабрины Ханн, Бониты Стюарт и Мишель Катасты.
Миссия Genmo — раскрыть потенциал правого полушария искусственного общего интеллекта. Mochi 1 — это первый шаг к созданию мировых симуляторов, которые могут воображать что угодно, возможное или невозможное.
В нашу команду входят ключевые участники таких проектов, как DDPM (Denoising Diffusion Probabilistic Models), DreamFusion, и Emu Video. Genmo консультируется с ведущими техническими экспертами, включая Иона Стоика (исполнительного председателя и сооснователя Databricks и Anyscale), Питера Аббела (сооснователя Covariant и ранней команды OpenAI) и Джоэя Гонсалеса (пионера систем языковых моделей и сооснователя Turi).
Оценки
Сегодня существует огромный разрыв между моделями генерации видео и реальностью. Качество движения и следование инструкциям — две из наиболее критически важных возможностей, которых все еще нет в моделях генерации видео.
Mochi 1 устанавливает новый лучший стандарт в области открытой генерации видео. Он также демонстрирует очень конкурентоспособные результаты по сравнению с ведущими закрытыми моделями. В частности, наша предварительная версия 480p имеет сильные стороны в следующих областях:
- Следование инструкциям: демонстрирует исключительную согласованность с текстовыми инструкциями, обеспечивая, что сгенерированные видео точно отражают данные указания. Это позволяет пользователям детально контролировать персонажей, настройки и действия. Мы оцениваем следование инструкциям с помощью автоматического метрического показателя, используя языковую модель с визуальным анализом в качестве судьи в соответствии с протоколом OpenAI DALL-E 3. Мы оцениваем сгенерированные видео с помощью Gemini-1.5-Pro-002.
- Качество движения: Mochi 1 генерирует плавные видео со скоростью 30 кадров в секунду и продолжительностью до 5,4 секунд с высокой временной согласованностью и реалистичной динамикой движения. Mochi имитирует физику, такую как динамика жидкостей, имитация меха и волос, и выражает последовательные, плавные человеческие действия, которые начинают пересекать зону странности. Рейтинговщики были проинструктированы сосредоточиться на движении, а не на эстетике на уровне кадра (критерии включают интересность движения, физическую правдоподобность и плавность). Оценки Elo рассчитываются в соответствии с протоколом LMSYS Chatbot Arena.
Следование инструкциям
Измеряет, насколько точно сгенерированные видео следуют предоставленным текстовым инструкциям, обеспечивая высокую точность соответствия намерению пользователя.
Оценка Elo
Оценивает как плавность движения, так и пространственную реалистичность, обеспечивая, что сгенерированные видео являются плавными и визуально привлекательными.
Ограничения
В рамках предварительного исследования Mochi 1 является живым и развивающимся чекпоинтом. Существуют некоторые известные ограничения. Начальный релиз генерирует видео в разрешении 480p сегодня. В некоторых крайних случаях с экстремальным движением могут также происходить незначительные искажения и деформации. Mochi 1 также оптимизирован для фотореалистичных стилей, поэтому не работает хорошо с анимационным контентом. Мы также ожидаем, что сообщество будет донастраивать модель для удовлетворения различных эстетических предпочтений. Кроме того, мы внедрили надежные протоколы модерации безопасности в площадке, чтобы обеспечить, что все сгенерированные видео остаются безопасными и соответствуют этическим нормам.
Архитектура модели
Mochi 1 представляет собой значительный прогресс в области открытой генерации видео: это диффузионная модель с 10 миллиардами параметров, построенная на нашей новой архитектуре Asymmetric Diffusion Transformer (AsymmDiT). Обученный полностью с нуля, он является крупнейшей моделью генерации видео, когда-либо выпущенной с открытым исходным кодом. И лучшее из всего этого — это простая, поддающаяся модификации архитектура.
Эффективность имеет решающее значение для обеспечения того, чтобы сообщество могло запускать наши модели. Наряду с Mochi мы открываем исходный код нашей видео-VAE. Наша VAE каузально сжимает видео до 96 раз меньшего размера с пространственным сжатием 8x8 и временным сжатием 6x до 12-канального латентного пространства.
AsymmDiT эффективно обрабатывает пользовательские запросы вместе со сжатыми видео-токенами, упрощая обработку текста и сосредоточивая нейронную сеть на визуальном рассуждении. AsymmDiT одновременно обрабатывает текстовые и визуальные токены с помощью мультимодального самообращения и обучает отдельные слои MLP для каждой модальности, аналогично Stable Diffusion 3. Однако наш визуальный поток имеет почти в 4 раза больше параметров, чем текстовый поток, благодаря большему скрытому измерению. Для объединения модальностей в самообращении мы используем не квадратные слои QKV и выходного проектирования. Эта асимметричная конструкция снижает требования к памяти при инференсе.
Многие современные диффузионные модели используют несколько предварительно обученных языковых моделей для представления пользовательских запросов. В отличие от этого, Mochi 1 просто кодирует запросы с помощью одной языковой модели T5-XXL.
Mochi 1 одновременно рассуждает в контекстном окне из 44 520 видео-токенов с полным 3D-обращением. Для локализации каждого токена мы расширяем обучаемые вращающиеся позиционные эмбеддинги (RoPE) до 3-мерного пространства. Сеть энд-to-end обучается смешивать частоты для пространственных и временных осей.
Mochi извлекает выгоду из некоторых последних улучшений в масштабировании языковых моделей, включая слои SwiGLU feedforward, нормализацию query-key для повышенной стабильности и сэндвич-нормализацию для контроля внутренних активаций.
Вскоре выйдет техническая статья с дополнительными деталями, чтобы стимулировать прогресс в области генерации видео.
Релиз с открытым исходным кодом
Мы выпускаем Mochi 1 под лицензией Apache 2.0. Критически важно, чтобы вокруг генерации видео существовала открытая исследовательская экосистема. Мы верим, что модели с открытым исходным кодом стимулируют прогресс и демократизируют доступ к передовым возможностям ИИ.
Ресурсы для разработчиков
Мы сотрудничаем с ведущими платформами, чтобы сделать Mochi 1 легко доступным:
- Открытые веса: Скачайте веса по адресу huggingface.co/genmo или через магнитную ссылку.
- Репозиторий GitHub: Доступ к исходному коду по адресу github.com/genmoai/models.
- Партнеры по API: Интегрируйте Mochi 1 в ваши приложения беспрепятственно с помощью API наших партнеров.
Приложения
Наша предварительная версия Mochi 1 открывает новые возможности в различных областях:
- Исследования и разработки: Продвигайте область генерации видео и исследуйте новые методологии.
- Разработка продуктов: Создавайте инновационные приложения в области развлечений, рекламы, образования и других областях.
- Творческое выражение: Расширьте возможности художников и создателей, чтобы воплотить свои идеи в жизнь с помощью видео, сгенерированных ИИ.
- Робототехника: Генерируйте синтетические данные для обучения моделей ИИ в области робототехники, автономных транспортных средств и виртуальных сред.







