Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Mochi 1 novyy sota v oblasti generatsii video po tekstu s otkrytym ishodnym kodo 2
Dev48

© 2026 · All rights reserved.

Mochi 1: новый SOTA в области генерации видео по тексту с открытым исходным кодом

Источник: Genmo

Mochi 1: новый SOTA в области генерации видео по тексту с открытым исходным кодом

Источник: Genmo

Предварительная версия Mochi 1 — это современная модель генерации видео с открытым исходным кодом, отличающаяся высокой точностью передачи движения и строгим следованием текстовым запросам. Наша новая модель значительно сокращает разрыв между закрытыми и открытыми системами генерации видео.

29 сентября 2026 г.•Обновлено: 29 сентября 2026 г.

Введение

Мы рады объявить о предварительном исследовании Mochi 1 — нашей новейшей модели генерации видео с открытым исходным кодом. Mochi 1 демонстрирует значительное улучшение качества движения, а также чрезвычайно высокую точность следования инструкциям. Предварительная версия Mochi 1, лицензированная по лицензии Apache 2.0, доступна бесплатно для личного и коммерческого использования.

Помимо релиза модели, мы рады представить нашу хостинговую площадку, где вы можете попробовать Mochi 1 бесплатно уже сегодня по адресу genmo.ai/play. Веса и архитектура Mochi 1 открыты и доступны на HuggingFace. Сегодня мы выпускаем базовую модель 480p, а Mochi 1 HD выйдет позже в этом году.

Мы также рады сообщить, что Genmo привлекла 28,4 миллиона долларов в рамках раунда финансирования серии A под руководством NEA во главе с Риком Янгом с участием The House Fund, Gold House Ventures, WndrCo, Eastlink Capital Partners и Essence VC, а также ангельских инвесторов Абхая Парансниса (гендиректора Typespace), Амжда Масада (гендиректора Replit), Сабрины Ханн, Бониты Стюарт и Мишель Катасты.

Миссия Genmo — раскрыть потенциал правого полушария искусственного общего интеллекта. Mochi 1 — это первый шаг к созданию мировых симуляторов, которые могут воображать что угодно, возможное или невозможное.

В нашу команду входят ключевые участники таких проектов, как DDPM (Denoising Diffusion Probabilistic Models), DreamFusion, и Emu Video. Genmo консультируется с ведущими техническими экспертами, включая Иона Стоика (исполнительного председателя и сооснователя Databricks и Anyscale), Питера Аббела (сооснователя Covariant и ранней команды OpenAI) и Джоэя Гонсалеса (пионера систем языковых моделей и сооснователя Turi).

Оценки

Сегодня существует огромный разрыв между моделями генерации видео и реальностью. Качество движения и следование инструкциям — две из наиболее критически важных возможностей, которых все еще нет в моделях генерации видео.

Mochi 1 устанавливает новый лучший стандарт в области открытой генерации видео. Он также демонстрирует очень конкурентоспособные результаты по сравнению с ведущими закрытыми моделями. В частности, наша предварительная версия 480p имеет сильные стороны в следующих областях:

  • Следование инструкциям: демонстрирует исключительную согласованность с текстовыми инструкциями, обеспечивая, что сгенерированные видео точно отражают данные указания. Это позволяет пользователям детально контролировать персонажей, настройки и действия. Мы оцениваем следование инструкциям с помощью автоматического метрического показателя, используя языковую модель с визуальным анализом в качестве судьи в соответствии с протоколом OpenAI DALL-E 3. Мы оцениваем сгенерированные видео с помощью Gemini-1.5-Pro-002.
  • Качество движения: Mochi 1 генерирует плавные видео со скоростью 30 кадров в секунду и продолжительностью до 5,4 секунд с высокой временной согласованностью и реалистичной динамикой движения. Mochi имитирует физику, такую как динамика жидкостей, имитация меха и волос, и выражает последовательные, плавные человеческие действия, которые начинают пересекать зону странности. Рейтинговщики были проинструктированы сосредоточиться на движении, а не на эстетике на уровне кадра (критерии включают интересность движения, физическую правдоподобность и плавность). Оценки Elo рассчитываются в соответствии с протоколом LMSYS Chatbot Arena.

Следование инструкциям

Измеряет, насколько точно сгенерированные видео следуют предоставленным текстовым инструкциям, обеспечивая высокую точность соответствия намерению пользователя.

Оценка Elo

Оценивает как плавность движения, так и пространственную реалистичность, обеспечивая, что сгенерированные видео являются плавными и визуально привлекательными.

Ограничения

В рамках предварительного исследования Mochi 1 является живым и развивающимся чекпоинтом. Существуют некоторые известные ограничения. Начальный релиз генерирует видео в разрешении 480p сегодня. В некоторых крайних случаях с экстремальным движением могут также происходить незначительные искажения и деформации. Mochi 1 также оптимизирован для фотореалистичных стилей, поэтому не работает хорошо с анимационным контентом. Мы также ожидаем, что сообщество будет донастраивать модель для удовлетворения различных эстетических предпочтений. Кроме того, мы внедрили надежные протоколы модерации безопасности в площадке, чтобы обеспечить, что все сгенерированные видео остаются безопасными и соответствуют этическим нормам.

Архитектура модели

Mochi 1 представляет собой значительный прогресс в области открытой генерации видео: это диффузионная модель с 10 миллиардами параметров, построенная на нашей новой архитектуре Asymmetric Diffusion Transformer (AsymmDiT). Обученный полностью с нуля, он является крупнейшей моделью генерации видео, когда-либо выпущенной с открытым исходным кодом. И лучшее из всего этого — это простая, поддающаяся модификации архитектура.

Эффективность имеет решающее значение для обеспечения того, чтобы сообщество могло запускать наши модели. Наряду с Mochi мы открываем исходный код нашей видео-VAE. Наша VAE каузально сжимает видео до 96 раз меньшего размера с пространственным сжатием 8x8 и временным сжатием 6x до 12-канального латентного пространства.

AsymmDiT эффективно обрабатывает пользовательские запросы вместе со сжатыми видео-токенами, упрощая обработку текста и сосредоточивая нейронную сеть на визуальном рассуждении. AsymmDiT одновременно обрабатывает текстовые и визуальные токены с помощью мультимодального самообращения и обучает отдельные слои MLP для каждой модальности, аналогично Stable Diffusion 3. Однако наш визуальный поток имеет почти в 4 раза больше параметров, чем текстовый поток, благодаря большему скрытому измерению. Для объединения модальностей в самообращении мы используем не квадратные слои QKV и выходного проектирования. Эта асимметричная конструкция снижает требования к памяти при инференсе.

Многие современные диффузионные модели используют несколько предварительно обученных языковых моделей для представления пользовательских запросов. В отличие от этого, Mochi 1 просто кодирует запросы с помощью одной языковой модели T5-XXL.

Mochi 1 одновременно рассуждает в контекстном окне из 44 520 видео-токенов с полным 3D-обращением. Для локализации каждого токена мы расширяем обучаемые вращающиеся позиционные эмбеддинги (RoPE) до 3-мерного пространства. Сеть энд-to-end обучается смешивать частоты для пространственных и временных осей.

Mochi извлекает выгоду из некоторых последних улучшений в масштабировании языковых моделей, включая слои SwiGLU feedforward, нормализацию query-key для повышенной стабильности и сэндвич-нормализацию для контроля внутренних активаций.

Вскоре выйдет техническая статья с дополнительными деталями, чтобы стимулировать прогресс в области генерации видео.

Релиз с открытым исходным кодом

Мы выпускаем Mochi 1 под лицензией Apache 2.0. Критически важно, чтобы вокруг генерации видео существовала открытая исследовательская экосистема. Мы верим, что модели с открытым исходным кодом стимулируют прогресс и демократизируют доступ к передовым возможностям ИИ.

Ресурсы для разработчиков

Мы сотрудничаем с ведущими платформами, чтобы сделать Mochi 1 легко доступным:

  • Открытые веса: Скачайте веса по адресу huggingface.co/genmo или через магнитную ссылку.
  • Репозиторий GitHub: Доступ к исходному коду по адресу github.com/genmoai/models.
  • Партнеры по API: Интегрируйте Mochi 1 в ваши приложения беспрепятственно с помощью API наших партнеров.

Приложения

Наша предварительная версия Mochi 1 открывает новые возможности в различных областях:

  • Исследования и разработки: Продвигайте область генерации видео и исследуйте новые методологии.
  • Разработка продуктов: Создавайте инновационные приложения в области развлечений, рекламы, образования и других областях.
  • Творческое выражение: Расширьте возможности художников и создателей, чтобы воплотить свои идеи в жизнь с помощью видео, сгенерированных ИИ.
  • Робототехника: Генерируйте синтетические данные для обучения моделей ИИ в области робототехники, автономных транспортных средств и виртуальных сред.
← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведениемПресса
OpenAI

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведением

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языковПресса
ElevenLabs

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языков

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИПресса
Amazon

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИ

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов
LangChain

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое
LangChain

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое

Ещё от Genmo

Mochi 1: новый SOTA в области генерации видео по тексту с открытым исходным кодом
Genmo

Mochi 1: новый SOTA в области генерации видео по тексту с открытым исходным кодом