Мы рады представить Muse Image и анонсировать предварительную версию Muse Video — первых моделей генерации медиаконтента, разработанных в Meta Superintelligence Labs.
Muse Image — наша самая передовая модель генерации изображений на сегодняшний день: она точно следует инструкциям, редактирует с высокой точностью и компонует контент по нескольким референсам. Она также обладает возможностями агентного использования инструментов и интегрируется с Muse Spark. Модель Muse Video, созданная на той же базовой предобученной основе, обеспечивает исключительную визуальную точность с поддержкой нативного аудио.
Muse Image доступна уже сегодня в приложении Meta AI и на сайте meta.ai, в историях Instagram в США и WhatsApp в ограниченном числе стран, а в скором времени появится и в Facebook. Muse Video скоро станет доступна авторам контента и в Meta AI.
Muse Image: агентная генерация изображений
Вместо того чтобы напрямую преобразовывать промпты в изображения, Muse Image действует как агент: она задействует инструменты поиска и написания кода для повышения точности, самостоятельно дорабатывает созданные варианты и совершенствуется за счет масштабирования вычислений во время инференса. Muse Image также интегрируется с Muse Spark, позволяя обеим моделям совместно использовать инструменты и планировать действия для мощной агентной генерации медиаконтента.
Использование инструментов
Мы предоставляем Muse Image доступ к инструментам для расширения ее агентных возможностей.
Написание кода. В ходе обучения с подкреплением Muse Image учится писать и выполнять код, который создает точные графики и QR-коды, а также опираться на отрендеренные фигуры для повышения точности генерируемых изображений. Muse Spark и Muse Image также интегрируются, используя комбинацию кода и генерации медиаконтента для создания анимированных GIF-файлов, веб-сайтов со встроенными изображениями и интерактивных визуальных игр.
Поиск. Muse Image учится искать информацию в интернете, чтобы привязывать создаваемые изображения к фактическим данным в реальном времени и визуальным референсам. Использование поиска повышает фактическую точность для запросов, требующих глубоких знаний, особенно в отношении текущих событий и реальных фактов.
Muse Image совершенствуется при использовании поисковых инструментов. Процент побед по результатам внутреннего абляционного исследования.
Самоисправление
Muse Image анализирует и улучшает собственную работу в рамках цепочки рассуждений. Такое поведение самоисправления может принимать различные формы: локальное редактирование текущего наброска изображения при небольшом отклонении детали, генерация нового изображения с нуля при ошибках в крупных элементах или выбор другой тактики, например использование инструментов для более точного с точки зрения фактов результата. Мы не закладывали это поведение специально. Оно возникло в процессе обучения с подкреплением просто потому, что самоисправление давало лучшие изображения и, следовательно, более высокую награду.
Muse Image совершенствуется благодаря эмерджентному самоисправлению. Процент побед по результатам внутреннего абляционного исследования.
Самоисправление
Поиск референсных изображений
Самоисправление
Сборка полосы
Я собираю страницу глянцевого журнала, объединяя этапы доказательства, заголовок и модный портрет в единый макет, одновременно проверяя типографику, интервалы и детали с золотым тиснением для создания выверенного редакционного стиля.
Самоисправление
Корректировка формулы
Я исправляю формулу, добавляя пропущенный знак деления, обновляя макет так, чтобы выражение выглядело как S = n(n + 1) / 2, и дважды проверяю окружающий текст на предмет четкости и согласованности.
Самоисправление
Проверка изображения
Я просматриваю сгенерированное изображение журнала, чтобы подтвердить макродетали, глянцевый макет и точность доказательства перед публикацией, и готова подкорректировать типографику или заменить портрет, если вы хотите. Что бы вы хотели настроить дальше?
Готово
Масштабирование вычислений во время инференса
Подобно языковым моделям, Muse Image тем лучше справляется с задачей, чем больше «размышляет» в момент инференса. С увеличением объема вычислений на этапе инференса модель больше рассуждает, чаще вызывает инструменты и использует больше этапов самоисправления для улучшения результатов. Повышение надежности рассуждений (и, следовательно, объема вычислений во время инференса) улучшает показатели Elo на основе человеческих предпочтений и демонстрирует примерно логарифмически линейную зависимость масштабирования. Примечательно, что эти вычисления охватывают два совершенно разных вида работы — текстовые токены для рассуждений и визуальные токены для генерации, — однако качество является функцией суммарного объема вычислений.
Мы обнаружили, что разумное распределение токенового бюджета имеет не менее важное значение для эффективного масштабирования во время инференса. Метод Best-of-N (BoN), при котором модель генерирует несколько изображений и выбирает лучшее, улучшает качество на начальном этапе, но быстро достигает плато. Направление тех же вычислительных ресурсов на осознанные рассуждения масштабируется значительно лучше. Рассуждения и использование инструментов усиливают друг друга в комбинации. Инструменты позволяют модели выходить за рамки того, что ей уже известно, будь то поиск недостающих референсов или написание кода для получения точных деталей, заполняя пробелы, которые одни рассуждения устранить не могут.
Muse Image совершенствуется при масштабировании вычислений во время инференса. Рейтинг Elo по результатам внутреннего абляционного исследования.
Редактирование изображений
Muse Image редактирует изображения с высокой точностью, изменяя именно то, о чем просит пользователь. Как показывают наши примеры, она способна следовать самым разным инструкциям.
Muse Image сохраняет согласованность при последовательном редактировании, поддерживая итеративную доработку и свободный брейншторминг для достижения целевого результата.
Композиция изображений по нескольким референсам
Muse Image может компоновать элементы из множества входящих референсных изображений, указанных в промпте, включая людей, объекты, одежду, стили и окружение. Модель поддерживает чередование текста и изображений прямо в тексте промпта для создания сложных композиций.
Бенчмарки изображений
На момент написания этой статьи Muse Image занимает 2-е место в арене в категориях «текст-в-изображение», «редактирование одного изображения» и «редактирование нескольких изображений» по оценкам Elo на основе предпочтений пользователей.
Рейтинги Arena Elo по состоянию на 5 июля 2026 г.
Рейтинги Arena Elo по состоянию на 5 июля 2026 г.
Рейтинги Arena Elo по состоянию на 5 июля 2026 г.
Предварительный просмотр Muse Video
Одновременно с выпуском Muse Image мы представляем раннюю предварительную версию Muse Video. Она демонстрирует конкурентоспособную производительность в соблюдении промптов, визуальной точности и временной согласованности. Мы инвестируем в направления с текущими пробелами в производительности, такими как синхронизация аудио и видео и физически точное быстрое движение. Muse Video скоро станет доступна авторам контента и в Meta AI.
На момент написания статьи Muse Video занимает 3-е место в рейтинге Arena Elo по предпочтениям пользователей в категории «текст-в-видео».
Рейтинги Arena Elo по состоянию на 5 июля 2026 г.
Content Seal
Чтобы помочь людям проверить, создано ли изображение с помощью ИИ, Muse Image включает Content Seal — нашу систему невидимого водяного знака. Созданные Muse Image в приложении Meta AI и на сайте meta.ai изображения содержат скрытый сигнал происхождения, который остается неизменным даже после обрезки, сжатия, изменения размера или создания скриншота. В скором времени мы планируем распространить Content Seal и на видео. Мы представляем инструмент детектирования, который позволяет проверить, содержит ли изображение водяной знак Content Seal, предоставляя базовый способ лучше понять, было ли изображение создано с помощью Meta AI.
Muse Image в продуктах Meta
Muse Image тесно связана с экосистемой Meta. Наши продолжающиеся инвестиции в генерацию изображений и видео позволят авторам и компаниям создавать динамичный контент во всех продуктах Meta.
Маркетинговые материалы для малого бизнеса
Персонализированные пресеты прямо в Instagram
Галерея
Ознакомьтесь с дополнительными материалами
Автор:
Meta Superintelligence Labs
Поделиться:
Наши последние обновления прямо в вашем почтовом ящике
Подпишитесь на нашу рассылку, чтобы быть в курсе новостей Meta AI, мероприятий, прорывов в исследованиях и многого другого.










