Сегодня мы рады представить Muse Spark 1.1, новейшую модель от Meta Superintelligence Labs и значительное обновление Muse Spark. Muse Spark 1.1 — это мультимодальная модель рассуждения, созданная для агентных задач, с существенными улучшениями в использовании инструментов и компьютеров, программировании и мультимодальном понимании.
Благодаря этим улучшениям Muse Spark 1.1 расширяет границы производительности и эффективности. Вместе с запуском Muse Image на этой неделе, этот релиз приближает нас к нашему видению персонального суперинтеллекта: моделей, которые помогают вам достигать целей, создавать то, что вы воображаете, укреплять отношения и действовать в соответствии с тем, что для вас наиболее ценно.
Вместе с этим релизом мы запускаем публичную предварительную версию нового Meta Model API, где разработчики могут получить доступ к Muse Spark 1.1. Модель уже доступна в режиме «Thinking» в приложении Meta AI и на meta.ai.
Оценки
Агенты
Muse Spark 1.1 демонстрирует исключительную производительность в персональных агентных задачах, требующих планирования и координации работы различных внешних приложений и сервисов. Она обобщает новые нативные инструменты, MCP-серверы и пользовательские навыки без предварительного обучения (zero-shot).
Она справляется со сложными проектами значительно быстрее, чем Muse Spark, поскольку обучена координировать мультиагентные системы для оптимизации сквозной задержки. В качестве основного агента она может собирать контекст, составлять план и делегировать выполнение параллельным субагентам. В качестве субагента она придерживается своей задачи, понимает доступные инструменты и знает, когда нужно передать управление обратно основному агенту.
Muse Spark 1.1 может активно управлять своим контекстным окном объемом 1 миллион токенов. Она запоминает действия, извлекает информацию из гораздо более ранних этапов работы и сжимает данные таким образом, чтобы сохранить критически важные шаги для последующей работы.
Использование компьютера
Muse Spark 1.1 превосходно справляется с рабочими процессами использования компьютера, которые разворачиваются в нескольких приложениях с динамически меняющейся информацией. Она сохраняет контекст в течение длительных сессий, адаптируется к меняющимся требованиям и перемещается по незнакомым интерфейсам с минимальным вмешательством человека.
Вместо того чтобы обдумывать каждый шаг на рабочем столе по одному клику, Muse Spark 1.1 понимает, когда нужно автоматизировать процесс, а когда использовать интерфейс напрямую. Мы обучили модель писать скрипты, когда автоматизация происходит быстрее, кликать, когда прямое взаимодействие проще, и генерировать пакеты действий на каждом этапе.
Агентная организация званого ужина: В реальных приложениях возникает новый контекст, который меняет задачу. Muse Spark 1.1 замечает эти изменения при оформлении заказа на ужин и вносит необходимые обновления без вмешательства пользователя.
Программирование
Производительность программирования для Muse Spark 1.1 существенно улучшилась в реальных задачах, связанных с большими и сложными кодовыми базами. Она может диагностировать и исправлять сложные ошибки, внедрять новые функции в системы корпоративного уровня и выполнять масштабные миграции кода. В таких сценариях использования, как создание веб-приложений и сквозные ответы на вопросы, Muse Spark 1.1 показывает значительный прирост по сравнению с нашей первой моделью.
Мы обучили нашу модель плавно адаптироваться к разнообразным инструментам и надежно справляться со сложной многоходовой динамикой. Muse Spark 1.1 хорошо работает с популярными агентными настройками программирования, поддерживая такие общие функции, как режим планирования, обусловленность целями, делегирование субагентам и сжатие контекста.
Демонстрация отладки в OpenCode: Muse Spark 1.1 создает веб-приложение для чата, делает автоматические скриншоты для выявления видимых пользователю сбоев, отслеживает проблемы до соответствующего кода для внесения исправлений и проверяет эти изменения. Модель органично сочетает в себе программирование, мультимодальное понимание и вызов инструментов.
В компании Meta разработчики и исследователи ежедневно используют Muse Spark 1.1, чтобы создавать быстрее и работать эффективнее. В нашем основном внутреннем тесте программирования, Meta Internal Coding Bench, Muse Spark 1.1 значительно превосходит Muse Spark и является конкурентоспособной по сравнению с ведущими альтернативами.
Исследователи теперь также автоматизируют задачи разработки и оценки моделей, используя Muse Spark 1.1 в своих рабочих процессах.
Оценка DeepSWE в OpenCode: Muse Spark 1.1 оценивает себя на подмножестве задач DeepSWE с различной силой рассуждения и создает панель анализа на основе результатов.
Мультимодальность
Наряду с навыками программирования и агентными возможностями, Muse Spark 1.1 превосходна в восприятии, мультимодальном рассуждении и использовании инструментов. Она может взаимодействовать с реальными средами и создавать обоснованные результаты, обладая сильными сторонами в генерации визуального кода, ультра-описательном создании подписей к изображениям и видео, а также в выполнении агентных рабочих процессов для мультимодальных сценариев.
Мультимодальные возможности Muse Spark 1.1 особенно ценны, когда восприятие и действие должны происходить одновременно. Модель может изучать визуальные и аудиоданные, сохранять детали на протяжении длительного рабочего процесса и использовать эти детали при работе с компьютерами от имени пользователя.
Агент для Facebook Marketplace: Используя видео, снятое со смартфона, Muse Spark 1.1 извлекает полезные фотографии и анализирует продукт, чтобы управлять браузером пользователя и создать объявление на Facebook Marketplace от имени пользователя.
Безопасность
Мы провели обширные оценки безопасности перед развертыванием, следуя Advanced AI Scaling Framework, которая определяет оценки, модели угроз и пороги развертывания для наших самых передовых моделей.
По всем категориям пограничных рисков — химические и биологические, кибербезопасность и потеря контроля — наши оценки показывают, что Muse Spark 1.1 работает в рамках безопасных границ. Muse Spark 1.1 демонстрирует высокую устойчивость к прямым джейлбрейкам и косвенным атакам с использованием недоверенных данных, инъекциям промптов и атакам на промпты разработчиков. Как следствие, она демонстрирует лучшую состязательную устойчивость, более низкие показатели галлюцинаций и сниженную склонность к поддакиванию.
Наша полная позиция по безопасности для версии 1.1 задокументирована в нашем отчете об оценке Muse Spark 1.1.
Доступность
Впервые разработчики могут начать создавать приложения с помощью Muse Spark 1.1 через новый Meta Model API, который сейчас находится в публичной предварительной версии. Первые партнеры Muse Spark 1.1 хвалят модель как полноценную агентную основу, сочетающую работу с длинным контекстом с сильными способностями к программированию и рассуждению для обработки крупномасштабных агентных рабочих нагрузок.
«Что больше всего впечатляет в Muse Spark, так это то, сколько всего вложено в одну модель: огромный контекст в миллион токенов, полная мультимодальная поддержка (изображения, видео, PDF), встроенный поиск с цитатами, сильное рассуждение, первоклассные способности к программированию (особенно фронтенд и дизайн), структурированный вывод и параллельный вызов инструментов — и все это в чистом пакете, совместимом с OpenAI. Полноценная агентная основа».
— Амджад Масад, генеральный директор Replit
«Meta явно создает инструменты для серьезного агентного программирования — сильное использование инструментов по цене, которая делает возможным выполнение реальных рабочих нагрузок по программированию в масштабе. Такое сочетание встречается редко, и именно поэтому мы хотели, чтобы разработчики Cline получили доступ к нему как можно раньше».
— Сауд Ризван, генеральный директор Cline
«При тестировании на наборе данных для оценки корпоративной работы Box модель Muse Spark продемонстрировала возможности корпоративного уровня, сопоставимые с современными передовыми моделями. Такой уровень интеллекта в сочетании с преимуществами в структурированных процедурных рабочих процессах в таких отраслях, как профессиональные услуги, государственный сектор и промышленные операции, делает ее привлекательным выбором для организаций».
— Яшодха Бхавнани, вице-президент по продуктам ИИ в Box
«Muse Spark 1.1 — потрясающая модель для запуска агентов. Быстрая, мощная и отлично работает с OpenClaw».
— Дэйв Морин, OpenClaw Foundation
Мы рады представить Muse Spark 1.1, что является свидетельством динамики наших исследований. У нас в процессе обучения находятся еще более мощные модели, и мы с нетерпением ждем возможности поделиться тем, что нас ждет впереди.
Автор:
Meta Superintelligence Labs







