Сегодня мы рады представить Muse Spark 1.1 — новейшую модель от Meta Superintelligence Labs и значительное обновление Muse Spark. Muse Spark 1.1 представляет собой мультимодальную модель рассуждений, созданную для агентских задач, с серьезными улучшениями в использовании инструментов и ПК, написании кодирования и мультимодальном понимании.
Благодаря этим улучшениям Muse Spark 1.1 раздвигает границы производительности и эффективности. Наряду с запускom Muse Image на этой неделе, этот релиз приближает нас к нашему видению персонального суперинтеллекта: моделей, которые помогают вам преследовать свои цели, создавать то, что вы воображаете, углублять отношения и действовать в отношении того, что вы цените больше всего.
Вместе с этим релизом мы запускаем публичную предварительную версию нового API Meta Model, где разработчики могут получить доступ к Muse Spark 1.1. Модель уже доступна в режиме «Размышления» (Thinking) в приложении Meta AI и на сайте meta.ai.
Оценки
Агенты
Muse Spark 1.1 обеспечивает исключительную производительность в персональных агентских задачах, требующих планирования и оркестрации в различных внешних приложениях и сервисах. Она выполняет zero-shot обобщение на новые нативные инструменты, серверы MCP и пользовательские навыки.
Она справляется со сложными проектами значительно быстрее, чем Muse Spark, так как обучена оркестрировать мультиагентные системы для оптимизации сквозной задержки. В качестве основного агента она может собирать контекст, составлять план и делегировать выполнение параллельным субагентам. В качестве субагента она придерживается своей задачи, понимает доступные инструменты и знает, когда эскалировать задачу обратно главному агенту.
Muse Spark 1.1 может активно управлять своим контекстным окном размером в 1 миллион токенов. Она запоминает действия, извлекает информацию из гораздо более ранних этапов работы и производит компактизацию таким образом, чтобы сохранять критически важные шаги для последующей работы.
Использование компьютера
Muse Spark 1.1 превосходно справляется с рабочими процессами использования компьютера, которые разворачиваются в нескольких приложениях с изменяющейся на лету информацией. Она поддерживает контекст в течение длительных сеансов, адаптируется к меняющимся требованиям и ориентируется в незнакомых интерфейсах с минимальным вмешательством человека.
Вместо того чтобы рассуждать над каждым шагом на рабочем столе по одному клику за раз, Muse Spark 1.1 понимает, когда нужно автоматизировать процесс, а когда использовать интерфейс напрямую. Мы обучили модель писать скрипты, когда автоматизация происходит быстрее, кликать мышью, когда прямое взаимодействие проще, и генерировать пакеты действий на каждом шаге.
Агентская организация званого ужина: В реальных приложениях возникает новый контекст, который меняет задачу. Muse Spark 1.1 замечает эти изменения при оформлении заказа на ужин и вносит необходимые обновления без вмешательства пользователя.
Написание кода
Производительность написания кода для Muse Spark 1.1 существенно улучшилась в реальных задачах, связанных с большими и сложными кодовыми базами. Она может диагностировать и исправлять сложные ошибки, реализовывать новые функции в системах корпоративного уровня и выполнять масштабные миграции кода. В таких сценариях использования, как создание веб-приложений и сквозные ответы на вопросы, Muse Spark 1.1 демонстрирует значительный прирост по сравнению с нашей первой моделью.
Мы обучили нашу модель плавно адаптироваться к различным обвязкам и надежно справляться со сложными многошаговыми сценариями динамики. Muse Spark 1.1 отлично работает с популярными настройками агентского программирования, поддерживая такие общие функции, как режим планирования, обусловленность целями, делегирование субагентам и компактизация контекста.
Демонстрация отладки в OpenCode: Muse Spark 1.1 создает чат-веб-приложение, делает автоматизированные скриншоты для выявления видимых пользователем сбоев, отслеживает проблемы до соответствующего кода для реализации исправлений и проверяет эти изменения. Модель органично сочетает в себе программирование, мультимодальное понимание и вызов инструментов.
По всей компании Meta разработчики и исследователи ежедневно используют Muse Spark 1.1 для более быстрого создания продуктов и более эффективной работы. В ходе нашей основной внутренней оценки программирования, Meta Internal Coding Bench, Muse Spark 1.1 значительно превосходит Muse Spark и конкурирует с ведущими альтернативами.
Исследователи теперь также автоматизируют задачи разработки и оценки моделей, используя Muse Spark 1.1 в своих рабочих процессах.
Оценка DeepSWE в OpenCode: Muse Spark 1.1 оценивает себя на подмножестве задач DeepSWE при различной силе рассуждений и создает аналитическую панель управления на основе результатов.
Мультимодальность
Наряду с возможностями кодирования и агентской работы, Muse Spark 1.1 превосходно справляется с восприятием, мультимодальными рассуждениями и использованием инструментов. Она может взаимодействовать с реальными средами и выдавать обоснованные результаты, обладая преимуществами в генерации визуальных артефактов в код, ультраописательном создании подписей к изображениям и видео, а также в выполнении агентских рабочих процессов для мультимодальных сценариев использования.
Мультимодальные возможности Muse Spark 1.1 особенно ценны, когда восприятие и действие должны происходить одновременно. Модель может инспектировать визуальные и аудиоданные, сохранять детали на протяжении длительного рабочего процесса и использовать эти детали при работе с компьютером от имени пользователя.
Агент Facebook Marketplace: Используя видео, снятое со смартфона, Muse Spark 1.1 извлекает полезные фотографии и анализирует продукт, чтобы управлять браузером пользователя и создать объявление на Facebook Marketplace от имени пользователя.
Безопасность
Мы провели обширные оценки безопасности перед развертыванием, следуя стандарту Advanced AI Scaling Framework, который определяет оценки, модели угроз и пороги развертывания для наших самых передовых моделей.
По всем категориям рисков передовых технологий — химическая и биологическая безопасность, кибербезопасность и потеря контроля — наши оценки показывают, что Muse Spark 1.1 работает в пределах безопасных границ. Muse Spark 1.1 демонстрирует сильную устойчивость к прямым джейлбрейкам и косвенным атакам с использованием ненадежных данных, внедрению промптов и атакам на промпты разработчиков. Следовательно, она демонстрирует лучшую состязательную устойчивость, более низкие показатели галлюцинаций и меньшую угодливость.
Наша полная политика безопасности для версии 1.1 задокументирована в Отчете об оценке Muse Spark 1.1.
Доступность
Впервые разработчики могут начать создание приложений с помощью Muse Spark 1.1 через новый API Meta Model, который теперь находится в режиме публичного предварительного просмотра. Ранние партнеры Muse Spark 1.1 хвалят модель как полноценную агентскую основу, сочетающую обработку длинного контекста с мощными возможностями кодирования и рассуждения для работы с масштабными агентскими нагрузками.
«Самое впечатляющее в Muse Spark — это то, как много всего в ней заложено: огромный миллионный контекст, полная мультимодальная поддержка (изображения, видео, PDF), встроенный поиск со ссылками на источники, сильные рассуждения, первоклассные навыки кодирования (особенно во фронтенде и дизайне), структурированный вывод и параллельный вызов инструментов — и все это в чистом пакете, совместимом с OpenAI. Полноценная агентская основа».
— Амджад Масад (Amjad Masad), генеральный директор Replit
«Meta явно создает технологии для серьезного агентского программирования — надежное использование инструментов по цене, которая делает целесообразным запуск реальных рабочих нагрузок по написанию кода в больших масштабах. Такое сочетание встречается редко, и именно поэтому мы хотели, чтобы у разработчиков Cline был ранний доступ».
— Сауд Ризван (Saoud Rizwan), генеральный директор Cline
«При тестировании на корпоративном наборе задач Box модель Muse Spark продемонстрировала корпоративные возможности, конкурентоспособные с ведущими современными передовыми моделями. Такой уровень интеллекта в сочетании с ее сильными сторонами в структурированных процедурных рабочих процессах в таких отраслях, как профессиональные услуги, государственный сектор и промышленное производство, делает ее привлекательным выбором для организаций».
— Яшодха Бхавнани (Yashodha Bhavnani), вице-президент по продуктам ИИ в Box
«Muse Spark 1.1 — потрясающая модель для запуска агентов. Быстрая, мощная и отлично работающая с OpenClaw».
— Дэйв Морин (Dave Morin), фонд OpenClaw
Мы рады выпустить Muse Spark 1.1, что свидетельствует о динамике наших исследований. У нас в обучении находятся еще более мощные модели, и мы с нетерпением ждем возможности поделиться тем, что будет дальше.
Автор:
Лаборатории супер интеллекта Meta
Поделиться:










