Представляем Mistral Large 4

Источник: Mistral

Представляем Mistral Large 4

Источник: Mistral

Самая мощная ИИ-платформа для предприятий. Настраивайте, дообучайте и развертывайте ИИ-ассистентов, автономных агентов и мультимодальный ИИ с помощью моделей с открытыми весами.

•Обновлено: 6 октября 2026 г.

Le Chonk

Сегодня мы запускаем публичную предварительную версию Mistral Large 4. Неофициально — ML4, официально: le Chonk. ML4 расширяет границы производительности моделей с открытыми весами. Вы можете опробовать API предварительной версии уже сегодня в Mistral Studio. Веса будут опубликованы в конце этого месяца.

Передовая производительность

ML4 — это нативно мультимодальная модель с 1 триллионом параметров, из которых 49 миллиардов являются активными. Это наша самая большая и мощная модель на сегодняшний день, и она продолжает быстро совершенствоваться по мере нашей работы над ней.

Модель демонстрирует исключительную производительность в задачах программирования, агентных рабочих процессах и мультимодальном понимании. Она уже достигает уровня производительности, сопоставимого с самыми сильными моделями с открытым исходным кодом в мире, значительно превосходя при этом любую модель с открытыми весами, разработанную в США или Европе. В критически важных корпоративных задачах, включая кибербезопасность, финансы и право, мы считаем её передовой среди открытых моделей. В некоторых областях, таких как визуальное обоснование (visual grounding), она идет еще дальше, превосходя даже передовые закрытые модели.

Мы выпустим веса к концу месяца. До тех пор мы проводим «красные учения» (red-teaming) модели в реальных условиях совместно с лидерами в области кибербезопасности, проверенными партнерами и государственными органами, которые получат доступ к той же модели с ослабленной модерацией и расширенными кибервозможностями.

Демонстрации

Создано в Европе. Построено для суверенитета в области ИИ.

ML4 была обучена с нуля на 3800 графических процессорах NVIDIA Grace Blackwell в собственных дата-центрах Mistral в Европе. Публичная предварительная версия работает на той же инфраструктуре. Это важная веха в наших долгосрочных инвестициях в инфраструктуру, исследования и разработку продуктов: передовая производительность в критически важных вертикалях, предоставляемая через открытые веса, разработанная для того, чтобы дать клиентам контроль над их ИИ.

Это особенно важно в кибербезопасности, где отказы на уровне провайдера могут блокировать законные исследования уязвимостей и реагирование на инциденты, а потеря доступа к возможностям в разгар инцидента сама по себе может стать критическим риском безопасности. ML4 сочетает в себе первоклассную киберпроизводительность с открытыми весами и возможностью самостоятельного развертывания, предоставляя организациям как возможности, так и автономию для выполнения передовых задач по обеспечению безопасности в соответствии с их собственными политиками.

Модель будет доступна в нескольких регионах по всему миру, включая европейский сегмент, который Mistral управляет полностью самостоятельно, независимо от других поставщиков цифровых услуг и в соответствии с европейским законодательством. Интересный факт: значительная часть данных для обучения ML4 была многоязычной и охватывала более 160 языков, включая все официальные языки Европейского союза.

Мы тесно сотрудничали с ведущими предприятиями по всему миру в сферах финансов, инженерии, производства, логистики, фармацевтики, науки, судоходства, государственного сектора и других критически важных отраслях для обучения ML4. Фактически, модель использует ту же среду обучения, настройки и обучения с подкреплением (RL), которую мы предлагаем нашим клиентам через Mistral Forge.

Попробуйте сегодня

Впереди еще много нового. По мере приближения к выпуску весов мы поделимся дополнительными подробностями об архитектуре модели, дополнительными бенчмарками и нашей методологией пост-тренировки.

Эта модель также послужит основой для нового поколения специализированных и оптимизированных моделей Mistral. Тем временем мы приглашаем вас попробовать API предварительной версии и поделиться с нами своими отзывами в социальных сетях.

Глубокий анализ возможностей

Кибербезопасность

ML4 — одна из самых сильных ИИ-моделей в мире для кибербезопасности. В Artificial Analysis Cyber Index, независимой оценке того, насколько хорошо ИИ-модели находят и исправляют уязвимости безопасности в реальном программном обеспечении, она входит в пятерку лучших моделей в мире и значительно опережает модели с открытыми весами, разработанные за пределами Китая. В одном из тестов индекса, который требует от модели воспроизвести реальную уязвимость в программном обеспечении с открытым исходным кодом, а затем исправить её, ML4 набирает 82%, что является самым высоким показателем среди всех моделей. Она также решает 93% задач в Cybench, наборе из 40 упражнений, взятых из соревнований по безопасности, что является одним из самых высоких результатов, зафиксированных для модели с открытыми весами.

Этот высокий результат отражает практическое преимущество. Несколько ведущих закрытых моделей, включая Claude Opus 5.5 и GPT-6 Astra, набирают около нуля в том же тесте, потому что они отказываются выполнять задачу. Тем не менее, защита программного обеспечения часто начинается с доказательства того, что уязвимость реальна — именно тот вид работы, который могут блокировать фильтры безопасности в закрытых моделях. Это становится еще важнее, поскольку злоумышленники все чаще взламывают те же самые модели для поддержки наступательной киберактивности: защитникам нужны системы, которые могут соответствовать этим возможностям, не будучи ограниченными теми же отказами. ML4 может выполнять эту работу, и её возможности выходят за рамки того, для чего она была специально обучена: во внутреннем тестировании она оказалась полезной для анализа вредоносного ПО, приоритизации уязвимостей и написания правил обнаружения. Для организаций, которым нужен суверенный, аудируемый ИИ для операций по безопасности, она сможет работать в частном облаке или локально (on-premise).

Агентное программирование

ML4 превосходно справляется с разработкой программного обеспечения, пониманием репозиториев и сложными рабочими процессами в терминале, набирая 61,7% в DeepSWE v1.1, 59,4% в SWE-Atlas-QnA и 28,3% в Terminal-Bench 4. Её совокупный балл Coding Agent Index, равный 49,8%, ставит её впереди DeepSeek V4 Pro 0813 и Qwen3.8 Max.

* Оценки в DeepSWE, Terminal-Bench 4 и SWE Atlas QnA используют цифры, представленные индексом программирования ArtificialAnalysis. Vibe Code Bench v1.1 использует цифры, представленные vals.ai.

Мы также провели слепую оценку качества программирования с участием Surge AI: профессиональные аннотаторы оценивали результаты работы моделей по шкале от 1 до 5, при этом личности моделей были скрыты. ML4 Preview заняла второе место из пяти моделей (3,74), опередив Kimi K3 (3,59), GLM-5.3 (3,60) и GLM-5.2 (3,40), и уступив только Claude Opus 5 (4,22).

Агентные рабочие процессы

ML4 запускает агентов общего назначения, которые собирают информацию, используют инструменты и создают готовые результаты в сложных рабочих процессах. В AutomationBench — 657 бизнес-процессов в таких приложениях, как Gmail, Google Sheets, Slack и Salesforce — она набирает 59,9%, опережая Kimi K3, MiMo-V2.6-Pro и DeepSeek V4 Pro.

Она столь же сильна в профессиональных результатах, которые на самом деле создает интеллектуальная работа: электронные таблицы, презентации и PDF-файлы. В AA-Briefcase, который оценивает долгосрочную интеллектуальную работу, она достигает 1393 Elo, опережая DeepSeek V4 Pro.

Мультимодальность

ML4 — это качественный скачок в способности наших моделей понимать изображения. Она мощно рассуждает над сложными документами, графиками и естественными изображениями, а также привносит возможности компьютерного зрения в отрасли, где восприятие критически важно, такие как инженерия, производство и наблюдение за Землей.

Модель может дополнительно сочетать визуальное обоснование с агентными возможностями: от инспекции гигапиксельных спутниковых снимков — помогая командам реагирования на стихийные бедствия действовать, когда время имеет значение — до анализа инженерных чертежей — приближая, осматривая и проверяя до тех пор, пока ответ не станет точным. В наших демонстрациях выше ML4 обосновывает плотные естественные сцены, проверяет механические детали на технических чертежах, извлекает доказательства из PDF-файлов и сканирует массивные геопространственные изображения в поисках самых труднодоступных объектов.

Что касается визуального обоснования, мы обнаружили, что ML4 является одной из самых способных моделей, которые мы тестировали, например, превосходя GPT-6-Astra в тесте Dense 200 (42% против 41%).

Наука и математика

ML4 обладает мощными научными возможностями, созданными путем объединения методов на основе ИИ с опытом наших исследователей в области математики, физики и химии.

Модель обладает высокой квалификацией в агентном программировании для таких научных задач, как анализ данных, моделирование и симуляция физической реальности, что позволяет исследователям сосредоточиться на вопросах, а не на технической реализации. В бенчмарках ML4 является передовой моделью среди моделей с открытыми весами по результатам SciCode-Verified. На практике она может сгенерировать полную симуляцию Хартри-Фока за один проход — сложную многоэтапную химическую задачу, состоящую из ряда продвинутых процедур.

Математические способности ML4 также стали сильнее, как в формальных рассуждениях, так и в прикладной математике. В наших оценках с участием людей модель рассуждает более точно и структурированно, чем GLM-5.3, и способна поддерживать длительные, узкоспециализированные задачи по прикладной математике, включая работу, актуальную для передовой теоретической физики.

В совокупности эти возможности делают ML4 сильным помощником в исследованиях на протяжении всего технического рабочего процесса — от постановки первого вопроса до получения окончательного результата.

SciCode-Verified тестирует способности моделей реализовывать сложные научные рабочие процессы в коде для таких областей, как физика, математика, материаловедение и биология.

Внутренняя оценка ML4 по сравнению с GLM5.3 в задачах STEM (математика и физика)

Интеллектуальная работа

ML4 — наша самая способная модель для реальных задач, с которыми профессионалы сталкиваются каждый день. Она может создавать, редактировать и исправлять сложные электронные таблицы и документы, демонстрируя образцовую производительность как в юридических, так и в финансовых бенчмарках.

Примечательно, что мы оценивали ML4 с помощью сторонних оценщиков () на репрезентативных задачах как в юридической, так и в финансовой сферах, обнаружив, что модель превосходит GPT-6-Astra в обоих случаях. В бенчмарке Legal Agent от HarveyAI модель ML4 превосходит все модели с открытым исходным кодом.

FinWorkBench тестирует возможности модели по созданию/редактированию электронных таблиц на реальных примерах использования в финансах и бухгалтерском учете.

Финансовый анализ требует точности и способности синтезировать информацию из нескольких источников — процесс, который во многих финансовых учреждениях до сих пор остается трудоемким. В этой демонстрации ML4 и Mistral Medium 3.5 берутся за одну и ту же многоэтапную задачу корпоративных финансов, выполняя поиск по документации публичных компаний и финансовым отчетам, таким как те, что доступны через EDGAR и аналогичные европейские базы данных. Анимированная семантическая карта отслеживает путь каждой модели к решению, выделяя каждый документ, полученный в процессе. Положение каждого трека отражает собранные доказательства, результаты расчетов и вопросы, которые остаются нерешенными. Зрители могут проследить, как разворачиваются исследования, и сравнить различные пути, которые выбирает каждая модель, прежде чем прийти к окончательному ответу.

Безопасность модели

ML4 достигла максимума в наших бенчмарках на устойчивость к косвенным инъекциям промптов, что ставит ее в авангард моделей с открытым исходным кодом (по сравнению с GLM-5.2, GLM-5.3, Kimi-K2.6, Kimi-K3, DS-V4-Pro-0813). В публичном тесте Lakera B3 AI Security Benchmark ML4 отражает 93,3% атак — мы не видим более высоких показателей среди конкурентов.

ML4 также взаимодействует с пользователями более ответственно, чем любая из наших предыдущих моделей. Мы подчеркиваем наши результаты в бенчмарке KORA, где ML4 снова занимает наш самый высокий измеренный балл среди моделей с открытым исходным кодом (1,691, где 2 — это максимум, обозначаемый как «Образцовый»).

Особую актуальность имеет склонность модели отказывать в выполнении вредоносных запросов, касающихся кибербезопасности. Несмотря на высокую производительность в кибер-бенчмарках, средний уровень отказов модели на кибер-промпты от JailbreakBench, StrongREJECT и AgentHarm выше, чем у всех моделей с открытым исходным кодом.

Оценка людьми

Мы провели внутреннюю оценку, в которой эксперты-аннотаторы в области программирования, автоматизированного проектирования (САПР), финансов, математики и физики сравнивали Mistral Large 4 с GLM-5.3. ML4 предпочли в САПР и STEM, в то время как в финансах и программировании она показала результаты на уровне или близкие к GLM-5.3.

Обучение с подкреплением в масштабе

Базовые модели быстро совершенствуются, и наше пост-обучение должно идти в ногу со временем. Рецепт, настроенный для вчерашней модели, оставляет неиспользованными возможности сегодняшней передовой модели, потому что примеры с «истиной в последней инстанции», которые когда-то доводили модель до предела, больше этого не делают. Мы используем обучение с подкреплением (RL), потому что оно адаптируется по мере адаптации самой модели: мы обучаемся на результатах собственных попыток модели, и мы можем повышать сложность и широту задач по мере того, как она становится сильнее.

Наша библиотека RL была разработана для того, чтобы новые среды было легко добавлять и обучать в масштабе. Общий компонуемый интерфейс позволяет одному циклу обучения объединять задачи, начиная от чата с одним поворотом и сложного решения научных проблем до обеспечения безопасности, фактической точности и использования инструментов на длинных горизонтах. Эти среды используют общие каркасы и ресурсы, такие как песочницы кода, веб-поиск и внешние API. Та же компонуемость распространяется на верификацию, где модели вознаграждения, модульные тесты, судьи LLM и статические проверки комбинируются по мере необходимости для каждой задачи.

Во время выполнения масштабируемый парк агентов генерирует десятки тысяч развертываний параллельно, пока обучение модели продолжается асинхронно. Конвейер генерации и обучения оптимизирован для длинных траекторий, поддерживая бюджеты развертывания в миллионы токенов при сохранении низкой задержки. Новые методы и оптимизации на обоих этапах минимизируют отклонение от политики и обеспечивают стабильное RL на длинных горизонтах.

При нашем текущем масштабе (3 тыс. графических процессоров) один цикл обучения дает примерно 33 миллиарда токенов в день, из которых около 16 миллиардов — обучаемые токены завершения после фильтрации и маскирования. Мы можем видеть прогресс выполнения непосредственно в развертываниях обучения: награды за обучение растут в нескольких репрезентативных средах по мере того, как политика учится решать все более сложные задачи. Ниже приведено несколько примеров.

Улучшения не ограничиваются средами, на которых мы обучаемся; они переносятся на последующие оценки, и финальная модель обязана ими обоим этапам пост-обучения (контролируемая донастройка и RL), как показано на графиках.

Что дальше

Это только начало. ML4 — первая веха на дорожной карте, финансируемой нашим раундом серии D на сумму 3 миллиарда евро — крупнейшим раундом акционерного капитала, когда-либо привлеченным европейской технологической компанией. Этот капитал уже пущен в дело: мы значительно масштабируем наши вычислительные мощности в наших собственных европейских центрах обработки данных, и многое другое будет введено в эксплуатацию в ближайшие месяцы.

Больше вычислительных мощностей означает больше обучения. Процесс обучения с подкреплением, стоящий за этим предварительным просмотром, все еще продолжается, и модель не показывает признаков насыщения — впереди значительный запас прочности. По мере масштабирования обучения на нашей расширенной инфраструктуре мы ожидаем больших и быстрых улучшений в ближайшие недели и месяцы.

Мы выпустим веса до конца месяца, а также предоставим более подробную информацию об архитектуре, дополнительные бенчмарки и нашу методологию пост-тренировки. И ML4 — это только фундамент: он послужит базой для нового поколения специализированных и оптимизированных моделей Mistral, созданных для отраслей и рабочих нагрузок, которые наиболее важны для наших клиентов.

Темпы прогресса с этого момента будут высокими. Следите за обновлениями.

О чём эта статья

Что-то непонятно? Спросите по статье — объясню простыми словами.

Не хотите разбираться сами? Мы поможем.