В собственной документации поставщика MiniMax-M3.1-Flash-Preview теперь указана выше, чем MiniMax-M3, и этот порядок в списке играет важную убеждающую роль. Это новейшая текстовая модель в линейке, она обладает тем же контекстным окном в миллион токенов и добавляет функцию контроля глубины мышления, которой нет у старой модели. Однако таблица не показывает, что старая модель — единственная из двух, которую можно скачать, использовать с оплатой за токен, протестировать на бенчмарках или вызвать без подписки, и что в новой модели убрали переключатель, который был доступен в MiniMax-M3.
Это не история о том, как одна модель вытесняет другую. Это история о том, как поставщик разделяет свою линейку на «рабочую лошадку» с оплатой по факту использования и предварительную версию, доступную только по подписке; эти две модели не являются взаимозаменяемыми ни в каком направлении. Вот что представляет собой каждая из них.
Сравнение спецификаций
Начнем с того, что указано на страницах самого поставщика для обеих моделей, поскольку суть различий проявляется именно здесь, а не в таблице бенчмарков.
• Анонс — MiniMax-M3 1 июня 2026 года с описанием архитектуры, таблицей бенчмарков и прайс-листом; MiniMax-M3.1-Flash-Preview 27 сентября 2026 года с записью в документации и постом в аккаунте MiniMax для агентов • Контекстное окно — 1 000 000 токенов для обеих моделей согласно таблицам MiniMax • Максимальный вывод — 512 000 токенов для MiniMax-M3 в нашем каталоге (цифра, которую MiniMax официально не публикует); для MiniMax-M3.1-Flash-Preview нигде не указано • Входные модальности — текст, изображения и видео на входе, текст на выходе для обеих • Контроль мышления — параметр мышления, который можно отключить в MiniMax-M3 и разделить на поле reasoning_details через reasoning_split; в MiniMax-M3.1-Flash-Preview мышление обязательно, а reasoning_split нельзя отключить • Глубина мышления — недоступна в MiniMax-M3; шкала усилий low, medium, high, xhigh и max (по умолчанию max) в MiniMax-M3.1-Flash-Preview • Опубликованная скорость вывода — примерно 100+ токенов в секунду для MiniMax-M3 согласно таблице MiniMax; для MiniMax-M3.1-Flash-Preview данных нет • Веса — MiniMax-M3 имеет открытые веса с публичным репозиторием; у MiniMax-M3.1-Flash-Preview их нет • Ценообразование — $0.30 за миллион входных токенов и $1.20 за миллион выходных для MiniMax-M3 по тарифу провайдера; для MiniMax-M3.1-Flash-Preview тарификация за токен отсутствует • Доступ — MiniMax-M3 доступна по модели pay-as-you-go и через Token Plan, а также через сторонние платформы; MiniMax-M3.1-Flash-Preview доступна только через Token Plan и MiniMax Code
Две строки в этом списке относятся к другой категории. Опубликованная скорость вывода — это показатель поставщика только для старой модели, поэтому новая модель продается как «быстрая» без указания конкретных цифр. А контроль мышления изменился в направлении, противоположном маркетинговым заявлениям: новая модель предлагает более тонкую настройку глубины мышления, но при этом лишает вас возможности полностью его отключить.
Переключатель, который убрали в MiniMax
Это деталь, которая может доставить больше всего проблем, и она задокументирована, а не скрыта. В MiniMax-M3 отправка параметра thinking: {"type": "disabled"} на OpenAI-совместимый эндпоинт пропускает процесс мышления и возвращает прямой ответ; на Anthropic-совместимом эндпоинте мышление по умолчанию выключено и может быть включено через adaptive. В MiniMax-M3.1-Flash-Preview идентичный запрос возвращает ошибку HTTP 400 с сообщением requires adaptive thinking. Поддерживаемого способа получить ответ без рассуждений не существует.
На практике это означает, что рабочая нагрузка, использующая MiniMax-M3 как дешевый и быстрый классификатор или роутер (короткий промпт на входе, короткий структурированный ответ на выходе, без цепочки рассуждений), не имеет пути для простого обновления до новой модели. Вы можете снизить уровень усилий до low, и руководство MiniMax прямо указывает, что снижение усилий — это предпочтительный способ уменьшить задержку мышления и количество токенов, а не отключение функции. Но токены и задержка не падают до нуля, и для высоконагруженных задач извлечения данных, где записываются четыре поля за вызов, «всегда думает сначала» — это совсем другая структура затрат, чем «думает, когда просят».
Что на самом деле измеряется для каждой модели
Одна сторона этого сравнения содержит цифры, а другая — пустую колонку, и важно уточнить, какие цифры к кому относятся.
Независимые показатели MiniMax-M3 реальны: Artificial Analysis оценивает её в 29.2 балла по индексу интеллекта (60-е место из 145), с 58.6 балла по индексу кодинга, 59.18 по индексу математики, 92.9% в GPQA Diamond в том же семействе индексов, 83% по запоминанию длинного контекста и 82.9% в IFBench. Это сторонние оценки модели, которую любой может скачать и запустить повторно. Собственные цифры MiniMax при запуске M3 — BrowseComp 83.5%, SWE-Bench Pro 59.0%, Terminal-Bench 2.1 66.0%, MCP Atlas 74.2%, OSWorld-Verified 70% — являются данными поставщика, и мы не видели их независимого подтверждения.
У MiniMax-M3.1-Flash-Preview нет ничего из этого. MiniMax не опубликовал таблицу бенчмарков, и у модели нет записи в индексе Artificial Analysis, поэтому нет независимого балла, индекса кодинга, показателя запоминания длинного контекста или измерения галлюцинаций. Каждая характеристика в обращении — «быстрая», «надежная», «создана для повседневной разработки» — это собственные прилагательные поставщика из поста о запуске. Отсутствие данных стоит отметить прямо, потому что это работает в обе стороны: ничего не было показано как худшее, и ничего не было показано как лучшее.
Эта асимметрия и есть суть решения. Вы можете оценить MiniMax-M3 сегодня, скачав её или вызвав через API, и сравнить эту оценку с публичной таблицей лидеров. С MiniMax-M3.1-Flash-Preview вы можете только использовать её и сформировать частное мнение.
В чем новая модель действительно выигрывает
Было бы легко воспринять написанное выше как аргумент в пользу игнорирования новой модели, но это тоже неверный вывод. Три вещи являются реальными и специфичными для неё.
Шкала усилий — это реальная возможность, а не просто переключатель. Пять уровней (от low до max) позволяют одной модели выполнять как рутинное переименование, так и рефакторинг всего репозитория с разными вычислительными затратами, и это задокументировано как эффективная функция только для MiniMax-M3.1-Flash-Preview. В MiniMax-M3 ваш выбор бинарен. Если ваша проблема в том, что вы не можете предсказать задержку для конкретной задачи, настраиваемая глубина — это именно тот контроль, который вам был нужен.
Это текущая топовая модель поставщика, что означает, что она наследует все, чему научилась линейка M-серии с июня, и MiniMax прямо заявляет, что это новейшая модель для агентных рассуждений, использования инструментов, кодинга и задач с длинным контекстом. Механизм использования инструментов с чередующимся мышлением, представленный в M3, сохранен, включая требование добавлять полный ответ (включая блоки мышления) обратно в историю сообщений.
И она принимает видео по цене Flash в рамках подписки. MiniMax-M3 тоже это делает, но с оплатой за токен. Если вы уже платите за место в Token Plan и вашим единственным барьером для использования видеовхода была предельная стоимость за вызов, M3.1-Flash-Preview устраняет этот барьер.
В чем старая модель все еще остается предпочтительной
Три случая, и все они касаются предсказуемости, а не качества.
Когда вам нужно смоделировать затраты, у MiniMax-M3 есть прайс-лист: 0,30 доллара за миллион входных токенов, 1,20 доллара за миллион выходных токенов и тариф на чтение кэша 0,06 доллара за миллион в нашем каталоге. Вы можете заранее рассчитать ежемесячную стоимость рабочей нагрузки до копейки, прежде чем запустить её. MiniMax-M3.1-Flash-Preview не имеет тарифа за токен ни на одной из страниц MiniMax, поэтому его стоимость — это ваша подписка, разделённая на количество использований. Это подходит для фиксированного бюджета, но бесполезно для юнитной экономики.
Когда вам нужно, чтобы модель была именно моделью, MiniMax-M3 — это модель с открытым весом: вы можете скачать её, запустить на своём оборудовании и быть уверенными, что артефакт, отвечающий на ваши запросы через шесть месяцев, будет тем же самым, что и сегодня. MiniMax-M3.1-Flash-Preview не имеет контрольной точки, а доступ предварительного просмотра означает, что стэк обслуживания, состав квот и доступность полностью контролируются поставщиком и могут быть изменены в любое время.
Когда вам нужен ответ без рассуждений. Как выше — это единственная регрессия возможностей в сравнении, и это то, что удивляет людей, потому что более новая модель, которая не может сделать то, что могла сделать старая, — это не тот случай, который кто-то планирует.
Вызов обоих из одного места
Проблема здесь в том, что обе модели покупаются по-разному — одна по мере использования, другая по подписке — и естественный инстинкт — выбрать сторону. Более полезный шаг — маршрутизировать между ними по форме задачи, что работает только в том случае, если сторона по мере использования доступна из того же места, что и всё остальное.
MiniMax-M3 на OrcaRouter имеет список цен MiniMax без наценки 0%, поэтому 0,30 доллара и 1,20 доллара в прайс-листе — это то, сколько стоит вызов, без маржи платформы сверху. Он находится на том же совместимом с OpenAI эндпоинте, что и MiniMax M2.7 — те же 0,30 доллара/1,20 доллара на окне в 200 000 токенов, также с открытым весом — и как более 200 других моделей, за одним API-ключом, с автоматическим переключением между провайдерами, когда один эндпоинт нестабилен. В отличие от нашей собственной телеметрии, которая является другим видом данных по сравнению с данными поставщика: за последние семь дней M3 отвечал примерно 238 выходными токенами в секунду при p50 около 4,1 секунды до первого токена с ошибкой около 0,15%, измеренной в OrcaRouter playground. Если вы хотите использовать MiniMax-M3 как надёжную половину конвейера и относиться к MiniMax-M3.1-Flash-Preview как к экспериментальной половине, то надёжная половина — это одна строка конфигурации, а не вторые отношения с поставщиком. Сам MiniMax-M3.1-Flash-Preview не находится в нашем каталоге; путь к нему — это собственный тарифный план поставщика и продукт кодирования.
Что изменило бы эту статью, конкретно и легко поддаётся наблюдению. Опубликованный прайс-лист для MiniMax-M3.1-Flash-Preview устранил бы основную причину предпочтения M3 с точки зрения экономики. Набор независимых оценок заменил бы пустую колонку чем-то сравнимым. Загружаемая контрольная точка устранила бы возражение против воспроизводимости. Пока хотя бы одно из этих условий не будет выполнено, MiniMax-M3 остается моделью в этой паре, которую вы можете контролировать, а более новая модель остается более быстрой, лучше контролируемой, немеряемой предварительной версией, за которую MiniMax решил взимать плату помесячно, а не за токен.










