MiniCPM-V 4.7 и Microsoft Mage-VL — это мультимодальные модели, которые обещают экономию токенов, но достигают этого противоположными путями. Mage-VL, выпущенная Microsoft 25 июля 2026 года, фокусируется на видео: она заимствует структуру видеокодека, сохраняя каждый патч опорного кадра и только те патчи предсказанных кадров, в которых присутствует реальное движение. Это позволяет сократить количество визуальных токенов более чем на 75% и ускорить работу до 3,5 раз по сравнению с равномерной выборкой кадров. MiniCPM-V 4.7, загруженная OpenBMB 6 октября 2026 года, фокусируется на последовательности: это разреженная MoE-модель с 35,2 млрд параметров, где 30 из 40 слоев используют линейное внимание, что позволяет KV-кэшу расти медленно на контексте 256K. Одна модель сжимает то, что видит. Другая сжимает то, что помнит. И только одна из них поставляется с чем-то, что можно оценить.
Что это такое
Microsoft Mage-VL — это мультимодальная базовая модель с нативной поддержкой кодеков и проактивной потоковой передачей, масштабом 4 млрд параметров, выпущенная под лицензией Apache-2.0 с техническим отчетом и обширным разделом оценки. Она была намеренно создана для решения того, что авторы называют парадоксом Моравека для VLM — сильные стороны в автономных рассуждениях при медленном восприятии в реальном времени. Визуальный энкодер Mage-ViT обучен полностью с нуля на примерно 100 миллионах неразмеченных изображений и видео, а не инициализирован на базе предобученного в интернете ViT. Единственным предобученным компонентом в стеке является языковая основа Qwen3-4B-Instruct-2507. Полный чекпоинт представляет собой единую модель, которая выполняет понимание изображений, автономные видеорассуждения и потоковое комментирование с событийным управлением без отдельных вариантов, а сопутствующий релиз microsoft/Mage-ViT предоставляет энкодер отдельно. С момента выпуска модель набрала около 10 600 скачиваний и 420 лайков.
MiniCPM-V 4.7 — это openbmb/MiniCPM-V-4.7-35B-A3B, чекпоинт BF16 с 35 212 875 824 параметрами, разбитый на шестнадцать шардов общим объемом 70,4 ГБ, созданный с помощью Transformers 5.2.0 и загруженный 6 октября 2026 года без карточки модели.
Ее текстовая конфигурация помечена как qwen3_5_moe_text с 256 экспертами, из которых 8 активны на токен; массив layer_types содержит три слоя линейного внимания на каждый слой полного внимания (всего 40 слоев); визуальная башня — собственная minicpmv4_7_vision с 27 слоями, 16-кратным даунсэмплингом и до девяти срезов изображения. Контекст составляет 256K. У репозитория ноль скачиваний, три лайка, нет бенчмарков и нет лицензии.
Шесть параметров для сравнения
Те же шесть измерений для обеих моделей. Там, где данные отсутствуют, оставлено пустое место.
• Параметры — Mage-VL: 4,74 млрд, плотная, все активны на токен. MiniCPM-V 4.7: 35,2 млрд всего, разреженная, 8 из 256 экспертов на токен. Число MiniCPM несопоставимо с плотной моделью.
• Лицензия — Mage-VL: Apache-2.0, указана в карточке и тегах репозитория. MiniCPM-V 4.7: ничего не заявлено.
• Откуда берется экономия токенов — Mage-VL: разреженность визуальных токенов на уровне энкодера, согласованная с кодеком, заявлено сокращение более чем на 75%. MiniCPM-V 4.7: линейное внимание на уровне декодера, которое замедляет рост KV-кэша на длинных последовательностях, но не уменьшает количество подаваемых токенов.
• Контекст — Mage-VL: обучена на этапе длинного контекста на 350 тыс. видео в виде скользящих окон кодека до 384 или 768 кадров. MiniCPM-V 4.7: max_position_embeddings: 262144.
• Происхождение визуального энкодера — Mage-VL: с нуля, обучен на ~100 млн неразмеченных кадров; в карточке указано 85,69% на ImageNet с 256 токенами и монотонное улучшение при увеличении бюджета токенов. MiniCPM-V 4.7: архитектура башни унаследована от MiniCPM-V 4.6 с той же формой 1152-hidden, 27 слоев, с дефолтным 16-кратным даунсэмплингом.
• Доказательства — Mage-VL: полная карточка с DocVQA 95.14, InfoVQA 80.33, OCRBench 81.80, ChartQAPro 32.57, MMStar 67.32, CV-Bench-3D 94.75 и преимуществом +53.1 по CrossPoint над Qwen3-VL-4B, все показатели предоставлены вендором на основе сопоставимой базы. MiniCPM-V 4.7: отсутствуют.
• Потоковое поведение — Mage-VL: когнитивный гейт, который оценивает каждое скользящее окно и молчит до завершения события, обучен на ~3,3 млн потоковых примеров. MiniCPM-V 4.7: нигде не описано.
Что все понимают неправильно в цифрах Mage-VL
Таблицы бенчмарков в карточке Mage-VL выглядят убедительно, и самые сильные показатели легче всего интерпретировать неверно. Сравнительные строки противопоставляют Mage-VL-4B моделям Qwen3-VL-4B, Phi-4-Multimodal-Instruct и Phi-4-Reasoning-Vision, и основные приросты — +22.5 на QVHighlight, +24.5 на VideoEval-Pro, +53.1 на CrossPoint — реальны в том смысле, что они присутствуют в таблицах вендора. Это также собственные измерения вендора, полученные командой, которая обучала модель, на том же инструментарии. Ни одна независимая сторона их не воспроизводила. Это нормально для модели, которой четыре месяца, и это не является недостатком, но это означает, что правильный глагол здесь — «сообщает», а не «показывает результат».
Две вещи заслуживают признания помимо таблиц. Во-первых, дизайн с сопоставимой базой — фиксация декодера Qwen3-4B и замена только ViT — является более чистым доказательством, чем позиция в лидерборде, поскольку это изолирует визуальный стек, а не всю систему целиком. Во-вторых, обучающий корпус для Mage-ViT составляет около 100 млн неразмеченных кадров против миллиардов пар изображение-текст, которые используют предобученные в интернете энкодеры, поэтому соответствие поведению SigLIP2-at-10B в кластерной дискриминации — это конкретное, проверяемое утверждение об эффективности данных, а не общее хвастовство.
У MiniCPM-V 4.7 нет ничего из этого. Не более слабая версия — а вообще ничего.
Нет ни таблицы, ни вендорской, ни какой-либо другой, а файл конфигурации, описывающий архитектуру, прямо отказывается что-либо говорить о точности.
Архитектура: два ответа на один и тот же вопрос
Обе модели пытаются ответить на вопрос «как сделать мультимодальный вывод дешевым», и контраст здесь поучителен, поскольку эти два ответа дополняют, а не конкурируют друг с другом.
Mage-VL уменьшает входные данные. Ее сетка патчей 16×16 является общей для опорных и предсказанных кадров, и предсказанные кадры вносят вклад только теми патчами, на которые кодек тратит биты — то есть там, где есть движение и новые детали. Результатом являются потоки токенов переменной длины на кадр, поэтому стеку нужен проектор, способный передать переменную последовательность причинно-следственному декодеру, и поэтому один и тот же интерфейс может принимать векторы движения H.264/HEVC или карту скоростей нейронного кодека без переобучения. Затем 3D-ротационное кодирование сохраняет пространственно-временные позиции согласованными при разреженности. Бюджет токенов — это то, чем управляют.
MiniCPM-V 4.7 уменьшает состояние. Ее слои линейного внимания поддерживают рекуррентное состояние фиксированного размера вместо растущего кэша ключей-значений, поэтому затраты памяти на длинный диалог перестают линейно масштабироваться с количеством токенов. Бюджет последовательности — это то, чем управляют, а контекст 256K — это выгода. Примечательно, что конфигурация MiniCPM-V 4.7 рекламирует 16-кратный визуальный даунсэмплинг — она тоже сжимает входные данные — но умалчивает о том, сохраняет ли она переключаемый режим 4x, который был в MiniCPM-V 4.6.
Проще говоря: подход Mage-VL эффективен для видео, где большинство кадров почти идентичны соседним. Подход MiniCPM-V 4.7 эффективен для длинных документов и длительных многоходовых сессий, где накапливаются токены. Конвейер, который принимает прямой эфир, а затем ведет о нем долгий разговор, выиграл бы от обоих решений, и ни одна из моделей пока не выполняет работу другой.
Внедрение в реальный рабочий процесс
Mage-VL можно попробовать уже сегодня: один чекпоинт, задокументированная архитектура, лицензия Apache-2.0 и карточка, которая описывает содержимое репозитория. Модель вышла в июле, и инструменты вокруг нее уже успели устояться.
MiniCPM-V 4.7 пока непрактична для использования по банальным причинам. 70 ГБ в формате BF16 без квантования означают, что вам потребуется объем памяти ускорителя, которого у вас, вероятно, нет в свободном доступе, а отсутствие лицензии оставляет открытым вопрос о том, можно ли ее вообще использовать. Пользовательские пути кода требуют trust_remote_code, а наличие ядер для комбинации MoE и линейного внимания в вашем стеке обслуживания не проверено.
Что верно для обоих случаев, так это то, что self-hosted модель компьютерного зрения является лишь одним из компонентов системы, которой также приходится обращаться к передовым моделям. Именно поэтому стоит разместить хостинговую часть за единым маршрутизатором, а не заключать второй контракт и использовать второй SDK: OrcaRouter предоставляет доступ к более чем 200 моделям по одному ключу, передает цены провайдеров без наценок и автоматически переключается при сбоях у провайдера. Ни Mage-VL, ни MiniCPM-V 4.7 не являются хостинговыми моделями в этом сервисе — обе представляют собой веса, которые вы обслуживаете самостоятельно, — поэтому рассматривайте это как инфраструктуру на дальней стороне передачи данных, а не как канал доступности для любой из моделей.
Вердикт
Mage-VL — это готовая, лицензированная, протестированная модель с конкретной и хорошо обоснованной философией дизайна, и ее преимущество заключается в потоковой передаче видео и пространственном мышлении, где ее кодек-ориентированный энкодер делает нечто структурно отличное от всех остальных. MiniCPM-V 4.7 — это более крупный, нелицензированный и не протестированный чекпоинт, чья философия дизайна понятна, но поведение остается загадкой. Во всем, что касается практического применения сегодня, Mage-VL побеждает по умолчанию — не потому, что она лучше, а потому, что это единственная из двух моделей, которую вообще можно оценить. Вернитесь к этому сравнению, когда появится README для MiniCPM-V 4.7; если в тот день появятся бенчмарки и лицензия, интересным вопросом станет, превзойдет ли MoE с линейным вниманием и контекстом 256K кодек-ориентированный энкодер разреженности на длинном видео, и это будет по-настоящему открытое противостояние.










