MiniCPM-V 4.7 и UI-Venus 2.9B представляют собой модели «зрение-язык», которые анализируют скриншот и выдают текст, и на этом их сходство заканчивается — потому что одна из них создавалась ровно для этой задачи. UI-Venus 2.9B — это универсальный GUI-агент от inclusionAI, выпущенный 26 августа 2026 года, дизайн которого полностью сосредоточен на наблюдении за интерфейсом, рассуждениях о состоянии задачи, генерации действия и учете получаемой обратной связи; он поставляется с техническим отчетом, таблицами бенчмарков по задачам позиционирования в GUI (grounding), мобильным, веб-, компьютерным задачам и CAPTCHA, а также с явной оценкой того, как часто его можно уговорами склонить к опасному действию. MiniCPM-V 4.7 — это разреженная смесь экспертов (sparse mixture-of-experts) на 35,2 миллиарда параметров, загруженная OpenBMB 6 октября 2026 года без карточки модели, лицензии и бенчмарков. Сравнение специалиста с неизмеренным универсалом — занятие несколько необычное, и на этой странице четко указано, где данное сравнение применимо, а где нет.
Два совершенно разных типа релизов
UI-Venus 2.9B — это inclusionAI/UI-Venus-2-9B, модель с 9 млрд параметров, инициализированная на базе Qwen3.5-9B и прошедшая посткалибровку специально в качестве GUI-агента. В карточке описан замкнутый цикл — наблюдение за интерфейсом, рассуждение о состоянии задачи, выполнение действия, интеграция обратной связи в следующее решение — обученный в три этапа: мультимодальное промежуточное обучение на крупномасштабных симулированных траекториях для мобильных устройств, интернета и десктопа; автономное обучение с подкреплением, разделенное на пять семейств задач; и дистилляция по принципу «несколько учителей на основе актуальной политики» (multi-teacher on-policy distillation), которая объединяет доменных специализированных учителей в единую политику. Модель оценивается на бенчмарках позиционирования в GUI, мобильных, веб-, компьютерных задачах и CAPTCHA, а также отдельно на безопасность при совершении критических действий: в карточке указан процент успешных атак (attack success rate) в 11,3% на OSHarm и 48.8% на OSBlind против 25,3% и 79,4% для базовой модели Qwen3.5-9B. Между прочим, собственный близкий проект OpenBMB затрагивал схожие темы: у организации MiniCPM есть проект AgentCPM-GUI от января 2026 года, так что это направление, в которое вошли обе лаборатории.
MiniCPM-V 4.7 — это openbmb/MiniCPM-V-4.7-35B-A3B, 35 212 875 824 параметра BF16, занимающие 70,4 ГБ и разделенные на шестнадцать шардов, загруженные 6 октября 2026 года.
Разреженный MoE текстовый бэкбон с тегом qwen3_5_moe_text — 256 экспертов, 8 на токен — поверх 40 слоев со схемой внимания «три линейных на один полный», 27-слойная собственная визуальная башня с 16-кратным уменьшением дискретизации (downsampling) и до девяти срезов изображений, а также контекстное окно на 256K. Отсутствует README, а следовательно — нет лицензии и бенчмарков. Три лайка, ноль скачиваний, пустые обсуждения.
Сравнение с оставшимися пробелами
• Назначение — UI-Venus 2.9B: GUI-агент, обученный «от конца до конца» (end-to-end) для взаимодействия с интерфейсом. MiniCPM-V 4.7: универсальная модель «зрение-язык»; на что именно она оптимизирована, не указано.
• Параметры — UI-Venus 2.9B: 9,41B, плотная. MiniCPM-V 4.7: 35,2B общих, разреженная, 8 из 256 экспертов на токен.
• Базовая модель — UI-Venus 2.9B: инициализирована из Qwen3.5-9B, плотного текстового стека Qwen. MiniCPM-V 4.7: текстовый стек MoE, производный от Qwen3.5, класс qwen3_5_moe_text. Разные ветви одного семейного древа.
• Позиционирование в интерфейсе (grounding) — UI-Venus 2.9B: ключевая компетенция, с выделенными семействами задач grounding и CAPTCHA при обучении и системой верификации на основе ключевых точек с использованием голосования нескольких моделей. MiniCPM-V 4.7: нет заявлений о специфике позиционирования и не задокументирован формат вывода координат.
• Оценка безопасности — UI-Venus 2.9B: сообщает об ASR в 11,3% на OSHarm и 48,8% на OSBlind. MiniCPM-V 4.7: отсутствует.
• Доказательная база — UI-Venus 2.9B: технический отчет на arXiv, страница проекта, репозиторий на GitHub и таблицы бенчмарков. MiniCPM-V 4.7: файл конфигурации.
• Инструментарий — UI-Venus 2.9B: быстрый старт в vLLM с флагом парсера рассуждений, плюс конвертации GGUF от сообщества. MiniCPM-V 4.7: пока ничего.
Почему GUI-агент — это не просто «VLM, которая смотрит на экраны»
Разрыв между этими двумя моделями заключается не столько в количестве параметров, и это стоит проговорить подробно, так как именно это делает данное сопоставление интересным, а не просто неравным.
У задачи со скриншотом есть свойство, которого нет у большинства визуальных бенчмарков: вывод должен быть исполняемым. Когда UI-Venus 2.9B просят нажать на кнопку, она должна выдать координаты или структурированное действие, которое среда действительно может применить, и небольшая ошибка в позиционировании — это не просто неправильный ответ в таблице лидеров, это проваленная задача и поврежденное состояние. Именно поэтому карточка UI-Venus 2 уделяет столько внимания верификации: завершение задачи оценивается по релевантным для задачи визуальным ключевым точкам, а не по общему взгляду на финальный экран, а разнородные судьи голосуют, чтобы снизить предвзятость одного судьи. Смысл этого механизма заключается в том, чтобы сделать сигнал вознаграждения при обучении с подкреплением устойчивым к хакерству вознаграждения (reward hacking) — когда модель учится удовлетворять ленивого верификатора, а не выполнять задачу.
Это также объясняет раздел безопасности.
Агент, способный управлять телефоном или ПК, имеет поверхность атаки, которой у модели описания изображений (captioning) нет, и публикация процента успешных атак — это минимум, который должна сделать лаборатория при выпуске такого продукта. UI-Venus 2.9B сообщает об 11,3% на OSHarm и 48,8% на OSBlind — вторая цифра высока в абсолютном выражении, и формулировка в карточке представляет собой сравнение с базовой моделью, а не абсолютное утверждение о надежности. Воспринимайте это как «значимо лучше, чем в начале», а не как «безопасно».
Архитектура MiniCPM-V 4.7 ничего не говорит ни о чем из этого. Линейное внимание на длинном контексте помогло бы агенту, которому нужно помнить длинную историю взаимодействия, а разреженная MoE помогла бы пропускной способности при запуске множества эпизодов. Но архитектура, которая была бы полезна для агента, не делает модель агентом, и ни одна часть выпущенного артефакта не документирует вывод действий, точность позиционирования или поведение с точки зрения безопасности.
Честная оценка со стороны MiniCPM
Возникает искушение заполнить этот раздел цифрами версии 4.6. Сопротивляйтесь этому. MiniCPM-V 4.6 — это плотная модель на 1,3B на базе Qwen3.5-0.8B с переключаемой схемой визуального сжатия 4x/16x, и ее заявленные результаты — балл 13 в индексе интеллекта Artificial Analysis (заявленный разработчиком) при доле затрат на токены сравнимых малых моделей — описывают именно ту модель. MiniCPM-V 4.7 меняет бэкбон, меняет шаблон внимания и меняет стандартное визуальное сжатие. Ни один из результатов 4.6 не переносится на новую модель, и ни один из них изначально не описывает GUI-агента.
То, что можно честно сказать о MiniCPM-V 4.7, ограничено и фактологично: веса существуют, форма необычна для семейства, контекстное окно длинное, а релиз неполный. Отсутствие лицензии является практическим препятствием; отсутствие бенчмарков — оценочным. И есть одна скромная причина для интереса, а не равнодушия — OpenBMB создает GUI-инструменты, включая AgentCPM-GUI, поэтому появление длинноконтекстной разреженной MoE-модели зрения от этой лаборатории не выглядит неправдоподобным в качестве будущего бэкбона для агентов. Это гипотеза о намерениях, и репозиторий ее не подтверждает.
Что бы вы выбрали и когда
Для всего, что связано со скриншотами и действиями — нажатиями, вводом текста, прокруткой, навигацией по приложению или веб-сайту, извлечением данных из интерфейса — UI-Venus 2.9B является единственной из двух моделей, которая справляется с этой задачей. У нее есть обучение, механизмы верификации, заявленные показатели безопасности и достаточно инструментов, чтобы запустить ее на vLLM уже сегодня. В MiniCPM-V 4.7 нет ничего, что указывало бы на конкуренцию в этой области, а без технического описания (card) вы даже не сможете проверить, выдает ли она координаты.
Для общих мультимодальных задач — описания изображений, чтения документов, анализа длинного контекста в материалах с большим количеством изображений — сравнение пока невозможно, поскольку у одной из сторон нет опубликованных данных о качестве. Если вам это нужно сегодня, UI-Venus 2.9B по крайней мере поддается оценке, хотя она была настроена для интерфейсов, а не для логического анализа документов, и также не является очевидным первым выбором для этой работы.
Модель поведения в обоих случаях одинакова: локально размещенная модель, которая выполняет рутинную работу, и облачная пограничная модель для сложных случаев, которые передаются ей. Именно на этапе такой передачи маршрутизатор оправдывает свое существование — один ключ для более чем 200 облачных моделей, каждая из которых предоставляется по цене провайдера без нашей наценки, с автоматическим переключением при сбоях у провайдера. Ни UI-Venus 2.9B, ни MiniCPM-V 4.7 не размещены на OrcaRouter; обе представляют собой веса, которые вы запускаете самостоятельно. Маршрутизатор — это то, к чему обращается ваш агент, когда решает, что локальной модели недостаточно.
К чему это вас приводит
Это не сложный выбор, и причина здесь структурная, а не оценочная в плане качества. UI-Venus 2.9B — это специализированное решение с отчетом, лицензией, таблицами бенчмарков, оценкой безопасности и инструкцией по развертыванию. MiniCPM-V 4.7 — это универсальное решение с конфигурационным файлом. Одно из них — продукт, а другое — обещание, и единственный ответственный способ сравнить их — сказать об этом прямо. Следите за репозиторием: если OpenBMB опубликует описание, демонстрирующее привязку к интерфейсу и вывод действий, то сравнение разреженной MoE с контекстом 256K и дистиллированного агента 9B станет по-настоящему интересным вопросом. А пока ответ на вопрос «что мне использовать» — то, что уже существует.










