Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Nv reason ct protiv qwen38 max doobuchennaya model i semeystvo iz kotorogo ona p
Dev48

© 2026 · All rights reserved.

NV-Reason-CT против Qwen3.8 Max: дообученная модель и семейство, из которого она происходит

Источник: OrcaRouter

NV-Reason-CT против Qwen3.8 Max: дообученная модель и семейство, из которого она происходит

Источник: OrcaRouter

NV-Reason-CT представляет собой дообученную версию Qwen/Qwen3.5-4B. Что может дать специализированная модель на 4B параметров из того, чего не может флагман Alibaba на 1 млн токенов, и в чем её ограничения.

25 сентября 2026 г.

Первая строка карточки модели NV-Reason-CT говорит о том, что большинство читателей упускают из виду. Базовой моделью является Qwen/Qwen3.5-4B, указанная в метаданных репозитория как связь путем дообучения. Таким образом, когда NVIDIA понадобилась языковая модель, к которой можно было бы прикрутить 3D-видеотрансформер Primus, она взяла Qwen. Сравните этот чекпоинт с Qwen3.8 Max — собственным флагманом Alibaba на 1 000 000 токенов, выпущенным 3 августа 2026 года, и вы увидите дообученную модель и семейный бизнес. С одной стороны, это специалист на 4,69 млрд параметров, который анализирует КТ-сканы грудной и брюшной полостей и был опубликован на Hugging Face 8 сентября 2026 года без каких-либо анонсов. С другой — общий флагман с возможностью ввода текста, изображений и видео, опубликованным прайс-листом и 37,2 миллионами токенов измеренного трафика в нашей сети за последнюю неделю. Самый интересный вопрос заключается не в том, кто победит. Вопрос в том, что может сделать дообученная модель на 4B, чего не может флагман её семейства, и почему ответ на него оказывается более конкретным, чем можно было ожидать.

Что конкретно дало дообучение

Собственная формулировка пробела от NVIDIA необычно точна, и это самое полезное предложение в репозитории: большинство зрительно-языковых систем «либо работают с 2D-изображениями, либо сжимают объемные признаки перед декодированием текста». Это описание целого класса моделей, и оно включает в себя каждый общий мультимодальный флагман на рынке.

Решение носит скорее архитектурный характер, нежели вопрос масштаба. Входной объем данных размером 384×384×384 мм преобразуется в сетку 24×24×24 из 13 824 визуальных токенов. Эти токены и их трехмерные координаты поступают в языковую модель без пространственного понижения дискретизации, а 3D MRoPE сохраняет пространственные отношения внутри декодера. Входные объемы подвергаются анатомически-осмысленному кроппингу до грудной или брюшной полости с использованием единиц Хаунсфилда, а затем ресэмплируются до изотропного разрешения 2 мм.

Сопоставьте это с тем, что принимает Qwen3.8 Max. Текст, изображения и видео. Причем видео — это самое близкое в данной серии к объемным данным, что делает его честной точкой для сравнения, а не риторическим приемом. Видео представляет собой набор 2D-кадров, упорядоченных по времени. Объем КТ — это набор 2D-срезов, упорядоченных по физическому положению вдоль оси z, в единицах Хаунсфилда, с известным расстоянием в миллиметрах. Оба являются трехмерными массивами. И только один из них имеет физическую систему координат, к которой можно привязать заключение рентгенолога, и только один из них измеряется в единицах, имеющих значение за пределами датчика изображения. Модель, обученная на видео, изучает временную непрерывность. Модель, обученная на КТ-сканах, узнает, что опухоль на одном срезе — это та же самая опухоль на следующем срезе на восемь миллиметров ниже.

Обучающий корпус — это главное отличие

Именно здесь две модели перестают быть сопоставимыми вообще, и это та часть, которую спецификация скрывает.

NV-Reason-CT обучалась сквозным образом (end-to-end) с помощью контролируемого дообучения (SFT), за которым следовала оптимизация по групповым относительным предпочтениям (GRPO) примерно на 550 000 структурированных примерах вопрос-ответ, полученных из 70 111 уникальных КТ-сканов. Источниками являются CT-RATE (47 149 случаев из больницы Стамбульского университета Медипол Мега с парными радиологическими отчетами), внутренний набор NIH из 15 991 случая и 22 720 случаев от CancerVerse по четырем фазам контрастирования и тринадцати типам злокачественных опухолей. Корпус включает в себя стандартизированные отчеты, вопросы и ответы, сфокусированные на патологиях, многодиалоговый диалог и рассуждения авторства радиологов, расшифрованные из записанных экспертных интерпретаций. Этап GRPO использует проверяемые вознаграждения для наборов аномалий грудной и брюшной полостей, что означает, что сигнал вознаграждения проверяет, присутствует ли заявленная находка в скане, а не то, звучит ли текст клинически.

Обучающий корпус Qwen3.8 Max не опубликован с такой детальностью, да это бы и не помогло, поскольку целевая возможность является общей. Вместо этого соответствующим доказательством являются показатели Artificial Analysis: индекс интеллекта 45,4 (15-е место из 145 моделей в срезе нашего API), AA Coding 76.2 (9-е место), Terminal-Bench 2.1 — 88.8, GPQA Diamond — 92.8, Humanity's Last Exam — 43.1, SciCode — 52.1 и полноконтекстный поиск — 80.3. Это сторонние измерения, а не заявления производителей, что делает их самыми надежными цифрами по обе стороны этой страницы.

Вывод рассуждений, два разных контракта

Обе модели выдают цепочки рассуждений, и обе позволяют их отключать. На этом сходство заканчивается на уровне интерфейса.

Qwen3.8 Max предоставляет параметры enable_thinking и reasoning_effort, а также полный набор для семплирования: temperature, top_p, seed, пенальти, структурированный вывод, вызов инструментов. Это универсальные возможности рассуждения, которые вы применяете к любой имеющейся у вас задаче. Его процесс мышления хорош ровно настолько, насколько хороша предложенная вами задача, и у него нет способа проверить утверждение ни по чему, кроме предоставленного ему текста.

Рассуждения NV-Reason-CT имеют более узкий контракт с читателем, и карточка модели прямо заявляет об ограничении: сгенерированные рассуждения являются «проверяемым выводом модели и не гарантируют отражение внутренних вычислений модели». Эта оговорка выполняет реальную работу, и это тот тип предложений, который появляется только тогда, когда команда подумала о том, что врач будет делать с правдоподобно звучащей цепочкой. В карточке результат описывается как проверяемые наблюдения, дифференциальные диагнозы и неопределенность. Другими словами, это цепочка, которую вы можете проверить по скану, а не та, которую можете только прочитать.

Пропускная способность по единственному доступному нам источнику измерений

За последние семь дней через собственный песочный шлюз OrcaRouter в Qwen3.8 Max прошло 37,2 миллиона токенов. Медианное время до первого токена составило 1,96 секунды (безоговорочно самый быстрый результат среди моделей этой серии) при скорости 53,3 токена вывода в секунду. Уровень ошибок за этот период составил 3,5%.

Эти два показателя тянут в противоположные стороны, и оба важны. Задержка превосходна и делает работу с моделью удобной. Уровень ошибок примерно в семнадцать раз выше, чем у Kimi K3 (0,21% за тот же период), и именно этот показатель определяет, станете ли вы использовать её для синхронных запросов пользователей или для пакетных заданий с повторными попытками. Это измеренное поведение в нашей сети, а не бенчмарк, и это как раз то, о чем прайс-лист никогда не расскажет.

Для NV-Reason-CT не существует эквивалентных измерений нигде. Это чекпоинт BF16 размером 10,6 ГБ с кастомным кодом модели, загружаемый с параметром trust_remote_code=True на оборудовании Ampere, Hopper или Lovelace, протестированный NVIDIA на H100 и L40S. Никаких значений p50, уровня ошибок или пропускной способности не опубликовано. Любой, кто говорит вам, при каком объеме запросов самохостинг оказывается выгоднее оплаты за токены, просто гадает.

Цена и характеристики лицом к лицу

• Цена — Капитальные затраты на GPU для NV-Reason-CT, нет платы за токен против $2.00 / $6.00 за миллион токенов для Qwen3.8 Max, $0.25 за кэшированное чтение, $2.50 за запись в кэш

• Входные данные — 3D NIfTI КТ-сканы в единицах Хаунсфилда (только грудная или брюшная полость) для NV-Reason-CT против текста, изображений и видео для Qwen3.8 Max

• Контекст — Один объем, фиксированный префикс на 13 824 токена для NV-Reason-CT против 1 000 000 токенов для Qwen3.8 Max

• Параметры — 4,69B всего / 4,35B активных в КТ-пути для NV-Reason-CT против нераскрытых данных для Qwen3.8 Max

• Лицензия — OpenMDW-1.1, веса опубликованы для NV-Reason-CT против проприетарной с доступом только через API для Qwen3.8 Max

• Независимые оценки — NV-Reason-CT (нет) против Qwen3.8 Max, индекс интеллекта AA 45.4, GPQA Diamond 92.8

Экономика кэширования Qwen3.8 Max поощряет определенный сценарий: кэшированное чтение по цене $0.25 против $2.00 за свежий ввод дает восьмикратную скидку, а запись в кэш за $2.50 означает, что длинный многократно используемый префикс окупается очень быстро. Это типичная рабочая нагрузка для системного промта и протокольного документа, которые используются повторно в тысячах запросов. У NV-Reason-CT противоположный профиль затрат — практически нулевая предельная стоимость сканирования после покупки графического процессора и жесткий нижний предел в виде одного GPU, занятого бессрочно.

Совместное использование семейства

Естественная архитектура здесь (и стоит отметить, что ее никто еще не публиковал) — это дообученная модель для больших объемов и флагманская модель для всего остального. NV-Reason-CT формирует структурированное заключение; Qwen3.8 Max обрабатывает текст направления, сопоставление с протоколами, кодирование, сопроводительное письмо — те задачи с большими объемами текста, где окно в миллион токенов и восьмикратная скидка на кэш действительно оправдывают себя.

Если это ваш пайплайн, то половина его представляет собой контрольную точку, которую вы размещаете самостоятельно, а вторая половина — это токены, которые вы покупаете. И именно во второй половине маршрутизатор (роутер) делает то, чего не может эндпоинт отдельного вендора. Qwen3.8 Max предоставляется через OrcaRouter по прейскуранту Alibaba без какой-либо наценки, поэтому указанные выше цены в $2.00 / $6.00 — это именно то, что вы платите, и любое будущее изменение цен отразится на вашем счете в тот же день, а не при продлении. Автоматическое переключение при сбоях между провайдерами имеет большее значение, чем обычно, когда измеренная частота ошибок самой модели составляет 3.5% — повторная попытка, направленная на другой исправный эндпоинт, означает разницу между кратковременным сбоем и неудачным пакетом. А поскольку общая половина пайплайна представляет собой одну модель за совместимым с OpenAI эндпоинтом, охватывающим более 200 моделей, замена на что-то другое для проведения недельного эксперимента требует изменения лишь одной строки кода, а не переписывания интеграции.

Следует уточнить: NV-Reason-CT отсутствует в OrcaRouter и не появится там — это специализированный код для 3D-инференса, который вы запускаете самостоятельно. Честная версия истории интеграции заключается в том, что самостоятельно хостящийся специалист и маршрутизируемый общего назначения могут работать под одним ключом, и в этом суть всего утверждения.

Вердикт, который действительно имеет смысл

Эту пару часто пытаются сравнить в стиле «что лучше», но делать этого не стоит. Qwen3.8 Max получает высокие оценки от третьих лиц за общие способности к рассуждениям и превосходит большинство конкурентов; у NV-Reason-CT есть собственная таблица показателей по одному бенчмарку КТ и количество параметров 4.69B, которое было бы ничем примечательным в любом общем сравнении. На любом общем бенчмарке побеждает флагман, и причина в том, что общий бенчмарк — это именно то, для чего он создавался.

В единственной задаче, для которой создавался NV-Reason-CT — чтение КТ-скана грудной клетки или брюшной полости и описание того, что на нем находится, с трассировкой, которую может проверить человек — Qwen3.8 Max не является слабым конкурентом. У него нет волюметрического энкодера, поэтому его вообще нельзя запустить на исходных данных, пока кто-то предварительно не решит, как сплющить сканирование в изображения. Именно в этом решении теряется пространственная информация. В этом и заключается весь смысл 4-миллиардной дообученной модели с нативным 3D-путем и фиксированным префиксом в 13,824 токена, и именно поэтому интересная особенность этой модели кроется в компактности ее бэкбона, а не в его размере.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в НевадеПресса
Tesla

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в Неваде

Waymo быстро масштабируется. Вот что показывают данные автопарка.Пресса
Waymo

Waymo быстро масштабируется. Вот что показывают данные автопарка.

Meta опережает OpenAI на рынке потребительских ИИ-устройств, но стратегия Цукерберга пока не доказала свою эффективность
Пресса
OpenAI

Meta опережает OpenAI на рынке потребительских ИИ-устройств, но стратегия Цукерберга пока не доказала свою эффективность

Скучный ИИ: почему ваш погрузчик важнее вашего чат-бота
DataRobot

Скучный ИИ: почему ваш погрузчик важнее вашего чат-бота

Создание мультимодальных моделей для пространственного мышления
Lambda

Создание мультимодальных моделей для пространственного мышления

Генеральный директор ElevenLabs — о маржинальности, сроках IPO и предупреждении клиентов о том, что они говорят с ботомПресса
ElevenLabs

Генеральный директор ElevenLabs — о маржинальности, сроках IPO и предупреждении клиентов о том, что они говорят с ботом

Ещё от OrcaRouter

NV-Reason-CT против Grok 4.6: кто читает сканы, а кто — отчеты
OrcaRouter

NV-Reason-CT против Grok 4.6: кто читает сканы, а кто — отчеты

NV-Reason-CT против Kimi K3: 210 загрузок и 588 миллионов токенов
OrcaRouter

NV-Reason-CT против Kimi K3: 210 загрузок и 588 миллионов токенов

ChatGPT Pro Max: Что говорится в отчете на $500 и что OpenAI пока не подтвердила
OrcaRouter

ChatGPT Pro Max: Что говорится в отчете на $500 и что OpenAI пока не подтвердила

У DeepSeek V4.1 Pro нет даты выпуска — есть лишь окно, которое закрывается 30 сентября
OrcaRouter

У DeepSeek V4.1 Pro нет даты выпуска — есть лишь окно, которое закрывается 30 сентября