RSI-Jev — это сторонний исследовательский проект с открытым исходным кодом, который создает модели принятия решений «Системы 1» в стиле Jev. Модель, о которой идет речь на этой странице, — это релиз 4B, RSI-Jev v6.0-VL от 6 октября 2026 года. Автором является Шанхуа Гао (@gasvn), при этом в разделе благодарностей репозитория указан Суфиан (@SufianTA). Проект не имеет отношения к Jev от TypeSafe и не связан с TypeSafe AI — об этом прямо говорится в лицензионном соглашении проекта. Идея, лежащая в его основе, достаточно узка, чтобы описать её одним предложением: задайте типизированный вопрос о документе, чате или изображении (да/нет, выбор одного из k, оценка по рубрике) — и один прямой проход вернет откалиброванную вероятность для каждого варианта. Ничего не генерируется, поэтому нет необходимости тратить токены на рассуждения, и они не тратятся. v6.0-VL — не первый релиз проекта; это седьмой релиз за двенадцать дней, и это самое важное, что нужно понимать, поскольку полезная информация здесь заключается в динамике развития, а не в каком-то одном чекпоинте.
Прежде чем приводить какие-либо цифры, необходимо сказать одну вещь, так как она делает их устаревшими. v6.0-VL была актуальной версией ровно один день. 7 октября 2026 года в 07:56 UTC — сегодня утром — проект опубликовал RSI-Jev v6.1-VL. Это усредненная версия v6.0-VL (вес 0,5 для каждой) с дополнительной дообученной моделью Qwen3.5-4B-Base на других данных, которая набрала 50,98 балла в наборе Decision Index 0.3 против 46,23 балла у v6.0-VL на том же наборе. После усреднения обучение не проводилось. Её калибровка хуже, чем у v6.0-VL, о чем прямо сказано в карточке модели. Этот релиз реален и актуален; данная страница не о нем. Все цифры ниже взяты из записи о релизе v6.0-VL от 6 октября 2026 года, и там, где показатели изменились (количество релизов, количество экспериментов), на этой странице приводятся как данные для v6.0-VL, так и текущие показатели.
Также стоит сразу прояснить, чем RSI-Jev не является, поскольку два из трех очевидных предположений неверны. Это не хостируемый продукт, который можно использовать сегодня через общий API, и он не обслуживается через OrcaRouter — в нашем каталоге нет идентификатора rsi-jev, идентификатора shgao или карточки модели для него. Единственное, что у нас есть, — это модель, чей HTTP-контракт копирует данный проект: коммерческая Jev от TypeSafe, которую мы предоставляем как typesafe/jev-1.13 на эндпоинте systemone. Одну из этих двух вы вызываете, а другую скачиваете и обслуживаете самостоятельно. Все нижеизложенное взято из собственного репозитория проекта, карточек релизов и документации по обслуживанию, прочитанных 7 октября 2026 года, и там, где число является собственным показателем проекта, а не сторонним измерением, на этой странице указано, чье оно.
Что на самом деле делает эта система
Проект описывает себя одной строкой как «рекурсивно самоулучшающуюся исследовательскую систему, которая создает модели принятия решений «Системы 1» в стиле Jev», а создаваемые ею артефакты являются решателями, а не генераторами. Вы передаете ей состояние — документ, транскрипт чата, транзакцию, а в версиях с поддержкой зрения до четырех изображений — и один или несколько типизированных вопросов с заданными критериями. Для каждого вопроса она возвращает вероятность для каждого варианта. Три типа вопросов покрывают все пространство, и именно они определены API TypeSafe:
• noul — суждение «истина/ложь», возвращаемое как единая вероятность, без распределения и значения уверенности, точно соответствующее формату ответа эталона.
• choice — выбор одного из набора помеченных вариантов, возвращаемый с полным распределением вероятностей и статистикой уверенности.
• score — оценка по упорядоченной рубрике, возвращаемая как взвешенный по вероятности индекс уровней (начиная с нуля), плюс легенда и распределение.
Поскольку этап генерации отсутствует, нет второго вызова модели и нет сэмплирования. Решение по документу, который модель уже прочитала, по своей конструкции является дешевой операцией, а собственная оценка стоимости проекта — «около 10 мс» — относится к его эпохе 2B, а не к текущему релизу; измеренные показатели для v6.0-VL приведены ниже.
Два факта о владении важны больше, чем что-либо другое на этой странице. RSI-Jev — это не работа TypeSafe, и TypeSafe не одобряла её. Лицензионная строка в полном виде: «Код: MIT. Веса: Apache-2.0, следуя базовой модели; некоторые источники обучения на изображениях являются некоммерческими, перечислены в каждой карточке модели. Не связано с TypeSafe AI». Отношения односторонние: проект намеренно копирует формат передачи данных Jev и открыто заявляет об этом, потому что совместимый сервер — это и есть цель. «В стиле Jev» — это собственная фраза проекта для описания типа модели, которую он строит. Jev от TypeSafe — это другая, закрытая коммерческая модель, и они не являются одним и тем же под более коротким названием.
Внутри текущей модели: башня Qwen 4B с тремя выходами
RSI-Jev v6.0-VL — это башня Qwen3.5-4B-Base с дообученной башней и обученной «головой» принятия решений сверху. Это вся архитектура — здесь нет смеси экспертов, нет маршрутизатора и нет второй модели. Она запускает всю базовую модель целиком, поэтому количество её параметров составляет 4,69 млрд, а не меньше: 3,57 млрд приходится на 32 слоя декодера, 0,64 млрд на эмбеддинги токенов, 0,33 млрд на визуальную башню, 0,05 млрд на основную «голову» принятия решений и 0,10 млрд на две «головы» раннего выхода. Выпущенный чекпоинт является автономным и занимает 9,7 ГБ в формате bf16.
Прикреплены три «головы» принятия решений на 16, 20 и 32 слоях базы, и именно они являются механизмом, стоящим за всем, чем известен текущий релиз. Четвертый выход на 12-м слое был создан, измерен и отброшен — «Выход 12-го слоя проигрывал каскаду с 16-го в каждом сравнении и не включен в пакет» — поэтому три поставляются, а четыре — нет. Выходы считывают отдельную копию своего слоя, деталь, которую проект обнаружил на горьком опыте: перенастройка «голов» на стволе, чьи выходы были прикреплены во время обучения, не восстановила точность глубоких слоев, поэтому именно их отсоединение восстановило глубину.
Одно число здесь — самый простой способ неправильно понять проект. Все версии до v3.0 включительно были моделями 2B на базе Qwen3.5-2B-Base, и это родословная, а не текущая модель. v4.0-VL была 2B, v5.0-VL сократила модель до 3B, а v6.0-VL — это 4B. Страница, которая называет текущую модель RSI-Jev 2B, отстает от реальности на три релиза.
Цикл — это и есть настоящий проект
Модели — это результат; то, что строится, — это процесс. Проект заявляет, что «цикл, управляющий исследованием, — это следующая версия AutoScientists», системы самоорганизующихся команд агентов, опубликованной лабораторией Zitnik в Гарварде, и она работает так, как подразумевает это предложение. ИИ-агенты предлагают гипотезы, регистрируют свои прогнозы перед тем, как тратить время GPU, проводят эксперименты и отправляют в отставку своих собственных чемпионов, когда доказательства говорят об этом. Два показателя делают это конкретным. По состоянию на 7 октября 2026 года заголовок репозитория гласит о восьми релизах за тринадцать дней, от v1.0 до v6.1-VL; для релиза v6.0-VL от 6 октября 2026 года это было семь релизов за двенадцать дней, каждый из которых был обучен, оценен и задокументирован циклом. А количество экспериментов, которое составляло 471 на момент выхода релиза на этой странице, сегодня равно 496 — каждый из них описан, включая неудачи. Оба показателя являются собственными данными проекта, и оба они меняются.
Именно дисциплина придает этим цифрам смысл, и проект четко их фиксирует. Нулевые уровни (null floors) измеряются, а не предполагаются — это ветви, которые доказуемо идентичны контрольной группе, что проверяется по идентичности объектов еще до затрат времени GPU, поэтому разброс между ними является уровнем шума, а разница, меньшая этого разброса, не считается результатом. Прогнозы регистрируются до запуска, поэтому версия, не дотянувшая до собственной планки, выпускается как неудачная, а не подвергается тихой переработке. Артефакты проверяются: контрольная точка перезагружается с диска, повторно оценивается и публикуется только в том случае, если она воспроизводит прогнозы по каждому вопросу из своего обучающего прогона, что обе контрольные точки v1.0 делают с точностью 1.0000. Загрязнение данных «проверяется, а не декларируется». И неудачные результаты также публикуются, включая те, что привели к краху собственного чемпиона проекта.
Что такое вклад, согласно собственным словам проекта из руководства для участников: «Вклад здесь — это обычно измерение, а не патч». Выпущенная запись хранится как цепочка, а не как моментальный снимок — «versions/ хранит по одной карточке на каждый релиз, все они остаются в основной ветке навсегда… Эта цепочка И ЕСТЬ проект» — именно поэтому цифры старого релиза можно сверить с тем, что проект говорит о них позже, и почему единственная поправка, обсуждаемая ниже, видна, а не скрыта.
Что изменилось в v6.0-VL: она расходует глубину вместо токенов
Механизм текущего релиза — это настройка под названием effort (усилие), и она управляет необычным параметром: сколько слоев модели разрешено использовать запросу. Поскольку «головы» (heads) расположены на трех уровнях глубины, на простой вопрос можно ответить на 16-м слое, а на сложный — задействовать все 32. low останавливается на 16-м слое, medium — на 20-м, high — на 32-м, а auto отвечает на первом выходе, чья откалиброванная вероятность превышает порог этого выхода. Медианная задержка на запрос по выборке Decision Index, измеренная на одном H200 в формате bf16: 23 мс для low, 27 мс для medium, 40 мс для high и 40 мс для неустановленного значения по умолчанию. Это собственные измерения проекта на его собственном оборудовании, и их не следует смешивать с цифрами GB10 из документации по обслуживанию, так как это другая машина.
Измеренное поведение auto — самая интересная часть: на наборе из пятнадцати бенчмарков проекта 20% вопросов останавливаются на 16-м слое, 46% — на 20-м, и 34% доходят до 32-го, что в среднем составляет 23,3 из 32 слоев. Один фиксированный порог дает в среднем 20,9, и избыточная остановка — это то, чем вы платите за использование одного порога. auto не является компромиссом в качестве, что стоит отметить, поскольку именно этим обычно и являются адаптивные настройки: он показывает лучший результат в наборе тестов среди всех настроек (0,771 против 0,770 для значения по умолчанию), лучший результат в MMLU-Pro (0,444 против 0,440) и лучшую итоговую калибровку (ECE 0,024 против 0,036). Единственное место, где выигрывает high — это отложенная выборка (held-out set): 0,702 против 0,696 у auto. Некоторые задачи заметно ухудшаются с увеличением глубины — BANKING77 на 0,035, сопоставление подписей New Yorker на 0,060 — поэтому уровень effort — это выбор, который делает вызывающая сторона, а не правило, навязываемое сервером.
Результат, который сделал это релизом, а не экспериментом, находится в публичном Decision Index 0.2.1 проекта, где оценка выросла с 38,38 для v5.0-VL до 46,24 для v6.0-VL за один релиз. На публичной доске от 2026-09-28 это самый высокий балл среди моделей 4B и меньше, и 14-е место из 71 в общем зачете; следующая запись такого размера — JPT-4B с 43,04. Более ранние релизы в этой линейке являются историей, а не текущей моделью: v5.0-VL (2026-10-02) сократила модель до первых 20 из 32 слоев и заставила ее отвечать «unknown», когда у вопроса нет ответа; v4.0-VL (2026-10-01) была первой, которая распознает изображения; а v3.0 (2026-09-28) — это релиз, где обучение с подкреплением впервые помогло через награду за ранжирование списков — NDCG@5 по 16 кандидатам — что подняло R@1 переранжирования с 0,192 до 0,308 по сравнению с ее контролируемым родителем при затратах 0,0028 на наборе тестов. Именно с этого начинается история RL в проекте, и это было три релиза назад.
Цифры и сопутствующие им оговорки
Заголовок Decision Index 0.2.1 для v6.0-VL составляет 46,24 по результатам полного прогона, в котором были даны ответы на все 150 759 запросов набора: знания 28,8, язык 46,2, поиск 55,5, инструменты 65,8, искусство 37,1. Набор из пятнадцати бенчмарков показывает 0,770, отложенная выборка — 0,698, MMLU-Pro — 0,440, и итоговый ECE — 0,024 с auto. Две оговорки должны идти в одном ряду с этими цифрами, потому что без них они вводят в заблуждение.
Первая — это сокращение набора тестов. Внутренняя задача набора open_jev_ood пересекалась с 579 строками обучения, поэтому ее показатель был завышен на неизвестную величину; начиная с v6.0-VL проект сообщает о наборе без нее, с результатом 0,770. Показатель 0,764 у v5.0-VL был с ней, и в карточке v6.0-VL этот релиз пересчитан как 0,763 без нее. Эти две цифры несопоставимы, и если вы их сравниваете, вы должны использовать пересчитанное значение 0,763 и указать, что именно вы делаете. Отложенная выборка, MMLU-Pro и BBH не имеют пересечений и не затронуты. Связанный с этим аудит обнаружил около 1000 элементов тестовых строк набора Decision Index в обучающих корпусах — ANLI 274, RouterBench-GSM8K 90, ARC 5 и текст запросов BRIGHT/ToolRet без меток, примерно 0,3% строк набора — и повторная оценка без них меняет индекс максимум на 0,04 на выборке проекта. Это поправка к записи v5.0-VL, опубликованная в карточке v6.0-VL, и это собственное правило проекта о загрязнении данных, которое стоило ему части результата.
Вторая — это то, чей это бенчмарк. Decision Index — это собственная публичная доска RSI-Jev, а не вердикт третьей стороны, и 46,24 — это балл именно на этой доске. Он не сопоставим ни с чем, что публиковала TypeSafe, потому что эти две цифры получены не из одной и той же системы, и никто не проводил независимое прямое сравнение между RSI-Jev и Jev 1.13. Можно сказать лишь о структурных, а не числовых различиях: одно — это размещенная коммерческая модель на эндпоинте вендора, а другое — контрольная точка, которую вы скачиваете и обслуживаете самостоятельно.
Два дополнительных контекстных момента относятся к этому набору. Проект прямо заявляет, что «десять из пятнадцати бенчмарков в той или иной форме содержат обучающие данные, поэтому ни одна из этих цифр не является zero-shot»; отложенная выборка — это сравнение, которое действительно отложено, и даже оно «отложено от обучения, а не изолировано от поиска». И v6.0-VL выполнила 97 прогонов в своей собственной линейке — 93, если исключить четыре аудита данных — что является масштабом поиска, который привел к скачку на 7,86 пункта в этом индексе.
Он поддерживает формат передачи данных Jev, с четырьмя отличиями, о которых должен знать вызывающий
Поверхность совместимости — причина, по которой этот проект существует в таком виде. Та же форма запроса ({state, model, questions}), те же три типа вопросов с теми же формами критериев, те же формы ответов, от 1 до 64 вопросов на запрос, те же конверты ошибок и та же статистика достоверности — пик, (K · p_max − 1) / (K − 1), ограниченный диапазоном 0..1. Собственное утверждение проекта об этой поверхности гласит, что «все, что написано для Jev, работает с этим без изменений», и сервер документирует, что скопировано, а что нет, что полезнее, чем само утверждение.
• Промпт и вывод являются уникальными для модели. RSI-Jev — это базовая модель с обученной головой вывода, которая работает с тем же энкодером, с которым она была обучена, поскольку использование промпта эталонной модели «вывело бы модель за пределы ее обучающего распределения». Контракт взаимодействия — это поверхность совместимости, а промпт — нет.
• Ключи опций видны модели. Эталонная модель скрывает их, поэтому переименование ключа заведомо не может изменить ответ в ней. Здесь это возможно, и сервер честно сообщает об этом через option_keys_visible_to_model: true.
• Критерии должны быть строками или null. Структурированный критерий (объект) отклоняется с ошибкой 422, поскольку ни один релиз не обучался на таком формате. Это единственный случай, когда запрос, принимаемый эталонной моделью, здесь не сработает.
• Ничего не обрезается. Обслуживание запроса поддерживает до 32 768 текстовых токенов плюс бюджет изображений, а более длинный запрос отклоняется с ошибкой 422 с соответствующим уведомлением, вместо того чтобы быть молча усеченным. Цифра в 2048 токенов, которая встречается в старых карточках, — это длина, на которой обучались модели, а не ограничение при обслуживании, и описание молчаливого усечения до 2048 токенов как текущего поведения является неверным.
Количество опций значительно выше в пользу обслуживаемой модели: до 5120 опций на вопрос (RSIJEV_MAX_ANSWERS) против 160 при обучении и 64, допускаемых эталонной моделью. Не указывайте 160 как ограничение при обслуживании. В ответах v6.0-VL появилось одно нововведение, а не унаследованная функция: каждый ответ сообщает, какой слой ответил (в usage.depth), наряду с откалиброванной уверенностью, чтобы адаптивное решение можно было проверить постфактум. Изображения — это расширение, которого нет в эталонной модели: от одного до четырех на запрос в виде base64 data URL, где состояние ссылается на каждое из них с помощью литерального маркера.
Где читатель может запустить это, а где нет
RSI-Jev распространяется как загружаемый файл. Проект поставляет собственный сервер, который поддерживает Jev-совместимый API, а документированный путь — это pip install из репозитория с последующей командой serve с псевдонимом чекпоинта и параметром усилий. Веса размещены на Hugging Face под организацией shgao и выпущены под лицензией Apache-2.0 вслед за базовой моделью, с одним открытым вопросом, который проект признает сам: пять источников обучающих изображений являются некоммерческими или предназначены только для исследований, и «вопрос о том, наследуют ли веса, обученные на некоммерческих данных, эти условия, остается нерешенным». Код распространяется под лицензией MIT.
Оборудование не является ограничением. Проект разрабатывается на HP ZGX Nano, машине NVIDIA GB10, которую проект отмечает в заслугах HP и NVIDIA, а сервер работает на любом CUDA GPU, на Apple Silicon или на обычном CPU — последний, согласно документации, обрабатывает один вопрос за 733 мс на собственном Arm CPU машины GB10, что делает его скорее пригодным для использования, чем быстрым.
Чего он не делает, так это не появляется в общем каталоге моделей, и здесь мы должны быть точны в отношении нашей собственной позиции. RSI-Jev нет в OrcaRouter, и для него нет карточки модели, на которую можно было бы перенаправить запрос. То, что мы обслуживаем, — это коммерческая модель Jev от TypeSafe, typesafe/jev-1.13, на выделенном эндпоинте systemone, доступном через POST-запрос к /v1/systemone, а не через формат OpenAI chat-completions — это те же форматы запросов и ответов, которые реализует данный проект, от модели, контракт которой он копирует. Это и есть вся суть отношений: они говорят на одном протоколе, мы обслуживаем одну из них, а вы запускаете другую самостоятельно. Если у вас уже есть ключ у нас, формат вызова Jev 1.13 является первоклассным маршрутом в одном API для более чем 200 моделей с 0% наценкой (цена поставщика передается напрямую, поэтому снижение цен поставщиком вступает в силу в тот же день) — что важно для сравнения в одном конкретном аспекте. Страницу вроде этой недорого использовать, если вы можете сначала попробовать коммерческий контракт и только потом решить, стоит ли запуск открытого чекпоинта на 4B параметров операционных усилий.
Как читать RSI-Jev по состоянию на 2026-10-07
Слабые стороны, которые публикует проект, так же конкретны, как и его результаты, и даты имеют значение. Внешнее тестирование v2.1 показало, что модель склоняется к более строгим или дорогим вариантам при упорядоченном выборе и оценках по рубрикам, редко выбирает «неизвестно», когда документ не может дать ответ, и отвечает на вопрос и его отрицание противоречиво. Более поздние релизы были направлены на работу с данными для случая «неизвестно» — KoBBQ unknown-when-ambiguous показал 0.891 в v4.0-VL, 0.932 в v5.0-VL и 0.918 / 0.939 в v6.0-VL — и в карточке v6.0-VL откровенно говорится, что прирост был достигнут за счет данных, а не глубины, и что 10% вопросов, которые должны были уйти на 32-й слой, но остановились на 16-м или 20-м, — это те случаи, где политика глубины все еще угадывает. Переранжированию еще есть куда расти: собственный порядок поиска hippo-memory имеет показатель 0.484 R@1 и остается впереди 0.308, достигнутых моделью в v3.0, — цифра, которую проект с тех пор не заявлял как превзойденную. Доказательства RL основаны на одном сиде, а v3.0 «сама по себе не имеет соответствующего контроля SFT». Обучающие корпуса и наборы для разработки политики не являются публичными, поэтому этапы нельзя повторить только на основе репозитория, а построитель корпуса для переранжирования — около 96 ГБ памяти — не был перезапущен от начала до конца.
Тракция, прочитанная в тот же день: 73 звезды, 5 форков, 0 открытых проблем, 7 релизов на GitHub. Эти показатели меняются ежедневно, и репозиторию, которому три недели, не является устоявшимся проектом, независимо от частоты его релизов. Честное резюме заключается в том, что RSI-Jev — одна из наиболее понятных исследовательских работ в этом сегменте — цепочка датированных, измеренных, иногда неудачных релизов с поиском, опубликованным наряду с оценками, — и одна из наименее независимо проверенных, поскольку почти каждая цифра на этой странице является уникальной для проекта, и ни одна внешняя сторона не сравнивала ее с коммерческой моделью, с которой она совместима.
За чем стоит следить, так это не за следующим релизом, потому что при такой частоте он будет через несколько дней; стоит следить за тем, начнет ли кто-то вне проекта проводить измерения. Две вещи, которые изменили бы картину, — это независимый бенчмарк, запущенный на опубликованных чекпоинтах, и сравнение моделей принятия решений, которое пропустит через один набор тестов как открытую модель 4B, так и хостинговую модель TypeSafe. Ни того, ни другого сегодня не существует. Пока этого нет, полезный способ интерпретации оценки, такой как 46.24, — это хорошо задокументированное утверждение от проекта, который заранее регистрирует свои прогнозы и поставляет инструменты, которые не сработали, — что является более сильным доказательством, чем у большинства, но все еще не является сторонним результатом.










