jinaai/jina-ocr-v1 · Hugging Face
Мы стремимся развивать и демократизировать искусственный интеллект с помощью открытого исходного кода и открытой науки.
jina-ocr-v1 - Search Foundation Models
Парсер документов «страница в Markdown» за один проход с 570 млн активных параметров
Search Foundation ModelsJina AI
Jina-OCR-v1: эффективное распознавание документов с помощью спекулятивного декодирования и плотных проверяемых наград
Мы представляем Jina-OCR-v1, модель для комплексного распознавания документов, созданную для работы на бюджетных GPU. Она сочетает в себе сжатый визуальный энкодер и 3-миллиардный декодер на основе смеси экспертов (MoE) от DeepSeek-OCR, который активирует около 570 млн параметров на токен, с головкой спекулятивного декодирования FastMTP, использующей один черновой блок рекурсивно для K=3 шагов предсказания. Жадная верификация делает декодирование без потерь. Пост-обучение объединяет выравнивание по инструкциям, дообучение на сложных документах для повышения устойчивости и GRPO с использованием плотных проверяемых наград: детерминированных формул, таблиц и структурных проверок, которые дают частичные баллы. Данные для обучения включают очищенные общедоступные корпуса и специально подготовленные синтетические страницы. При настройке динамического разрешения по умолчанию Jina-OCR-v1 набирает 91,14 балла в OmniDocBench v1.6 и 83,4 в olmOCR-Bench, достигая самой высокой пропускной способности страниц в нашем сравнении — 2,57 страницы в секунду. На бюджетном GPU, таком как NVIDIA L4, FastMTP удваивает скорость декодирования по сравнению с жадным авторегрессионным декодированием. Модель доступна публично по адресу https://huggingface.co/jinaai/jina-ocr-v1.
arXiv.orgAlejandro Barón García
Мы выпускаем jina-ocr-v1, парсер документов с 3,4 млрд параметров и около 570 млн активных параметров декодера на токен. Он набирает 91,14 балла в OmniDocBench v1.6 и 83,4 в olmOCR-Bench, а при скорости 2,57 страницы в секунду обладает самой высокой пропускной способностью среди четырнадцати протестированных нами систем. На NVIDIA L4 его головка спекулятивного декодирования почти удваивает скорость, сохраняя при этом декодирование без потерь.
Модель построена на базе сжатого визуального энкодера и декодера смеси экспертов из DeepSeek-OCR, к которым добавлены два компонента. Черновая головка FastMTP применяет один блок рекурсивно для трех шагов предсказания, поэтому количество черновых параметров не растет с глубиной. Пост-обучение проводится с использованием плотных проверяемых наград, где каждая проверка представляет собой детерминированный код, сравниваемый с эталоном, и каждая проверка оценивается. По сравнению с базовой моделью, пост-обучение добавляет 7,4 балла в olmOCR-Bench и улучшает показатели по всем столбцам OmniDocBench.
Модель и обучение
Длинные выходные данные делают распознавание документов дорогостоящим процессом. DeepSeek-OCR устранил большую часть этих затрат с помощью сжатого визуального энкодера и компактного декодера смеси экспертов, а jina-ocr-v1 унаследовала оба решения и нацелилась на оставшееся авторегрессионное «узкое место».
Вывод OCR почти детерминирован и локально структурирован, что делает его благоприятной рабочей нагрузкой для спекулятивного декодирования. Обычная конструкция предполагает одну черновую головку на каждую глубину предсказания, поэтому количество черновых параметров растет по мере того, как далеко модель заглядывает вперед. FastMTP использует один плотный блок, применяемый рекурсивно для K = 3 шагов. Верификатор жадно проверяет каждое предложение и принимает самый длинный префикс, с которым согласны черновик и верификатор, поэтому зафиксированная последовательность совпадает с жадной последовательностью верификатора, а спекуляция влияет только на скорость получения вывода.
Спецификация модели. Декодер выдает Markdown, таблицы в HTML, а формулы в LaTeX.
Данные для обучения включают общедоступные корпуса OCR, включая olmOCR-mix, FinePDFs, LightOnOCR, MMTab и UniMER, а также специально отобранные сложные источники, такие как газеты Europeana, транскрипты Библиотеки Конгресса и пенсионные архивы NARA. Фильтр на основе правил удаляет циклы дегенерации и дубликаты, а проход через визуально-языковую модель переразмечает сложные источники. Мы также синтезируем страницы по одной конкретной причине: на естественных страницах награды за формулы и таблицы применяются к очень немногим образцам, поэтому большинство прогонов не несут структурного сигнала. JinaOCRSynth наполняет каждую страницу оцениваемыми формулами и таблицами и поставляется вместе с модульными тестами.
Пост-обучение включает контролируемое выравнивание, дообучение на деградировавших страницах для повышения устойчивости и GRPO, повторяемые в циклах внешнего контура. Награда GRPO представляет собой произведение проверяемых условий, каждое из которых вычисляется детерминированным кодом относительно эталонной транскрипции.
Мультипликативная композиция наград. Большинство условий имеют нижний порог, так как при произведении одна неудачная проверка удалила бы градиент из в остальном правильной страницы. Условие повторения не имеет порога, поскольку дегенеративные циклы — это тип сбоя, который легче всего завышает оценку контента.
Каждый раунд оставляет пул кандидатов-чекпоинтов. Агент ищет конфигурации слияния в рамках фиксированного бюджета оценки и оценивает их с помощью модульных тестов и проверок расстояния редактирования, а ошибки в выбранном слиянии определяют следующий раунд сбора данных. Черновая головка подбирается в последнюю очередь, на основе верификатора, выбранного циклом.
Результаты
olmOCR-Bench. jina-ocr-v1 достигает 83,4 балла в общем зачете, что на 7,4 балла выше, чем у базовой модели DeepSeek-OCR, и опережает 8B olmOCR-2. Столбец Hdr/Ftr проверяет отсутствие текста и поощряет пропуск колонтитулов, поэтому точная транскрипция всей страницы получает там низкие баллы.
OmniDocBench v1.6. jina-ocr-v1 достигает 91,14 балла при 570 млн активных параметров, опережая DeepSeek-OCR-2 по всем столбцам и обходя значительно более крупную Qwen3-VL-235B.
Спекулятивное декодирование на L4
FastMTP в olmOCR-Bench, NVIDIA L4, vLLM 0.20.1, размер батча 1. τ — среднее количество токенов, зафиксированных за один спекулятивный шаг, включая бонусный токен, а c = τ/S — стоимость одного спекулятивного шага в единицах одного авторегрессионного шага. Измерено на устройстве, отличном от указанного выше.
Качество черновика не зависит от режима выполнения, так как τ составляет 2,73 в режиме eager и 2,74 при использовании CUDA graphs при k = 3. Базовая модель зависит. CUDA graphs повышают скорость авторегрессионного декодирования с 42,7 до 158,3 токенов в секунду, в то время как накладные расходы на спекулятивный шаг остаются около 9 мс, поэтому его стоимость возрастает с 1,40 до 2,51 авторегрессионных шагов. Прирост отслеживает стоимость шага верификатора, который он заменяет, что делает оптимальной глубину k = 3 в режиме eager и k = 1 при использовании графов.
Начало работы
Самый быстрый способ запустить модель — использовать Jina Reader. Укажите r.jina.ai для URL и добавьте один заголовок: Reader извлекает страницу или PDF, рендерит её, запускает jina-ocr-v1 для результата и возвращает Markdown. Ничего не нужно развертывать, не нужно писать код для обработки изображений, используется тот же API-ключ, что и для остальной платформы.
Добавьте X-Page для транскрибирования одной страницы многостраничного документа. Оба параметра есть в редакторе Reader API, где переключатель сам запишет заголовок за вас.
Для прямого доступа к модели размещенный эндпоинт совместим с OpenAI и требует только API-ключ от jina.ai.
Document OCR - Jina AI
Превращайте отсканированные страницы, фотографии или PDF в чистый Markdown, включая таблицы и уравнения.
Jina AI
Мы подготовили демо для вас, чтобы вы могли оценить работу.
Чтобы развернуть модель самостоятельно, веса и пользовательский код моделирования поставляются в одном репозитории Hugging Face, который загружается с trust_remote_code=True. FastMTP требует vLLM 0.21 или новее и однократную регистрацию архитектуры перед запуском движка.
Одна деталь определяет, появится ли ускорение. Вспомогательный модуль регистрирует «голову» с методом method="eagle", поскольку FastMTP обучается с использованием рекурсивной обратной связи по скрытому состоянию, а метод по умолчанию method="mtp" выполняет повторное обоснование каждого шага черновика на целевом значении. Путь Transformers запускает только декодер MoE и игнорирует веса MTP.
Модель также справляется с транскрипцией таблиц и формул на уровне элементов, созданием подписей, ответами на вопросы по документам (VQA) и извлечением ключевой информации на английском и китайском языках. Веса выпущены под лицензией CC BY-NC 4.0.
Заключение
Имея 570 млн активных параметров, jina-ocr-v1 находится на границе точности на параметр в обоих бенчмарках и обладает самой высокой пропускной способностью страниц среди измеренных нами систем. Эту работу обеспечивают два рычага, и ни один из них не требует увеличения модели: градуированное вознаграждение за каждую проверяемую отметку и «голова» черновика, обученная с использованием финального верификатора.
Длину вывода стоит рассмотреть внимательнее. Пропускная способность токенов и пропускная способность страниц ранжируют системы по-разному, а длина вывода не зависит от качества парсинга, поэтому лаконичность можно оптимизировать отдельно. jina-ocr-v1 имеет самые короткие выходные данные среди всех систем с результатом выше 83.








