jinaai/jina-ocr-v1 · Hugging Face
Мы стремимся развивать и демократизировать искусственный интеллект с помощью открытого исходного кода и открытой науки.
jina-ocr-v1 - Search Foundation Models
Парсер документов «страница в Markdown» за один проход с 570 млн активных параметров
Search Foundation ModelsJina AI
Jina-OCR-v1: Эффективный парсинг документов со спекулятивной декодировкой и плотными проверяемыми вознаграждениями
Мы представляем Jina-OCR-v1, комплексную модель парсинга документов, созданную для работы на бюджетных GPU. Она сочетает в себе сжатый визуальный энкодер и 3-миллиардный декодер на основе смеси экспертов (MoE) от DeepSeek-OCR, который активирует около 570 млн параметров на токен, с головкой спекулятивной декодировки FastMTP, использующей один черновой блок рекурсивно на K=3 шагах предсказания. Жадная верификация делает декодирование без потерь. Пост-обучение объединяет выравнивание по инструкциям, дообучение на сложных документах для повышения устойчивости и метод GRPO с использованием плотных проверяемых вознаграждений: детерминированных формул, таблиц и структурных проверок, которые дают частичные баллы. Обучающие данные смешивают очищенные публичные корпуса с целевыми синтетическими страницами. При стандартных настройках динамического разрешения Jina-OCR-v1 набирает 91,14 балла в OmniDocBench v1.6 и 83,4 балла в olmOCR-Bench, достигая самой высокой пропускной способности страниц в нашем сравнении — 2,57 страницы в секунду. На бюджетном GPU, таком как NVIDIA L4, FastMTP удваивает скорость декодирования по сравнению с жадным авторегрессионным декодированием. Модель доступна публично по адресу https://huggingface.co/jinaai/jina-ocr-v1.
arXiv.orgAlejandro Barón García
Мы выпускаем jina-ocr-v1, парсер документов с 3,4 млрд параметров и около 570 млн активных параметров декодера на токен. Он набирает 91,14 балла в OmniDocBench v1.6 и 83,4 балла в olmOCR-Bench, а при скорости 2,57 страницы в секунду обладает самой высокой пропускной способностью среди четырнадцати протестированных нами систем. На NVIDIA L4 его головка спекулятивной декодировки почти удваивает скорость декодирования, сохраняя при этом отсутствие потерь.
Модель построена на базе сжатого визуального энкодера и декодера смеси экспертов от DeepSeek-OCR и добавляет две вещи. Черновая головка FastMTP применяет один блок рекурсивно для трех шагов предсказания, поэтому количество черновых параметров не растет с глубиной. Пост-обучение проводится с использованием плотных проверяемых вознаграждений, где каждая проверка представляет собой детерминированный код, сверяемый с эталоном, и каждая проверка оценивается. На этом фундаменте пост-обучение добавляет 7,4 балла в olmOCR-Bench и улучшает показатели по всем столбцам OmniDocBench.
Модель и обучение
Длинные выходные данные делают парсинг документов дорогим с точки зрения декодирования. DeepSeek-OCR устранил большую часть этих затрат с помощью сжатого визуального энкодера и компактного декодера смеси экспертов, и jina-ocr-v1 наследует оба этих решения, нацеливаясь на оставшееся авторегрессионное «бутылочное горлышко».
Вывод OCR почти детерминирован и локально структурирован, что делает его благоприятной рабочей нагрузкой для спекулятивной декодировки. Обычная конструкция предполагает одну черновую головку на глубину предсказания, поэтому количество черновых параметров растет по мере того, как далеко модель заглядывает вперед. FastMTP использует один плотный блок, применяемый рекурсивно для K = 3 шагов. Верификатор жадно проверяет каждое предложение и принимает самый длинный префикс, с которым согласны черновик и верификатор, поэтому зафиксированная последовательность совпадает с жадной последовательностью верификатора, а спекуляция меняет только время получения вывода.
Спецификация модели. Декодер выдает Markdown, таблицы в HTML, а формулы в LaTeX.
Обучающие данные взяты из публичных корпусов OCR, включая olmOCR-mix, FinePDFs, LightOnOCR, MMTab и UniMER, а также из намеренно сложных источников, таких как газеты Europeana, транскрипты Библиотеки Конгресса и пенсионные дела NARA. Фильтр на основе правил удаляет циклы дегенерации и дубликаты, а визуально-языковой проход переразмечает сложные источники. Мы также синтезируем страницы по одной конкретной причине: на естественных страницах условия вознаграждения за формулы и таблицы применяются к очень немногим образцам, поэтому большинство прогонов не несут структурного сигнала. JinaOCRSynth наполняет каждую страницу формулами и таблицами, которые можно оценить, и поставляется с модульными тестами.
Пост-обучение включает контролируемое выравнивание, дообучение на деградированных страницах для устойчивости и GRPO, повторяемые в циклах внешнего контура. Вознаграждение GRPO представляет собой произведение проверяемых условий, каждое из которых вычисляется детерминированным кодом относительно эталонной транскрипции.
Мультипликативная композиция вознаграждений. Большинство условий имеют нижний порог, так как при произведении одна неудачная проверка удалила бы градиент со страницы, которая в остальном верна. Условие повторения не имеет порога, поскольку дегенеративные циклы — это тип сбоя, который легче всего завышает оценку контента.
Каждый раунд оставляет пул кандидатных чекпоинтов. Агент ищет конфигурации слияния при фиксированном бюджете оценки и оценивает их с помощью модульных тестов и проверок расстояния редактирования, а ошибки в выбранном слиянии определяют следующий раунд сбора. Черновая головка подбирается в последнюю очередь, на верификаторе, который выбирает цикл.
Результаты
olmOCR-Bench. jina-ocr-v1 достигает 83,4 балла в общем зачете, что на 7,4 балла выше, чем у базовой модели DeepSeek-OCR, на которой проводилось пост-обучение, и опережает 8B olmOCR-2. Столбец Hdr/Ftr проверяет отсутствие текста и поощряет исключение колонтитулов, поэтому точная транскрипция всей страницы получает там низкие баллы.
OmniDocBench v1.6. jina-ocr-v1 достигает 91,14 балла при 570 млн активных параметров, опережая DeepSeek-OCR-2 по всем столбцам и обходя значительно более крупную Qwen3-VL-235B.
Спекулятивная декодировка на L4
FastMTP на olmOCR-Bench, NVIDIA L4, vLLM 0.20.1, размер батча 1. τ — среднее количество токенов, зафиксированных за один спекулятивный шаг, включая бонусный токен, а c = τ/S — стоимость одного спекулятивного шага в единицах одного авторегрессионного шага. Измерено на другом устройстве, отличном от приведенных выше цифр.
Качество черновика не зависит от режима выполнения, так как τ составляет 2,73 в режиме eager и 2,74 при использовании CUDA-графов при k = 3. Базовая линия зависит. CUDA-графы повышают скорость авторегрессионного декодирования с 42,7 до 158,3 токенов в секунду, в то время как накладные расходы на спекулятивный шаг остаются около 9 мс, поэтому его стоимость возрастает с 1,40 до 2,51 авторегрессионного шага. Прирост отслеживает стоимость шага верификатора, который он заменяет, что делает оптимальной глубину k = 3 в режиме eager и k = 1 при использовании графов.
Начало работы
Самый быстрый способ запустить её — Jina Reader. Укажите r.jina.ai на URL и добавьте один заголовок: Reader извлекает страницу или PDF, рендерит её, запускает jina-ocr-v1 поверх результата и возвращает Markdown. Ничего не нужно развертывать, не нужно писать код для обработки изображений, и используется тот же API-ключ, что и для остальной платформы.
Добавьте X-Page для транскрипции одной страницы многостраничного документа. Оба параметра есть в редакторе Reader API, где переключатель сам прописывает заголовок.
Для прямого доступа к модели хостируемый эндпоинт совместим с OpenAI и требует только API-ключ от jina.ai.
Document OCR - Jina AI
Превращайте отсканированную страницу, фото или PDF в чистый Markdown, включая таблицы и уравнения.
Jina AI
Мы подготовили демо, чтобы вы могли оценить работу.
Чтобы развернуть модель самостоятельно, веса и пользовательский код моделирования поставляются в одном репозитории Hugging Face, который загружается с trust_remote_code=True. FastMTP требует vLLM 0.21 или новее и однократную регистрацию архитектуры перед запуском движка.
Одна деталь определяет, появится ли ускорение. Вспомогательный регистр помечает заголовок методом "eagle", поскольку FastMTP обучается с использованием рекурсивной обратной связи по скрытому состоянию, а метод по умолчанию "mtp" переосновывает каждый шаг черновика на целевом объекте. Путь Transformers запускает только декодер MoE и игнорирует веса MTP.
Модель также обрабатывает транскрипцию таблиц и формул на уровне элементов, создание подписей, визуальные ответы на вопросы по документам (VQA) и извлечение ключевой информации на английском и китайском языках. Веса выпущены под лицензией CC BY-NC 4.0.
Заключение
При 570 млн активных параметров jina-ocr-v1 находится на границе точности на параметр в обоих тестах и обладает самой высокой пропускной способностью страниц среди измеренных нами систем. Эту работу выполняют два рычага, и ни один из них не требует модели большего размера: градуированное вознаграждение за каждую проверяемую отметку и черновой заголовок, обученный с использованием финального верификатора.
Длину вывода стоит рассмотреть внимательнее. Пропускная способность токенов и пропускная способность страниц ранжируют системы по-разному, а длина вывода не зависит от качества синтаксического анализа, поэтому лаконичность можно оптимизировать отдельно. jina-ocr-v1 имеет самые короткие выходные данные среди всех систем с оценкой выше 83.
