Введение
Сегодня мы выпускаем Schematron V2, следующее поколение наших специализированных моделей для извлечения данных из HTML в JSON. Если вы здесь впервые: Schematron — это семейство компактных специализированных моделей, которые преобразуют «грязный» HTML в чистый структурированный JSON, обеспечивая качество извлечения на уровне передовых моделей при значительно меньших затратах и задержках по сравнению с крупными универсальными LLM.
Schematron V1 уже сегодня обеспечивает масштабные рабочие процессы извлечения данных для компаний, работающих с веб-данными в промышленном масштабе, и мы рады представить новые варианты, которые еще больше повышают производительность.
В Schematron V2 представлены две новые модели: Schematron V2 Small и Schematron V2 Turbo. Schematron V2 Small практически соответствует качеству нашей модели первого поколения с 8 млрд параметров, сохраняя при этом скорость уровня 3 млрд параметров. Schematron V2 Turbo оптимизирована для максимальной пропускной способности, обрабатывая 4,14 запроса в секунду на одном H100 (улучшение в 2,5 раза по сравнению с оригинальной Schematron 3B), при этом превосходя по качеству модель 3B предыдущего поколения.
Мы обучили Schematron с помощью Inference platform — нашего движка для дообучения LLM, созданного специально для тренировки высокопроизводительных специализированных LLM. Обе модели Schematron доступны уже сегодня через наш бессерверный API на Inference.net.
Создайте бесплатную учетную запись или ознакомьтесь с нашей документацией, чтобы начать работу.
API Schematron
Вызывайте Schematron V2 через бессерверный API Inference.net, используя приведенный ниже код. Убедитесь, что вы установили INFERENCE_API_KEY и переменную HTML для вашего HTML-документа.
Почему это важно
Когда мы запустили Schematron V1 в сентябре 2025 года, мы показали, что небольшие специализированные модели могут сравниться с передовыми LLM в извлечении данных из HTML, будучи при этом в 40–80 раз дешевле. Реакция сообщества подтвердила то, что мы уже знали: команды повсюду пытаются извлекать структурированные данные из интернета в больших масштабах, и стоимость была главным препятствием.
С выходом V2 мы еще больше улучшили соотношение качества и размера. Вы можете получить скорость гораздо меньших моделей, сохраняя при этом стоимость на уровне 8B. А если для вас приоритетна пропускная способность, вариант Turbo позволит обрабатывать страницы быстрее, чем когда-либо прежде.
Качество: сокращение разрыва с моделями 8B
Мы оценили Schematron V2, используя ту же методологию «LLM как судья» из нашего первоначального запуска, где GPT 5.4 оценивала извлеченные данные по шкале от 1 до 5.
Schematron V2 Small набрала 4,060 балла, что ставит ее в один ряд с оригинальной Schematron 8B (4,070) и значительно опережает Schematron 3B первого поколения (3,909). Для большинства производственных задач разница между V2 Small и 8B незначительна.
Schematron V2 Turbo набрала 4,039 балла, что все еще является значительным скачком по сравнению с оригинальной 3B, и это достигается при оптимизации на скорость, а не на качество.
Для сравнения: обе модели V2 превосходят DeepSeek V3.2 и GPT-5.4 Nano в этом тесте, хотя обе они являются значительно более крупными моделями.
Пропускная способность: в 2,5 раза быстрее, чем V1
Schematron V2 Turbo создана для высоконагруженных рабочих процессов, где важна каждая миллисекунда и каждый доллар.
На одном H100 с 10 тыс. входных токенов и 500 выходными токенами:
Schematron V2 Small: 2,47 запроса/сек
Schematron V2 Turbo: 4,14 запроса/сек
Schematron 8B (V1): 1,63 запроса/сек
Schematron 3B (V1): 2,47 запроса/сек
Модель Turbo достигает 4,14 запроса в секунду, что в 2,5 раза быстрее оригинальной 8B и почти в 1,7 раза быстрее предыдущей 3B. Для конвейеров сканирования и парсинга, чувствительных к задержкам (например, разбор финансовых документов для биржевой торговли или мониторинг цен в реальном времени), это преимущество в скорости быстро накапливается.
Улучшение фактической точности LLM: результаты SimpleQA
Мы также повторно запустили наш тест SimpleQA, который измеряет, насколько хорошо Schematron повышает фактическую точность при использовании в качестве слоя извлечения в конвейере с дополненным веб-поиском (используя GPT-5 Nano в качестве базовой модели с поиском Exa).
Schematron V2 Turbo: 79,42
Schematron V2 Small: 83,10
Schematron 8B (V1): 85,58
Schematron 3B (V1): 75,47
GPT-5 Nano (без поиска): 8,54
Schematron V2 Small достигает 83,10, что является огромным улучшением на 7,6 пункта по сравнению с 3B первого поколения и всего на 2,5 пункта отстает от модели 8B. Даже вариант Turbo достигает 79,42, что почти на 4 пункта выше, чем у оригинальной 3B, при значительно более быстрой обработке страниц.
Эти результаты подтверждают наш основной вывод: структурированное извлечение данных фундаментально меняет экономику веб-поиска для LLM. Вместо того чтобы передавать целые необработанные HTML-страницы в большую модель (десятки тысяч токенов на запрос), Schematron извлекает только важные структурированные данные, делая фактическую точность с использованием веб-поиска жизнеспособной в больших масштабах.
Ценообразование
Стоимость Schematron V2 установлена так, чтобы сделать извлечение данных в масштабах интернета доступным:
Schematron V2: $0,10 за 1 млн входных токенов – $0,25 за 1 млн выходных токенов
Schematron V2 Turbo: $0,06 за 1 млн входных токенов – $0,15 за 1 млн выходных токенов
При таких ценах обработка 1 миллиона страниц в день (при условии 10 тыс. входных + 8 тыс. выходных токенов на страницу) стоит примерно $700 в день с V2 3B или $440 в день с V2 3B Turbo. Для больших объемов работ доступны дополнительные скидки через выделенные инстансы. Свяжитесь с нами, чтобы узнать больше о выделенных мощностях.
Что дальше: Schematron Pro
Мы не останавливаемся на достигнутом. Schematron Pro находится в разработке, нацеливаясь на еще более высокую точность, чем текущая модель 8B, при сохранении аналогичной пропускной способности запросов. Для команд, которым нужно наилучшее качество извлечения и которые готовы платить больше, чем за модели 3B, Pro станет ответом. Следите за обновлениями.
Начало работы
Обе модели V2 обладают теми же основными возможностями, что и оригинальное семейство Schematron: контекстное окно на 128 тыс. токенов и строгий режим JSON, гарантирующий 100% соответствие выходных данных схеме. Определите свою схему с помощью Pydantic, Zod или JSON Schema, передайте необработанный HTML и получите проверенные, типобезопасные данные.
Для получения дополнительной информации об использовании, пожалуйста, обратитесь к нашей документации.
Веса моделей Schematron V2 Small и V2 Turbo пока останутся закрытыми и будут доступны исключительно через наш бессерверный API. Оригинальные модели с открытым исходным кодом Schematron 3B и 8B остаются доступными для скачивания.
Начать извлечение
Нам было бы интересно узнать, что вы создаете. Начните работу с этими ресурсами:
Создать учетную запись: Попробуйте API Inference.net с бесплатными кредитами на $10
Документация: Прочитайте документацию по Schematron, чтобы узнать, как вызывать API
Запланировать встречу: Встретьтесь с нашей командой, чтобы узнать о выделенных инстансах и ценах на большие объемы
Мы с нетерпением ждем возможности увидеть, что вы создадите с помощью еще более быстрого и дешевого извлечения данных.










