Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Batch api snizhenie stoimosti vyvoda vdvoe za schet paketnoy obrabotki zaprosov
Dev48

© 2026 · All rights reserved.

Batch API: снижение стоимости вывода вдвое за счет пакетной обработки запросов

Источник: OpenRouter Blog

Batch API: снижение стоимости вывода вдвое за счет пакетной обработки запросов

Источник: OpenRouter Blog

Отправляйте весь объем работы одним POST-запросом, получайте результаты в течение 24 часов и платите, как правило, вдвое меньше за токен. За двухнедельный период бета-тестирования было выполнено более 230 тысяч пакетов, медианное время выполнения которых составило 7 минут.

26 сентября 2026 г.•Обновлено: 26 сентября 2026 г.

Для больших объемов работы или запросов, которые не требуют немедленного выполнения, теперь можно использовать новый Batch API. При отправке пакета провайдер может сам выбрать время в течение 24-часового окна для выполнения запроса, а взамен он обычно взимает 50% (а иногда и меньше) от своей обычной стоимости за токен.

Функция уже работает для более чем 70 моделей. Узнайте, как ее использовать, в документации по Batch API.

На практике мы заметили, что вам редко приходится ждать близко к 24 часам. Из более чем 230 тыс. пакетов, обработанных за двухнедельный период бета-тестирования, медианное время выполнения составило 7 минут, а 90% завершились в течение часа.

Batch — это асинхронный API для рабочих нагрузок, где вы можете допускать сильно варьирующееся время ответа, таких как разметка корпуса данных, заполнение эмбеддингов, оценка набора тестов, суммирование накопленных тикетов или запуск одного и того же промпта для нескольких тысяч строк за ночь.

Как работает Batch API

Вызовите api/v1/batches со списком ваших запросов и укажите, какой формат эндпоинта использовать. Поддерживаются чат-комплиты, ответы, сообщения и эмбеддинги. Например:

После запроса начните опрос GET /api/v1/batches/:id, пока статус не станет completed, failed, expired или cancelled. Завершенные пакеты возвращают свои результаты в том же ответе.

Большинство пакетов завершаются за считанные минуты

Мы проанализировали пакеты, завершенные за двухнедельный период бета-тестирования, и измерили время от принятия до получения готовых результатов. Медианное значение составило 7 минут, 90-й перцентиль — 1,0 часа, а 99-й перцентиль — 10,3 часа. Мы также выяснили, что время суток, когда вы отправляете запрос, имеет большее значение, чем количество отправленных запросов.

Пакеты, отправленные с 5 часов утра до полудня по тихоокеанскому времени (Pacific), обрабатываются значительно медленнее, чем в другое время суток. Самые медленные десять процентов занимают от 2 до 4,5 часов. Отправляйте запросы в любые другие часы, и 90-й перцентиль опустится ниже 1,1 часа, а после 18:00 по тихоокеанскому времени он составит менее 50 минут.

Пакет из одного запроса завершается за 5–11 минут в зависимости от часа, а пакет из 1000 и более запросов — за 12–21 минут. Обработка больших пакетов действительно занимает больше времени. Самые медленные десять процентов пакетов с более чем 100 запросами, отправленными в период с полуночи до полудня по тихоокеанскому времени, обрабатывались до 6,8 часов.

Что поддерживается в пакетной обработке

  • Форматы запросов: поддерживается любой формат тела текстового запроса, который вы уже отправляете в OpenRouter, включая чат-комплиты, ответы, сообщения и эмбеддинги.
  • Маршрутизация: каждый пакет выполняется у одного провайдера. По умолчанию мы выбираем самый дешевый эндпоинт пакетной обработки для модели после применения вашего белого списка провайдеров, политики данных и настроек BYOK.
  • BYOK: если настроен ключ провайдера, пакеты у поддерживающих это провайдеров маршрутизируются через ваш ключ, и вы платите только комиссию BYOK.
  • Результаты по каждому запросу: каждый результат возвращается независимо, поэтому несколько некорректных строк никогда не приведут к сбою остальной части задания.
  • Хранение: входные данные и результаты сохраняются в течение 30 дней или до тех пор, пока вы не удалите пакет с помощью DELETE.
  • Логирование: каждый пакет отображается на вкладке Batches в ваших логах с указанием модели, провайдера, статуса и стоимости.
  • Цены: скидка применяется к стоимости за токен и различается в зависимости от модели. Вызовы веб-поиска тарифицируются по стандартным ставкам.
  • Входные данные: изображения и файлы должны быть доступны по публичным URL-адресам. Аудио, видео и собственный плагин веб-поиска OpenRouter недоступны в пакетном режиме (см. раздел ограничений в документации).

Начало работы

Выберите модель с поддержкой пакетной обработки, получите ключ API и отправьте свой первый пакет на https://openrouter.ai/api/v1/batches. В руководстве по быстрому старту приведены полные форматы запросов и ответов.

Расскажите нам о том, что вы обрабатываете пакетами, в в Discord.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лаборатории

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Ещё от OpenRouter

Как использовать Jev: модерация с помощью API Jev на TypeScript
OpenRouter

Как использовать Jev: модерация с помощью API Jev на TypeScript

Лучшие модели эмбеддингов в 2026 году
OpenRouter

Лучшие модели эмбеддингов в 2026 году

Что такое Nemotron 3.5 Lightning
OpenRouter

Что такое Nemotron 3.5 Lightning

Насколько Jev точен в классификации по сравнению с передовыми моделями?
OpenRouter

Насколько Jev точен в классификации по сравнению с передовыми моделями?