Производственный индекс AI Gateway — сентябрь 2026 г.
Каждый месяц AI Gateway маршрутизирует десятки триллионов токенов между производственными приложениями и лабораториями ИИ. Этот трафик дает нам представление о том, как на самом деле выглядит использование ИИ на современных предприятиях, и мы публикуем его здесь ежемесячно. Ознакомьтесь с отчетами производственного индекса за июнь, июль и август.
Сводка за сентябрь 2026 г.
В сентябрьском индексе представлены данные AI Gateway, собранные по август 2026 года включительно.
- Модели с открытыми весами впервые обработали большую часть токенов шлюза, увеличившись с 7% в декабре до 56% в августе.
Модели с открытыми весами впервые обработали большую часть токенов шлюза, увеличившись с 7% в декабре до 56% в августе.
- Средний токен стоит менее половины от того, что он стоил пять месяцев назад. Цена за токен упала на 23,2% в августе, что стало третьим снижением подряд за месяц, а медианная команда заплатила на 7,6% меньше.
Средний токен стоит менее половины от того, что он стоил пять месяцев назад. Цена за токен упала на 23,2% в августе, что стало третьим снижением подряд за месяц, а медианная команда заплатила на 7,6% меньше.
- Fable 5, самая мощная модель Anthropic, потеряла две трети своей доли в расходах на шлюз за один месяц. Opus 5, при вдвое меньшей цене, утроил свою долю. Anthropic сохранила 64% всех расходов.
Fable 5, самая мощная модель Anthropic, потеряла две трети своей доли в расходах на шлюз за один месяц. Opus 5, при вдвое меньшей цене, утроил свою долю. Anthropic сохранила 64% всех расходов.
- Gemini 3 Flash потеряла 95% своей доли токенов шлюза с мая, и более трех четвертей потерянного объема досталось моделям из других лабораторий.
Gemini 3 Flash потеряла 95% своей доли токенов шлюза с мая, и более трех четвертей потерянного объема досталось моделям из других лабораторий.
Последние обновления индекса
Ежемесячный отчет охватывает данные по август включительно. Между выпусками мы добавляем сюда важные события.
- 17 сентября: OpenAI запустила Astra 3 сентября, и она захватила треть расходов OpenAI в течение двух дней и вдвое превысила долю Fable 5.1 в расходах на шлюз. Astra заняла 7,7% всех расходов на шлюз за первые двенадцать дней, в то время как Fable 5.1, запущенная на два дня раньше по той же цене, заняла 3,7%.
17 сентября: OpenAI запустила Astra 3 сентября, и она захватила треть расходов OpenAI в течение двух дней и вдвое превысила долю Fable 5.1 в расходах на шлюз. Astra заняла 7,7% всех расходов на шлюз за первые двенадцать дней, в то время как Fable 5.1, запущенная на два дня раньше по той же цене, заняла 3,7%.
- 18 сентября: Jev теперь является моделью с самым быстрым внедрением в истории AI Gateway. В течение первых 24 часов ее использовали почти 13% платная команд, что в 2 раза больше, чем семейство GPT-5.6, и более чем в 6 раз больше, чем Fable 5.1.
18 сентября: Jev теперь является моделью с самым быстрым внедрением в истории AI Gateway. В течение первых 24 часов ее использовали почти 13% платная команд, что в 2 раза больше, чем семейство GPT-5.6, и более чем в 6 раз больше, чем Fable 5.1.
Модели с открытыми весами впервые занимают большую часть объема токенов
В августе модели с открытыми весами обработали 56% всех токенов на AI Gateway, что стало первым месяцем, когда они заняли большую часть объема.
В декабре 2025 года они обрабатывали менее одного из десяти токенов, а всего восемь месяцев спустя они обработали больше объема токенов, чем все модели с закрытыми весами вместе взятые.
Хотя передовые модели сохранили большую часть расходов, доля долларов моделей с открытыми весами ускоряется. По мере того как модели с открытыми весами становятся все более производительными, клиенты переносят на них все больше рабочих нагрузок.
Рост популярности моделей с открытыми весами помог снизить среднюю цену за токен на шлюзе на 23,2% в августе, что стало третьим подряд месячным падением и самым резким с апреля. Среди команд, использующих более десяти миллионов токенов в оба месяца, медианная команда платила на 7,6% меньше за токен, что более чем в два раза превышает падение на 2,9% в июле.
Теперь команды могут получать больше логического вывода в рамках того же бюджета и резервировать передовые модели только для тех задач, которые оправдывают более высокую стоимость.
Передовые модели достигают плато, поскольку расходы на Fable перенаправляются на Opus 5
Производственные рабочие нагрузки, оправдывающие использование передовой модели, не всегда требуют самой дорогой из них. Им нужна модель, которая достаточно хороша.
Fable — самая производительная модель, продаваемая Anthropic. Opus — это уровень ниже, и он стоит примерно половину цены Fable за токен. Когда экспортный контроль США на Fable 5 был снят и доступ к ней был восстановлен 1 июля, ее доля в расходах на шлюз подскочила до 13,2%. В конце того же месяца появился Opus 5.
В августе доля Fable 5 в расходах на шлюз упала до 4,9%, а доля Opus 5 выросла до 22,5%. Девять из десяти команд, использующих Fable, сократили ее использование, и большинство из них перенесли свои рабочие нагрузки на Opus 5, а не на какую-либо другую модель. Дополнительные возможности Fable не стоили вдвое дороже.
Команды ушли от Fable, самой дорогой и производительной модели Anthropic, но лаборатория сохранила львиную долю расходов на шлюз, потому что эти рабочие нагрузки перешли на Opus 5, а не в другую лабораторию.
Anthropic забирала по меньшей мере 61 цент с каждого доллара, потраченного через AI Gateway, каждый месяц с декабря, а в августе — 64 цента. Ее модели занимали первые два места по расходам каждый месяц с декабря, даже несмотря на то, что модели на этих местах менялись.
Лояльность клиентов зависит от профиля модели, а не от лаборатории
Лояльность к лабораториям зависит не от бренда, а от профиля модели, и побеждает стабильность.
Когда новая модель сохраняет то, за что пользователи ценили ее предшественницу, лаборатория сохраняет своих клиентов. Когда это не так, эти клиенты удовлетворяют свои потребности через других провайдеров.
Когда была выпущена Claude Opus 5, она привлекла почти в два раза больше средств, чем потеряла Fable, поскольку она справлялась с теми же рабочими нагрузками за полцены. И в течение пяти дней после запуска Z.ai GLM-5.3-Flash она обрабатывала в три раза больше ежедневного объема GLM-5.2.
Google с трудом удерживала клиентов со своими новыми моделями. Поскольку новые предложения не обеспечивали относительного преимущества в производительности или цене, большая часть рабочих нагрузок Gemini 3 Flash перешла к OpenAI, Anthropic и DeepSeek.
Около половины объема, ушедшего из Gemini 3 Flash, досталось более дешевым моделям во главе с GPT-5.6 Luna, которая стоит менее чем в два раза дороже за токен. Большая часть оставшейся половины досталась более дорогим моделям во главе с Claude Opus 5 и Sonnet 5, которые стоят примерно в девять и три раза дороже Gemini 3 Flash соответственно.
Переход к моделям с более подходящими характеристиками привел к тому, что за тот же период доля Google в объеме токенов шлюза упала с 30% до 5%, причем на долю Gemini 3 Flash пришлось 22 из 25 потерянных процентных пунктов.
Специальный отчет: Astra захватила треть расходов OpenAI в течение 48 часов и обогнала Fable 5.1 в соотношении два к одному на запуске
GPT-6 Astra была запущен на AI Gateway 3 сентября по той цене, что и Fable 5.1, и в два с половиной раза дороже GPT-5.6 Sol. Два дня спустя на нее приходился каждый третий доллар, потраченный на модели OpenAI через шлюз. Ее доля расходов сохранилась, колеблясь в пределах от 28% до 39%.
В линейке моделей OpenAI Astra и Sol обработали 27% токенов OpenAI, но на них пришлось 71% расходов компании в период с 4 по 16 сентября. Luna и Nano обработали более чем в два раза больше токенов при затратах примерно в девять раз меньших.
Anthropic выпустила Fable 5.1 1 сентября, за два дня до Astra. За первые двенадцать дней работы каждой модели на шлюзе Astra заняла 7,7% всех расходов через шлюз, что более чем в два раза превышает долю Fable 5.1, составляющую 3,7%, и использовалась вдвое большим количеством команд.
Более дешевые модели OpenAI обеспечивают ее объем, в то время как раннее лидерство Astra над Fable показывает, что она также может привлекать команды в самом высоком ценовом сегменте. Вместе они позволяют OpenAI конкурировать с другими передовыми лабораториями как по масштабу, так и по премиальным расходам.
Следите за обновлениями в отчете в следующем месяце.
Копировать ссылку на заголовокТакже в данных за август
- Google Nano Banana впервые вышла в лидеры по расходам на изображения с 50% против 44% у GPT Image, хотя GPT Image вернула себе лидерство по сгенерированным изображениям — 46% против 39%.
Google Nano Banana впервые вышла в лидеры по расходам на изображения с 50% против 44% у GPT Image, хотя GPT Image вернула себе лидерство по сгенерированным изображениям — 46% против 39%.
- Google Veo поднялась на второе место по расходам на видео с 20% по сравнению с 15% в июле. Seedance осталась на первом месте как по сгенерированным видео, так и по расходам на видео.
Google Veo поднялась на второе место по расходам на видео с 20% по сравнению с 15% в июле. Seedance осталась на первом месте как по сгенерированным видео, так и по расходам на видео.
- Доля видео, сгенерированных с помощью Grok Imagine от xAI, сократилась более чем вдвое с июня: с 42% до 31% и до 19%.
Доля видео, сгенерированных с помощью Grok Imagine от xAI, сократилась более чем вдвое с июня: с 42% до 31% и до 19%.
Копировать ссылку на заголовокПредыдущие отчеты AI Gateway Production Index
Копировать ссылку на заголовокОб этом отчете
В этом отчете используется анонимизированный совокупный трафик, направляемый через Vercel AI Gateway по август 2026 года.
Несколько примечаний об измерениях:
- Объем токенов включает входные, выходные, логические, кэшированные входные токены и токены создания кэша.
Объем токенов включает входные, выходные, логические, кэшированные входные токены и токены создания кэша.
- Расходы оцениваются на основе опубликованных прейскурантов лабораторий; фактические счета могут отличаться. Средняя цена за токен рассчитывается как предполагаемые расходы, деленные на объем токенов.
Расходы оцениваются на основе опубликованных прейскурантов лабораторий; фактические счета могут отличаться. Средняя цена за токен рассчитывается как предполагаемые расходы, деленные на объем токенов.
- Заявления о том, куда переместился объем, сравнивают изменения среди одних и тех же команд. Они не отслеживают отдельные токены между моделями.
Заявления о том, куда переместился объем, сравнивают изменения среди одних и тех же команд. Они не отслеживают отдельные токены между моделями.
- Классификации моделей с открытыми весами соответствуют текущему списку моделей AI Gateway, который шире определения, использовавшегося в предыдущих отчетах.
Классификации моделей с открытыми весами соответствуют текущему списку моделей AI Gateway, который шире определения, использовавшегося в предыдущих отчетах.
- Все цифры используют последние доступные данные; предыдущие месяцы могут быть пересмотрены по мере обновления методологии.
Все цифры используют последние доступные данные; предыдущие месяцы могут быть пересмотрены по мере обновления методологии.











