Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Rashody na tokeny ne umenshayutsya dlya upravleniya imi trebuetsya bolshe chem p
Dev48

© 2026 · All rights reserved.

Расходы на токены не уменьшаются. Для управления ими требуется больше, чем простая маршрутизация

Источник: AI21

Расходы на токены не уменьшаются. Для управления ими требуется больше, чем простая маршрутизация

Источник: AI21

As I write this, rumblings of an impending tokenpocalypse are making their rounds, as providers have announced – and walk back – moves from subscription to token-based billing. Nobody knows how it will land. But the scare alone prompted an overdue conversation about cost.

29 сентября 2026 г.•Обновлено: 29 сентября 2026 г.

К настоящему времени проблема расходов на токены хорошо известна. И она не исчезает: Goldman Sachs expects token usage to grow ~24x by 2030.

Это означает, что лидеры в области ИИ решают разные задачи. Мы заметили это в наших собственных разговорах. Мы больше не слышим: «Достаточно ли хорош мой агент?» Теперь вопрос звучит так: «Можем ли мы позволить себе запускать его в больших масштабах?»

Это изменение создало новые технические проблемы. Командам нужны автоматизированные системы, которые сокращают потери токенов без ущерба для качества агентов и продолжают совершенствовать эти сокращения по мере изменения моделей, цен и рабочих процессов.

Мы помогаем компаниям сократить расходы на токены, не жертвуя качеством. Подайте заявку на ранний доступ здесь

Это не только заголовки

Мы поговорили с одним CTO компании по разработке корпоративного ИИ-кодирования, который кратко описал этот момент: «Я понимаю, что вы потратили 1 млн долларов на токены, но каков был результат? Никто не может ответить на это».

Командам известно, что им нужно сократить расходы. Но им мешают две проблемы. В десятках частных разговоров с командами, которые запускают агентов в производстве, мы услышали следующее:

  • Ручная настройка агентов медленна и нестабильна: новые методы оптимизации выходят каждую неделю, и не каждый трюк работает. Вице-президент по ИИ в компании S&P 500 по разработке программного обеспечения рассказал нам, как их правила маршрутизации, которые перенаправляют трафик на более дешевые модели, в конечном итоге привели к росту затрат, потому что более слабая модель производила значительно более длинные траектории. Нахождение правильной логики для каждого случая использования может занять недели экспериментов.
  • Изменения модели сбрасывают настройки: оптимизация агентов не дает пожизненной гарантии. Генеральный директор компании-единорга в области ИИ-кодирования рассказал, как их предположения о ценах и производительности выбрасываются в окно каждый раз, когда их базовая модель получает изменения. То же самое касается добавления новой модели, инструментов или корректировки оснастки: основание меняется, и тщательно настроенные агенты или правила маршрутизации устаревают.

Картина, которую мы получили с места событий, такова: оптимизация агентов – сокращение затрат без ущерба для качества – остается ручной и неточной для каждого случая использования; преодоление этих барьеров требует уровня ресурсов, времени и экспертизы, которыми многие компании не располагают.

Итак, что делают команды тем временем?

Команды сходятся на маршрутизации

Вы можете сократить затраты по всему стэку, но наиболее часто упоминаемым шагом является маршрутизация: отправлять каждый вызов на самую дешевую модель, которая может его обработать. Маршрутизация повсеместна:

  • От лидеров отрасли: Только за последний месяц такие лидеры, как генеральный директор Salesforce Марк Бениофф, сооснователь Harvey Гейб Перейра или генеральный директор Box Аарон Леви, выступили в поддержку маршрутизации.
  • В производственных данных: Новый отчет Vercel показал, что команды, работающие в больших масштабах, используют в среднем 35 моделей в виде маршрутизационной графики. Это теперь лучшая практика в производстве.
  • И в нашей собственной лаборатории тоже: Мы потратили время на исследование преимуществ разнообразных ансамблей моделей и агентов, что в конечном итоге привело нас к достижению #1 в BrowseComp-Plus и DeepResearch Bench II за последние несколько недель..

Самое сложное – сделать маршрутизацию автоматической, с логикой, которая учится выбирать лучшие вызовы для каждого агента и каждого домена. Она должна учитывать такие вещи, как специфические особенности провайдеров, кэширование KV, различия в запросах и многое другое.

Как мы автоматизируем оптимизацию агентов

Мы начинаем с создания интеллектуального маршрутизатора – готового слоя, на который вы указываете конечную точку агента, чтобы найти и сократить потери в режиме реального времени. На базовом уровне он обнаруживает обычных подозреваемых в утечке токенов (например, избыточный контекст, дублированные инструкции, неактуальные инструменты) и обрезает их, учитывая кэширование и последовательность. Выше этого он принимает продвинутые решения о маршрутизации, которые со временем продолжают совершенствоваться по мере накопления трафика.

Это работает: Маршрутизация популярного агента для код-ревью таким образом сократила затраты на один PR на 68% по сравнению с публичными базовыми показателями. Это около 560 000 долларов в год на производственный трафик от одного агента. (Больше об этом исследовании скоро.)

Мы не останавливаемся на этом. За последние 6 месяцев мы продемонстрировали новые передовые и эффективные с точки зрения затрат результаты на 4 различных тестах, применив специфические методы оптимизации агентов, которые выходят за рамки маршрутизации и сокращения потерь.

Инстинкт тот же, независимо от того, оптимизируем ли мы в точке маршрутизации или углубляемся в архитектуру агента: сократить затраты, не ломать то, что работает, и продолжать учиться. Автоматизируя этот цикл, мы помогаем большему количеству команд уверенно ответить на этот вопрос: Можем ли мы позволить себе запускать его в больших масштабах?

Если это проблема, с которой сталкивается ваша команда, давайте поговорим. Подайте заявку на ранний доступ к нашему интеллектуальному маршрутизатору →

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведениемПресса
OpenAI

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведением

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языковПресса
ElevenLabs

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языков

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИПресса
Amazon

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИ

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов
LangChain

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое
LangChain

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое

Ещё от AI21 Labs

Вам не нужна модель-фронтир. Вам нужен проверщик.
AI21 Labs

Вам не нужна модель-фронтир. Вам нужен проверщик.

Лучше и дешевле вместе: открытые модели исследуют, модели границы исправляют
AI21 Labs

Лучше и дешевле вместе: открытые модели исследуют, модели границы исправляют

Улучшение Best-of-N с учетом бюджета при выполнении задач для агентов SWE
AI21 Labs

Улучшение Best-of-N с учетом бюджета при выполнении задач для агентов SWE

Переломный момент: объединение слабых агентов в современного глубокого исследователя
AI21 Labs

Переломный момент: объединение слабых агентов в современного глубокого исследователя