Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Rashody na tokeny ne snizhayutsya dlya upravleniya imi nuzhno nechto bolshee che
Dev48

© 2026 · All rights reserved.

Расходы на токены не снижаются. Для управления ими нужно нечто большее, чем просто примитивная маршрутизация

Источник: AI21

Расходы на токены не снижаются. Для управления ими нужно нечто большее, чем просто примитивная маршрутизация

Источник: AI21

Пока я пишу эти строки, ходят слухи о надвигающемся «токен-апокалипсисе», поскольку провайдеры объявляют — а затем отменяют — переход от подписки к оплате за токены. Никто не знает, к чему это приведет. Но один только этот страх спровоцировал давно назревший разговор о затратах.

26 сентября 2026 г.

К настоящему моменту проблема расходов на токены хорошо задокументирована. И она никуда не исчезнет: расходы на ИИ растут.

Это означает, что перед лидерами в области ИИ встают другие вопросы. Мы заметили это в ходе наших собственных бесед. Мы больше не слышим: «Достаточно ли хорош мой агент?». Теперь вопрос звучит так: «Можем ли мы позволить себе запускать его в промышленном масштабе?»

Этот сдвиг породил новые технические проблемы. Командам нужны автоматизированные системы, которые сокращают бесполезные траты токенов, не снижая качество работы агентов, и продолжают совершенствовать эти методы по мере изменения моделей, цен и рабочих процессов.

Мы помогаем компаниям сократить расходы на токены без ущерба для качества. Подайте заявку на ранний доступ здесь

Дело не только в заголовках

Мы беседовали с техническим директором компании, занимающейся корпоративным ИИ-кодингом, который кратко описал текущий момент: «Я понимаю, что вы потратили 1 миллион долларов на токены, но каков был результат? Никто не может на это ответить».

Команды знают, что им нужно сокращать расходы. Но на их пути стоят две проблемы. Вот что мы услышали в ходе десятков частных бесед с командами, использующими агентов в продакшене:

  • Ручная настройка агентов — это медленно и ненадежно: новые методы оптимизации появляются еженедельно, и не каждый трюк работает. Вице-президент по ИИ в компании из списка S&P 500 рассказал нам, как их правила маршрутизации, перенаправляющие трафик на более дешевые модели, в конечном итоге привели к росту затрат, поскольку более слабая модель создавала значительно более длинные цепочки рассуждений. Поиск правильной логики для каждого варианта использования может потребовать недель экспериментов.
  • Изменения моделей заставляют начинать все сначала: оптимизация агентов не дает пожизненной гарантии. Генеральный директор «единорога» в сфере ИИ-кодинга поделился тем, как их предположения о ценах и производительности рушатся каждый раз, когда базовая модель обновляется. То же самое касается добавления новой модели, инструментов или настройки обвязки: почва уходит из-под ног, и тщательно настроенные агенты или правила маршрутизации устаревают.

Картина, которую мы получили «в полях», такова: оптимизация агентов — сокращение затрат без ущерба для качества — остается ручной и неточной для каждого конкретного случая; преодоление этих барьеров требует уровня ресурсов, времени и опыта, которыми располагают далеко не все компании.

Так что же делают команды тем временем?

Команды приходят к маршрутизации

Можно пытаться сокращать расходы на всех уровнях стека, но решение, о котором мы слышим чаще всего, — это маршрутизация: отправлять каждый запрос на самую дешевую модель, способную его обработать. Маршрутизация повсюду:

  • От лидеров отрасли: только за последний месяц такие лидеры, как генеральный директор Salesforce Марк Бениофф, соучредитель Harvey Гейб Перейра или генеральный директор Box Аарон Леви, выступили в поддержку маршрутизации.
  • В данных продакшена: новый отчет Vercel показал, что команды, работающие в масштабе, используют в среднем 35 моделей в качестве графа маршрутизации. Теперь это лучшая практика для продакшена.
  • В нашей собственной лаборатории тоже: мы потратили время на исследование преимуществ разнообразных ансамблей моделей и агентов, что в конечном итоге позволило нам занять 1-е место в BrowseComp-Plus и DeepResearch Bench II за последние несколько недель.

Сложность заключается в том, чтобы сделать маршрутизацию автоматической, с логикой, которая изучает лучшие вызовы для каждого агента и каждого домена. Она должна учитывать такие вещи, как особенности провайдера, KV-кэширование, различия в запросах и многое другое.

Как мы автоматизируем оптимизацию агентов

Мы начали с создания интеллектуального маршрутизатора — подключаемого слоя, на который вы направляете эндпоинт вашего агента, чтобы находить и устранять потери во время выполнения. На базовом уровне он обнаруживает типичные источники утечки токенов (например, избыточный контекст, дублирующиеся инструкции, нерелевантные инструменты) и обрезает их согласованным образом с учетом кэширования. Поверх этого он принимает продвинутые решения по маршрутизации, которые со временем становятся все лучше по мере накопления трафика.

Это работает: маршрутизация популярного агента для проверки кода таким способом сократила стоимость одного PR на 68% по сравнению с публичными базовыми показателями. Это около 560 тысяч долларов в год на производственном трафике от одного агента. (Подробнее об этом исследовании в ближайшее время.)

Мы не останавливаемся на достигнутом. За последние 6 месяцев мы продемонстрировали новые передовые показатели и экономическую эффективность на 4 различных бенчмарках, применяя методы оптимизации, специфичные для агентов, которые выходят за рамки маршрутизации и обрезки лишнего.

Инстинкт остается прежним, независимо от того, оптимизируем ли мы точку маршрутизации или углубляемся в архитектуру агента: сокращайте расходы, не ломайте то, что работает, и продолжайте учиться. Автоматизируя этот цикл, мы помогаем большему количеству команд уверенно ответить на вопрос: можем ли мы позволить себе запускать это в промышленном масштабе?

Если ваша команда сталкивается с этой проблемой, давайте поговорим. Подайте заявку на ранний доступ к нашему интеллектуальному маршрутизатору →

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лаборатории

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Ещё от AI21 Labs

Вам не нужна пограничная модель. Вам нужен верификатор.
AI21 Labs

Вам не нужна пограничная модель. Вам нужен верификатор.

Вместе лучше и дешевле: открытые модели исследуют, пограничные модели исправляют
AI21 Labs

Вместе лучше и дешевле: открытые модели исследуют, пограничные модели исправляют

Улучшение Best-of-N с помощью выполнения с учетом бюджета для SWE-агентов
AI21 Labs

Улучшение Best-of-N с помощью выполнения с учетом бюджета для SWE-агентов

Переломный момент: объединение слабых агентов в передовую систему глубокого исследования
AI21 Labs

Переломный момент: объединение слабых агентов в передовую систему глубокого исследования