К настоящему времени проблема расходов на токены хорошо известна. И она не исчезает: Goldman Sachs expects token usage to grow ~24x by 2030.
Это означает, что лидеры в области ИИ решают разные задачи. Мы заметили это в наших собственных разговорах. Мы больше не слышим: «Достаточно ли хорош мой агент?» Теперь вопрос звучит так: «Можем ли мы позволить себе запускать его в больших масштабах?»
Это изменение создало новые технические проблемы. Командам нужны автоматизированные системы, которые сокращают потери токенов без ущерба для качества агентов и продолжают совершенствовать эти сокращения по мере изменения моделей, цен и рабочих процессов.
Мы помогаем компаниям сократить расходы на токены, не жертвуя качеством. Подайте заявку на ранний доступ здесь
Это не только заголовки
Мы поговорили с одним CTO компании по разработке корпоративного ИИ-кодирования, который кратко описал этот момент: «Я понимаю, что вы потратили 1 млн долларов на токены, но каков был результат? Никто не может ответить на это».
Командам известно, что им нужно сократить расходы. Но им мешают две проблемы. В десятках частных разговоров с командами, которые запускают агентов в производстве, мы услышали следующее:
- Ручная настройка агентов медленна и нестабильна: новые методы оптимизации выходят каждую неделю, и не каждый трюк работает. Вице-президент по ИИ в компании S&P 500 по разработке программного обеспечения рассказал нам, как их правила маршрутизации, которые перенаправляют трафик на более дешевые модели, в конечном итоге привели к росту затрат, потому что более слабая модель производила значительно более длинные траектории. Нахождение правильной логики для каждого случая использования может занять недели экспериментов.
- Изменения модели сбрасывают настройки: оптимизация агентов не дает пожизненной гарантии. Генеральный директор компании-единорга в области ИИ-кодирования рассказал, как их предположения о ценах и производительности выбрасываются в окно каждый раз, когда их базовая модель получает изменения. То же самое касается добавления новой модели, инструментов или корректировки оснастки: основание меняется, и тщательно настроенные агенты или правила маршрутизации устаревают.
Картина, которую мы получили с места событий, такова: оптимизация агентов – сокращение затрат без ущерба для качества – остается ручной и неточной для каждого случая использования; преодоление этих барьеров требует уровня ресурсов, времени и экспертизы, которыми многие компании не располагают.
Итак, что делают команды тем временем?
Команды сходятся на маршрутизации
Вы можете сократить затраты по всему стэку, но наиболее часто упоминаемым шагом является маршрутизация: отправлять каждый вызов на самую дешевую модель, которая может его обработать. Маршрутизация повсеместна:
- От лидеров отрасли: Только за последний месяц такие лидеры, как генеральный директор Salesforce Марк Бениофф, сооснователь Harvey Гейб Перейра или генеральный директор Box Аарон Леви, выступили в поддержку маршрутизации.
- В производственных данных: Новый отчет Vercel показал, что команды, работающие в больших масштабах, используют в среднем 35 моделей в виде маршрутизационной графики. Это теперь лучшая практика в производстве.
- И в нашей собственной лаборатории тоже: Мы потратили время на исследование преимуществ разнообразных ансамблей моделей и агентов, что в конечном итоге привело нас к достижению #1 в BrowseComp-Plus и DeepResearch Bench II за последние несколько недель..
Самое сложное – сделать маршрутизацию автоматической, с логикой, которая учится выбирать лучшие вызовы для каждого агента и каждого домена. Она должна учитывать такие вещи, как специфические особенности провайдеров, кэширование KV, различия в запросах и многое другое.
Как мы автоматизируем оптимизацию агентов
Мы начинаем с создания интеллектуального маршрутизатора – готового слоя, на который вы указываете конечную точку агента, чтобы найти и сократить потери в режиме реального времени. На базовом уровне он обнаруживает обычных подозреваемых в утечке токенов (например, избыточный контекст, дублированные инструкции, неактуальные инструменты) и обрезает их, учитывая кэширование и последовательность. Выше этого он принимает продвинутые решения о маршрутизации, которые со временем продолжают совершенствоваться по мере накопления трафика.
Это работает: Маршрутизация популярного агента для код-ревью таким образом сократила затраты на один PR на 68% по сравнению с публичными базовыми показателями. Это около 560 000 долларов в год на производственный трафик от одного агента. (Больше об этом исследовании скоро.)
Мы не останавливаемся на этом. За последние 6 месяцев мы продемонстрировали новые передовые и эффективные с точки зрения затрат результаты на 4 различных тестах, применив специфические методы оптимизации агентов, которые выходят за рамки маршрутизации и сокращения потерь.
Инстинкт тот же, независимо от того, оптимизируем ли мы в точке маршрутизации или углубляемся в архитектуру агента: сократить затраты, не ломать то, что работает, и продолжать учиться. Автоматизируя этот цикл, мы помогаем большему количеству команд уверенно ответить на этот вопрос: Можем ли мы позволить себе запускать его в больших масштабах?
Если это проблема, с которой сталкивается ваша команда, давайте поговорим. Подайте заявку на ранний доступ к нашему интеллектуальному маршрутизатору →










