К настоящему моменту проблема расходов на токены хорошо задокументирована. И она никуда не исчезнет: расходы на ИИ растут.
Это означает, что перед лидерами в области ИИ встают другие вопросы. Мы заметили это в ходе наших собственных бесед. Мы больше не слышим: «Достаточно ли хорош мой агент?». Теперь вопрос звучит так: «Можем ли мы позволить себе запускать его в промышленном масштабе?»
Этот сдвиг породил новые технические проблемы. Командам нужны автоматизированные системы, которые сокращают бесполезные траты токенов, не снижая качество работы агентов, и продолжают совершенствовать эти методы по мере изменения моделей, цен и рабочих процессов.
Мы помогаем компаниям сократить расходы на токены без ущерба для качества. Подайте заявку на ранний доступ здесь
Дело не только в заголовках
Мы беседовали с техническим директором компании, занимающейся корпоративным ИИ-кодингом, который кратко описал текущий момент: «Я понимаю, что вы потратили 1 миллион долларов на токены, но каков был результат? Никто не может на это ответить».
Команды знают, что им нужно сокращать расходы. Но на их пути стоят две проблемы. Вот что мы услышали в ходе десятков частных бесед с командами, использующими агентов в продакшене:
- Ручная настройка агентов — это медленно и ненадежно: новые методы оптимизации появляются еженедельно, и не каждый трюк работает. Вице-президент по ИИ в компании из списка S&P 500 рассказал нам, как их правила маршрутизации, перенаправляющие трафик на более дешевые модели, в конечном итоге привели к росту затрат, поскольку более слабая модель создавала значительно более длинные цепочки рассуждений. Поиск правильной логики для каждого варианта использования может потребовать недель экспериментов.
- Изменения моделей заставляют начинать все сначала: оптимизация агентов не дает пожизненной гарантии. Генеральный директор «единорога» в сфере ИИ-кодинга поделился тем, как их предположения о ценах и производительности рушатся каждый раз, когда базовая модель обновляется. То же самое касается добавления новой модели, инструментов или настройки обвязки: почва уходит из-под ног, и тщательно настроенные агенты или правила маршрутизации устаревают.
Картина, которую мы получили «в полях», такова: оптимизация агентов — сокращение затрат без ущерба для качества — остается ручной и неточной для каждого конкретного случая; преодоление этих барьеров требует уровня ресурсов, времени и опыта, которыми располагают далеко не все компании.
Так что же делают команды тем временем?
Команды приходят к маршрутизации
Можно пытаться сокращать расходы на всех уровнях стека, но решение, о котором мы слышим чаще всего, — это маршрутизация: отправлять каждый запрос на самую дешевую модель, способную его обработать. Маршрутизация повсюду:
- От лидеров отрасли: только за последний месяц такие лидеры, как генеральный директор Salesforce Марк Бениофф, соучредитель Harvey Гейб Перейра или генеральный директор Box Аарон Леви, выступили в поддержку маршрутизации.
- В данных продакшена: новый отчет Vercel показал, что команды, работающие в масштабе, используют в среднем 35 моделей в качестве графа маршрутизации. Теперь это лучшая практика для продакшена.
- В нашей собственной лаборатории тоже: мы потратили время на исследование преимуществ разнообразных ансамблей моделей и агентов, что в конечном итоге позволило нам занять 1-е место в BrowseComp-Plus и DeepResearch Bench II за последние несколько недель.
Сложность заключается в том, чтобы сделать маршрутизацию автоматической, с логикой, которая изучает лучшие вызовы для каждого агента и каждого домена. Она должна учитывать такие вещи, как особенности провайдера, KV-кэширование, различия в запросах и многое другое.
Как мы автоматизируем оптимизацию агентов
Мы начали с создания интеллектуального маршрутизатора — подключаемого слоя, на который вы направляете эндпоинт вашего агента, чтобы находить и устранять потери во время выполнения. На базовом уровне он обнаруживает типичные источники утечки токенов (например, избыточный контекст, дублирующиеся инструкции, нерелевантные инструменты) и обрезает их согласованным образом с учетом кэширования. Поверх этого он принимает продвинутые решения по маршрутизации, которые со временем становятся все лучше по мере накопления трафика.
Это работает: маршрутизация популярного агента для проверки кода таким способом сократила стоимость одного PR на 68% по сравнению с публичными базовыми показателями. Это около 560 тысяч долларов в год на производственном трафике от одного агента. (Подробнее об этом исследовании в ближайшее время.)
Мы не останавливаемся на достигнутом. За последние 6 месяцев мы продемонстрировали новые передовые показатели и экономическую эффективность на 4 различных бенчмарках, применяя методы оптимизации, специфичные для агентов, которые выходят за рамки маршрутизации и обрезки лишнего.
Инстинкт остается прежним, независимо от того, оптимизируем ли мы точку маршрутизации или углубляемся в архитектуру агента: сокращайте расходы, не ломайте то, что работает, и продолжайте учиться. Автоматизируя этот цикл, мы помогаем большему количеству команд уверенно ответить на вопрос: можем ли мы позволить себе запускать это в промышленном масштабе?
Если ваша команда сталкивается с этой проблемой, давайте поговорим. Подайте заявку на ранний доступ к нашему интеллектуальному маршрутизатору →










