Что внутри
Компании, использующие ИИ в 2026 году, столкнулись с парадоксом: стоимость вывода ИИ за токен снизилась на 98%, однако счета за корпоративный ИИ утроились.
Стоимость токенов находится на рекордно низком уровне, но их потребление продолжает расти по мере внедрения компаниями автоматизированных рабочих процессов и автономных агентов. Без правильной архитектуры и управления ежемесячные расходы на ИИ в крупномасштабных развертываниях могут достигать 500 миллионов долларов.
В этой статье Vention расскажет об архитектурных и операционных решениях, которые определяют, станет ли ваша ИИ-инициатива экономически жизнеспособной или превратится в «черную дыру» для бюджета. Вы узнаете, где теряются токены, как сократить их потребление в стеке ИИ и когда запуск моделей ИИ на собственных мощностях имеет финансовый смысл.
Измеряйте использование токенов LLM, прежде чем оптимизировать его
Прежде чем исправлять архитектуру ИИ, нужно точно знать, где происходят утечки. Стандартные ежемесячные облачные панели мониторинга не дадут такой видимости. Они показывают только совокупное использование, оставляя вас в неведении относительно того, какая функция, репозиторий или рабочий процесс увеличивают ваши расходы на ИИ.
Начните с внедрения гранулярной наблюдаемости. Отслеживайте расходы на токены на уровне команд, функций, агентов и даже версий промптов. На практике это означает настройку вашего промежуточного ПО для тегирования каждого вызова API метаданными до того, как он достигнет провайдера модели.
Современные архитектуры LLM затрудняют определение того, вызван ли всплеск использования токенов необходимыми рассуждениями, избыточным поиском документов или автономным агентом, застрявшим в цикле повторных попыток. Понятная панель мониторинга, показывающая, какой именно конвейер потребляет бюджет, позволяет настроить автоматические «предохранители», которые ограничивают выполнение или предупреждают инженерную команду в тот момент, когда рабочий процесс выходит из-под контроля.
Только после того, как вы узнаете, где теряются токены, можно приступать к решению проблемы.
Где теряются токены ИИ
Современные модели ИИ и рабочие процессы автоматизации затрудняют различие между «этот шаг потребляет много токенов, но он необходим» и «это не должно стоить так дорого». Каждый шаг рассуждения, поиск документов, вызов API и взаимодействие с агентом увеличивают общее потребление токенов. Понимание того, какие расходы оправданы, а какие можно исключить, — это первый шаг к сокращению затрат на ИИ.
Как архитектура ИИ влияет на потребление токенов
Расходы на токены ИИ начинают накапливаться задолго до того, как пользователи отправляют свой первый промпт. Архитектура данных определяет, сколько входных токенов обрабатывается за запрос, что делает ее одним из главных факторов долгосрочных расходов на ИИ.
Одним из первых основных источников потребления токенов является индексация данных. Графовые RAG-архитектуры и автоматизированная векторная индексация требуют, чтобы модели обрабатывали весь набор данных перед запуском для создания метаданных для поиска. Только этот процесс может потреблять миллионы токенов.
В одном из проектов Vention зафиксировала снижение потребления кэшированных токенов до 87% после внедрения графового поиска и сокращение входного контекста на 87,19% за счет ограниченного поиска доказательств.
Плохая фрагментация данных — еще один распространенный источник ненужного потребления токенов. Если ваши данные не были должным образом очищены, сегментированы и ранжированы на этапе архитектуры, поисковые системы часто возвращают избыточные или нерелевантные фрагменты вместо информации, необходимой для ответа на запрос пользователя. В некоторых случаях это может увеличить использование токенов до 50 раз.
Внедрение 151 пакета контекста в проект позволило Vention сократить совокупный размер контекста на 43,46% и увеличить бюджет контекста в 1,77 раза.
Интеграции ИИ и промежуточное ПО
Современные системы ИИ редко полагаются на автономную LLM. Большинство компаний подключают модели к внешним инструментам, внутренним системам и рабочим процессам автоматизации. Каждая интеграция вносит дополнительный контекст, дублирующиеся входные данные или промежуточную обработку, что увеличивает потребление токенов.
Внешние инструменты и API — распространенный пример. Каждый раз, когда агент ИИ может вызывать внешние инструменты, ему нужен доступ к JSON-схеме, описывающей эти инструменты. Эта схема внедряется в системный промпт при каждом запросе, добавляя от 2000 до 4000 статических входных токенов для сложных интеграций с 20 и более инструментами и API, независимо от того, использует ли их агент на самом деле.
Циклы агентов с сохранением состояния — еще один крупный источник потребления токенов. Многошаговые задачи требуют, чтобы модель перечитывала историю выполнения на каждом шаге. На втором шаге модель перечитывает первый. На третьем — снова перечитывает первый и второй. По мере роста диалогов и истории задач потребление токенов растет квадратично, а не линейно.
Цифры, которые мы видели в реальных проектах: внедрение выбора шагов «точно в срок» (JIT) сократило потребление входных токенов на 66,84%; компиляция StepCard уменьшила объем контекста почти на 98% при сохранении 3 из 3 критических якорей, а проверка больших функций снизила использование токенов до 78%.
Защитные барьеры (guardrails) — еще один скрытый источник использования токенов. Они необходимы для предотвращения инъекций промптов, улучшения качества ответов и защиты конфиденциальных данных. Многие реализации полагаются на дополнительные вызовы моделей для проверки промптов и ответов, что может удвоить или даже утроить потребление токенов на запрос.
Шлюзы LLM и маршрутизация моделей
Отправка каждого запроса вашей самой мощной модели — это как использование гидравлического молота для раскалывания ореха. Такие задачи, как форматирование данных, синтаксический анализ логов или базовый анализ тональности, редко требуют рассуждений уровня передовых моделей.
Шлюз LLM с семантической маршрутизацией оценивает каждый запрос и автоматически направляет простые, повторяющиеся задачи на более мелкие и менее дорогие модели, оставляя передовые модели для сложных рассуждений и архитектурных задач. Учитывая разницу в цене в 20–60 раз между уровнями моделей, одна только динамическая маршрутизация может значительно сократить расходы на ИИ без ущерба для качества вывода.
Помимо маршрутизации запросов, шлюз LLM становится плоскостью управления для вашей инфраструктуры ИИ. Он централизует кэширование промптов, защитные барьеры, атрибуцию затрат и механизмы аварийного переключения вместо дублирования этой логики в приложениях. Централизованное управление упрощает мониторинг использования токенов и помогает избежать привязки к поставщику.
Vention внедрила маршрутизируемый «быстрый путь» для одного из проектов, что сократило бюджет рабочего процесса примерно с 24 000 токенов до 4 000.
Дисциплина промптов
Разговорные «заполнители» добавляют ненужные токены. Если вашему приложению нужен структурированный JSON, нет смысла в ответах, которые начинаются с фраз вроде «Конечно!» или включают длинные объяснения перед выводом. Каждый лишний токен увеличивает стоимость.
Кэширование промптов — еще одна область, которую стоит пересмотреть. Стабильные промпты позволяют провайдерам повторно использовать кэшированные представления, а не переобрабатывать одни и те же инструкции для каждого запроса. Чтобы максимизировать попадания в кэш, размещайте статические элементы, такие как системные инструкции, схемы инструментов и основные модели поведения, в начале промпта, а контекст, специфичный для пользователя, — в конце. Поскольку многие провайдеры предлагают скидки на кэшированные токены, хорошо структурированные промпты снижают как использование токенов, так и затраты на вывод.
В одном из клиентских проектов Vention сравнила сериализацию TOON с минифицированным JSON, при этом TOON обеспечила экономию токенов на 2,87%. Хотя общий прирост был скромным, экономия в определенных областях оказалась выше: 19,04% для планов выполнения и 12,23% для контекста функций.
Почему потребление токенов LLM растет даже при хорошей архитектуре ИИ
Даже при хорошо спроектированной архитектуре ИИ и чистых данных потребление токенов может увеличиться после смены моделей или версий моделей. Если вы исключили архитектурные проблемы, причиной более высокого потребления токенов может быть сама модель.
Токенизаторы LLM
Токенизаторы — это одни из немногих компонентов модели, которые могут повысить эффективность использования токенов. Они разбивают текст на токены, и современные модели обычно имеют более обширные словари, что позволяет им более эффективно сжимать текст. Например, если старая модель представляла вашу кодовую базу в 1000 токенов, новый токенизатор может сократить это количество до 750 токенов.
Подвох в том, что токенизаторы встроены в модель. Вы не можете просто заменить токенизатор в старой дообученной модели, чтобы воспользоваться преимуществами лучшего сжатия.
Дрейф многословности
Поставщики моделей постоянно корректируют разговорное поведение, используя обучение с подкреплением на основе отзывов людей (RLHF) и прямую оптимизацию предпочтений (DPO). После обновления до более новой модели вы можете заметить, что она выдает гораздо более длинные ответы, даже если вашему приложению нужны только краткие результаты.
Задача, которая раньше требовала 150 выходных токенов, может внезапно сгенерировать объяснение на 1000 токенов.
Обновленные системные промпты обычно могут исправить это поведение, закрепляя предпочтительный для вас стиль ответа.
Токены рассуждения (режим «мышления»)
Многие новые модели, включая серию o от OpenAI, модели Claude Thinking и DeepSeek R1, выполняют внутреннее рассуждение перед генерацией ответа.
Внутреннее рассуждение повышает точность, но также потребляет токены. Запрос, который выдает ответ на 300 токенов, может потребовать 5000 или даже 10 000 токенов рассуждения в фоновом режиме. Хотя этот компромисс оправдан для сложных или высокорисковых задач, многие рабочие нагрузки в продакшене не требуют такого уровня рассуждений.
Аннулирование кэша промптов
Проблемы с кэшированием промптов не всегда вызваны их дизайном. Миграция на другую модель может аннулировать существующие кэши промптов, поскольку кэшированные представления «ключ-значение» не переносятся автоматически между моделями.
Миграция моделей также может потребовать изменений в ваших системных промптах, чтобы они соответствовали ожидаемой структуре промптов новой модели. Пока эти промпты не будут обновлены и снова закэшированы, каждый запрос заставляет модель перерабатывать их с нуля, временно увеличивая потребление токенов.
Как выбрать правильную модель потребления
Оптимизация архитектуры ИИ — это лишь часть уравнения. Выбор правильной модели потребления не менее важен. Большинство организаций полагаются на три основные модели потребления ИИ, и использование неподходящей модели для конкретной рабочей нагрузки может быстро увеличить расходы.
Подписки на основе рабочих мест (seat-based)
Интерактивная работа с участием человека лучше всего подходит для подписок на основе рабочих мест, таких как Claude Team, ChatGPT Enterprise и GitHub Copilot.
Фиксированная ежемесячная плата за пользователя делает эти инструменты в пять-десять раз более экономичными, чем API с оплатой по факту использования, для повседневной работы разработчиков с аналогичными объемами генерации кода.
Предсказуемое ежемесячное ценообразование также упрощает бюджетирование, защищая вашу организацию от скачков потребления токенов, возникающих при интенсивных диалоговых рабочих процессах.
API ИИ и пакетная обработка
Автоматизированные рабочие процессы, автономные агенты и CI/CD конвейеры должны полагаться на доступ через API. Ценообразование API основано на использовании, что означает, что вы платите только за потребленные токены. Простаивающие агенты не генерируют расходы.
Не каждый запрос требует немедленного ответа. Фоновые рабочие нагрузки, такие как ночные проверки кода, массовое извлечение данных и обновление документации, лучше подходят для пакетной обработки. Многие провайдеры предлагают скидки до 50% на асинхронные задания, обрабатываемые в непиковые часы, что снижает стоимость крупномасштабных рабочих нагрузок ИИ.
Локальный ИИ (on-premises)
Локальный ИИ имеет смысл только после ответа на один вопрос: работает ли ваша организация с ИИ непрерывно при высокой загрузке?
В отличие от развертываний на основе API, локальная инфраструктура влечет за собой расходы независимо от того, обслуживает ли модель запросы или простаивает. Оборудование, обслуживание и электричество становятся фиксированными операционными расходами.
Локальная инфраструктура ИИ обычно становится экономически эффективной только тогда, когда загрузка остается стабильно высокой. Организации, использующие рабочие нагрузки ИИ примерно на 80% или выше, могут окупить инвестиции в инфраструктуру в течение двух-трех лет, одновременно сокращая долгосрочные расходы на API.
Запуск ИИ на собственных мощностях также сопряжен со скрытыми расходами:
- Для эксплуатации и обслуживания локальной инфраструктуры вывода требуются квалифицированные инженеры MLOps.
- Оборудование для ИИ быстро устаревает. Системы, приобретенные сегодня, возможно, придется заменить в течение двух лет, чтобы идти в ногу с требованиями моделей.
- Большие модели с открытыми весами легко настраиваются и становятся все более конкурентоспособными по сравнению с проприетарными альтернативами, но обслуживание моделей с сотнями миллиардов параметров требует значительной памяти, распределенной инфраструктуры, квантования и инженерных усилий.
Успех ИИ зависит от эффективности использования токенов
Снижение затрат на ИИ достигается не за счет использования меньшего количества моделей или ограничения их внедрения. Оно достигается за счет более эффективного использования ИИ. Лучшая архитектура, более умная маршрутизация моделей, оптимизированные промпты и правильная стратегия развертывания могут значительно сократить потребление токенов без ущерба для производительности.
Поиск самого большого источника потерь токенов всегда должен быть на первом месте. Оптимизация промптов не сильно поможет, если реальная проблема заключается в слишком больших фрагментах RAG, неэффективных циклах агентов или ненужных рассуждениях.
Не знаете, с чего начать? Семинар Vention по ИИ поможет определить, куда уходят ваши токены, выявить возможности для сокращения расходов и составить дорожную карту для более эффективной работы с ИИ.
Результаты говорят сами за себя: в одном из проектов работа Vention по оптимизации разработки с помощью ИИ сократила контекст, отправляемый в модель, на 95,47%, уменьшив количество необходимых входных токенов при сохранении 100% точности критических привязок в сценариях, подтвержденных провайдером.
Часто задаваемые вопросы
Как нам установить бюджеты на токены для команды или проекта?
Ваши бюджеты на токены должны основываться на использовании токенов и их целесообразности.
Вы можете отслеживать использование токенов вашими командами и проектами, помечая каждый вызов API метаданными до того, как он достигнет провайдера модели. После этого вы можете настроить пользовательскую панель мониторинга, которая предоставляет всю информацию об использовании токенов, разделенную по командам и проектам. Затем вы можете определить целесообразность расходов на токены и установить пользовательские лимиты, при этом система будет уведомлять ваши команды о превышении пороговых значений.
Можем ли мы сократить расходы на токены, не меняя модели или провайдеров?
Вы абсолютно точно можете сократить расходы на токены, не меняя модели или провайдеров моделей. Если вы еще не проводили архитектурную оптимизацию или оптимизацию промптов в своей текущей системе, это должно стать первым вариантом для рассмотрения. Размещение статических элементов в начале промптов для улучшения кэширования, удаление «слов-паразитов» из системных инструкций, исправление неэффективного разбиения данных (chunking) в RAG и маршрутизация несрочных задач через пакетную обработку помогут вам использовать меньше токенов и обеспечить выполнение задач по сниженным тарифам.
Сэкономит ли нам деньги перенос AI-моделей на локальные серверы (on-premises)?
Перенос AI-моделей на локальные серверы сэкономит вам деньги только в том случае, если вы соответствуете следующим критериям: использование вашего AI составляет примерно 80% или выше в любое время.
В других случаях, например, при низком или нестабильном уровне использования, расходы на локальную инфраструктуру, такие как оборудование, электроэнергия и необходимость в штатных MLOps-инженерах, часто приводят к более высоким затратам по сравнению с облачными API с оплатой за использование или подписками на основе количества рабочих мест.
Как динамическая маршрутизация моделей сокращает ненужные расходы на токены?
LLM-шлюз с семантической маршрутизацией определяет контекст и тип задачи, которую вы ставите перед AI, и решает, должна ли она быть выполнена передовой моделью или более легкой и дешевой.
Проще говоря, для повторяющихся задач, таких как форматирование данных, более дешевые модели дают те же результаты, что и передовые, но за малую часть стоимости. В конечном итоге вы все равно выполняете все задачи, но ваш бюджет расходуется значительно меньше.
Не знаете, с чего начать?
AI-воркшоп от Vention поможет определить, на что уходят ваши токены, выявить возможности для сокращения расходов и составить дорожную карту для более эффективной работы с AI.










