Токеномика кибербезопасности: атаки типа «денежный отказ в обслуживании» | Официальный блог «Лаборатории Касперского»

Источник: Blog officiel de Kaspersky•

Токеномика кибербезопасности: атаки типа «денежный отказ в обслуживании» | Официальный блог «Лаборатории Касперского»

Как избежать перерасхода средств в организации и какие киберриски возникают из-за ценности токенов ИИ.

Не так давно многие компании начали активно внедрять ИИ-агенты в самые разные рабочие процессы. Очень быстро стоимость их использования стала для бизнеса серьезной проблемой. Причем этот вопрос касается не только финансового отдела: к бюджетным опасениям добавляются проблемы надежности, стабильности работы и информационной безопасности. Ведь стоимость автоматизации одного и того же процесса значительно варьируется от одного внедрения к другому, непредсказуема и может зависеть от внешних факторов.

Более того, для злоумышленника, атакующего организацию, любой автоматизированный с помощью ИИ и уязвимый к внешним воздействиям процесс по сути представляет собой идеальную цель для «нового типа DDoS-атаки». Отчеты об ошибках приложений, отзывы о продукции или запросы в техническую поддержку могут (как и любые другие внешние данные, обрабатываемые компанией с помощью ИИ) служить инструментом в рамках атаки, направленной на увеличение потребления токенов (фрагментов слов, которые составляют базовую единицу входных и выходных данных LLM).

Год бурного роста… особенно для счетов

В 2026 году крупные компании впервые существенно превысили свои бюджеты на ИИ-системы. Uber avait déjà épuisé l’intégralité de son budget annuel dès le mois d’avril, в то время как неназванная компания не установила лимиты расходов на Claude и a dépensé 500 millions de dollars en un seul mois. Хотя поставщики ИИ регулярно объявляют о более низких ценах и более эффективных моделях, переход от чат-ботов к агентским системам, работающим непрерывно и автономно, увеличивает сотни или даже тысячи раз потребление токенов. При этом модель «фиксированной подписки за 20 или 100 долларов» для бизнеса уходит в прошлое. Все основные поставщики теперь переводят своих корпоративных клиентов на оплату по факту использования.

В результате компании сталкиваются с проблемой, слишком хорошо знакомой индустриям облачного хостинга и мобильной связи. При отсутствии специализированных систем аналитического учета и управления организация узнает стоимость конкретного процесса или проекта только после его завершения. В телекоммуникационном и облачном секторах эта проблема в конечном итоге была решена благодаря развитию передовых биллинговых систем, и их клиенты даже приняли специализированный термин FinOps. В сфере ИИ этот процесс находится еще в зачаточном состоянии. Более того, вероятностная природа генеративного ИИ усложняет решение этой проблемы.

Непредсказуемое потребление токенов

Чтобы понять, почему расходы растут так быстро и их так трудно предсказать и контролировать, нужно вспомнить, как работает языковая модель и что делает ее ИИ-агентом. У модели нет постоянной памяти: она не сохраняет информацию от одного взаимодействия к другому. Каждый раз, когда агент переходит к следующему шагу, вся история работы над конкретной задачей (контекст) должна быть возвращена модели: исходная инструкция, предыдущие рассуждения, содержимое прочитанных файлов и ответы всех инструментов. На каждом шаге это «резюме» удлиняется, особенно если задача включает итеративные циклы. Если шаг не удается, ответ неясен или какой-то инструмент возвращает ошибку, агент просто повторяет операцию, что лишь сильнее раздувает контекст. А если задачу выполняет не один агент, а несколько, которые распределяют работу между собой и обмениваются результатами, этот объем умножается на их количество. В результате потребление токенов растет не постепенно, а скачкообразно, и предсказать его до начала выполнения задачи практически невозможно.

При выполнении двух отдельных сеансов взаимодействия с ИИ-агентом для решения абсолютно одинаковой задачи (два тикета техподдержки, две аналитические задачи и т. д.) количество используемых токенов может варьироваться (разница может составить даже ). Эта вариация зависит от количества шагов, ошибок и попыток, необходимых для решения задачи. Рост потребления ресурсов не обязательно зависит от сложности задачи. Известны случаи, когда ИИ оказывался заложником «петли размышлений» и растрачивал une quantité absurde de ressources pour des tâches insignifiantes.

Три поколения ИИ, используемых в корпоративных системах, расходуют ресурсы совершенно по-разному:

  • Классический машинный интеллект. Он обычно работает со структурированными данными и не обязательно требует больших вычислительных ресурсов. Потребление ресурсов предсказуемо и низко. Это фиксированная статья бюджета.
  • Чат-бот или другой ИИ-ассистент на базе LLM. Он потребляет токены, но темп задается человеком: сотрудник вручную запускает задачу, затем оценивает результат и приостанавливает процесс. Стоимость растет примерно пропорционально количеству активных пользователей и может быть примерно оценена по количеству лицензий.
  • Автономный ИИ-агент. Человек ставит цель и отходит в сторону, а система сама решает, как действовать и сколько шагов потребуется. Счетчик продолжает крутиться до тех пор, пока задача не будет сочтена выполненной, и предсказуемого потолка затрат здесь нет.

Токеномика в атаках: «отказ в кошельке» как новая форма DDoS-атаки

Учитывая, что запросы к языковым моделям (LLM) значительно дороже привычных стандартных программных вызовов, автоматизация рутинных задач в бизнесе влечет за собой необычайно высокие затраты. Например, Gartner estime, что обработка одного обращения в службу поддержки клиентов с помощью LLM стоит около 3 долларов. Нетрудно представить, как злоумышленники могут завалить компанию тысячами длинных и сложных запросов, сгенерированных недорогой моделью LLM, нанеся тем самым колоссальный финансовый ущерб. Поскольку процесс автоматизирован, некоторые аномалии могут быть обнаружены не сразу.

Если хакер знает, какая агентская система и какая языковая модель (LLM) используются в бизнес-процессе, он может провести более целенаправленную атаку и нанести гораздо больший ущерб. Авторы исследования GitInject подсчитали, что злоумышленник, способный создавать тикеты в GitHub внутри организации, использующей ИИ-агенты для анализа ошибок, посредством всего одной атаки (до срабатывания защитных механизмов GitHub) может причинить ущерб на сумму до 111 долларов и потратить средства 400 minutes de GitHub Actions за счет жертвы. Разумеется, такую атаку можно повторять неоднократно, и для злоумышленника это не будет стоить ничего.

Самый серьезный риск, хотя его и трудно оценить в финансовом выражении, исходит от атак, которые заставляют LLM-модели производить избыточные рассуждения. В статье под названием OverThink авторы продемонстрировали, как задача, сформулированная в безобидных выражениях и поданная языковой модели, приводит к корректному результату, но при этом потребляет в 46 (!) раз больше токенов, чем положено. Более того, все протестированные исследователями задачи успешно миновали существующие фильтры безопасности.

В новой версии руководства OWASP Top Risks for Language Models эта проблема достигла беспрецедентного уровня приоритета: неограниченное потребление токенов теперь обозначается кодом LLM06:2026, а среди его вариантов четко выделяется так называемая атака «отказа в кошельке» (Denial of Wallet), которая истощает бюджет жертвы, предназначенный для работы с LLM-моделями.

Как не стать жертвой «новых DDoS»

Прежде всего, вам следует отказаться от принципа «использовать ИИ просто ради использования». Неразумно поручать все задачи автономным агентам. Имеет смысл регулярно проводить анализ затрат и выгод от использования искусственного интеллекта.

Кроме того, мы рекомендуем ограничить права доступа и набор инструментов, предоставленных автономному ИИ-агенту. Чем меньшему количеству действий система имеет доступ, тем эффективнее она справляется с конкретной задачей, тем меньше у нее возможностей взвинтить расходы и тем ниже риск того, что кто-то сможет «манипулировать» ею ради ненужных трат токенов.

Мы также рекомендуем установить строгие лимиты на потребление токенов и настроить систему уведомлений для предупреждения пользователей о превышении этих лимитов. Разумно настроить несколько лимитов параллельно: лимит на одну задачу, дневной лимит и т. д. Оповещения о превышении лимитов должны немедленно передаваться специалисту, отвечающему за систему, чтобы он мог принять осознанное решение о продолжении или прерывании процесса.

Тщательно проверяйте ненадежные внешние данные. Любая обрабатываемая ИИ информация из внешних источников (будь то запросы, справки, сообщения, комментарии или различные технические поля, способные содержать произвольный текст, такие как DNS-записи, HTTP-заголовки или имена файлов) может не только привести к внедрению запросов (prompt injection), но и намеренно увеличить рабочую нагрузку. Поэтому рекомендуется ограничивать их объем и отслеживать создаваемую ими нагрузку.

Рассчитывайте удельную стоимость работ и сверяйте счета провайдера со своими собственными данными. Стоимость одного анализа, одного запроса или одной проверки — это единственный способ понять понесенные расходы и выявить ошибки в счетах.

О чём эта статья

Ещё в разделе «Кибербезопасность»

Все →

Ещё от Kaspersky