## От облачного нативного ПО к агентному ИИ
Десять лет назад мы поставили перед собой задачу объединить мир с помощью API, которые мы рассматривали как фундаментальные строительные блоки программного обеспечения. До появления Kong мы основали Mashape в качестве первого маркетплейса API, предоставляющего конвейер для разработчиков, создающих приложения, а затем открыли исходный код его базовой среды выполнения API — Kong, самого быстрого облачного шлюза API.
Компания Kong Inc. официально родилась летом 2017 года. Началась новая эра микросервисов и облачных приложений. Этот момент превратил нас из небольшого шлюза с открытым исходным кодом в репозиторий API №1 на GitHub и ведущую облачную платформу управления API, которую используют тысячи организаций по всему миру и которую Gartner, Forbes и многие другие признали лидером и одним из самых дальновидных игроков в сфере облачной инфраструктуры.
Сегодня мир находится на очередном поворотном этапе: агентный ИИ. Подключение остается неизменным. Создателям по-прежнему нужно строить облачные приложения, которые соединяют сервисы с людьми. Но в лице агентов появляется новая потребительская сущность — первая настоящая «продуктовая форма» ИИ.
Впервые интернет вращается не только вокруг графического интерфейса, но и вокруг программных интерфейсов (скоро и голосовых). API — это пользовательский интерфейс для агентного мира, созданного для *машинного* потребления, а не для людей. Агенты будут поглощать эти интерфейсы в масштабах, которые мы сейчас даже не можем осознать. Они обнаруживают, учатся и совершают транзакции быстрее людей. Появляются новые стеки. Бэкенды изменятся. Например, в облачных приложениях вы в основном используете базы данных SQL; в агентном мире мы будем использовать базы данных с разделением хранения и вычислений, векторные базы данных, озера данных и LLM в качестве источников гравитации данных.
Клики мышкой, указание и прокрутка станут менее значимыми. Они будут использоваться, когда что-то застревает. Агентный рабочий процесс — с голосовым наложением для ввода данных человеком — станет основным методом потребления интернета. Даже если инновации в области агентов стабилизируются, будет развертываться все больше специализированных агентов, что увеличит сложность оркестрации и потребности Kong по мере роста проблем с трафиком и подключением.
Следующей великой задачей станет переход от соединения облачных сервисов к соединению интеллекта.
Добро пожаловать в эру ИИ-подключения.
## Вызовы API + токены
Соединительной тканью облачной эпохи были вызовы API в чистом стиле REST. Но в эпоху ИИ мы стоим на новом поворотном этапе: токены. Они находятся на пересечении API-трафика и ИИ-трафика.
API вызывают. Теперь они *думают*.
API-трафик дополняется уровнем интеллекта. Прежде чем запрос покинет эндпоинт или будет установлено MCP-соединение, он обладает контекстом, памятью и способностью к рассуждению. Очень скоро сам трафик станет интеллектуальным.
Следующий уровень интернета будет состоять не просто из вызовов API, питающих приложения; он будет состоять из моделей, ИИ-агентов, голосовых помощников и второго пилота, которые передают интеллект туда и обратно с помощью токенов. Каждый раз, когда система отправляет промпт модели, каждое окно контекста, каждый разговор между агентами порождает новый тип токен-трафика. Но почему это важно?
*Горный перевал.*
Я считаю, что управление ИИ будет выиграно именно здесь. Чтобы ИИ мог беспрепятственно работать и совершать транзакции, он должен находиться под надежным управлением. Хотя первоначальное рыночное позиционирование ставит эту задачу ближе к платформе данных из-за естественного притяжения, ни у одной компании нет единой платформы данных. Таким образом, лучшее место для управления гетерогенным ландшафтом различных облаков, данных и моделей — это нейтральный уровень трафика. Это произошло во время революции микросервисов, которую мы возглавили, и это произойдет в сфере ИИ.
Мы всегда считали, что самый стратегический плацдарм для создания платформы API — это контроль над горным перевалом уровня трафика. В облачном мире шлюзы API были брокерской технологией. Но в агентном мире ИИ-шлюзы — это следующие брокеры подключения, которые оркестрируют трафик между API и моделями; ИИ-трафик будет в 1000 раз больше. Это масштаб машин.
Таким образом, *горный перевал смещается*.
Сначала медленно. А потом внезапно. По мере быстрого появления нового ИИ-трафика возникают новые протоколы (как REST в облаке). MCP — это первая массовая форма, но появятся и другие протоколы ИИ, позволяющие ИИ подключаться и общаться новыми способами. Наши принципы всегда будут поддерживать то, что появится в будущем, для самых требовательных компаний.
Мы рождены для этого момента. Та же «*логика подключения*», используемая для управления API — или, лучше сказать, потребность в безопасности, управлении, ускорении и наблюдаемости — еще более важна для ИИ-трафика.
Эффективное и безопасное управление и доставка этих токенов — это новая задача, которую мы решаем.
API — для разработчиков. MCP — для LLM. Подобно тому как Kong стал плоскостью управления для API, теперь он станет плоскостью управления для ИИ-трафика. Новой единицей проксируемой ценности являются *токены*. Каждый токен несет в себе конфиденциальный контекст и должен контролироваться. Пропускная способность токенов определяет эффективность, а контроль затрат — это разница между положительной и отрицательной маржой.
## Гипер-объемы
По мере размножения фабрик токенов возникает новый закон масштабирования ИИ. ИИ приносит порядок величины и объемы, которых мы никогда раньше не видели. Совершение миллиарда вызовов API раньше было значительным вехой для бизнеса. Kong Gateway обрабатывает триллионы запросов в день на сверхвысоких скоростях без единой ошибки. Это огромное число, но оно даже близко не стоит к тому, что нас ждет в эпоху агентного ИИ.
Гонка масштабов ИИ заключается в том, кто победит в сфере *гипер-объемов*.
Теперь мы должны подготовить нашу инфраструктуру к квадриллионам, а вскоре и к квинтиллионам запросов API и ИИ-трафика. Объем заключается не только в вызовах и токенах, но и в данных в реальном времени, событиях, потоковых сеансах MCP и промптах LLM. Он *мультимодальный*. Его сложность нарастает. У нас не только огромные объемы трафика, но и гетерогенные. Большая часть аппаратной и программной инфраструктуры, которую мы создали до сегодняшнего дня, потребует переработки с нуля для работы с гипер-объемами. Но не Kong. Kong создан для мультимодальных гипер-объемов.
Например, в мае 2025 года генеральный директор Google Сундар Пичаи представил график, показывающий, что ежемесячная обработка токенов Gemini выросла почти в 50 раз по сравнению с маем 2024 года и достигла 480 миллиардов токенов. К октюбрем компания объявила о достижении 1,3 КВАДРИЛЛИОНА токенов в месяц во всех продуктах Google AI.
Триллионы были единицей масштаба, которую, как мы думали, трудно достичь. Теперь мы должны верить в квадриллионы, а вскоре и в квинтиллионы, поскольку ИИ устанавливает новый закон масштабирования. Гипер-объемы.
## Скорость — это все, что вам нужно
Токены по-прежнему крайне неэффективны. Сжатие промптов, оптимизация нотации, семантическое кэширование и интеллектуальная маршрутизация понадобятся в больших масштабах для сокращения отходов и обильного распределения интеллекта. Все это проблемы ИИ-подключения, которые помогает решить Kong.
В мире, который уже движется с поразительной скоростью и где дата-центры превращаются в фабрики по генерации токенов, выручка будет привязана к энергии. И есть только две вещи, которые имеют значение:
- - Токены x Ватт
- - Токены x Секунда
Первое важно потому, что оно напрямую коррелирует с выручкой и маржинальностью. Второе необходимо, так как связано с ростом доходов. Чем больше токенов бизнес может пропустить через себя, тем больше выручки он способен получить. Задержка в полсекунды в масштабах квадриллиона токенов означает существенную разницу в выручке.
*Токены = Выручка.*
Мы всегда хотели быстрые приложения и бэкенды с низкими задержками и надежными вызовами API. Сегодня речь идет не просто о более быстром цифровом взаимодействии, когда кто-то ждет на пару секунд дольше, чтобы забронировать билет на самолет. Речь идет об экономической выживаемости в гонке ИИ. Бизнесу придется трансформироваться и приобрести самый быстрый и эффективный стек ИИ — от железа до софта. Например, в мире CPU отставание на 10% не имело особого значения, но в мире GPU всё решает производительность. Nvidia поняла это десятилетие назад и захватила большую часть рынка GPU, создав продукты быстрее, чем у всех остальных.
Скорость — это всё, что нужно.
Как уже упоминалось, показатели токенов в секунду, которые мы видим сегодня, по-прежнему в основном обусловлены действиями человека. Когда агенты станут мейнстримом и будут потреблять токены напрямую от других агентов для выполнения работы, нагрузка по пропускной способности вырастет еще сильнее.
Но здесь есть подвох! Чтобы двигаться быстро и передавать токены на высокой скорости, предприятиям придется создать новые защитные механизмы, чтобы обеспечивать безопасность, надежность и минимизацию масштаба возможных сбоев при передаче интеллекта. И снова наша задача — действовать как диспетчерская вышка на уровне трафика.
Токены — это то, как будет перемещаться интеллект. Скорость — это то, как быстро он изменит мир.
Kong — это скорость.
## Новый уровень подключения
Этот беспрецедентный спрос на скорость требует новых цифровых рельсов. Уровня подключения для гипер-объемов. Для скорости света. С управлением. Для агентов, вызовов API, моделей и токенов. И всё это под защитой систем безопасности.
*Уровень подключения для ИИ.*
У нас есть возможность построить цифровые рельсы, которые позволят каждому бизнесу процветать, не оставаться позади, ускоряться и безопасно раскрывать интеллект.
Появляется новый стек ИИ.
У нас есть новые облака для ИИ («неооблака»), такие как CoreWeave, базовые модели, LLMOps и платформы инференса, и это лишь некоторые из них. «Клиентами» этой новой волны являются не только веб-сайты, сервисы и приложения, но и ИИ-агенты, а в перспективе — робототехника. Короче говоря, машины.
Где же уровень подключения — тот клей, который держит всё вместе, и почему именно сейчас?
Главная ставка делается на то, что тот же архитектурный паттерн, который возник в облачных микросервисах, проявится и в агентном ИИ. Около десяти лет назад трафик в инфраструктуре предприятий и технологических компаний резко вырос; контейнеры, Kubernetes, бессерверные вычисления, файлы YAML, CI/CD и многое другое появились для разделения монолитов на микросервисы с целью создания новых масштабируемых систем.
Возникла потребность в эластичном масштабировании бэкенда до самодостаточного, более мелкого фрагмента программного обеспечения. Так родилась эра облачных технологий.
Это породило взрывной рост API для обеспечения их взаимодействия, а HTTP RESTful-трафик рос по мере того, как все больше новых приложений и устройств входили в нашу жизнь. Сначала разработчики встраивали логику подключения бизнеса — ограничение скорости (rate-limiting), логирование, аутентификацию — прямо в свои микросервисы, используя библиотеки на предпочитаемых языках программирования. Затем, когда число микросервисов выросло до сотен, изобретение велосипеда заново стало ресурсоемким для R&D, и так появился шлюз API.
Логика подключения внезапно сместилась на уровень прокси — абстрагированный, не зависящий от языка программирования и способный передавать нужные элементы управления (например, ограничения частоты запросов) в каждый сервис. Инженеры вернулись к созданию основных интеллектуальных прав (IP), а не к управлению трафиком. Рынок управления API взлетел до небес, и вокруг API-шлюзов сформировался полный жизненный цикл API, помогающий в *создании, запуск, обнаружении и управлении* API.
Это повторяется и в сфере ИИ. Сначала в организации было всего несколько LLM, и появились такие фреймворки, как LangChain. По мере того как компании развивают свои ИИ-инициативы, в их инфраструктуру будет поступать всё больше больших, средних и малых языковых моделей и агентов, стимулируя ИИ-трафик через вызовы, потоки событий и токены. Как и раньше, потребуется создать новую логику подключения. Защитные механизмы больше не будут создаваться в бэкендах/LLMOps снова и снова, они будут абстрагированы (опять же) в новый паттерн: ИИ-шлюз.
ИИ-шлюзы не станут единственным видом «ИИ-мидлвара». На стыке инференса и взаимодействия агентов друг с другом появится еще больше типов брокеров трафика.
Первоначальный уровень подключения ИИ похож на API-шлюзы, но более сложен и семантичен по своей природе. Мы будем поддерживать входящий/исходящий трафик для LLM и MCP-серверов, применяя защитные механизмы — от вызовов API до токенов — в рамках единого интерфейса. Например, ограничение частоты запросов будет переплетаться с бюджетами токенов.
Подход остается прежним; логика подключения продолжит существовать на уровне трафика, подобно диспетчерской вышке аэропорта. Точно так же, как диспетчерская вышка управляет безопасностью, маршрутизацией и темпом, ИИ-шлюз управляет токенами, а также доступом и разрешениями агентов. Команды API и ИИ-трафика будут направляться нужным людям, машинам, сервисам и агентам в нужный момент. Интеллектуальный поток.
Будущий путь для любого бизнеса — это ИИ.
Kong создала *единственную в своем роде универсальную платформу API и ИИ*, обеспечивающую безопасность, управление, ускорение, администрирование и монетизацию потока интеллекта по всем данным, моделям и API — на любом облаке.
Квадриллион токенов за раз. Мы внедряем современные рельсы. Уровень подключения для ИИ, позволяющий безопасно высвободить интеллект.
Началась *эпоха подключения ИИ*.







