Предприятия могут создавать ИИ-агентов. Гораздо сложнее добиться достаточного уровня доверия для их внедрения в промышленную эксплуатацию, и для этого требуется, чтобы тестирование, наблюдаемость и объяснимость работали как единая система.
В Camunda мы общаемся со множеством предприятий, которые прямо сейчас пытаются внедрить ИИ-агентов в производство, и везде звучит одна и та же история.
Агент прекрасно работает на демонстрации. Затем он запускается в реальных условиях, принимает решение по реальному клиенту, и возникает первый сложный вопрос: почему он это сделал?
Допустим, агент отклоняет заявку на кредит, и заявитель звонит, чтобы узнать причину. Операционный отдел открывает данные процесса и логи агента: страницы текста с рассуждениями без четкой точки принятия решения и без записи о том, какое правило политики сработало. Никто не может дать заявителю внятный ответ.
Разрыв между пилотом и окупаемостью
Согласно отчету Camunda «Состояние агентской оркестрации и автоматизации 2026», 71% предприятий сегодня используют ИИ-агентов в бизнесе — в пилотных проектах, «песочницах» и ограниченных испытаниях. Только 11% внедрили хотя бы одного агента в реальную эксплуатацию для принятия решений по реальным клиентам, и 85% заявляют, что у них нет достаточной зрелости процессов для такого шага.
Каждый из этих пилотов уже доказал, что агент может выполнять работу в контролируемых условиях. Отсутствие зрелости процессов сводится к одной важной вещи: доверию. Как только агент начинает принимать решения внутри реального бизнес-процесса, ответственные за него люди не могут сказать, как он себя поведет, что он делает прямо сейчас или почему он сделал то, что сделал.
Одни и те же вопросы возникают в каждом разговоре на предприятии о внедрении агента в производство, часто от разных людей и в разное время:
Цена полета вслепую
Некоторые предприятия не ждут ответов на все эти вопросы. Они внедряют агентов в производство без них, и затраты начинают проявляться.
- На первом месте — регуляторные издержки. Закон ЕС об ИИ требует наличия возможности аудита, объяснимости и контроля со стороны человека для систем ИИ с высоким уровнем риска. Если вы ошибетесь с прозрачностью, штраф может достигать 3% от мирового годового оборота или 15 миллионов евро, в зависимости от того, что больше. Агент, который не может объяснить решение, принятое в отношении клиента, — это уже не технологический риск, а регуляторная ответственность, ожидающая аудита.
- Коммерческие затраты — это то, о чем спрашивает совет директоров. Каждый квартал, пока агент находится на стадии проверки концепции, конкурент тратит тот же квартал на его выпуск, а финансовый директор хочет знать, почему бюджет на ИИ еще не превратился в нечто измеримое. Мы присутствовали на достаточном количестве таких обзоров, чтобы знать: фраза «это работало на демо» дает вам одну встречу. Но не вторую.
- Операционные затраты — это то, что команды недооценивают, пока не столкнутся с ними. Единый бизнес-кейс, претензия, кредит, заказ — все это проходит через людей, системы и агентов вместе, но инструменты, созданные для каждой стороны, не взаимодействуют друг с другом: фреймворк агента записывает, что сделал агент, инструмент для участия человека записывает, что одобрил человек, и ни один из них не фиксирует передачу управления между ними. Человек вмешивается, чтобы одобрить или отменить решение агента (именно тот момент, о котором позже спросит аудитор), и именно здесь история распадается: рассуждения агента находятся в одной системе, решение человека — в другой, и ничто не связывает их в единую запись о том, что произошло. Видимость исчезает именно там, где выполняется бизнес-кейс: на этапе передачи управления между человеком и агентом.
Тестируй, наблюдай, объясняй
Ответ Camunda начинается с этих вопросов, а не со списка функций. Мы называем это «Доверием к промышленным агентам» (Production Agentic Trust) — частью агентской оркестрации, которая делает безопасным запуск в производство. Три вещи должны соблюдаться одновременно. Вы доказываете, как ведет себя агент, прежде чем он дойдет до клиента. Вы наблюдаете за тем, что он делает во время работы. И каждое принятое им решение оставляет запись, которую можно передать аудитору.
Тестируй: доказывает, как ведет себя агент, прежде чем он коснется реального клиента, и это должно отвечать на более сложный вопрос, чем большинство тестов. Один и тот же агент, получив одни и те же входные данные, может дважды принять разные, но одинаково обоснованные решения. Это не баг, который нужно исправить. Это то, как работают такие системы, поэтому тестирование агента означает многократный запуск одного и того же сценария и проверку того, что разброс результатов остается в пределах того, что бизнес считает приемлемым, а не просто проверку того, что один прогон прошел успешно. Статистические методы выполняют эту работу: измерение того, как часто решения агента варьируются, насколько сильно они варьируются и уменьшается или увеличивается ли эта вариативность по мере изменения агента.
Наблюдай: означает, что оператор может видеть, что делает агент в процессе работы, а не реконструировать это постфактум из лог-файла. Этот обзор начинается с системного промпта и модели, на которой работает агент, поэтому контекст его поведения виден, а не предполагается. Он охватывает диалог между агентом и тем, кого или что он обслуживает, а также каждый вызов инструмента с его входными и выходными данными. И он распространяется на инструменты, которые были доступны агенту, но которые он решил не вызывать: агент, который никогда не использует предоставленный ему путь эскалации, представляет собой другой риск, чем тот, которому путь эскалации вообще не был предоставлен, и только видя, что он мог бы сделать, можно различить эти два случая.
Объясняй: означает, что каждое решение автоматически оставляет запись, созданную для ответа на вопросы, которые задает регулятор или аудитор: с каким контекстом работал агент, какие инструменты он вызывал, эскалировал ли он вопрос, когда был не уверен, вместо того чтобы гадать, где вмешался человек и почему он пришел к такому результату. Ограничители (guardrails), действующие в то время, также являются частью этой записи: пороги одобрения, правила эскалации и лимиты, которые применялись, когда агент действовал, а не политика, хранящаяся где-то еще. Это возможно, потому что Camunda управляет агентом на двух уровнях одновременно: как он участвует в более крупном бизнес-процессе, который уже включает людей и другие системы, и что ему разрешено делать, когда он решает действовать. Когда регулятор спрашивает, почему было принято решение, или руководитель операций спрашивает, где находится кейс, ответ уже существует.
Ничего из этого не нужно перестраивать каждый раз, когда выпускается новый агент. Та же запись, которая объясняет одно решение, объединяется в текущий обзор того, как агент работает в сотнях случаев: уровни эскалации, как его поведение меняется по мере роста объема, справляется ли версия этой недели так же хорошо, как версия прошлой недели. Это отвечает на вопрос, который никто не задает на первой неделе: работает ли это все еще хорошо?
Что дают вам все остальные
Большинство инструментов, которыми уже владеют предприятия, решают только одну часть этой задачи и останавливаются. Инструменты мониторинга, созданные для ИТ-операций, показывают, работает ли система, а не почему агент выбрал один путь, а не другой. Инструменты управления рабочими процессами и кейсами показывают лог того, что было выполнено, но этот лог обрывается на границе того, что создало агента: объедините агентов из двух разных фреймворков в один бизнес-процесс, и каждый из них будет отвечать только за свою половину истории. Существуют также точечные решения для тестирования, наблюдаемости и подтверждения соответствия требованиям, каждое из которых продается отдельно и охватывает только свой сегмент.
Согласно тому же отчету Camunda, почти половина предприятий (48%) заявляют, что их ИИ-агенты работают изолированно и не интегрированы в сквозные процессы. Предприятия, уже использующие агентов из нескольких фреймворков, напрямую сталкиваются с этой «слепой зоной»: агент, созданный на базе open-source фреймворка, передает задачу на этап утверждения человеком, который затем передает ее второму агенту, разработанному собственными силами. В итоге никто не имеет единого представления о детерминированных шагах, людях и агентах, которые сосуществуют в рамках одного процесса. Сбор такой картины вручную на основе логов из трех разных инструментов — это полноценная работа, на которую в конечном итоге нанимают сотрудников все компании, масштабирующие использование более чем нескольких агентов.
Что Camunda предлагает взамен
Альтернативой является платформа, где тестирование, мониторинг и объяснение работы агента объединены в единую систему, адаптированную к поведению агентов: способную принимать обоснованное решение при одном запуске и другое, столь же обоснованное решение при следующем.
Этот подход решает все задачи в одном месте. Camunda отображает весь процесс как единое целое: задачи, выполняемые пользователем, сервисы, вызываемые системой, ИИ-агенты Camunda и агенты, созданные в других средах (например, в LangGraph или с помощью пользовательского скрипта на Python), которыми Camunda управляет как шагом в том же процессе. Добавьте внешнего агента в процесс Camunda, и он появится рядом с нативными: тот же интерфейс диалога, тот же контрольный журнал, а не «черный ящик» с входом и выходом.
Большинство инструментов могут проверять только то, что они сами создали. Camunda же проверяет весь процесс целиком, независимо от того, какой агентский фреймворк выполняет работу внутри него: это единое пространство, где решение агента, одобрение человека и процесс, объединяющий их обоих, остаются связанными, а не разбросаны по трем системам, которые не взаимодействуют друг с другом. В этом и заключается разница между наблюдением за агентом и наблюдением за бизнес-процессом, частью которого является этот агент.
Успешный вывод агентов в промышленную эксплуатацию в этом году сводится к одному: способности отвечать на все четыре вопроса для каждого агента, каждый раз, без необходимости собирать команду для восстановления хронологии событий. Самая продвинутая модель здесь не поможет, а вот Production Agentic Trust — да. Она создана именно для того, чтобы устранить этот разрыв, и ее внедрение сегодня позволит вам опередить почти всех, кто все еще застрял на этапе пилотных проектов.
Далее в этой серии: что значит тестировать агента, который может принять два разных, но одинаково обоснованных решения на одних и тех же входных данных? Это тема второй статьи, которая выйдет в ближайшее время.