Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/V agentnom mire so stremitelno desheveyuschey avtomatizatsiey kakuyu rabotu stoi
Dev48

© 2026 · All rights reserved.

В агентном мире со стремительно дешевеющей автоматизацией: какую работу стоит передавать человеку?

Источник: Scale AI

В агентном мире со стремительно дешевеющей автоматизацией: какую работу стоит передавать человеку?

Источник: Scale AI

Оценка пороговых значений для участия человека (human-in-the-loop) в денежном выражении на примере рабочего процесса по возврату кредиторской задолженности, созданного в Scale AI совместно с глобальной медиатехнологической компанией.

25 сентября 2026 г.

Где человеческое суждение сохраняет свою ценность

Крупные компании часто упускают выгоду в кредиторской задолженности. Выписки поставщиков регулярно содержат кредиты, переплаты и дублирующие начисления, подлежащие возврату, однако их выявление требует ручной сверки с корпоративными записями. Ограничивающим фактором здесь становится пропускная способность отдела проверки. Объем выписок превышает ресурсы команды по работе с кредиторами, поэтому проверку проходит лишь часть документов, а подлежащие возврату остатки остаются невостребованными.

Работая с финансовой командой глобальной медиатехнологической компании (Media Co.), специалисты Scale AI создали агентную систему для этого рабочего процесса. Она принимает и классифицирует запросы поставщиков, выявляет кредитные позиции в выписках, получает кредитные номограммы от поставщиков и в конечном итоге вносит данные в систему планирования ресурсов предприятия (ERP). Ожидается, что система вернет миллионы долларов в виде кредитов, которые в противном случае остались бы невостребованными.

Один из вопросов при ее разработке заключался в том, когда позволить агенту действовать самостоятельно, а когда привлекать человека. Этому вопросу и тому, как ответить на него в денежном выражении, посвящена данная статья.

С каждой новой волной технологий автоматизации возникает знакомый вопрос: какую часть конкретной работы можно переложить на машину? Агентные системы усложняют эту постановку задачи. Агент на базе языковой модели готов выполнить практически любую интеллектуальную задачу с пренебрежимо малой предельной стоимостью, однако его надежность может варьироваться от задачи к задаче. Ответ на этот вопрос в долларах требует наличия предметной области, в которой можно измерить как стоимость ошибки, так и ценность времени сотрудника.

Финансы часто представляют собой именно такую область, особенно возврат средств. Кредит либо возвращен, либо нет, а час аналитика потрачен либо на одну выписку, так или иначе. Обе стороны уже выражены в денежных единицах, поэтому границу, при которой человеческая проверка становится целесообразной, можно установить напрямую. Не каждое решение работает по такому принципу. Финансовый директор подписывает квартальные отчеты потому, что этого требует закон, а не потому, что его проверка является самым дешевым способом обнаружения ошибок; кроме того, некоторые решения в рамках этого процесса регулируются нормативными актами, внутренней политикой или отношениями с поставщиками. Они обрабатываются как правила, а не оцениваются в денежном эквиваленте.

Автоматизация также часто сопровождается эффектом второго порядка, заслуживающим внимания. По мере того как предельная стоимость задачи приближается к нулю, объем работы, экономически оправданный для выполнения, не остается фиксированным — он растет. Работа, которая не оправдывала затрат человеческого времени, становится по силам агенту, а ранее выходившие за рамки задачи задачи начинают иметь смысл. Джевонс (1865) наблюдал аналогичную закономерность в потреблении угля, где рост эффективности паровых двигателей увеличивал общее потребление за счет того, что ранее неэкономичные сферы применения становились жизнеспособными.

Максимизация доли автоматизируемой работы больше не является главной целью. Вопрос в том, какая часть расширяющейся вселенной задач заслуживает внимания человека. Мы утверждаем, что в финансовых рабочих процессах эту границу можно определить количественно, сопоставив стоимость человеческой проверки с ожидаемой ценностью решений, которые эта проверка улучшает. Получаемая граница учитывает риски, а не является фиксированной: по мере роста потенциального воздействия ошибки должна расти и требуемая уверенность для автономных действий. Мы разрабатываем эту концепцию на примере рабочего процесса по возврату кредиторской задолженности и показываем, как ее можно использовать для распределения ограниченного ресурса человеческой проверки на те решения, где вмешательство имеет наибольшую ожидаемую ценность.

Связанные работы

Наиболее близкие к нашей разработке решения уже используются предприятиями в продакшене. Автоматизация кредиторской задолженности имеет стандартную структуру: извлечение полей из документа, их проверка по правилам и маршрутизация на утверждение в случае сбоя правила или превышения лимита расходов. Варун и Ислам (2026) описывают бескудовую (no-code) агентную архитектуру, в которой языковая модель читает счета-фактуры, извлекает правила налогообложения из векторной базы данных и записывает результаты обратно через функции базы данных, используемые в качестве инструментов. Симкокс (2026) описывает аналогичную последовательность внутри облачной ERP, включающую захват, извлечение, сверку с заказами на покупку и маршрутизацию утверждения на основе пороговых значений. Обе системы отлично подходят для стандартного сценария. Ни одна из них не решает проблемы, возникающие при ошибке модели. Здесь нет показателей уверенности в решении, оценки стоимости некорректного автономного действия и критериев для привлечения человека. Маршрутизация утверждений в таких системах запускается сбоями правил и лимитами расходов, а не вероятностью правильности работы системы.

Исследования в области автоматизации на основе правил устанавливают предел возможностей детерминированных подходов. Джамитиредди (2025) реализует роботизацию процессов (RPA), основанную на обработке исключений, для кредиторской и дебиторской задолженности, главной книги и сверки банковских счетов в SAP, сообщая о сокращении циклов сверки, снижении объема ручного вмешательства и улучшении выявления нарушений. Эта архитектура присваивает исключениям оценки уверенности, хотя они проистекают из фиксированных допусков правил и заранее определенных путей преодоления сбоев. Следовательно, производительность падает на транзакциях, не предусмотренных набором правил, — именно в эту категорию часто попадают кредиты поставщиков.

Машинное обучение, применяемое к документам, ближе к нашей работе. Малла (2025) описывает действующую систему обработки счетов, объединяющую оптическое распознавание символов (OCR), обработку естественного языка и цикл проверки человеком на основе степени уверенности. Однако ее метрика уверенности отвечает на более узкий вопрос, чем наша: правильно ли было прочитано поле со страницы, а не является ли верным все решение по сверке в целом. Дадопулос и Москыдис (2026) используют языковую модель для оценки того, как часто правильная запись появляется среди трех кандидатов, предлагаемых аналитику. Эта метрика предполагает наличие правильной записи для каждой строки, однако при кредитной сверке наиболее частым результатом является полное отсутствие возвращаемых кредитов. Обе системы решают, что показать человеку, но ни одна из них не ставит вопрос о том, не стоит ли время этого сотрудника дороже в другом месте.

Отдельное направление исследований посвящено тому, как разделить работу между моделью и человеком. Селективное прогнозирование позволяет модели воздержаться от ответа при отсутствии уверенности и передать такие кейсы кому-то другому: чем меньше ответов она дает, тем выше ее точность по оставшимся (Чоу, 1970). Пайплайны с участием человека в контуре используют ту же идею с порогом уверенности. Эти подходы оценивают ошибку, но по единому фиксированному тарифу: отказ от ответа оценивается одинаково как для строки на 50 долларов, так и на 50 000 долларов. При работе с возвратами, где ценность сосредоточена в нескольких крупных кредитах, это предположение не работает.

Соответствует ли выраженная моделью уверенность её эмпирической точности — это вопрос сам по себе. Точность наблюдается только после того, как становится известен правильный ответ, в то время как уверенность — это оценка, производимая в момент принятия решения. Сюн и др. (Xiong et al., 2024) обнаружили, что большие языковые мотели, которых просят сообщить об их собственной уверенности, систематически самоуверенны. Второй подход рассматривает согласие между ответами как свидетельство надежности, но его полезность зависит от температуры — параметра, который определяет, сколько случайности использует модель при создании текста (Лин, Триведи и Сун / Lin, Trivedi, and Sun, 2023). Ни один из подходов не дает цифры, пригодной для экономических расчетов, до тех пор, пока она не будет откалибрована, что означает, что решениям, которым присвоен балл 0,9, в близких к 90 процентах случаев оказывается свойственно быть правильными. Гоо и др. (Guo et al., 2017) сортируют предсказания по балкам в зависимости от уверенности и сопоставляют среднюю уверенность каждой корзины с долей в ней тех решений, которые оказались правильными. Точки ниже 45-градусной линии указывают на самоуверенность, суммарно выражаемую как ожидаемая ошибка калибровки (ECE). Калибровка здесь важна потому, что порог в Разделе 3 зависит от реального уровня ошибки, а не только от меры того, насколько уверенной модель заявляет себя.

Определение высокоценной работы

В соответствии с классической экономической концепцией предельного продукта труда в денежном выражении (MRPL), высокоценную человеческую работу можно определить как работу, для которой ожидаемый вклад человека, измеряемый в долларах, превышает стоимость его времени. Для отдельного решения внутри автоматизированного рабочего процесса этот вклад представляет собой убыток, предотвращаемый проверяющим, поэтому проверка оправдана, когда

P(error) × Impact(error) > Cost(review)

Работа, не прошедшая этот тест, является кандидатом на автоматизацию или на исключение из конвейера. Применение теста на практике требует соблюдения двух критериев.

Критерий 1: Ожидаемая стоимость. В базовом случае каждый член уравнения непосредственно наблюдаем. Влияние (Impact) — это стоимость кредита, находящегося на кону, C. Вероятность ошибки равна единице минус уверенность агента q в том, что его решение верно, то есть P(error) = 1 − q. Стоимость проверки — это стоимость R времени аналитика, необходимого для ее проведения. Таким образом, проверка оправдана, когда

(1 − q) × C > R

Для большинства кредитных позиций этого сравнения достаточно, а получаемый в результате пороговый показатель легко вычислить.

Критерий 2: Асимметричные риски снижения стоимости. Приведенный выше расчет ожидаемой стоимости предполагает, что стоимость ошибки симметрична выгоде от правильного решения. В рабочих процессах по возврату средств это предположение выполняется не всегда. Рассмотрим кредит, который агент ошибочно определил как уже взысканный и поэтому закрыл без эскалации. Возмещаемый баланс упускается полностью, и если контрагент является крупным поставщиком, та же неверная классификация, скорее всего, повторится в последующих выписках, усугубляя убытки и создавая трения в коммерческих отношениях. Противоположная ошибка — эскалация кредита, который оказывается недействительным, — поглощает несколько минут времени аналитика. Таким образом, стоимость ложноотрицательного результата не равна и не противоположна выгоде от истинно положительного результата.

Эту асимметрию можно сделать явной, отделив номинальную стоимость кредита от той его доли, которая действительно теряется, когда агент совершает ошибку, а человек не вмешивается:

Impact(error) = s × C, где 0 < s ≤ 1

Здесь C — номинальная стоимость кредита, а s — коэффициент тяжести (серьезности), определяемый обратимостью. Этот расчет отражает механизм, посредством которого ошибки проявляются или не проявляются. Тихо закрытый кредит имеет s близкое к 1 именно потому, что ничто на последующих этапах не обнаруживает его, и именно поэтому такие балансы обычно обнаруживаются только в ходе аудита. Недействительный кредит, который был проведен, ведет себя противоположным образом: поставщик оспаривает его, и последующая выверка аннулирует его, поэтому реализованная стоимость составляет лишь часть номинала, а s мала.

Введение коэффициента тяжести позволяет варьировать порог проверки в зависимости от типа ошибки. Незвучащие (скрытые) ошибки, которые вряд ли будут обнаружены или исправлены на последующих этапах, должны вызывать необходимость проверки человеком при более низких номиналах кредита. Обратимые ошибки могут допускать более высокие значения, прежде чем потребуется проверка, поскольку большая часть их потенциального влияния будет обнаружена и исправлена позже. Это направляет внимание человека на те ошибки, где вмешательство имеет наибольшее значение.

В совокупности оба критерия дают пороговое значение. При фиксированном бюджете на проверку они также обеспечивают способ ранжирования, что на практике имеет большее значение. Если предположить, что пропускная способность (ресурс) аналитиков остается постоянной, реальный вопрос заключается не в том, заслуживает ли данный кредит проверки сам по себе, а в том, какие кредиты получат доступ к имеющимся минутам. Ранжирование решений по ожидаемым убыткам, то есть по P(error) × s × C, и распределение ресурсов в таком порядке порождает пороговое значение как побочный продукт: оно оказывается там, где исчерпывается бюджет. Таким образом, эта структура функционирует в равной степени и как правило приоритизации, и как тест стоимости, направляя дефицитное экспертное внимание на те решения, которые одновременно являются наименее определенными и наиболее значимыми.

Приложение: Возврат невостребованных кредитов в Media Co.

Media Co. осуществляет деятельность по циклу «от закупки до оплаты» (procure-to-pay), в рамках которой кредиты обычно возвращаются только в том случае, если поставщики заблаговременно направляют кредитное авизо. Ручная проверка выписок поставщиков с целью выявления кредитов требует слишком много времени для того, чтобы команда могла проводить ее в больших масштабах, поэтому в настоящее время кредиты выявляются активно крайне редко.

Агентная система, разработанная для этого рабочего процесса, принимает каждый документ, классифицирует выписки поставщиков и кредитные авизо как релевантные по сравнению с другими документами, извлекает кредитные позиции из выписок поставщиков и возвращает одно из двух решений: «счастливый путь» (happy path), который ускоряет проведение кредита, или ручной путь, передающий дело аналитику для более глубокого рассмотрения. За один месяц предвнедренческого тестирования агент обнаружил в несколько раз больше возвращаемых кредитов, чем находил существующий процесс, при этом сквозная точность принятия решений составила не менее 92 процентов по всей цепочке классификации, извлечения и выверки.

Содержательным вкладом данной статьи является механизм, регулирующий эскалацию в рамках этого рабочего процесса. Граница уверенности скорректирована с учетом рисков, а не является фиксированной: по мере увеличения финансового влияния ошибки возрастает и уверенность, необходимая для автономных действий. В оставшейся части этого раздела описывается, как рассчитывается эта граница и к какому результату она приводит на протестированных кредитах.

Сами агенты разрабатываются и проверяются посредством оценки, но даже хорошо оцененная система на базе LLM остается вероятностной, и совокупная производительность оценки не может определить, является ли какой-либо отдельный результат правильным. Описанный здесь механизм уверенности работает поверх этих оценок, обеспечивая оценку неопределенности для каждого решения во время выполнения. Поскольку самооценка уверенности модели ненадежна, как описано в Разделе 2, система работает в три этапа, показанных на Рисунке 2.

Во-первых, уверенность разлагается на отдельные сигналы, соответствующие точкам, в которых процесс может дать сбой: правильно ли были прочитаны исходные данные, были ли извлечены верные корпоративные записи и насколько сильно аргументация подтверждает принятое решение. Во-вторых, эти сигналы объединяются в единый показатель и калибруются по наблюдаемым результатам с целью, чтобы показатель 0,9 соответствовал эмпирической точности примерно в 90 процентов. В-третьих, два порога разделяют калиброванную уверенность на три операционных диапазона: решения с высокой степенью уверенности выполняются с минимальным вмешательством (low touch), решения с низкой степенью уверенности обрабатываются повторно или эскалируются, а промежуточные случаи направляются на проверку человеку. Пороги уравновешивают стоимость проверки аналитиком и ожидаемые издержки от неверного решения.

Мы демонстрируем оценку границы при наблюдаемой точности 92 процента, чтобы проиллюстрировать ее влияние на протестированные кредиты. Мы принимаем стоимость проверки равной 150 долларам США, что оценивается как альтернативные издержки времени аналитика, которое могло бы быть потрачено на выявление следующего кредита. Эта цифра намеренно не основана на заработной плате. Полная почасовая ставка оценила бы час работы аналитика гораздо ниже; здесь важно значение суммы возврата, которую этот час вытесняет. Значение в 150 долларов используется для иллюстрации компромисса между ручной проверкой и приоритизацией высокопотенциальных случаев на основе анализа агента и на практике может быть заменено оценкой, специфичной для конкретной организации.

Объединение двух критериев из раздела 3 дает условие для проверки в виде (1 − q) × s × C > R. Решая уравнение для стоимости кредита, при которой проверка становится оправданной:

C > R / ((1 − q) × s)

При расчете на основе наблюдаемой точности популяции q = 0,92, стоимости проверки R = 150 долларов США и s = 1 для необратимой ошибки:

C > $150 / (0,08 × 1) = $1,875

При такой уверенности, стоимости и критичности агент будет эскалировать кредиты стоимостью выше 1 875 долларов для проверки аналитиком. При уверенности 98 процентов порог составит 7 500 долларов; при критичности s = 0,1 порог станет равным 18 750 долларам.

Для иллюстрации. Значения стоимости, уверенности и критичности основаны на допущениях.

Два аспекта оценки заслуживают описания. Данные сверки, размеченные вручную, дороги в производстве, поэтому имеющийся размеченный корпус было решено дополнить синтетическими данными, чтобы увеличить эффективный размер выборки и обеспечить охват режимов отказа, которые редко встречаются в эксплуатации. Была построена таксономия случаев отказов, и реальные выписки были искажены по этим измерениям, чтобы охарактеризовать, где и почему работа агента ухудшается. Отдельно система была протестирована на устойчивость к не отвечающим API, сбоям зависимостей баз данных и ограничению частоты запросов. В этих условиях система логирует свое текущее состояние, повторяет неудачные вызовы и регулирует темп обработки запросов поставщиков, чтобы всплески объема не приводили к сбоям.

Обобщение за пределами кредиторской задолженности

Кредиторская задолженность (accounts payable) является удобной средой для этой работы, но фреймворк не зависит от ее специфики. Другие рабочие процессы, в которых автоматизация снижает предельные издержки задачи, продемонстрируют такое же расширение объема работ, которые стоит выполнять, и поставят тот же вопрос относительно размещения проверки человеком. Смежные рабочие процессы, включая возврат платежей (order-to-cash), аудит закупок, а также проверку налогов и кодировки, имеют схожую структуру: большой объем транзакций, существенная финансовая ценность, сосредоточенная в исключениях, и ошибки, стоимость которых распределена неравномерно. В каждом случае граница может быть установлена по тем же двум критериям: взвешивание ожидаемой ценности проверки по отношению к ее стоимости и корректировка на асимметричные риски.

Еще одно свойство поддается обобщению. Ресурсы для проверки человеком медленно адаптируются в любом направлении. Они добавляются по одному сотруднику за раз, требуют месяцев обучения и накопленных институциональных знаний, и оплачиваются как в периоды затишья, так и в периоды пиковой нагрузки. Производительность агента эластична, масштабируясь от нескольких документов до многих тысяч без соответствующего изменения структуры затрат. Таким образом, фреймворк, который правильно оценивает стоимость проверки, будет склонен рекомендовать команду людей для принятия решений с самой высокой степенью критичности, в то время как агент будет поглощать объем и вариативность, которые фиксированная команда не может экономически эффективно нести.

Заключение

Снижение стоимости интеллектуального труда, обеспечиваемое агентскими системами, расширяет объем работ, которые стоит выполнять, и смещает стратегический вопрос с масштабов автоматизации на место человеческого суждения в ней. Эта граница не может быть определена только точностью, поскольку ценность человеческой проверки зависит как от вероятности ошибки, так и от ее последствий. Разработанный здесь фреймворк определяет границу на основе калиброванной уверенности, которая оценивается с учетом финансовых последствий ошибки и преобразуется в денежный порог, при котором агент выполняет эскалацию. Результатом является система, которая направляет внимание человека на те решения, в которых оно создает наибольшую ценность, вместо применения единого порога проверки.

Работа с Media Co. продолжается над двумя аспектами, от которых это зависит больше всего: уточнением калибровки показателя уверенности по результатам эксплуатации и расширением охвата за пределы первоначальной группы поставщиков. Затем этот же фреймворк следует применить к смежным процессам.

Ссылки

Chow, C. K. 1970. "Об оптимальном компромиссе между ошибкой распознавания и отказом". IEEE Transactions on Information Theory 16(1): 41–46.

Dadopoulos, M., and Moschidis, S. 2026. "За пределами нечеткого соответствия: система RAG с двойным дополнением для надежной сверки продуктов в бухгалтерском учете". Journal of Risk and Financial Management 19(6): 402.

Guo, C., Pleiss, G., Sun, Y., and Weinberger, K. Q. 2017. "О калибровке современных нейронных сетей". Proceedings of the 34th International Conference on Machine Learning: 1321-1330.

Jamithireddy, N. H. 2025. "Роботизированная автоматизация процессов в SAP ERP: улучшение сверки финансовых транзакций и мониторинга комплаенса". Archives for Technical Sciences 33(2): 279–296.

Jevons, W. S. 1865. Угольный вопрос. London: Macmillan.

Lin, Z., Trivedi, S., and Sun, J. 2023. "Генерация с уверенностью: количественная оценка неопределенности для больших языковых моделей типа «черный ящик»". arXiv:2305.19187.

Malla, P. 2025. "Масштабируемая корпоративная платформа для обработки счетов на основе ИИ с использованием Document Intelligence". International Journal of AI, BigData, Computational and Management Studies 6(4): 181–186.

Simcox, L. 2026. "От программного обеспечения для автоматизации кредиторской задолженности до облачных ERP: как финансовые лидеры масштабируются более разумно". SAP.

Varun, K. G., and Islam, M. A. 2026. "Превращение комплаенса счетов в масштабируемый, проверяемый рабочий процесс с помощью Private Agent Factory". Oracle Database Insider.

Xiong, M., Hu, Z., Lu, X., Li, Y., Fu, J., He, J., and Hooi, B. 2024. "Могут ли LLM выражать свою неопределенность? Эмпирическая оценка выявления уверенности в LLM". International Conference on Learning Representations.

Благодарим Ryan Kappedal и Shreyas Subramanian за рецензирование и предоставление отзывов.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в НевадеПресса
Tesla

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в Неваде

Waymo быстро масштабируется. Вот что показывают данные автопарка.Пресса
Waymo

Waymo быстро масштабируется. Вот что показывают данные автопарка.

Meta опережает OpenAI на рынке потребительских ИИ-устройств, но стратегия Цукерберга пока не доказала свою эффективность
Пресса
OpenAI

Meta опережает OpenAI на рынке потребительских ИИ-устройств, но стратегия Цукерберга пока не доказала свою эффективность

Скучный ИИ: почему ваш погрузчик важнее вашего чат-бота
DataRobot

Скучный ИИ: почему ваш погрузчик важнее вашего чат-бота

Создание мультимодальных моделей для пространственного мышления
Lambda

Создание мультимодальных моделей для пространственного мышления

Генеральный директор ElevenLabs — о маржинальности, сроках IPO и предупреждении клиентов о том, что они говорят с ботомПресса
ElevenLabs

Генеральный директор ElevenLabs — о маржинальности, сроках IPO и предупреждении клиентов о том, что они говорят с ботом

Ещё от Scale AI

ALIF: Развитие навыков работы с ИИ, поток за потоком
Scale AI

ALIF: Развитие навыков работы с ИИ, поток за потоком

Почему вам необходим Red Teaming для корпоративного ИИ
Scale AI

Почему вам необходим Red Teaming для корпоративного ИИ

Развертывание корпоративных ИИ-агентов с помощью Scale и Google Cloud
Scale AI

Развертывание корпоративных ИИ-агентов с помощью Scale и Google Cloud