Команда из трех агентов, превращающая разрозненные корпоративные данные в проверенную модель, к которой эксперты в предметной области могут обращаться напрямую
Авторы: Сина Паказад, вице-президент по науке о данных; Анушка Вьяс, старший специалист по науке о данных; Аруши Дханука, специалист по науке о данных; и Хенрик Ульссон, вице-президент и главный научный сотрудник по науке о данных, C3 AI
Типичный массив корпоративных данных представляет собой смесь различных форматов: электронные таблицы, выгруженные из устаревших систем, CSV-файлы из операционных баз данных, JSON-потоки из API и файлы Excel, пересылаемые между отделами. Практически ничто из этого не поступает в структурированном для анализа виде. Прежде чем данные смогут поддержать машинное обучение или бизнес-решение, кто-то должен их обнаружить, понять, интегрировать, структурировать и сделать доступными. Эта последовательность является одним из самых трудоемких этапов в жизненном цикле аналитики, а самая сложная ее часть носит семантический характер: формирование общего понимания того, что означает каждое поле, каким записям можно доверять и как бизнес-концепции соотносятся с таблицами. Добиться такого понимания сложнее, чем осуществить перемещение самих данных.
На практике эта работа требует постоянного взаимодействия между владельцами данных, экспертами в предметной области, инженерами данных и специалистами по науке о данных. Владельцы данных знают, как они производятся, что означают поля и какие записи надежны. Инженеры данных занимаются загрузкой, трансформацией, валидацией, оркестрацией и масштабируемым доступом. Специалисты по науке о данных и аналитики полагаются на полученную структуру, чтобы задавать корректные вопросы. Как только эти группы находят общий язык, они кодифицируют связи между источниками в семантический слой, который превращает сырые корпоративные данные в нечто, что аналитики могут запрашивать с уверенностью.
Пакет C3 AI Data Intelligence Suite оптимизирует этот рабочий процесс. Он представляет собой набор из трех агентов (интерпретатор данных, создатель схем и генератор запросов), которые позволяют людям, лучше всего знающим данные, напрямую управлять процессом на естественном языке, пока агенты изучают данные, строят проверенный семантический слой и выполняют анализ. В ходе полностью автономного тестирования эта система не уступает специализированным современным системам text-to-SQL на стандартных бенчмарках или превосходит их, используя универсальную модель вместо специально обученной.
Где замедляется традиционная интеграция данных
Рисунок 1: Эффективный доступ к данным требует от команд итеративной интерпретации, а затем проектирования и проверки схемы на основе данных.
Интеграция корпоративных данных следует знакомому циклу (Рисунок 1). Сначала идет обнаружение: какие данные существуют и откуда они взялись. Затем файлы и таблицы профилируются, чтобы понять их структуру и качество, а также прийти к единому пониманию бизнес-смысла. Следующим шагом проектируются схемы, фиксирующие сущности, связи, ограничения и индексы. Данные загружаются и проверяются, при этом устраняются несоответствия типов, пропущенные значения и проблемы ссылочной целостности. Только после этого аналитики могут отвечать на бизнес-вопросы по интегрированным данным. Каждый шаг необходим, и каждый требует нескольких раундов итераций и передачи задач между владельцами данных и инженерами.
Владельцы данных понимают, что означают данные. Инженеры и аналитики знают, как их структурировать и валидировать, а также как оркестровать запросы, необходимые бизнесу. Когда эти знания передаются между людьми посредством встреч, заявок и доработок документов, контекст теряется, а задержки накапливаются. Одно упущенное отношение или неверно понятое поле может потребовать изменения схем, обновления конвейеров и переработки запросов. Этот процесс является строгим, но он медленный, ресурсоемкий в плане координации и сопряжен с потерями. Возможность заключается в том, чтобы предоставить владельцам данных и профильным экспертам более быстрый, прямой и надежный способ управления этим процессом.
Три специализированных агента в составе C3 AI Data Intelligence Suite
Пакет C3 AI Data Intelligence Suite сохраняет строгость интеграции корпоративных данных, устраняя при этом медленные переходы между этапами, которые мешают ее масштабированию. Он ставит владельцев данных и экспертов в предметной области на лидирующие позиции. Вместо того чтобы переводить каждое уточнение, решение по схеме или запрос на анализ в инженерный цикл, они руководят агентами, которые изучают данные, создают исполняемые артефакты, тестируют эти артефакты и предоставляют результаты на рассмотрение. Пакет также интегрируется с возможностями работы с данными платформы C3 Agentic AI Platform для сбора, доступа и анализа в масштабах предприятия.
Пакет состоит из трех специализированных агентов, каждый из которых отвечает за определенный этап рабочего процесса. Агенты взаимодействуют с пользователем и друг с другом по мере того, как они исследуют данные, создают артефакты, выполняют код, проверяют результаты и уточняют их.
Агент-интерпретатор данных
Агент-интерпретатор данных помогает пользователям понять, какие данные у них есть и что они означают. Он исследует необработанные файлы и таблицы для выявления:
- Доступных файлов, таблиц и полей
- Типов данных, распределений, пропущенных значений и аномалий
- Дубликатов записей и проблем с качеством данных
- Кандидатов в сущности, представленные в данных
- Потенциальных ключей, путей соединения и связей между наборами данных
- Несоответствий в именах и допущений, которые могут потребовать подтверждения со стороны экспертов
Он представляет эти результаты в структурированном виде, доступном для проверки, чтобы владельцы данных и профильные эксперты могли подтвердить, исправить и обогатить понимание системы до того, как начнется любое дальнейшее моделирование.
Агент-создатель схем
После интерпретации данных агент-создатель схем строит их семантическое представление, фиксируя:
- Основные сущности и атрибуты
- Связи между таблицами и файлами
- Первичные ключи, внешние ключи и ссылочные ограничения
- Релевантные для бизнеса концепции и определения
- Нормализованные структуры, поддерживающие надежный анализ
- Индексы и варианты схем для эффективного выполнения запросов
Агент создает схему, загружает в нее базовые данные и выполняет тестовые запросы, чтобы подтвердить работоспособность схемы, возможность ее выполнения и соответствие реальным данным. Проектирование схем становится тестируемым артефактом, а не статичным упражнением по моделированию.
Агент-генератор запросов
После появления семантического слоя агент-генератор запросов позволяет пользователям задавать аналитические вопросы на естественном языке и преобразует каждый запрос в исполняемый план анализа, который может:
- Определить релевантные сущности, таблицы и связи
- Разбить сложные вопросы на несколько аналитических шагов
- Сгенерировать и выполнить один или несколько запросов
- Проанализировать промежуточные результаты
- Уточнить анализ, если результаты неполные или противоречивые
- Синтезировать окончательный ответ с подтверждающими доказательствами из данных
Агент-генератор запросов выходит за рамки базового текста в SQL. Он планирует, выполняет, анализирует промежуточные результаты и передает их в формулировках, которые пользователи могут проверить и использовать в работе.
В совокупности эти три агента повторяют традиционный процесс интеграции данных, одновременно сжимая циклы обратной связи. Обнаружение, проектирование схем, валидация и анализ остаются строгими, но при этом становятся интерактивными, исполняемыми и напрямую направляемыми людьми, которые знают данные лучше всего.
Основано на исполнении: почему агенты интеллектуального анализа данных проверяются на реальных данных
Агенты Data Intelligence (DI) построены на основе выполнения. Они напрямую используют автономных агентов кодирования (ACA), работающих в удаленных облачных «песочницах», где они создают, выполняют, тестируют, отлаживают и дорабатывают конкретные артефакты.
Это важно, поскольку работа по интеграции данных зависит от их правильности. Схема полезна только тогда, когда в нее загружаются данные; преобразование — только когда оно выполняется; запрос — только когда он отрабатывает и возвращает результаты, опирающиеся на исходные данные. Агент, полагающийся исключительно на языковую модель, может лишь предложить, что следует сделать; поскольку агенты DI выполняются внутри ACA, они проверяют свою работу непосредственно на данных.
Результатами являются проверенные исполняемые артефакты: схемы, скрипты загрузки данных, преобразования, запросы, проверки достоверности и сводки результатов. Каждый из них можно изучить, протестировать, повторно использовать, подвергнуть критике и аудиту. Вместе они формируют конкретную запись о том, как система интерпретировала данные, какие допущения она сделала, что выполнила и что произвела.
Эта архитектура также меняет то, как агенты используют память. Традиционные агенты на базе LLM полагаются на текст, удерживаемый в контексте модели, или на уровень извлечения данных. Агенты ACA работают с постоянными артефактами в своей «песочнице»: кодом, схемами, образцами данных, отчетами о проверке, логами запросов и предыдущими результатами. Это дает системе более богатую, операционную память и позволяет опираться на прошлую работу вместо того, чтобы каждый раз воссоздавать контекст из текста.
В результате получается рабочий процесс, который выходит за рамки статической предписанной автоматизации. Агенты генерируют артефакт, выполняют его, фиксируют сбои, исправляют ошибки и проверяют результат. Они координируют действия с помощью общих артефактов, а не текстовых передач, что делает весь процесс более прозрачным, воспроизводимым и надежным. Для владельцев данных и профильных экспертов это устраняет длинную цепочку передачи: они направляют работу на естественном языке, в то время как агенты изучают данные, создают и тестируют артефакты, а также выводят результаты для проверки. Путь от сырых корпоративных данных к надежной аналитике становится короче без ущерба для строгости, которую требует работа с корпоративными данными.
Тестирование агентов DI в полностью автономном режиме
Этот раздел написан для технически подкованных читателей. Если вас интересуют концепции системного уровня или сценарии использования, смело переходите к следующему разделу.
Агенты Data Intelligence созданы для совместной работы с пользователями, и мы также оцениваем их в полностью автономном режиме, без участия пользователя. В этом сценарии агент Query Generator самостоятельно интерпретирует схемы баз данных, анализирует вопросы на естественном языке, генерирует SQL, выполняет запросы, фиксирует сбои и дорабатывает свои результаты от начала до конца.
Мы измеряем производительность на основе устоявшихся тестов преобразования текста в SQL и логического вывода на основе баз данных, которые проверяют, может ли агент превратить вопросы на естественном языке в корректные, исполняемые запросы к реальным базам данных. Поскольку эти тесты включают эталонные запросы (ground truth), результаты выполнения или тестовые сценарии на уровне задач, они измеряют правильность по результатам выполнения: действительно ли сгенерированный SQL возвращает правильный ответ. В Таблице 1 обобщены показатели производительности агентов DI по сравнению с современными передовыми системами.
Бенчмарк
Современная передовая система
Точность передовой системы
Точность агента C3 AI DI
BIRD
dev (EX)
MARS-SQL
77,8%
78,0% (▲ +0,2 п. п.)
LiveSQLBench (EX)
Claude Opus 4.6 (OpenHands)
38,0%
50,7% (▲ +12,7 п. п.)
CRITIC (EX)
Gemini 3.1 Pro Preview
48,8%
64,2% (▲ +15,4 п. п.)
INTERACT (EX)
MERIT + GPT-5.4 (Snowflake)
22,7%
55,7% (▲ +33,0 п. п.)
Spider2
Lite (EX)
ReFoRCE + o3
55,2%
71,5% (▲ +16,3 п. п.)
Snow (EX)
DSR-SQL + DeepSeek-R1
63,8%
70,0% (▲ +6,2 п. п.)
DBT (соответствие базы данных)
Spider-Agent
14,7%
37,5% (▲ +22,8 п. п.)
Таблица 1: В тестах преобразования текста в SQL и логического вывода на основе баз данных агенты DI не уступают ведущим системам или превосходят их.
Показатели передовых систем отражают лучшие опубликованные результаты таблиц лидеров для каждого бенчмарка на момент написания статьи.
Агенты DI соответствуют передовым результатам или превосходят их в различных тестах на SQL и логический вывод на базах данных. Это примечательно, поскольку многие лидирующие системы опираются на специализированные архитектуры, специфичные для бенчмарков методы, специально обученные модели или ансамбли из нескольких моделей, настроенные для задачи преобразования текста в SQL. Агенты DI достигают этих результатов с помощью коммерческой модели общего назначения — Claude Sonnet 4.5 от Anthropic — в сочетании с архитектурой, основанной на выполнении: агенты анализируют схемы, генерируют возможные запросы, выполняют их, проверяют ошибки и промежуточные результаты, а затем дорабатывают свои выводы. Тщательная разработка агентов, обратная связь на основе выполнения и рассуждения с учетом схем позволяют не уступать специализированным системам или превосходить их в сложных задачах анализа данных.
На практике: анализ работы сестринского персонала от начала до конца
Чтобы сделать рабочий процесс наглядным, рассмотрим пример из больничной практики ухода за пациентами. Данные охватывают отделения, структуру смен, медицинских сестер, табели посещаемости и историю работы. Как и во многих корпоративных наборах данных, они распределены по нескольким файлам и таблицам, а связи между ними изначально не очевидны.
Пользователь предоставляет файлы с примерами данных агентам Data Intelligence и запускает рабочий процесс (Рисунок 2). Агент Data Interpreter проверяет файлы, выявляет ключевые поля и сущности, обнаруживает проблемы с качеством данных и предлагает возможные связи: как медсестры соотносятся со сменами, как смены связаны с отделениями и как учет посещаемости связан с общими схемами укомплектования персоналом.
Рисунок 2: Пользователи загружают данные и запускают рабочий процесс в интерфейсе C3 Intelligence, где агент Data Interpreter начинает инспекцию файлов.
Результаты интерпретации возвращаются в структурированном виде, удобном для проверки. Этот шаг важен, потому что система не должна молча угадывать, что означают корпоративные данные. Владельцы данных и профильные эксперты изучают выводы агента, исправляют допущения, уточняют значение полей и подтверждают предполагаемые связи, создавая общее понимание данных до начала любого моделирования или анализа.
Как только пользователь остается доволен результатами интерпретации, агент Schema Creator строит семантический слой поверх данных (Рисунок 3). В этом примере он формирует схему «звезда»: центральную табличку фактов примерно с 122 000 назначений на смены, связанную с таблицами измерений для медсестер, отделений, графиков смен и временных окон (Рисунок 4). Агент создает схему, загружает данные, а также запускает проверки достоверности и тестовые запросы, сообщая о полной ссылочной целостности и отсутствии потерянных записей.
Рисунок 3: Агент Schema Creator суммирует интерпретированные данные в виде схемы «звезда» и сообщает о результатах проверки качества данных, включая полную ссылочную целостность и отсутствие потерянных записей.
Рисунок 4: Проверенная схема, где центральная таблица фактов назначений на смены связана с таблицами измерений для медсестер, отделений, графиков смен и временных окон.
После настройки семантического слоя Агент генерации запросов позволяет пользователю задавать аналитические вопросы на естественном языке. Пользователь может спросить, какие отделения больше всего страдают от нехватки персонала, связаны ли определенные графики смен с прогулами или как опыт медсестер влияет на посещаемость. Агент превращает каждый запрос в исполняемый план, выполняет запросы, проверяет промежуточные результаты и возвращает ответы на основе проверенной схемы. Он также создает визуальные представления, включая панели мониторинга, что упрощает восприятие результатов, сохраняя при этом полную прозрачность для проверки.
В приведенной выше демонстрации используются примеры файлов, загруженные пользователем. Тот же рабочий процесс запускается для корпоративных исходных систем с помощью C3 Agentic AI Platform, которая подключается к источникам, загружает данные, управляет рабочими процессами, контролирует доступ и масштабирует выполнение для корпоративных наборов данных. Агенты проверяют логику и анализ в своей среде выполнения, а затем применяют эти проверенные рабочие процессы к более широким корпоративным данным с помощью платформы.
Комплект C3 AI Data Intelligence Suite вкратце
- Три агента, один рабочий процесс. Агенты Data Interpreter, Schema Creator и Query Generator обеспечивают обнаружение и профилирование данных, создание семантического слоя и анализ на естественном языке.
- Управляют профильные эксперты. Владельцы данных и профильные специалисты руководствуют процессом на естественном языке и проверяют каждый результат вместо того, чтобы подавать заявки и ждать окончания инженерных циклов.
- С опорой на выполнение. Агенты работают как автономные агенты кодирования в облачных изолированных средах, проверяя схемы, преобразования и запросы на основе реальных данных.
- Проверяемые артефакты. Каждый шаг приводит к созданию доступных для осмотра и повторного использования результатов: схем, скриптов загрузки, преобразований, запросов, проверок правильности и сводок результатов.
- Протестировано на бенчмарках. В автономном режиме этот набор инструментов не уступает или превосходит лучшие современные системы преобразования текста в SQL и рассуждений по базам данных при использовании модели общего назначения.
- Корпоративный масштаб. С помощью C3 Agentic AI Platform те же проверенные рабочие процессы выполняются в производственных исходных системах с управляемой загрузкой, доступом и оркестровкой.
Что меняется, когда профильные эксперты управляют работой с данными
Вместе агенты Data Interpreter, Schema Creator и Query Generator образуют совместный набор инструментов для понимания, интеграции и анализа корпоративных данных в масштабе. Самое главное изменение заключается в том, кто выполняет работу. Владельцы данных и профильные эксперты участвуют напрямую, проверяя предположения, уточняя интерпретации и задавая все более сложные вопросы, в то время как агенты изучают данные, строят схемы, выполняют код и создают проверяемые артефакты.
Это сокращает путь от разрозненных необработанных данных к надежным инсайтам. Это сокращает количество этапов передачи задач, замедляющих работу команд, сохраняет строгость, требуемую при работе с корпоративными данными, и делает процесс более прозрачным, воспроизводимым и масштабируемым. Профильные эксперты перестают ждать, пока каждый запрос на уточнение или анализ пройдет через длинную техническую очередь, и начинают работать бок о бок с агентами, которые выполняют эту работу вместе с ними. Для предприятий это означает ускорение получения ценности из существующих данных, более надежные аналитические основы и более прямой путь от операционных знаний к интеллектуальным данным, готовым к принятию решений.
Если ваша организация сталкивается с разрозненными данными, медленными циклами интеграции или растущим давлением с целью сделать данные доступными для тех, кто понимает их лучше всего, мы хотели бы показать вам, на что способны агенты C3 AI Data Intelligence при работе с вашими собственными данными.
Хотите запустить этих агентов для работы с вашими собственными данными? Свяжитесь с нами, и мы применим C3 AI Data Intelligence Suite к образцу данных из вашей среды.
Об авторах
Сина Хошфедрат Паказад (Sina Khoshfetrat Pakazad) — вице-президент по науке о данных в C3 AI, где он руководит исследованиями и разработками в области генеративного ИИ, машинного обучения и оптимизации. Имеет степень доктора философии (Ph.D.) по автоматическому управлению Линчёпингского университета и степень магистра наук в области систем, управления и мехатроники Технологического университета Чалмерса. Работал в Ericsson, Waymo и C3 AI, внеся свой вклад в решения на базе ИИ для здравоохранения, финансов, автомобилестроения, робототехники, аэрокосмической промышленности, телекоммуникаций, цепочек поставок и перерабатывающих отраслей. Его последние исследования, опубликованные на таких площадках, как ICLR, ICML и EMNLP, посвящены генерации мультимодальных данных, следованию инструкциям и декодированию для больших языковых моделей, а также распределенной оптимизации. Он также является соавтором патентов на корпоративные архитектуры ИИ и прогнозное моделирование для производства.
Анушка Вьяс (Anoushka Vyas) — старший специалист по обработке данных в C3 AI. Имеет степень магистра компьютерных наук Технологического института Вирджинии и степень бакалавра в области электроники и техники связи IIIT Хайдарабада. Ее опыт охватывает графовые нейронные сети, геометрическое глубокое обучение и машинное обучение на основе оптимизации, с публикациями по архитектурам гиперболических графовых нейронных сетей на конференции The Web Conference (WWW) и по графовому прогнозированию для точного земледелия в треке IJCAI-ECAI AI for Good. Ее текущая работа сосредоточена на масштабируемом ИИ и оптимизации для принятия сложных операционных решений в корпоративной среде.
Аруши Данука (Aarushi Dhanuka) — специалист по обработке данных в C3 AI, где она специализируется на агентной разработке и интеллектуальной автоматизации рабочих процессов, применяя методы науки о данных и инженерии для создания инструментов на базе ИИ для корпоративных операций. Она получает степень магистра в области вычислительных наук и инженерии в Технологическом институте Джорджии, специализируясь на прикладном машинном обучении и вычислительных системах данных.
Хенрик Ольссон (Henrik Ohlsson) — вице-президент и главный научный сотрудник по данным в C3 AI. До прихода в C3 AI он занимал академические должности в Калифорнийском университете в Беркли, Кембриджском университете и Линчёпингском университете. Имея более 70 опубликованных работ и 30 выданных патентов, он является признанным лидером в области искусственного интеллекта и его промышленного применения. Он также является членом Всемирного экономического форума, где участвует в дискуссиях о глобальном влиянии ИИ и новых технологий.








