Команда из трех агентов, которая превращает разрозненные корпоративные данные в проверенную модель, к которой эксперты в предметной области могут обращаться напрямую
Авторы: Сина Паказад, вице-президент по науке о данных; Анушка Вьяс, старший специалист по науке о данных; Аруши Данука, специалист по науке о данных; и Хенрик Олссон, вице-президент и главный научный сотрудник по науке о данных, C3 AI
Типичный массив корпоративных данных представляет собой смесь различных форматов: электронные таблицы, экспортированные из устаревших систем, CSV-файлы из операционных баз данных, JSON-потоки из API и файлы Excel, передаваемые между отделами. Практически ничто из этого не поступает в структурированном для анализа виде. Прежде чем эти данные смогут послужить основой для машинного обучения или принятия бизнес-решений, кто-то должен их обнаружить, понять, интегрировать, структурировать и сделать доступными. Эта цепочка действий является одним из самых трудоемких этапов в жизненном цикле аналитики, а самая сложная ее часть носит семантический характер: формирование общего понимания того, что означает каждое поле, каким записям можно доверять и как бизнес-концепции соотносятся с таблицами. Добиться такого понимания сложнее, чем осуществить саму передачу данных.
На практике эта работа требует постоянного взаимодействия между владельцами данных, экспертами в предметной области, инженерами данных и специалистами по анализу данных. Владельцы данных знают, как они создаются, что означают поля и какие записи заслуживают доверия. Инженеры данных управляют процессами загрузки, трансформации, валидации, оркестрации и обеспечивают масштабируемый доступ. Специалисты по анализу данных и аналитики полагаются на полученную структуру для получения достоверных ответов. Как только эти группы приходят к единому мнению, они кодифицируют взаимосвязи между источниками в семантический слой, который превращает сырые корпоративные данные в информацию, которую аналитики могут запрашивать с полной уверенностью.
Пакет C3 AI Data Intelligence Suite оптимизирует этот рабочий процесс. Он представляет собой набор из трех агентов (интерпретатор данных, создатель схем и генератор запросов), которые позволяют людям, лучше всего знающим данные, напрямую управлять процессом на естественном языке, в то время как агенты изучают данные, строят проверенный семантический слой и выполняют анализ. В ходе полностью автономного тестирования эта система не уступает специализированным передовым системам text-to-SQL на стандартных тестах или превосходит их, используя универсальную модель вместо специально обученной.
Где замедляется традиционная интеграция данных
Рисунок 1. Эффективный доступ к данным требует от команд итеративной интерпретации, а затем проектирования и проверки схемы данных.
Интеграция корпоративных данных следует привычному циклу (Рисунок 1). Сначала идет этап обнаружения: какие данные существуют и откуда они взялись. Затем файлы и таблицы проходят профилирование для понимания структуры и качества, а также согласования бизнес-смысла. На следующем этапе проектируются схемы, фиксирующие сущности, связи, ограничения и индексы. Данные загружаются и проверяются, при этом устраняются несоответствия типов, пропущенные значения и проблемы ссылочной целостности. Только после этого аналитики могут отвечать на бизнес-вопросы с использованием интегрированных данных. Каждый шаг необходим, и каждый требует нескольких циклов итераций и передачи задач между владельцами данных и инженерами.
Владельцы данных понимают смысл информации. Инженеры и аналитики знают, как ее структурировать и проверять, а также как оркестровать запросы, необходимые бизнесу. Когда эти знания передаются между людьми через встречи, тикеты и исправления документов, контекст теряется, а задержки накапливаются. Единая упущенная связь или неправильно понятое поле могут потребовать изменения схем, обновления конвейеров и переработки запросов. Этот процесс является тщательным, но медленным, требующим больших усилий по координации и приводящим к потерям. Наша цель — дать владельцам данных и экспертам более быстрый, прямой и надежный способ управления этим процессом.
Три специализированных агента в составе C3 AI Data Intelligence Suite
Пакет C3 AI Data Intelligence Suite сохраняет строгий подход к интеграции корпоративных данных, устраняя при этом медленные этапы передачи задач, которые мешают масштабированию. Он отдает контроль в руки владельцев данных и экспертов в предметной области. Вместо того чтобы переводить каждое уточнение, решение по схеме или запрос на анализ в инженерный цикл, они руководят агентами, которые проверяют данные, создают исполняемые артефакты, тестируют их и предоставляют результаты для проверки. Этот пакет также интегрируется с возможностями работы с данными платформы C3 Agentic AI Platform для сбора, доступа и анализа в масштабах всего предприятия.
Пакет состоит из трех специализированных агентов, каждый из которых отвечает за определенный этап рабочего процесса. Агенты взаимодействуют с пользователем и друг с другом по мере анализа данных, создания артефактов, выполнения кода, проверки результатов и их уточнения.
Агент-интерпретатор данных
Агент-интерпретатор данных помогает пользователям понять, какие данные у них есть и что они означают. Он исследует необработанные файлы и таблицы для выявления:
- Доступных файлов, таблиц и полей
- Типов данных, распределений, пропущенных значений и аномалий
- Дубликатов записей и проблем с качеством данных
- Потенциальных сущностей, представленных в данных
- Потенциальных ключей, путей соединения и связей между наборами данных
- Несоответствий в наименованиях и допущений, которые могут потребовать подтверждения со стороны экспертов
Он представляет эти результаты в структурированном виде, удобном для проверки, чтобы владельцы данных и эксперты могли проверить, исправить и обогатить понимание системы до начала любого последующего моделирования.
Агент-создатель схем
После интерпретации данных агент-создатель схем строит их семантическое представление, фиксируя:
- Основные сущности и атрибуты
- Взаимосвязи между таблицами и файлами
- Первичные ключи, внешние ключи и ссылочные ограничения
- Актуальные для бизнеса концепции и определения
- Нормализованные структуры, поддерживающие надежный анализ
- Индексы и варианты схем для эффективного выполнения запросов
Агент создает схему, загружает в нее исходные данные и выполняет тестовые запросы, чтобы убедиться, что схема функциональна, исполняема и соответствует реальным данным. Проектирование схем становится тестируемым артефактом, а не статичным упражнением по моделированию.
Агент-генератор запросов
После создания семантического слоя агент-генератор запросов позволяет пользователям задавать аналитические вопросы на естественном языке и преобразует каждый запрос в исполняемый план анализа, который может:
- Определить релевантные сущности, таблицы и связи
- Разбить сложные вопросы на несколько аналитических шагов
- Сгенерировать и выполнить один или несколько запросов
- Проверить промежуточные результаты
- Уточнить анализ, если результаты оказались неполными или противоречивыми
- Синтезировать окончательный ответ с подтверждающими данными из источников
Агент-генератор запросов выходит за рамки базового преобразования текста в SQL. Он планирует, выполняет действия, анализирует промежуточные результаты и сообщает о них в понятной для пользователей форме, позволяющей принимать решения и действовать.
В совокупности эти три агента повторяют традиционный процесс интеграции данных, одновременно сокращая циклы обратной связи. Обнаружение, проектирование схем, проверка и анализ остаются строгими, но становятся интерактивными, исполняемыми и напрямую управляемыми людьми, которые лучше всего знают данные.
Создано на основе реального исполнения: почему агенты Data Intelligence проверяют данные по их реальным значениям
Агенты Data Intelligence (DI) созданы с упором на выполнение кода. Они напрямую строятся на базе автономных агентов программирования (autonomous coding agents, ACA), работающих в удаленных облачных песочницах, где они создают, выполняют, тестируют, отлаживают и дорабатывают конкретные артефакты.
Это имеет решающее значение, поскольку работа по интеграции данных зависит от правильности результатов. Схема полезна только тогда, когда в нее загружаются данные; трансформация — когда она выполняется; запрос — когда он отрабатывает и возвращает результаты, опирающиеся на исходные данные. Агент, полагающийся исключительно на языковую модель, может лишь предлагать план действий; поскольку же агенты DI функционируют внутри ACA, они проверяют свою работу непосредственно на реальных данных.
Результатами являются проверенные исполняемые артефакты: схемы, скрипты загрузки данных, трансформации, запросы, проверки валидации и сводки результатов. Каждый из них можно изучить, протестировать, повторно использовать, подвергнуть критике и аудиту. Вместе они формируют конкретную историю того, как система интерпретировала данные, какие допущения она сделала, что именно выполнила и что произвело на свет.
Эта архитектура также меняет подход агентов к использованию памяти. Традиционные агенты на базе LLM полагаются на текст, удерживаемый в контексте модели или на уровень извлечения данных (retrieval layer). ACA работают с персистентными артефактами в своей песочнице: кодом, схемами, образцами данных, отчетами о валидации, логами запросов и предыдущими результатами. Это наделяет систему более богатой, оперативной памятью и позволяет опираться на ранее выполненную работу, а не воссоздавать контекст из текста каждый раз заново.
В результате получается рабочий процесс, выходящий за рамки статической предварительно со скриптованной автоматизации. Агенты генерируют артефакт, выполняют его, фиксируют сбои, исправляют ошибки и проверяют результат. Они координируют свои действия через общие артефакты, а не посредством передачи текстовых сообщений, что делает весь процесс более прозрачным, воспроизводимым и надежным. Для владельцев данных и профильных экспертов это устраняет длинную цепочку передачи задач: они руководят процессом на естественном языке, в то время как агенты исследуют данные, создают и тестируют артефакты, а также предоставляют результаты на рассмотрение. Путь от «сырых» корпоративных данных до надежных аналитических выводов сокращается без ущерба для строгости, требуемой при работе с корпоративными данными.
Бенчмаркинг агентов DI в полностью автономном режиме
Этот раздел написан для технически подкованных читателей. Если вас интересуют концепции системного уровня или варианты использования, можете смело пропустить его.
Агенты Data Intelligence созданы для совместной работы с пользователями, однако мы также оцениваем их в полностью автономном режиме без участия человека. В таких условиях агент-генератор запросов (Query Generator Agent) самостоятельно интерпретирует схемы баз данных, анализирует вопросы на естественном языке, генерирует SQL, выполняет запросы, отслеживает сбои и дорабатывает результаты от начала и до конца.
Мы измеряем производительность на основе устоявшихся бенчмарков типа text-to-SQL и логического вывода на базе баз данных, которые проверяют способность агента превращать вопросы на естественном языке в корректные, исполняемые запросы к реальным базам данных. Поскольку эти бенчмарки включают эталонные запросы (ground-truth), результаты выполнения или тестовые сценарии на уровне задач, точность измеряется через выполнение: действительно ли сгенерированный SQL возвращает правильный ответ. В таблице 1 суммированы показатели производительности агентов DI по сравнению с современными передовыми системами.
Бенчмарк
Современная передовая система
Точность передовой системы
Точность агента C3 AI DI
BIRD
dev (EX)
MARS-SQL
77.8%
78.0% (▲ +0.2 п.)
LiveSQLBench (EX)
Claude Opus 4.6 (OpenHands)
38.0%
50.7% (▲ +12.7 п.)
CRITIC (EX)
Gemini 3.1 Pro Preview
48.8%
64.2% (▲ +15.4 п.)
INTERACT (EX)
MERIT + GPT-5.4 (Snowflake)
22.7%
55.7% (▲ +33.0 п.)
Spider2
Lite (EX)
ReFoRCE + o3
55.2%
71.5% (▲ +16.3 п.)
Snow (EX)
DSR-SQL + DeepSeek-R1
63.8%
70.0% (▲ +6.2 п.)
DBT (соответствие базы данных)
Spider-Agent
14.7%
37.5% (▲ +22.8 п.)
Таблица 1: В бенчмарках text-to-SQL и логического вывода на основе баз данных агенты DI не уступают ведущим системам или превосходят их.
Показатели передовых систем отражают лучшие опубликованные результаты таблиц лидеров (leaderboard) для каждого бенчмарка на момент написания статьи.
Агенты DI демонстрируют результаты на уровне лучших современных систем (state-of-the-art) или превосходят их в различных бенчмарках SQL и логического вывода на базах данных. Это примечательно, поскольку многие передовые системы полагаются на специализированные архитектуры, специфичные для бенчмарков методы, кастомно обученные модели или ансамбли из нескольких моделей, настроенные под задачу text-to-SQL. Агенты DI достигают таких результатов с помощью универсальной коммерческой модели Anthropic Claude Sonnet 4.5 в сочетании с архитектурой, основанной на выполнении: агенты анализируют схемы, генерируют варианты запросов, выполняют их, изучают ошибки и промежуточные результаты, а затем дорабатывают свои ответы. Тщательное проектирование агентов, обратная связь на основе выполнения и рассуждения с учетом схем позволяют не уступать специализированным системам в решении сложных задач анализа данных или превосходить их.
На практике: анализ работы сестринского персонала от начала и до конца
Чтобы сделать рабочий процесс более наглядным, рассмотрим пример из сферы организации работы больничного сестринского персонала. Данные охватывают отделения, структуру смен, медсестер, табели посещаемости и историю работы. Как и во многих корпоративных наборах данных, они распределены по нескольким файлам и таблицам, причем связи между ними изначально не очевидны.
Пользователь передает примеры файлов данных агентам Data Intelligence и запускает рабочий процесс (рисунок 2). Агент-интерпретатор данных (Data Interpreter Agent) изучает файлы, определяет ключевые поля и сущности, обнаруживает проблемы с качеством данных и предлагает возможные связи: как медсестры соотносятся со сменами, как смены относятся к отделениям и как табели посещаемости связаны с общими паттернами укомплектования штата.
Рисунок 2: Пользователи загружают данные и запускают рабочий процесс в интерфейсе C3 Intelligence, где агент-интерпретатор данных начинает проверку файлов.
Результаты интерпретации возвращаются в структурированном и удобном для проверки виде. Этот шаг имеет решающее значение, поскольку система не должна заниматься молчаливыми догадками о том, что означают корпоративные данные. Владельцы данных и профильные эксперты изучают находки агента, корректируют предположения, проясняют значения полей и проверяют предполагаемые связи, создавая единое понимание данных до начала любого моделирования или анализа.
Как только пользователя устраивает интерпретация, агент создания схем (Schema Creator Agent) строит семантический слой поверх данных (рисунок 3). В данном примере он формирует схему «звезда» (star schema): центральную таблицу фактов, содержащую примерно 122 000 назначений на смены, связанную с таблицами измерений для медсестер, отделений, графиков смен и временных интервалов (рисунок 4). Агент создает схему, загружает данные, а также запускает проверки валидации и тестовые запросы, рапортуя о полной ссылочной целостности и отсутствии потерянных (orphaned) записей.
Рисунок 3: Агент создания схем обобщает интерпретированные данные в виде схемы «звезда» и отчитывается о проверках качества данных, включая полную ссылочную целостность и отсутствие потерянных записей.
Рисунок 4: Проверенная схема с центральной таблицей фактов назначений на смены, связанной с таблицами измерений для медсестер, отделений, графиков смен и временных интервалов.
После настройки семантического слоя агент-генератор запросов позволяет пользователю задавать аналитические вопросы на естественном языке. Пользователь может спросить, какие отделения больше всего страдают от нехватки персонала, связаны ли определенные графики смен с прогулами или как опыт медсестер влияет на посещаемость. Агент превращает каждый запрос в исполняемый план, выполняет запросы, проверяет промежуточные результаты и возвращает ответы на основе проверенной схемы. Он также создает визуальные представления, включая информационные панели, что облегчает восприятие результатов, сохраняя при этом возможность проверки всех компонентов.
В приведенной выше демонстрации используются примеры файлов, загруженные пользователем. Тот же рабочий процесс выполняется для корпоративных исходных систем с помощью C3 Agentic AI Platform, которая подключается к источникам, загружает данные, управляет рабочими процессами, контролирует доступ и масштабирует выполнение для корпоративных наборов данных. Агенты проверяют логику и анализ в своей среде выполнения, а затем применяют эти проверенные рабочие процессы к более широким корпоративным данным через платформу.
Обзор C3 AI Data Intelligence Suite
- Три агента, один рабочий процесс. Агенты интерпретатора данных (Data Interpreter), создателя схем (Schema Creator) и генератора запросов (Query Generator) охватывают задачи обнаружения и профилирования, создания семантического слоя и анализа на естественном языке.
- Ведущая роль предметных экспертов. Владельцы данных и профильные специалисты руководствуют процессом на естественном языке и проверяют каждый результат вместо того, чтобы оформлять требования и ждать завершения инженерных циклов.
- Опора на реальное исполнение. Агенты работают как автономные агенты-кодировщики в облачных песочницах, проверяя схемы, преобразования и запросы на основе реальных данных.
- Проверяемые артефакты. Каждый шаг создает доступные для проверки и повторно используемые результаты: схемы, скрипты загрузки, преобразования, запросы, проверки валидации и сводки результатов.
- Тестирование на бенчмарках. В автономном режиме этот комплекс соответствует современным системам преобразования текста в SQL и логического вывода на базах данных или превосходит их при использовании универсальной модели.
- Корпоративный масштаб. С помощью C3 Agentic AI Platform те же проверенные рабочие процессы запускаются на промышленных исходных системах с управляемой загрузкой, доступом и оркестрацией.
Что меняется, когда работу с данными возглавляют предметные эксперты
Вместе агенты Data Interpreter, Schema Creator и Query Generator образуют совместный набор инструментов для понимания, интеграции и анализа корпоративных данных в масштабе. Самое главное изменение заключается в том, кто именно выполняет работу. Владельцы данных и предметные эксперты участвуют напрямую, проверяя предположения, уточняя интерпретации и задавая все более сложные вопросы, в то время как агенты исследуют данные, строят схемы, выполняют код и создают артефакты, доступные для проверки.
Это сокращает путь от фрагментированных необработанных данных до надежных аналитических выводов. Такое решение сокращает количество этапов передачи между командами, замедляющих работу, сохраняет строгость, необходимую для работы с корпоративными данными, а также делает процесс более прозрачным, воспроизводимым и масштабируемым. Эксперты предметной области перестают ждать, пока каждый запрос на уточнение или анализ пройдет через длинную очередь технических специалистов, и начинают работать бок о бок с агентами, которые выполняют эту работу вместе с ними. Для предприятий это означает ускорение получения ценности из существующих данных, более надежные аналитические основы и более прямой путь от операционных знаний к интеллектуальным решениям, готовым к внедрению.
Если ваша организация сталкивается с фрагментарными данными, медленными циклами интеграции или растущим давлением с целью сделать данные доступными для тех, кто понимает их лучше всего, мы хотели бы показать вам, на что способны агенты C3 AI Data Intelligence при работе с вашими собственными данными.
Хотите задействовать этих агентов для работы с вашими данными? Свяжитесь с нами, и мы применим C3 AI Data Intelligence Suite к образцу данных из вашей среды.
Об авторах
Сина Хошфедрат Паказад — вице-президент по науке о данных в C3 AI, где он руководит исследованиями и разработками в области генеративного искусственного интеллекта, машинного обучения и оптимизации. Он имеет степень доктора философии (Ph.D.) по автоматическому управлению Линчёпингского университета и степень магистра (M.Sc.) по системам, управлению и мехатронике Технологического университета Чалмерса. Он работал в компаниях Ericsson, Waymo и C3 AI, внеся свой вклад в создание решений на базе ИИ для здравоохранения, финансов, автомобилестроения, робототехники, аэрокосмической отрасли, телекоммуникаций, цепочек поставок и перерабатывающей промышленности. Его последние исследования, опубликованные на таких площадках, как ICLR, ICML и EMNLP, посвящены генерации мультимодальных данных, следованию инструкциям и декодированию для больших языковых моделей, а также распределенной оптимизации. Он также является соавтором патентов на корпоративные архитектуры ИИ и прогнозное моделирование для производства.
Анушка Вьяс — старший специалист по науке о данных в C3 AI. Она имеет степень магистра компьютерных наук Технологического института Вирджинии и степень бакалавра в области электроники и техники связи IIIT Хайдарабада. Ее опыт охватывает графовые нейронные сети, геометрическое глубокое обучение и машинное обучение, интегрированное с оптимизацией; она имеет публикации по гиперболическим архитектурам графовых нейронных сетей на The Web Conference (WWW) и по прогнозированию на основе графов для задач искусственного интеллекта на благо общества в треке IJCAI-ECAI AI for Good. Ее текущая работа сосредоточена на масштабируемом искусственном интеллекте и оптимизации для принятия сложных операционных решений в корпоративных средах.
Ааруши Дханука — специалист по науке о данных в C3 AI, где она занимается агентской разработкой и интеллектуальной автоматизацией рабочих процессов, применяя методы науки о данных и инженерии для создания инструментов на базе ИИ для корпоративных операций. Она получает степень магистра в области вычислительных наук и инженерии в Технологическом институте Джорджии, специализируясь на прикладном машинном обучении и вычислительных системах данных.
Хенрик Ульссон — вице-президент и главный специалист по науке о данных в C3 AI. До прихода в C3 AI он занимал академические должности в Калифорнийском университете в Беркли, Кембриджском университете и Линчёпингском университете. Имея более 70 опубликованных работ и 30 выданных патентов, он является признанным лидером в области искусственного интеллекта и его промышленного применения. Он также является членом Всемирного экономического форума, где принимает участие в дискуссиях о глобальном влиянии ИИ и новых технологий.








