Модернизация рабочих нагрузок с неструктурированными данными с помощью Alteryx и BigQuery

Источник: Google Cloud Blog•

Модернизация рабочих нагрузок с неструктурированными данными с помощью Alteryx и BigQuery

Создавайте конвейеры без написания кода с помощью Live Query + BigQuery. Безопасно используйте Gemini внутри своей платформы данных для обработки и анализа неструктурированных данных.

Alteryx One Live Query и Google Cloud BigQuery меняют подход предприятий к работе со сложными неструктурированными данными в масштабе, снижая зависимость от разрозненных инструментов, минимизируя перемещение данных и обеспечивая выполнение операций непосредственно в хранилище.

Live Query предоставляет интуитивно понятную браузерную среду, которая позволяет бизнес-пользователям создавать сложные конвейеры данных, не написав ни строчки кода. В сочетании с масштабируемостью и производительностью BigQuery этот дуэт обеспечивает безопасную передачу SQL-запросов (pushdown), что означает, что логика преобразования данных выполняется непосредственно внутри хранилища, а не передается по сети. Эта синергия особенно эффективна для рабочих процессов с большим количеством документов, где Live Query может координировать передовые модели ИИ и машинного обучения Google, такие как Gemini, для извлечения информации из PDF-файлов и изображений, сохраняя при этом строгие стандарты управления данными и безопасности среды BigQuery.

От PDF-счетов до управления обработкой исключений в BigQuery с помощью Live Query

Финансовые и операционные отделы часто оказываются погребены под горой счетов от поставщиков. Эти документы поступают в формате PDF с несогласованными данными, различными форматами номеров счетов и высоким риском ошибок при ручной обработке. Традиционно команды по работе с данными были вынуждены прибегать к ручному извлечению данных или использовать фрагментированный набор инструментов для перемещения данных в хранилище — процесс, который отнимает много времени и чреват дубликатами или несоответствиями в суммах.

Благодаря интеграции Live Query для BigQuery теперь можно автоматизировать весь жизненный цикл счета. Обрабатывая PDF-файлы, извлекая ключевые поля и стандартизируя результаты непосредственно в экосистеме BigQuery, команды по работе с данными могут быстрее выявлять исключения, такие как аномалии или проблемы с данными в документах, гарантируя при этом, что их корпоративные данные, защищенные политиками детального доступа BigQuery, никогда не покидают хранилище.

Обзор решения: извлечение, классификация, проверка, маршрутизация и публикация

Давайте подробнее рассмотрим, как работает решение Live Query. PDF-счета поступают в виде неструктурированных документов в Google Cloud Storage. В рабочем процессе Live Query инструмент Document Extract извлекает структурированные поля с использованием выбранной пользователем модели, такой как Gemini или Document AI. Затем результаты стандартизируются для надежного сопоставления и сравниваются с историческими записями счетов, которые уже хранятся и защищены в BigQuery.

Этот автоматизированный рабочий процесс разработан для перехода от документа к решению с минимальным ручным вмешательством. В масштабах предприятия эта модель касается не просто обработки нескольких PDF-файлов, а обеспечения аналитики и ИИ для миллионов неструктурированных документов при сохранении логики сверки в соответствии с BigQuery.

Сочетая извлечение на основе ИИ с выполнением операций непосредственно в BigQuery, решение обеспечивает:

  • Более высокую сквозную обработку: сокращение ручной обработки и автоматическое прохождение большего количества счетов через процесс.

Более высокую сквозную обработку: сокращение ручной обработки и автоматическое прохождение большего количества счетов через процесс.

  • Более быструю сверку и меньшее количество ручных исключений: сравнение извлеченных счетов с данными BigQuery на более ранних этапах процесса, чтобы команды могли быстрее выявлять дубликаты и несоответствия, сокращая количество счетов, требующих ручной проверки.

Более быструю сверку и меньшее количество ручных исключений: сравнение извлеченных счетов с данными BigQuery на более ранних этапах процесса, чтобы команды могли быстрее выявлять дубликаты и несоответствия, сокращая количество счетов, требующих ручной проверки.

  • Более строгую подотчетность: поддержание четкого пути данных от источника до операционного результата.

Более строгую подотчетность: поддержание четкого пути данных от источника до операционного результата.

  • Сокращение перемещения данных: хранение данных в BigQuery и использование его встроенных возможностей для повышения безопасности, управления и контроля.

Сокращение перемещения данных: хранение данных в BigQuery и использование его встроенных возможностей для повышения безопасности, управления и контроля.

Архитектура: шаблон, ориентированный на Google Cloud

На верхнем уровне PDF-счета размещаются в Cloud Storage, обрабатываются через рабочий процесс Live Query в браузере, сверяются с защищенной историей счетов, уже находящейся в BigQuery, и записываются обратно в качестве операционных результатов для финансовых отделов. Ключевым архитектурным преимуществом этого шаблона является то, что создание рабочего процесса происходит в браузере, а логика преобразования и сверки выполняется с помощью платформенных сервисов в защищенной среде данных.

Архитектура Live Query разработана для обработки в масштабах хранилища и защищенного выполнения. Она использует безопасную передачу SQL-запросов для выполнения логики преобразования и сверки непосредственно в BigQuery и интегрируется с Gemini для расширенных возможностей ИИ, таких как извлечение, классификация и обобщение документов.

  • Live Query (браузер): пользователи визуально создают рабочие процессы в браузере, настраивая логику извлечения, классификации, очистки, проверки и маршрутизации документов.

Live Query (браузер): пользователи визуально создают рабочие процессы в браузере, настраивая логику извлечения, классификации, очистки, проверки и маршрутизации документов.

  • Сервисы платформы Alteryx One: сервис преобразования координирует обработку запросов, планирование выполнения и извлечение результатов между рабочим процессом в браузере и средой данных клиента. Сервисы также обеспечивают прослеживаемость и наблюдаемость выполнения рабочего процесса, усиливая как операционный мониторинг, так и подотчетность.

Сервисы платформы Alteryx One: сервис преобразования координирует обработку запросов, планирование выполнения и извлечение результатов между рабочим процессом в браузере и средой данных клиента. Сервисы также обеспечивают прослеживаемость и наблюдаемость выполнения рабочего процесса, усиливая как операционный мониторинг, так и подотчетность.

  • Google Cloud клиента: PDF-счета размещаются в Google Cloud Storage (GCS), исторические данные счетов остаются защищенными в BigQuery, извлечение с поддержкой ИИ выполняется в этой среде, а результаты рабочего процесса записываются обратно в BigQuery.

Google Cloud клиента: PDF-счета размещаются в Google Cloud Storage (GCS), исторические данные счетов остаются защищенными в BigQuery, извлечение с поддержкой ИИ выполняется в этой среде, а результаты рабочего процесса записываются обратно в BigQuery.

В этой модели браузер является уровнем создания, сервисы платформы Alteryx One — уровнем координации, а Google Cloud — уровнем защищенных данных и выполнения. Это позволяет визуально создавать логику рабочего процесса в Live Query, в то время как выполнение остается согласованным с защищенными данными и обработкой в масштабах хранилища в BigQuery.

Пошаговое руководство по рабочему процессу Live Query: от PDF до инсайтов

Давайте подробнее рассмотрим, как рабочий процесс Live Query обрабатывает неструктурированные PDF-файлы на примере счета.

Прием PDF-счетов. Рабочий процесс начинается с указания входного каталога в Google Cloud Storage, где хранятся исходные PDF-файлы. На практике этот шаг делает больше, чем просто идентификацию папки: он перечисляет расположения PDF-файлов и возвращает метаданные на уровне файлов — такие как абсолютные пути к файлам, размер, а также временные метки создания и обновления — чтобы рабочий процесс мог надежно передавать нужный набор документов на последующие этапы извлечения данных.

Извлечение ключевых полей. Используя инструмент Document Extract от Alteryx, рабочий процесс обрабатывает PDF-счета, хранящиеся в Google Cloud Storage, и извлекает структурированные или полуструктурированные результаты непосредственно в BigQuery. Этап извлечения использует выбранную пользователем модель, Document AI или Gemini AI, в зависимости от конфигурации рабочего процесса. По сути, инструмент создает временную внешнюю объектную таблицу из URI входных документов и выполняет соответствующую функцию — ML.PROCESS_DOCUMENT для модели Document AI или AI.GENERATE для модели Gemini AI. В данном рабочем процессе используется путь Gemini, при этом AI.GENERATE возвращает запрошенные поля счета в последующий рабочий процесс Live Query.

Во время интерактивного проектирования Live Query ограничивает обработку небольшим подмножеством URI документов для предварительного просмотра, в то время как выполнение во время выполнения обрабатывает полный набор PDF-счетов.

Классификация извлеченного контента. После извлечения рабочий процесс использует инструмент Classify от Alteryx для применения классификации с нулевым снимком (zero-shot classification) к извлеченному тексту счета. В этом сценарии использования содержимое позиций маркируется по предопределенным бизнес-категориям — например, промышленные или офисные товары — с использованием AI.CLASSIFY в BigQuery, что возвращает новый столбец с предсказанными метками в последующий рабочий процесс. Этот бизнес-контекст делает извлеченные данные более полезными для последующей сверки, обработки исключений и отчетности.

Нормализация данных. Извлеченные номера счетов очищаются и стандартизируются, чтобы незначительные различия в форматировании — такие как пробелы или несоответствия в оформлении — не скрывали потенциальные дубликаты во время сверки.

Сравнение с историческими данными. Рабочий процесс объединяет нормализованные записи текущих счетов с историческими данными счетов, уже находящимися в BigQuery. Этот этап сверки идентифицирует записи с совпадающими номерами счетов, которые уже присутствуют в истории, и помечает их как потенциальные дубликаты.

Маркировка исключений. Затем этап формул применяет логику бизнес-правил к оставшимся записям. Эти правила могут варьироваться в зависимости от рабочего процесса и могут включать проверки на несоответствие сумм, отсутствие обязательных полей, неверные итоговые значения или другие специфические для финансов исключения. В этом примере одно правило проверяет, соответствует ли invoice_amount сумме net_amount + tax_amount, и помечает несоответствия для проверки.

Создание операционных результатов. Рабочий процесс создает два операционных результата: один для счетов, сопоставленных с историческими записями и помеченных как потенциальные дубликаты, и другой для несопоставленных текущих счетов, которые были проверены, помечены для исключений там, где это необходимо, и подготовлены для обработки неоплаченных счетов.

Результатом является не просто извлечение данных, а управляемые операционные результаты, которые финансовые команды могут немедленно просмотреть и принять в работу.

Резюме: Управляемый рабочий процесс «от документа к решению»

Наши общие клиенты с энтузиазмом восприняли эти новые возможности, которые помогут улучшить бизнес-процессы.

«Что меня поразило в Alteryx One: Google Edition, так это то, насколько естественно он вписывается в экосистему Google Cloud. Я рад возможности сделать аналитику более доступной, позволив бизнес-пользователям работать с данными BigQuery через интуитивно понятный и управляемый интерфейс». — Майкл Уайант, вице-президент по корпоративным данным и корпоративным решениям, Papa Johns

Этот сценарий использования — больше, чем просто простой инструмент извлечения; он представляет собой мощный шаблон, ориентированный на Google Cloud, для преобразования неструктурированных документов в полезные операционные результаты. Вместо перемещения данных хранилища в разрозненные инструменты подготовки, рабочий процесс сохраняет хранение, извлечение, сверку и генерацию результатов в соответствии с управляемыми корпоративными данными, уже находящимися в BigQuery. Объединяя интуитивно понятный дизайн Alteryx One Live Query с масштабируемостью и возможностями ИИ BigQuery, финансовые команды могут сократить ручные усилия, ускорить обработку исключений и сосредоточиться на более ценных стратегических инициативах.

  • Аналитика данных
  • BigQuery
  • Партнеры

О чём эта статья

Ещё в разделе «Данные и аналитика»

Все →

Ещё от Looker