Проектирование фундамента данных для промышленного ИИ и аналитики

Источник: Starburst•

Проектирование фундамента данных для промышленного ИИ и аналитики

Дискуссия вокруг корпоративного ИИ кардинально изменилась. Мы перешли этап...

Дискуссия вокруг корпоративного ИИ кардинально изменилась. Мы перешли от этапа экспериментов к более сложной и важной фазе — проектированию прорыва в области ИИ. Что нужно корпоративному агентному ИИ для успешной работы в промышленной среде? В конечном итоге все сводится к трем вещам:

  • Точность
  • Согласованность
  • Аудируемость

ИИ-агент галлюцинирует не из-за слабости модели. Он галлюцинирует, потому что данные под ним устарели, определения противоречивы или путь, который он прошел, невозможно отследить. По мере масштабирования промышленного агентного ИИ, аналитики логов в реальном времени и высоконагруженных аналитических рабочих процессов, командам платформ данных требуется нечто большее, чем просто базовый движок запросов. Им нужны унифицированное управление lakehouse, операционная наблюдаемость в реальном времени, стабильность движка без простоев, обработка логов/событий почти в реальном времени и современные инструменты для разработчиков.

В этом релизе Starburst Galaxy предоставляет спроектированный фундамент данных, необходимый для промышленного ИИ и аналитики, опираясь на шесть основных столпов.

Агентное доверие, интеллект и федеративный бизнес-контекст

Корпоративному ИИ и автоматизированным конвейерам данных требуются точные, управляемые и богатые бизнес-контекстом данные.

Galaxy обеспечивает это с помощью Starburst AIDA, которая теперь включает встроенные механизмы безопасности ИИ (AI Safety Guardrails), программные API контроля качества данных и редактируемое управление метаданными.

Федеративный бизнес-контекст и управление метаданными

Редактируемое управление метаданными и публичные API контекста

Эта функция позволяет инженерам данных и командам платформ читать и записывать бизнес-описания, пользовательские метаданные и бизнес-правила на уровне таблиц непосредственно в Catalog Explorer или программно через публичные REST API. Двусторонняя синхронизация между активами Catalog Explorer и продуктами данных устраняет разрозненность метаданных, а интеграции с dbt позволяют описаниям, тегам и сопоставлениям столбцов автоматически поступать в Starburst для обоснования логики ИИ.

Расширенные семантические механизмы защиты для ИИ

Семантические механизмы защиты (Semantic Guardrails) расширяют уровень корпоративного контекста полями описания, специально разработанными для улучшения сбора контекста. Кураторы могут определять точные пары ключей соединения, кратность соединений (1:1, 1:n, n:n), теги фактов и измерений, списки разрешенных значений, синонимы столбцов и предлагаемые вопросы непосредственно для наборов данных, чтобы помочь уменьшить галлюцинации агента при сложных соединениях и агрегациях, предоставляя необходимый источник достоверных данных.

Программные API контроля качества данных

Программные API контроля качества данных обеспечивают полную поддержку API для чтения и записи проверок качества данных в Starburst Galaxy. Команды платформ могут программно создавать, управлять и отслеживать тесты качества данных как код в GitHub, а также связывать тесты напрямую с DAG-конвейерами оркестрации Airflow для автоматической остановки последующих заданий в случае несоблюдения пороговых значений качества.

AIDA: Доверенная разговорная аналитика на основе управляемых данных

Хотя ИИ-агенты обещают предоставить аналитику каждому бизнес-пользователю, они настолько надежны, насколько надежны данные и средства контроля, стоящие за ними. Этот релиз расширяет возможности Starburst AIDA за счет дополнительных способов расширения агента через AIDA Studio, а также новых функций аудита и контроля использования для администраторов — все это построено на управляемых продуктах данных и уже существующих в Galaxy средствах контроля доступа.

Опыт работы с аналитическим агентом

Аналитика на естественном языке с использованием продуктов данных

Позволяет бизнес-пользователям задавать вопросы по курируемым продуктам данных на естественном языке, не написав ни строчки SQL, и углубляться в детали, чтобы понять, что влияет на результат. Каждый ответ показывает SQL-запрос и шаги, стоящие за ним, поэтому пользователи могут точно видеть, как был получен результат.

Применение контроля доступа на основе ролей

Выполняет каждый запрос AIDA под ролью, с которой вошел пользователь, поэтому те же средства контроля доступа, которые управляют данными в остальной части Galaxy, применяются к каждому ответу, возвращаемому AIDA.

Персоны, история чата и интерактивные графики

Встроенные персоны (руководитель, аналитик и инженер данных) и пользовательские персоны адаптируют ответы AIDA для каждой аудитории. История чата позволяет пользователям продолжить исследование с того места, где они остановились, а интерактивные графики превращают результаты запросов в визуализации.

AIDA Studio

Навыки

Упаковывает инструкции для повторяющейся аналитической работы, чтобы каждый, кто выполняет общий процесс, следовал одним и тем же шагам.

Внешние серверы MCP

Подключает AIDA к инструментам и контексту за пределами Starburst, при этом перед вызовом любого инструмента требуется одобрение для каждого конкретного случая.

Управление и мониторинг

Механизмы защиты ИИ (AI Guardrails)

Защита, включенная по умолчанию, которая не дает AIDA раскрывать свои собственные инструкции, предписывает ей рассматривать инструкции в результатах запросов и ответах инструментов как данные, удерживает встроенные инструменты в рамках продукта данных сессии и отклоняет слишком объемные промпты до того, как они достигнут модели. Опциональная фильтрация тем блокирует предметы, выходящие за рамки предполагаемого использования AIDA. Узнайте больше о механизмах защиты ИИ.

Журналы аудита агента

Неизменяемая запись каждого взаимодействия с AIDA, включая пользователя, вопрос, продукт данных, персону, предпринятые шаги, использованные навыки и любые отзывы пользователей. Администраторы могут фильтровать журналы по дате, пользователю, продукту данных и статусу, а также экспортировать их в формате CSV для обеспечения соответствия требованиям и отчетности.

Мониторинг использования и затрат

Ежедневное использование токенов AIDA и затраты с разбивкой по пользователям, доступные для экспорта для внутренней отчетности и бюджетирования.

Унифицированная консоль Starburst Icehouse и масштабируемый движок Iceberg

Хотя Apache Iceberg стал открытым стандартом для современного data lakehouse, управление Iceberg в промышленной среде исторически было фрагментированным и непрозрачным. Этот релиз представляет консоль Starburst Icehouse — унифицированный комплексный интерфейс управления Iceberg в Galaxy, подкрепленный глубокими оптимизациями движка Iceberg корпоративного уровня.

Консоль Icehouse и UX управления

Выделенная плоскость управления Icehouse

Централизованная плоскость управления в Galaxy, где команды данных могут обнаруживать, оптимизировать, отслеживать и управлять всеми таблицами Apache Iceberg во всех каталогах без переключения контекста между инструментами.

Автоматическое обнаружение схемы и управление ее дрейфом

Автоматически выводит и регистрирует схемы таблиц Iceberg при создании каталога с непрерывным фоновым мониторингом схемы для обнаружения и устранения дрейфа схемы до того, как сломаются последующие BI-дашборды или модели ИИ.

Действенная наблюдаемость Iceberg и метрики ROI

Видимость в реальном времени состояния таблиц, сокращения количества файлов, восстановленного места в хранилище и истории выполнения обслуживания. Визуальные сравнения экономии затрат и базовых показателей производительности количественно определяют точный ROI от обслуживания вашего lakehouse непосредственно для руководства.

Масштабируемость и производительность движка Iceberg

Инкрементальное обновление материализованных представлений Iceberg

Представляет запланированные инкрементальные обновления только для добавления (append-only) для материализованных представлений Iceberg с использованием определяемого пользователем инкрементального столбца. Обрабатывая только недавно добавленные строки из любого источника, доступного для запросов Trino, вместо выполнения полных пересчетов, Galaxy значительно сокращает окна обновления и устраняет основной барьер, удерживающий устаревшие конвейеры на Hive.

Спроектированное серверное обслуживание таблиц

Переносит ресурсоемкие задачи по уплотнению (compaction), удалению «осиротевших» файлов и истечению срока действия снимков состояния (snapshots) со стандартных кластеров запросов на выделенный бессерверный движок выполнения. Возобновляемые процессы уплотнения, отчеты о ходе выполнения и автоматическая настройка пороговых значений устраняют проблемы с мелкими файлами после интенсивных операций MERGE, предотвращая риски нехватки памяти (Out-Of-Memory) в кластере и защищая SLA производственных запросов.

Распределенное извлечение метаданных и планирование Iceberg

Переносит парсинг манифестов и генерацию разделов с координатора на рабочие узлы (worker nodes) для запросов, сканирующих таблицы с десятками миллионов файлов. Делегируя задачи по работе с метаданными рабочим узлам кластера, Galaxy снижает потребление памяти и ресурсов процессора координатором, устраняет «узкие места» координатора при работе с огромными наборами данных и позволяет уменьшить размер узлов координатора в 2 раза, что обеспечивает значительную экономию средств.

Полная поддержка спецификации Iceberg v3 и облачная REST-интеграция

Основываясь на векторах удаления и ветвлении Iceberg v3, этот релиз расширяет поддержку нативных сопоставлений типов v3 (включая типы данных Geometry и Geography), а также предлагает готовые интеграции с каталогом Iceberg REST, поддерживающие выдачу краткосрочных учетных данных и нативные потоки облачной аутентификации в AWS, Azure и GCP.

Высокая параллельность, федерация данных, аналитика логов с субсекундной задержкой и динамическое кэширование Warp Speed

Аналитические рабочие нагрузки выходят за рамки традиционной BI-отчетности, охватывая масштабную аналитику логов, событий и потоковых данных в реальном времени. Это стимулируется федерацией данных, способной получать доступ к информации, где бы она ни находилась. Обновления движка в этом релизе оптимизируют координацию кластера, эффективность кэширования и паттерны агрегации по одной таблице, обеспечивая максимальное соотношение цены и производительности в требовательных корпоративных средах.

Оптимизация аналитики движка

Производительность аналитики логов и событий в режиме, близком к реальному времени

Целевые оптимизации движка сосредоточены на высокоскоростных паттернах запросов, в частности на агрегациях по одной таблице, интенсивной фильтрации и проекциях, типичных для тестов ClickBench. Устраняя внутренние «узкие места» запросов, Galaxy обеспечивает отклик, близкий к реальному времени, для аналитических нагрузок по логам и событиям, напрямую превосходя специализированные движки, такие как ClickHouse и StarRocks, при этом безопасно сохраняя данные в открытом хранилище lakehouse.

Глобальный динамический уровень кэширования файловой системы для Warp Speed

Обновляет Warp Speed с помощью унифицированного глобального уровня кэширования файловой системы для развертываний с несколькими каталогами. Дисковое пространство SSD теперь динамически распределяется между каталогами в реальном времени на основе активного спроса на запросы, что исключает статическое разделение дисков по каталогам, максимизирует использование SSD и ускоряет выполнение запросов в каталогах lakehouse с поддержкой индексов.

Параллелизм кластера и маршрутизация

Оптимизированная координация движка для повышения QPS в 2-3 раза

Усовершенствования движка значительно снижают накладные расходы на координацию на уровне кластера между рабочими узлами. Один кластер теперь может обрабатывать в 2-3 раза больше параллельных запросов и обеспечивать более высокую пропускную способность, что снижает операционные затраты на запуск десятков отдельных кластеров для корпоративных приложений с высокой степенью параллелизма.

Умная балансировка нагрузки через атомарную маршрутизацию с учетом состояния

Заменяет случайное распределение запросов интеллектуальной маршрутизацией, основанной на метриках, в наборах развертываний с несколькими кластерами. Умная балансировка нагрузки постоянно оценивает глубину очереди в реальном времени и количество активных запросов в кластерах. Используя атомарный счетчик диспетчеризации с учетом состояния, система детерминированно распределяет всплески параллельных запросов между работоспособными развертываниями, гарантируя, что ни один кластер не будет простаивать, пока другой накапливает задачи.

Наблюдаемость в реальном времени и долгосрочный аудит FinOps

Невозможно управлять или доверять фундаменту данных ИИ, если вы не можете наблюдать за ним нативно. Этот релиз расширяет возможности наблюдаемости Galaxy за счет прямых открытых интеграций и долгосрочного исторического анализа.

Корпоративные интеграции наблюдаемости

Прямой экспорт OpenTelemetry в Datadog и AWS CloudWatch

Galaxy поддерживает прямой экспорт метрик, событий и трассировок в системы наблюдаемости клиентов через выделенные коллекторы OpenTelemetry. Платформенные команды получают оповещения в реальном времени о свежести потоковых данных, задержках запросов и состоянии ресурсов внутри своих существующих корпоративных панелей мониторинга, подкрепленные изоляцией коллектора OpenTelemetry с нулевым доверием (zero-trust) и поддержкой одного арендатора.

Масштабируемая история запросов и расширенная отчетность по аналитике

Перенос хранения истории запросов из баз данных метаданных в высокомасштабируемое аналитическое хранилище позволяет сохранять историю за 30 и более дней. Администраторы платформы могут выполнять долгосрочный аудит FinOps, отслеживание затрат и анализ соответствия требованиям с временем отклика отчетов менее секунды в интерфейсе Galaxy.

Пользовательский опыт разработчика, созданный для скорости и немедленной ценности

Редактор запросов — это главная страница, где инженеры данных и аналитики проводят большую часть своего времени. Этот релиз предлагает полную переработку интерфейса разработчика наряду с пошаговыми рабочими процессами адаптации.

Улучшения IDE и навигации

Переработанный редактор запросов и унифицированная IDE

Включает модернизированный SQL-редактор с навигацией, ориентированной на каталоги, более удобным управлением вкладками, гибкими переключателями выполнения операторов и улучшенным автодополнением для глубоких иерархий объектов каталога. Расширенные элементы управления переполнением вкладок, закрепление вкладок и изменение порядка перетаскиванием позволяют эффективно работать со сложными многозапросными рабочими процессами. Построенный на единой кодовой базе Starburst Enterprise и Starburst Galaxy, обновления функций и улучшения IDE появляются одновременно в обеих средах.

Навигация, ориентированная на данные, и расширенная фильтрация

Перепроектирует боковую панель Data Explorer, отходя от иерархий, ориентированных на кластеры, к ментальной модели, ориентированной на данные, сфокусированной непосредственно на каталогах, схемах, таблицах и продуктах данных. Фильтрация на уровне столбцов и прямое перетаскивание столбцов для вставки упрощают составление запросов.

Пошаговая адаптация в Galaxy

Упрощенные процессы адаптации устраняют первоначальные трудности, обеспечивая четкую связь между каталогами и кластерами, рекомендуемые настройки размера кластера по умолчанию и пошаговые пути настройки, что значительно сокращает среднее время до первого запроса.

Корпоративная интероперабельность и время безотказной работы

Производственные платформы требуют непрерывной доступности и бесшовной интероперабельности с существующими корпоративными инвестициями в управление данными.

Управление жизненным циклом и открытое управление

Разделение жизненного цикла движка и плоскости управления (Control Plane)

Обновления версии движка Trino теперь отделены от релизов платформы Galaxy. Обновления плоскости управления больше не прерывают активные запросы движка Trino, что позволяет проводить обновления платформы без простоев.

Расширенная интероперабельность с Unity Catalog и Delta Lake

Поддерживая наше обязательство по открытой интероперабельности, Galaxy расширяет поддержку записи для управляемых таблиц, принадлежащих каталогу Unity Catalog. Расширенная выдача учетных данных и интеграция с Unity Catalog по принципу REST-first позволяют организациям сохранять Databricks Unity Catalog в качестве централизованного уровня управления, используя при этом Starburst для высокопроизводительной SQL-аналитики по нескольким источникам.

Создание фундамента ИИ сегодня

Прорыв, который открывает путь к внедрению корпоративного ИИ в промышленную эксплуатацию, никогда не заключался в создании более крупной модели. Он всегда был связан с созданием фундамента данных, достаточно надежного, чтобы ему можно было доверять. Благодаря Project AIDA, встроенным механизмам обеспечения безопасности ИИ (AI Safety Guardrails), программным API для контроля качества данных, управлению редактируемыми метаданными, унифицированному управлению Iceberg, глобальному динамическому кэшированию, аналитике логов с задержкой менее секунды, увеличению пропускной способности запросов в 2-3 раза, интеллектуальной балансировке нагрузки, встроенному экспорту OpenTelemetry и современным инструментам для разработчиков, Starburst Galaxy предоставляет управляемую облачную основу, необходимую для вашей стратегии работы с данными.

Изучите документацию и начните работу

  • Документация Starburst Galaxy
  • Руководство по консоли Icehouse и обслуживанию таблиц
  • Начните бесплатную пробную версию Starburst Galaxy уже сегодня

О чём эта статья