Мы участвовали в достаточном количестве подобных разговоров, чтобы выучить этот сценарий наизусть. Клиент уже выбрал модель, уже определился с вариантом использования, бюджет уже утвержден. Затем кто-то спрашивает, где на самом деле хранятся обучающие данные, и в комнате на секунду воцаряется тишина. Конечно, они в S3. Но также в экземпляре Snowflake, которому больше никто не доверяет, в озере данных Databricks, развернутом для прошлогоднего проекта, и в кластере Hadoop, который команда все собирается отключить, но никак не может. Девять из десяти организаций заявляют, что внедрят ИИ в течение следующего года. Почти никто из них не разобрался с этой частью в первую очередь.
NetApp и Starburst вместе устраняют этот разрыв. Вот как и почему это отличается от обычных партнерских маркетинговых текстов.
Больше хранилищ, те же «слепые зоны»
Каждый клиент, с которым мы общаемся, покупает больше хранилищ, а не меньше. Объемы данных продолжают расти с каждым годом, независимо от действий наших компаний. Это партнерство не пытается сократить объем хранилищ; оно нацелено на другое: никто не может видеть или запрашивать все данные сразу, и этот пробел проявляется почти в каждой сделке, над которой мы работаем.
Каждый переход между системой хранения и уровнем вычислений чего-то стоит — будь то задержка, деньги или еще одна копия конфиденциальных данных, которую теперь кто-то должен защищать и отслеживать. ИИ-модель может быть настолько умной, насколько позволяет самый узкий сегмент данных, который ей действительно разрешено видеть, а сейчас это тот разрозненный источник, который оказался ближе всего, что редко бывает самым важным. Хранилища, созданные для стабильных и предсказуемых задач отчетности, просто не были рассчитаны на импульсивный и непредсказуемый характер нагрузок при обучении и выводе ИИ.
Где на самом деле помогает AI Data Engine
NetApp создала AI Data Engine, чтобы исправить именно это, а Starburst работает вместе с ним как уровень федерации и запросов. Программное обеспечение взаимодействует с программным обеспечением. Starburst управляет аналитической федерацией и запросами, в то время как AI Data Engine наполняет их ценным контекстом из неструктурированных данных. Стоит прояснить один момент, так как люди иногда предполагают обратное: здесь нет совместного аппаратного устройства, нет единой «коробки», которую нужно устанавливать в стойку. NetApp предоставляет платформу хранения и данных, мы предоставляем движок федерации, и они работают вместе как полноценная интеграция, а не как логотип партнера, наклеенный на слайд.
В результате вы получаете единый управляемый SQL-уровень, охватывающий ONTAP и S3, а также таблицы Snowflake, Databricks, Iceberg и Delta Lake, и, конечно, старые системы, такие как Hive, Hadoop, Teradata — и все это без предварительного копирования данных. ИИ-помощник Starburst, AIDA, находится поверх всего этого и выполняет основную работу:
- Планирование каждого запроса
- Извлечение данных из нужных источников
- Указание точного источника, из которого был получен ответ ИИ-агента
Управление данными сопровождает ответ, а не проверяется постфактум.
Цифры, с которых мы начнем
Клиенты получают одну интегрированную платформу вместо пяти или более инструментов, с которых начинаются большинство ИИ-проектов, что само по себе значительно сокращает время настройки типичной сборки. Затраты на подготовку данных снижаются примерно на 70 процентов, когда работа выполняется на месте, а не в конвейере. Конечно, федерация не означает, что запрос никогда не касается сети. Если источник и вычислительные мощности находятся не в одном месте, данные все равно должны перемещаться для обработки; эта часть никуда не девается. Что исчезает, так это плата за копирование и хранение одних и тех же данных второй раз только для того, чтобы сделать их доступными для запросов. В гибридных и мультиоблачных средах функция Stargate от Starburst удерживает вычисления как можно ближе к данным и позволяет кластерам обмениваться данными напрямую, поэтому вы не переходите к одной центральной загрузке каждый раз. Если посмотреть на всю базу клиентов Starburst, цифры становятся еще внушительнее. Более 100 000 выведенных из эксплуатации ETL-конвейеров, затраты на аналитику сокращены примерно вдвое по сравнению с облачным хранилищем данных, работа на масштабах, включающих петабайты данных.
Как отметили NetApp и Starburst в совместной публикации руководителей продуктов обеих компаний в сообществе NetApp: «NetApp и Starburst — идеальная пара».
Управление данными должно быть на первом месте
Скорость не имеет значения, если она стоит вам контроля над данными. Единая точка управления в Starburst Enterprise обеспечивает безопасность доступа к данным, пока они запрашиваются на месте внутри защищенного периметра NetApp, с контролем доступа на уровне строк и столбцов, маскированием и полными журналами аудита по каждому источнику, в дополнение к шифрованию и требованиям соответствия NetApp. Особенно для финансовых услуг, здравоохранения и телекоммуникаций это разница между подтверждением концепции, которое заслуживает демонстрации, и тем, которое действительно пройдет аудит через полгода.
Как это выглядит на практике
Реальная проблема с данными рассказывает эту историю лучше, чем любой слайд. Поэтому приносите нам свои данные, в самом запутанном виде — данные, разбросанные по хранилищам, ИИ-проект, который заглох полгода назад, потому что никто не мог договориться, где на самом деле живут данные, бюджет, растянутый на слишком много пересекающихся платформ. Мы предпочли бы услышать об этом напрямую, а не в последующем электронном письме.












