Потоковая интеграция данных является фундаментальным компонентом любой современной архитектуры данных. Компаниям все чаще требуется принимать решения на основе данных — независимо от того, где эти данные находятся и когда они наиболее важны — немедленно. Потоковая интеграция данных — это один из первых шагов к использованию инфраструктур нового поколения, таких как облачные технологии, Big Data, приложения реального времени и IoT, которые лежат в основе этих решений.
В этой статье мы рассмотрим, как платформа Striim была создана с нуля для потоковой интеграции данных и какую пользу она приносит организациям. Striim позволяет компаниям переходить в облако, легко создавать приложения реального времени и извлекать больше пользы из решений Hadoop.
Striim — это запатентованное программное обеспечение корпоративного уровня для потоковой интеграции данных, которое предлагает непрерывный сбор данных, потоковую обработку, мониторинг конвейеров и доставку в режиме реального времени с проверкой целостности в гетерогенных системах. Striim предоставляет актуальные данные в пригодном для использования виде в Kafka, Hadoop и базы данных — локально или в облаке — для поддержки операционной аналитики и других высокопроизводительных рабочих нагрузок.
Основные возможности платформы
- Непрерывный сбор структурированных и неструктурированных данных: Striim захватывает данные в режиме реального времени из широкого спектра источников, включая базы данных (с использованием технологии захвата измененных данных с низким уровнем воздействия), облачные приложения, файлы журналов, IoT-устройства и очереди сообщений.
- Потоковая обработка на основе SQL: Striim применяет фильтрацию, преобразования, агрегацию, маскирование и обогащение с использованием статических или потоковых справочных данных.
- Мониторинг конвейеров и оповещение: Striim позволяет пользователям визуализировать поток данных и их содержимое в режиме реального времени, а также предлагает проверку доставки.
- Доставка в режиме реального времени: Striim распределяет данные в режиме реального времени в пригодном для использования виде по всем основным целевым системам, включая облачные среды, Kafka и другие системы обмена сообщениями, Hadoop, реляционные и NoSQL базы данных, а также плоские файлы.
Ключевые отличительные особенности платформы
- Потоковая интеграция данных с интеллектуальными функциями на базе платформы в оперативной памяти
- Перемещение данных в режиме реального времени между локальными и облачными средами
- CDC с низким уровнем воздействия для Oracle, SQL Server, HPE NonStop и MySQL
- Фильтрация, агрегация, преобразование и обогащение «на лету» с использованием SQL
- Быстрое развертывание и простая интеграция через интерфейс перетаскивания (drag-and-drop)
- Непрерывный мониторинг конвейера данных и встроенная проверка доставки
- Интеграция с существующими технологиями и решениями с открытым исходным кодом
Типичные сценарии использования
Вот лишь несколько наиболее распространенных способов, которыми клиенты Striim используют это запатентованное программное обеспечение для решения критических корпоративных задач:
Гибридная облачная интеграция
Striim упрощает внедрение облачных технологий за счет непрерывного перемещения данных в режиме реального времени из локальных и облачных источников в среды Microsoft Azure, Amazon Web Services (AWS) и Google Cloud Platform. Многие клиенты Striim используют готовые конвейеры данных для наполнения своих облачных решений из локальных баз данных, файлов, систем обмена сообщениями и датчиков для поддержки операционных рабочих нагрузок в облаке. Фильтруя, агрегируя, преобразуя и обогащая данные в движении перед их доставкой в облако, Striim предоставляет данные в режиме реального времени в пригодном для использования виде и помогает оптимизировать облачное хранилище. Доступный локально или в облаке, Striim позволяет компаниям начать работу за считанные минуты.
Интеграция данных для приложений реального времени
Striim обеспечивает работу приложений реального времени в системах обмена сообщениями на основе событий, таких как Kafka, решениях для быстрого аналитического хранения, таких как Kudu, и NoSQL базах данных, таких как Cassandra, путем непрерывной подачи предварительно обработанных данных в режиме реального времени. Striim предлагает интерфейс на основе мастеров и язык на основе SQL для простой и быстрой разработки. Кроме того, при необходимости Striim выполняет потоковую аналитику на основе SQL и визуализирует потоковые данные перед их доставкой в целевую систему для обеспечения операционной аналитики в реальном времени.
Интеграция и предварительная обработка данных в реальном времени для Hadoop
Striim обеспечивает современную интеллектуальную архитектуру данных для озер данных за счет ненавязчивого и непрерывного сбора данных в режиме реального времени из баз данных, журналов, систем обмена сообщениями и датчиков, а также предварительной обработки данных в движении для операционной отчетности и аналитики. Чтобы ускорить получение инсайтов и оптимизировать хранение, Striim фильтрует, маскирует, агрегирует, преобразует и обогащает данные перед доставкой в HDFS, HBase и Hive с задержкой менее секунды. Striim также может предварительно обрабатывать и извлекать признаки, подходящие для машинного обучения, перед непрерывной передачей обучающих файлов в Hadoop. Модели, созданные с использованием технологий Hadoop, могут быть перенесены в Striim, чтобы инсайты в реальном времени могли направлять принятие операционных решений и по-настоящему трансформировать бизнес. Striim также может отслеживать пригодность моделей и инициировать их переобучение для полной автоматизации.
Чтобы узнать больше о наших возможностях потоковой интеграции данных, посетите нашу страницу решения «Интеграция данных в реальном времени», запланируйте демонстрацию с экспертом Striim или загрузите платформу Striim, чтобы начать работу!
