По мере того как предприятия осваивают генеративный ИИ (GenAI), они неизбежно обнаруживают, что успех их инициатив в области GenAI зависит от качества данных. Низкое качество данных негативно сказывается на конвейерах машинного обучения (ML), что приводит к ошибочным бизнес-решениям и упущенным возможностям. Чтобы обеспечить доверие к системам ИИ, предприятиям необходимо найти новые подходы к постоянному повышению качества данных.
Два столпа GenAI: основные и контекстные данные
В основе GenAI лежат два типа данных: основные и контекстные. Основные данные подпитывают обучение больших языковых моделей (LLM), позволяя им расшифровывать сложные закономерности и структуры. Эти фундаментальные знания критически важны для получения результатов, которые не только логичны, но и глубоко соответствуют поставленной задаче. Напротив, контекстные данные обогащают этот процесс, предоставляя детализированную информацию о конкретных ситуациях или средах, что приводит к созданию более адаптированных и эффективных результатов GenAI.
Чтобы обеспечить высокое качество основных данных, предприятиям следует уделить первоочередное внимание следующему:
1. Контекстуализация: Контекстуализация необходима для эффективности GenAI, особенно при создании адаптированного контента. Ярким примером является медико-технологическая организация, улучшающая опыт медицинских работников (HCP) за счет персонализированного маркетинга, что достигается путем агрегирования и тщательной проверки данных из различных источников. Этот комплексный подход к объединению данных и контролю качества позволил создать продукты данных, которые значительно повысили вовлеченность HCP, продемонстрировав возможности персонализации GenAI.
2. Полнота: Крайне важно обеспечить охват всех соответствующих групп и сценариев данными. Например, модели, которые будут использоваться по всему миру, должны обучаться на данных из всех целевых стран.
3. Смягчение предвзятости: Итеративные проверки наборов данных и приложения для обнаружения предвзятости играют важную роль в минимизации предвзятости моделей. Помимо управления данными, проектирование промптов во время обучения модели играет жизненно важную роль в создании объективных и инклюзивных результатов.
4. Соблюдение нормативных требований: Соблюдение правовых стандартов, особенно в отношении персонально идентифицируемой информации (PII) и конфиденциальных данных, является обязательным. Такие данные должны быть соответствующим образом замаскированы или исключены для удовлетворения нормативных требований, обеспечивая конфиденциальность и соответствие требованиям.
Контекстные данные для создания промптов
Искусство создания промптов для моделей GenAI опирается на три основных концепции: ясность, специфичность и осознание предвзятости. Четкие и недвусмысленные промпты повышают точность результатов, а специфичность гарантирует, что ИИ понимает контекст и эффективно работает с ним. Более того, глубокое понимание потенциальных предвзятостей в языке способствует разработке более справедливых и сбалансированных ответов ИИ. Это создает среду, в которой GenAI может развиваться ответственно и этично.
Основные элементы качества основных данных
Основные данные часто страдают от таких проблем, как пропущенные значения, несоответствия и неточности. Эти проблемы ставят под угрозу надежность и доверие к данным, в конечном итоге препятствуя обучению и производительности моделей GenAI. Общие проблемы качества данных, влияющие на масштабируемость GenAI, включают:
1. Немаркированные или плохо маркированные данные: Отсутствие контекста в наборах данных может привести к тому, что большие языковые модели (LLM) будут генерировать неверные результаты. Эта проблема усугубляется разнообразными потребностями в данных в бизнес-секторе и ИТ, что подчеркивает необходимость централизованного инвентаря хорошо маркированных наборов данных, богатых метаданными. Без такой организации поиск данных становится трудоемким, а возникают сомнения в качестве и происхождении данных. Обеспечение проверки качества, курирования и легкого доступа к наборам данных повышает доверие к данным, оптимизирует доступ, поощряет сотрудничество и гарантирует согласованные метрики для всех пользователей. Это оптимизирует эффективность и результативность использования данных для GenAI и других проектов, основанных на данных.
2. Неполные данные и пропущенные значения: Неполные данные препятствуют производительности модели, предлагая неполное представление для анализа. Решения по обеспечению качества данных решают эту проблему, создавая подробные отчеты об исключениях в данных, таких как пропущенные значения, что критически важно для ответственных за данные лиц (data stewards) для их выявления и исправления. Корректирующие действия могут включать обновление значений в источнике или установку значений по умолчанию в конвейере данных. Это обеспечивает чистоту данных для последующего использования.
Внедрение решений по обеспечению качества данных систематически повышает качество данных, что отслеживается с помощью ключевых показателей эффективности (KPI), установленных для организационных команд. KPI отслеживают улучшения в точности, полноте и своевременности данных.
3. Точность данных: Решение по обеспечению качества данных необходимо для обеспечения целостности и надежности данных, используемых в приложениях GenAI. Оно создает подробные отчеты о проблемах с данными, включая пропущенные значения. Это помогает ответственным за данные лицам вносить необходимые исправления, такие как обновление значений в источнике или установка значений по умолчанию в конвейере для получения более чистых данных на последующих этапах.
Внедрение решений по обеспечению качества данных приводит к значительному повышению качества данных, которое отслеживается на предмет точности, полноты и своевременности с помощью KPI.
Проактивное управление качеством данных гарантирует, что модели GenAI обучаются на высококачественных данных, повышая точность и надежность генерации глубоких результатов.
4. Свежесть данных: Устаревшие данные могут вводить модели в заблуждение, влияя на их актуальность для текущих тенденций. Решение по наблюдаемости данных повышает свежесть данных за счет раннего обнаружения аномалий, предоставляя информацию о давности загрузок данных и выявляя устаревшие данные. Например, розничная компания, использующая старые данные о транзакциях, может неправильно настроить рекомендации по продуктам. Благодаря наблюдаемости данных обеспечивается актуальность данных, что делает рекомендации модели GenAI более своевременными и релевантными для эффективного взаимодействия с клиентами.
5. Дубликаты: Дублирующиеся записи данных могут привести к избыточности и предвзятому анализу. Решение по обеспечению качества данных выявляет дубликаты с использованием правил сопоставления, таких как сравнение наборов данных клиентов по имени, электронной почте и номеру телефона. Оно присваивает оценки соответствия для оценки уверенности в дубликатах, автоматизируя объединение записей для совпадений с высокой степенью уверенности и помечая другие для проверки. Этот метод обеспечивает точность данных для обучения и анализа, предотвращая искажение производительности модели из-за чрезмерно представленных данных.
6. Согласованность данных: Несогласованные данные препятствуют способности модели применять полученные знания в разных контекстах. Например, если медицинский работник активен в CRM, но неактивен в маркетинговом приложении, устранение этого несоответствия жизненно важно для точной сегментации данных. Выявление и согласование таких несоответствий требует выбора основного источника данных для истины и соответствующей корректировки конвейеров данных. Это гарантирует, что модели могут эффективно обобщать, повышая надежность и производительность приложений GenAI.
Масштабирование GenAI для более широких корпоративных приложений
Успех корпоративных программ GenAI неразрывно связан с готовностью качества данных. Чтобы эффективно масштабировать программы GenAI с использованием высококачественных данных, организации могут выполнить следующие шесть стратегических шагов:
1. Стратегия качества данных и поддержка руководства: сформировать всестороннее видение драйверов и приоритетов управления качеством данных. Согласование с бизнес‑приоритетами и получение поддержки руководства критически важны для успеха инициатив по качеству данных и вовлечения различных бизнес‑заинтересованных сторон.
2. Начните с малого: чётко понять бизнес‑цели и текущие проблемы качества данных. Идентифицировать и приоритизировать случаи использования для реализации, например, качество данных в области клиентов или конкретный случай/приложение GenAI. Оценить ожидаемые результаты от приложения/случая GenAI, а также исходные данные и соответствующие стандарты/КПИ качества данных.
3. Создайте рамки качества данных: определить процессы и процедуры качества данных, такие как идентификация критических элементов данных (CDE) или управление проблемами. Описать целевую операционную модель, включающую модель взаимодействия, организационную структуру и роли и обязанности (RACI). Убедиться, что владельцы и хранители данных определены и их роли согласованы с приоритетными случаями использования.
4. Пилотное решение и масштабирование: разработать масштабируемое решение, способное адаптироваться к будущим потребностям, включая возможность интеграции новых источников данных, наборов данных или правил. Создать центральный репозиторий для повторно используемых правил, интуитивные панели управления для отчетов о качестве данных и механизм отслеживания проблем данных. Вовлекать бизнес на протяжении всей реализации, собирать обратную связь и предоставлять обучение, адаптированное к различным персонам и ролям, таким как рабочие процессы управления проблемами или создание новых критических элементов данных. Определить чемпионов данных в рабочих группах, чтобы помочь распространять результаты и постепенно включать другие случаи использования/функции бизнеса.
5. Устранение проблем качества данных: внедрить надёжный процесс устранения, при котором исправления управляются рядом с источником, чтобы предотвратить распространение проблем данных downstream. Создать технологически поддерживаемый рабочий процесс управления проблемами для отслеживания исключений и принятия корректирующих действий. Проводить регулярные встречи по управлению данными с заинтересованными сторонами для обеспечения своевременного разрешения проблем.
6. Непрерывный мониторинг и улучшение качества данных: рассматривать управление качеством данных как непрерывный процесс, включающий регулярный мониторинг по определённым метрикам и КПИ, выявление аномалий в потоках данных, оповещение хранителей данных и отслеживание проблем качества данных до их разрешения.
Сделать качество данных #1
Высококачественные, надёжные данные являются основой любой успешной инициативы GenAI. Организации должны приоритизировать готовность данных, определяя свои случаи использования и цели GenAI. Задержка внимания к качеству данных может привести к снижению амбиций в области ИИ и упущению возможностей для инноваций и роста.








