Стало совершенно очевидно, что в современную эпоху исследований ИИ именно обучающие данные определяют успех. Архитектуры приходят и уходят, но урок последних нескольких лет остается неизменным: модели становятся лучше, когда они получают больше данных, причем более разнообразных. Нигде это не проявляется так ярко, как в сфере голосовых технологий. Речь — один из самых богатых сигналов, производимых человеком. Она несет в себе не только слова, но и акцент, эмоции, стиль речи, фоновый шум и текстуру реального разговора. Системы, достигшие новых высот в голосовом ИИ, такие как Whisper от OpenAI и GPT-Live, были построены на основе больших и разнообразных проприетарных аудиоколлекций. Для сообщества открытых исследований доступ к данным сопоставимого масштаба был главным препятствием на пути к прогрессу.
Однако до недавнего времени этот барьер был еще выше. До того как мы впервые выпустили первую версию YODAS почти 3 года назад, существовало мало разнообразия в крупномасштабных наборах данных для голоса. Крупнейшие открытые ресурсы, доступные в то время, были впечатляющими сами по себе, но ограниченными в важных аспектах. LibriLight предлагал около 60 000 часов неразмеченной английской речи, а Multilingual LibriSpeech расширил этот подход до 8 языков, но оба они были основаны на чтении аудиокниг — чистом, тщательно артикулированном стиле речи, который мало похож на то, как люди говорят в реальности. VoxPopuli обеспечил многоязычный охват за счет записей Европейского парламента, но лишь малая часть была транскрибирована, а содержание ограничивалось официальными политическими речами на европейских языках. The People's Speech Corpus приблизился к более естественному аудио с объемом около 30 000 часов, но был доступен только на английском языке. Исследователи, которым нужна была модель, способная обрабатывать спонтанную, зашумленную, разговорную речь на сотнях языков, просто не имели открытого набора данных для обучения. YODAS был создан, чтобы заполнить этот пробел: ~370 000 часов реальной, коммерчески пригодной речи на более чем 100 языках.
С момента выпуска оригинальная версия YODAS была скачана более 2,5 миллионов раз, а общее число загрузок, включая официальные производные наборы данных, такие как YODAS 2 и YODAS Granary, превысило 5,8 миллионов. Он стал ключевой частью других известных наборов данных, таких как Emilia, MOSEL и LEMAS. YODAS также использовался для разработки фундаментальных моделей промышленного масштаба, таких как IBM Granite, Canary и Parakeet от NVIDIA, а также OLMoASR от AI2. Он также стал важным источником данных для региональных моделей и бенчмарков, например, в Юго-Восточной Азии (Sea-LLMs и SEA-SpeechBench), Таиланде (Typhoon 2) и Центральной Азии (GigaAM и GigaChat Audio).
Представляем YODAS v3
Сегодня мы рады объявить о выпуске YODAS v3, многоязычного набора данных объемом 1,1 миллиона часов речи, который является крупнейшим открытым релизом в семействе YODAS на сегодняшний день. YODAS v3 утроил масштаб оригинала, улучшив почти каждый аспект, важный для обучения современных голосовых моделей: охват, качество и удобство использования.
Что нового. В общих чертах, YODAS v3 предлагает:
- Масштаб: 1,1 миллиона часов аудио (по сравнению с ~370 тыс. в YODAS v1), охватывающих более 100 языков (34 из которых имеют более 1000 часов данных).
- Высокая точность: YODAS v3 полностью выпущен в формате 48 кГц, и более 92% данных имеют частотный контент, эквивалентный частоте дискретизации 32 кГц или выше. Это делает его подходящим для задач, чувствительных к качеству, таких как синтез речи, улучшение звука и кодеки, а не только для ASR.
- Многоканальность: Более 70% данных содержат как минимум 2 различных канала, а не дублированное моно. Впервые генерация стерео- и пространственной речи может быть обучена в масштабе на открытых данных.
- Улучшенные транскрипты: Транскрипты готовы к использованию «из коробки», с временными метками на уровне слов и высказываний. Для более чем половины многоязычных данных добавлены переводы на английский язык с временными метками.
- Легкость: YODAS v3 занимает 60 ТБ в формате OPUS — такой же объем, как у YODAS v2, но с трехкратным увеличением количества данных и удвоенной частотой дискретизации и количеством аудиоканалов.
Как и его предшественники, YODAS v3 выпущен под лицензией CC BY 3.0. Скачайте или ознакомьтесь с ним напрямую на HuggingFace: https://huggingface.co/datasets/espnet/yodas3
Что включено
YODAS v3 организован по языкам, при этом каждый пример содержит аудио в формате 48 кГц, транскрипт с временными метками на уровне слов и высказываний, определенный язык и, где доступно, перевод на английский язык с временными метками.
Языковой охват. YODAS v3 охватывает более 100 языков, 34 из которых имеют более 1000 часов данных — это примерный порог, при котором язык может поддерживать сильную автономную модель ASR.
Количество каналов. Более 70% YODAS v3 содержит как минимум 2 различных канала. Мы учитывали запись как многоканальную только тогда, когда ее каналы были заметно разными, поэтому дублированное моно-аудио, сохраненное как стерео, помечено как моно.
Эффективная частота дискретизации. Поскольку большая часть веб-аудио получена путем апсемплинга из источников более низкого качества, мы оценили эффективную частоту дискретизации каждой записи на основе ее фактического частотного контента, а не доверяя заголовку файла. Более 92% данных достигают эффективной частоты 32 кГц или выше, а 67% — 44 кГц. Мы включили эту оценку в качестве метаданных, чтобы пользователи могли фильтровать данные по необходимой для их задачи точности.
Что это дает
YODAS v1 был в основном ресурсом для распознавания речи. Благодаря более высокой точности, нескольким каналам и более богатым аннотациям, YODAS v3 открывает гораздо более широкий спектр исследований:
- Многоязычный ASR и фундаментальные модели речи: 1,1 миллиона часов реальной речи достаточно для того, чтобы любой желающий мог обучить модель уровня Whisper (680 тыс.+ часов) с нуля.
- Синтез речи и генерация голоса: При частоте 48 кГц YODAS v3 поддерживает обучение моделей TTS, которые могут генерировать насыщенное и четкое аудио.
- Генерация стерео- и пространственного аудио: Благодаря сотням тысяч часов по-настоящему многоканальной речи, генерация стерео- и пространственного аудио наконец может выйти за рамки небольших студийных наборов данных.
- Перевод речи: Переводы на английский язык с временными метками для более чем половины многоязычных данных делают YODAS v3 одним из крупнейших открытых ресурсов для перевода речи в текст.
- Выравнивание и задачи, чувствительные к таймингу: Временные метки на уровне слов позволяют создавать субтитры, выполнять принудительное выравнивание (forced alignment) и обучать модели, которым необходимо точно знать, когда было произнесено то или иное слово.
- Аудиокодеки и улучшение речи: Аудио высокого качества из реальных условий с метаданными точности идеально подходит для обучения кодеков и моделей улучшения звука, которые должны справляться с реальными условиями записи.
Полезные ссылки
- Набор данных YODAS v3








