Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Yodas v3 nabor dannyh obemom 1 million chasov dlya issledovaniy v oblasti otkryt
Dev48

© 2026 · All rights reserved.

YODAS v3: Набор данных объемом 1 миллион часов для исследований в области открытого голосового ИИ нового поколения

Источник: wavymulder

YODAS v3: Набор данных объемом 1 миллион часов для исследований в области открытого голосового ИИ нового поколения

Источник: wavymulder
29 сентября 2026 г.•Обновлено: 29 сентября 2026 г.

Стало совершенно очевидно, что в современную эпоху исследований ИИ именно обучающие данные определяют успех. Архитектуры приходят и уходят, но урок последних нескольких лет остается неизменным: модели становятся лучше, когда они получают больше данных, причем более разнообразных. Нигде это не проявляется так ярко, как в сфере голосовых технологий. Речь — один из самых богатых сигналов, производимых человеком. Она несет в себе не только слова, но и акцент, эмоции, стиль речи, фоновый шум и текстуру реального разговора. Системы, достигшие новых высот в голосовом ИИ, такие как Whisper от OpenAI и GPT-Live, были построены на основе больших и разнообразных проприетарных аудиоколлекций. Для сообщества открытых исследований доступ к данным сопоставимого масштаба был главным препятствием на пути к прогрессу.

Однако до недавнего времени этот барьер был еще выше. До того как мы впервые выпустили первую версию YODAS почти 3 года назад, существовало мало разнообразия в крупномасштабных наборах данных для голоса. Крупнейшие открытые ресурсы, доступные в то время, были впечатляющими сами по себе, но ограниченными в важных аспектах. LibriLight предлагал около 60 000 часов неразмеченной английской речи, а Multilingual LibriSpeech расширил этот подход до 8 языков, но оба они были основаны на чтении аудиокниг — чистом, тщательно артикулированном стиле речи, который мало похож на то, как люди говорят в реальности. VoxPopuli обеспечил многоязычный охват за счет записей Европейского парламента, но лишь малая часть была транскрибирована, а содержание ограничивалось официальными политическими речами на европейских языках. The People's Speech Corpus приблизился к более естественному аудио с объемом около 30 000 часов, но был доступен только на английском языке. Исследователи, которым нужна была модель, способная обрабатывать спонтанную, зашумленную, разговорную речь на сотнях языков, просто не имели открытого набора данных для обучения. YODAS был создан, чтобы заполнить этот пробел: ~370 000 часов реальной, коммерчески пригодной речи на более чем 100 языках.

С момента выпуска оригинальная версия YODAS была скачана более 2,5 миллионов раз, а общее число загрузок, включая официальные производные наборы данных, такие как YODAS 2 и YODAS Granary, превысило 5,8 миллионов. Он стал ключевой частью других известных наборов данных, таких как Emilia, MOSEL и LEMAS. YODAS также использовался для разработки фундаментальных моделей промышленного масштаба, таких как IBM Granite, Canary и Parakeet от NVIDIA, а также OLMoASR от AI2. Он также стал важным источником данных для региональных моделей и бенчмарков, например, в Юго-Восточной Азии (Sea-LLMs и SEA-SpeechBench), Таиланде (Typhoon 2) и Центральной Азии (GigaAM и GigaChat Audio).

Представляем YODAS v3

Сегодня мы рады объявить о выпуске YODAS v3, многоязычного набора данных объемом 1,1 миллиона часов речи, который является крупнейшим открытым релизом в семействе YODAS на сегодняшний день. YODAS v3 утроил масштаб оригинала, улучшив почти каждый аспект, важный для обучения современных голосовых моделей: охват, качество и удобство использования.

Что нового. В общих чертах, YODAS v3 предлагает:

  • Масштаб: 1,1 миллиона часов аудио (по сравнению с ~370 тыс. в YODAS v1), охватывающих более 100 языков (34 из которых имеют более 1000 часов данных).
  • Высокая точность: YODAS v3 полностью выпущен в формате 48 кГц, и более 92% данных имеют частотный контент, эквивалентный частоте дискретизации 32 кГц или выше. Это делает его подходящим для задач, чувствительных к качеству, таких как синтез речи, улучшение звука и кодеки, а не только для ASR.
  • Многоканальность: Более 70% данных содержат как минимум 2 различных канала, а не дублированное моно. Впервые генерация стерео- и пространственной речи может быть обучена в масштабе на открытых данных.
  • Улучшенные транскрипты: Транскрипты готовы к использованию «из коробки», с временными метками на уровне слов и высказываний. Для более чем половины многоязычных данных добавлены переводы на английский язык с временными метками.
  • Легкость: YODAS v3 занимает 60 ТБ в формате OPUS — такой же объем, как у YODAS v2, но с трехкратным увеличением количества данных и удвоенной частотой дискретизации и количеством аудиоканалов.

Как и его предшественники, YODAS v3 выпущен под лицензией CC BY 3.0. Скачайте или ознакомьтесь с ним напрямую на HuggingFace: https://huggingface.co/datasets/espnet/yodas3

Что включено

YODAS v3 организован по языкам, при этом каждый пример содержит аудио в формате 48 кГц, транскрипт с временными метками на уровне слов и высказываний, определенный язык и, где доступно, перевод на английский язык с временными метками.

Языковой охват. YODAS v3 охватывает более 100 языков, 34 из которых имеют более 1000 часов данных — это примерный порог, при котором язык может поддерживать сильную автономную модель ASR.

Количество каналов. Более 70% YODAS v3 содержит как минимум 2 различных канала. Мы учитывали запись как многоканальную только тогда, когда ее каналы были заметно разными, поэтому дублированное моно-аудио, сохраненное как стерео, помечено как моно.

Эффективная частота дискретизации. Поскольку большая часть веб-аудио получена путем апсемплинга из источников более низкого качества, мы оценили эффективную частоту дискретизации каждой записи на основе ее фактического частотного контента, а не доверяя заголовку файла. Более 92% данных достигают эффективной частоты 32 кГц или выше, а 67% — 44 кГц. Мы включили эту оценку в качестве метаданных, чтобы пользователи могли фильтровать данные по необходимой для их задачи точности.

Что это дает

YODAS v1 был в основном ресурсом для распознавания речи. Благодаря более высокой точности, нескольким каналам и более богатым аннотациям, YODAS v3 открывает гораздо более широкий спектр исследований:

  • Многоязычный ASR и фундаментальные модели речи: 1,1 миллиона часов реальной речи достаточно для того, чтобы любой желающий мог обучить модель уровня Whisper (680 тыс.+ часов) с нуля.
  • Синтез речи и генерация голоса: При частоте 48 кГц YODAS v3 поддерживает обучение моделей TTS, которые могут генерировать насыщенное и четкое аудио.
  • Генерация стерео- и пространственного аудио: Благодаря сотням тысяч часов по-настоящему многоканальной речи, генерация стерео- и пространственного аудио наконец может выйти за рамки небольших студийных наборов данных.
  • Перевод речи: Переводы на английский язык с временными метками для более чем половины многоязычных данных делают YODAS v3 одним из крупнейших открытых ресурсов для перевода речи в текст.
  • Выравнивание и задачи, чувствительные к таймингу: Временные метки на уровне слов позволяют создавать субтитры, выполнять принудительное выравнивание (forced alignment) и обучать модели, которым необходимо точно знать, когда было произнесено то или иное слово.
  • Аудиокодеки и улучшение речи: Аудио высокого качества из реальных условий с метаданными точности идеально подходит для обучения кодеков и моделей улучшения звука, которые должны справляться с реальными условиями записи.

Полезные ссылки

  • Набор данных YODAS v3
← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Прямая трансляция OpenAI DevDay: Альтман сталкивается с вопросами о безопасности на фоне презентации новых функций компанииПресса
OpenAI

Прямая трансляция OpenAI DevDay: Альтман сталкивается с вопросами о безопасности на фоне презентации новых функций компании

Генеральный директор Mistral заявил, что дискуссия о безопасности ИИ в США скрывает «халатность» конкурентовПресса
Mistral AI

Генеральный директор Mistral заявил, что дискуссия о безопасности ИИ в США скрывает «халатность» конкурентов

Бывшая команда Tesla привлекла $12,5 млн для автоматизации цепочек поставокПресса
Tesla

Бывшая команда Tesla привлекла $12,5 млн для автоматизации цепочек поставок

OpenAI, по сообщениям, отказывается от модели из-за проблем с безопасностьюПресса
OpenAI

OpenAI, по сообщениям, отказывается от модели из-за проблем с безопасностью

OpenAI отказывается от плана выпустить новую модель из-за растущих опасений по поводу безопасностиПресса
OpenAI

OpenAI отказывается от плана выпустить новую модель из-за растущих опасений по поводу безопасности

Источник: Инфраструктурный провайдер AI-инференции Modal Labs приближается к раунду финансирования на $750 млн по оценке $15,75 млрдПресса
Modal

Источник: Инфраструктурный провайдер AI-инференции Modal Labs приближается к раунду финансирования на $750 млн по оценке $15,75 млрд

Ещё от wavymulder

Что такое Jev AI? Практическое руководство по System One и исполняемым решениям
wavymulder

Что такое Jev AI? Практическое руководство по System One и исполняемым решениям

Внедрение гуманоидов в LeRobot
wavymulder

Внедрение гуманоидов в LeRobot

Как использовать модель Jev AI: пошаговое руководство для разработчиков
wavymulder

Как использовать модель Jev AI: пошаговое руководство для разработчиков

Знайте, кто и когда говорил: создавайте ИИ для работы с несколькими спикерами в реальном времени с помощью NVIDIA Nemotron 3 Diarization
wavymulder

Знайте, кто и когда говорил: создавайте ИИ для работы с несколькими спикерами в реальном времени с помощью NVIDIA Nemotron 3 Diarization