27 февраля 2025 г.
Брендан Ирибе, Анкит Кумар и команда Sesame
Откуда мы знаем, что кто-то нас действительно понимает? Редко дело только в словах — все дело в тонкостях голоса: нарастающем волнении, вдумчивой паузе, теплом утешении.
Голос — наш самый интимный способ общения, несущий слои смыслов через бесчисленные вариации тона, высоты, ритма и эмоций.
Современным цифровым голосовым помощникам не хватает важных качеств, чтобы стать по-настоящему полезными. Не раскрыв весь потенциал голоса, они не могут надеяться на эффективное сотрудничество с нами. Личный помощник, который говорит только нейтральным тоном, с трудом находит постоянное место в нашей повседневной жизни, как только проходит первоначальная новизна.
Со временем эта эмоциональная плоскость становится чем-то большим, чем просто разочарование — она начинает утомлять.
Достижение голосового присутствия
В Sesame наша цель — достичь «голосового присутствия», того магического качества, которое делает устное взаимодействие реальным, понятным и ценным. Мы создаем собеседников, которые не просто обрабатывают запросы, а ведут подлинный диалог, укрепляющий уверенность и доверие с течением времени. Поступая так, мы надеемся реализовать нераскрытый потенциал голоса как идеального интерфейса для инструкций и понимания.
Ключевые компоненты
- Эмоциональный интеллект: считывание и реагирование на эмоциональный контекст.
- Динамика разговора: естественные тайминги, паузы, перебивания и акценты.
- Контекстуальная осведомленность: настройка тона и стиля в соответствии с ситуацией.
- Последовательная личность: поддержание связного, надежного и уместного присутствия.
Мы еще не достигли цели
Создание цифрового компаньона с голосовым присутствием — задача не из легких, но мы делаем уверенные шаги по нескольким направлениям, включая личность, память, выразительность и уместность. Эта демонстрация — пример некоторых наших работ в области генерации разговорной речи. Представленные здесь компаньоны были оптимизированы для дружелюбия и выразительности, чтобы проиллюстрировать потенциал нашего подхода.
Техническая статья
Генерация разговорной речи
Авторы
Йохан Шалквик, Анкит Кумар, Дэн Лит, Сефик Эмре Эскимез, Зак Ходари, Синжон Ресник, Рамон Санабрия, Рэйвен Цзян
Чтобы создать ИИ-компаньонов, которые ощущаются по-настоящему интерактивными, генерация речи должна выйти за рамки создания высококачественного аудио — она должна понимать контекст и адаптироваться к нему в режиме реального времени. Традиционные модели преобразования текста в речь (TTS) генерируют устный вывод непосредственно из текста, но им не хватает контекстуальной осведомленности, необходимой для естественных разговоров. Несмотря на то, что современные модели создают очень похожую на человеческую речь, они сталкиваются с проблемой «один ко многим»: существует бесчисленное множество правильных способов произнести предложение, но лишь некоторые из них подходят для конкретной ситуации. Без дополнительного контекста — включая тон, ритм и историю разговора — моделям не хватает информации для выбора наилучшего варианта. Улавливание этих нюансов требует рассуждения по нескольким аспектам языка и просодии.
Чтобы решить эту проблему, мы представляем модель разговорной речи (Conversational Speech Model, CSM), которая формулирует задачу как сквозную мультимодальную задачу обучения с использованием трансформеров. Она использует историю разговора для создания более естественной и связной речи. Есть два ключевых вывода из нашей работы. Первый заключается в том, что CSM работает как
одноэтапная модель, тем самым повышая эффективность и выразительность. Второй — это наш набор инструментов оценки, который необходим для отслеживания прогресса в контекстуальных возможностях и решает проблему того, что распространенные публичные оценки уже перенасыщены.
История вопроса
Один из подходов к моделированию аудио с помощью трансформеров заключается в преобразовании непрерывных сигналов в последовательности дискретных аудиотокенов с использованием токенизаторов. Большинство современных подходов ([1], [2]) опираются на два типа аудиотокенов:
- Семантические токены: компактные, инвариантные к диктору представления семантических и фонетических признаков. Их сжатая природа позволяет им захватывать ключевые характеристики речи ценой высокоточной репрезентации.
- Акустические токены: кодировки мелкозернистых акустических деталей, которые позволяют восстанавливать аудио высокой точности. Эти токены часто генерируются с использованием остаточного векторного квантования (RVQ) [2]. В отличие от семантических токенов, акустические токены сохраняют естественные характеристики речи, такие как индивидуальность диктора и тембр.
Распространенная стратегия сначала моделирует семантические токены, а затем генерирует аудио с использованием RVQ или методов на основе диффузии. Разделение этих шагов позволяет использовать более структурированный подход к синтезу речи — семантические токены обеспечивают компактное, инвариантное к диктору представление, которое захватывает лингвистическую и просодическую информацию высокого уровня, в то время как второй этап восстанавливает мелкозернистые акустические детали, необходимые для высококачественной речи. Однако этот подход имеет критическое ограничение: семантические токены являются «узким местом», которое должно полностью охватывать просодию, но обеспечить это во время обучения сложно.
Методы на основе RVQ создают свой собственный набор проблем. Модели должны учитывать последовательную зависимость между кодовыми книгами в кадре. Один из методов, шаблон задержки (рисунок ниже) [3], постепенно сдвигает более высокие кодовые книги, чтобы обусловить прогнозы на более низких кодовых книгах в пределах одного кадра. Ключевым ограничением этого подхода является то, что время до первого аудио плохо масштабируется, поскольку токенизатор RVQ с N кодовыми книгами требует N шагов магистрали перед декодированием первого аудиофрагмента. Хотя это подходит для офлайн-приложений, таких как аудиокниги, такая задержка проблематична в сценарии реального времени.
Пример генерации с шаблоном задержки в токенизаторе RVQ с 4 кодовыми книгами
Модель разговорной речи (CSM)
CSM — это мультимодальная модель текста и речи, которая работает непосредственно с токенами RVQ. Вдохновленные RQ-Transformer [4], мы используем два авторегрессионных трансформера. В отличие от подхода в [5], мы разделяем трансформеры на нулевой кодовой книге. Первая мультимодальная магистраль обрабатывает чередующиеся текст и аудио для моделирования нулевой кодовой книги. Второй аудиодекодер использует отдельную линейную головку для каждой кодовой книги и моделирует оставшиеся N – 1 кодовых книг для восстановления речи из представлений магистрали. Декодер значительно меньше магистрали, что обеспечивает генерацию с низкой задержкой, сохраняя при этом сквозную структуру модели.
Процесс вывода модели CSM. Текстовые (T) и аудио (A) токены чередуются и последовательно подаются в магистраль (Backbone), которая предсказывает нулевой уровень кодовой книги. Затем декодер (Decoder) выбирает уровни с 1 по N – 1, обусловленные предсказанным нулевым уровнем. Восстановленный аудиотокен (A) затем авторегрессионно подается обратно в магистраль для следующего шага, продолжаясь до тех пор, пока не будет выдан символ EOT аудио. Этот процесс начинается снова при следующем запросе на вывод, при этом промежуточное аудио (например, высказывание пользователя) представляется чередующимися токенами аудио и текстовой транскрипции.
Оба трансформера являются вариантами архитектуры Llama. Текстовые токены генерируются с помощью токенизатора Llama [6], в то время как аудио обрабатывается с использованием Mimi, токенизатора с разделенным RVQ, создающего одну семантическую кодовую книгу и N – 1 акустических кодовых книг на кадр при частоте 12,5 Гц. [5] Обучающие выборки структурированы как чередующиеся перемежающиеся паттерны текста и аудио, при этом личность говорящего закодирована непосредственно в текстовом представлении.
Амортизация вычислений
Такая конструкция создает значительные инфраструктурные проблемы во время обучения. Аудиодекодер обрабатывает эффективный размер пакета B × S и N кодовых книг авторегрессионно, где B — исходный размер пакета, S — длина последовательности, а N — количество уровней кодовой книги RVQ. Эта высокая нагрузка на память даже при использовании небольшой модели замедляет обучение, ограничивает масштабируемость модели и препятствует быстрому экспериментированию, что критически важно для производительности.
Чтобы решить эти проблемы, мы используем схему амортизации вычислений, которая устраняет узкое место в памяти, сохраняя при этом точность полных кодовых книг RVQ. Аудиодекодер обучается только на случайном подмножестве аудиокадров (1/16), в то время как нулевая кодовая книга обучается на каждом кадре. Мы не наблюдаем заметной разницы в потерях аудиодекодера во время обучения при использовании этого подхода.
Процесс амортизированного обучения. Базовый трансформер моделирует нулевой уровень для всех кадров (выделено синим цветом), в то время как декодер предсказывает оставшиеся N – 31 уровней, но только для случайной 1/16 части кадров (выделено зеленым цветом). В верхней части выделены конкретные кадры, моделируемые декодером, для которых он получает потери.
Эксперименты
Набор данных: Мы используем большой набор общедоступных аудиозаписей, которые мы транскрибируем, размечаем по спикерам и сегментируем. После фильтрации набор данных состоит примерно из одного миллиона часов преимущественно англоязычного аудио.
Размеры моделей: Мы обучили модели трех размеров, различающиеся размерами базовой части и декодера:
- Tiny: 1 млрд параметров (базовая часть), 100 млн (декодер)
- Small: 3 млрд параметров (базовая часть), 250 млн (декодер)
- Medium: 8 млрд параметров (базовая часть), 300 млн (декодер)
Каждая модель обучалась с длиной последовательности 2048 (~2 минуты аудио) в течение пяти эпох.
Примеры
Паралингвистика
00:00
00:00
00:00
00:00
Предложения из Base TTS
Иностранные слова
00:00
00:00
00:00
00:00
Предложения из Base TTS
Контекстная выразительность
00:00
00:00
00:00
00:00
Примеры из Expresso, продолжение после звукового сигнала
Исправление произношения
00:00
00:00
00:00
00:00
Предложение с исправлением произношения является записью, все остальное аудио сгенерировано.
Разговоры с несколькими говорящими
00:00
00:00
Единая генерация с использованием аудиоподсказок от двух говорящих
Оценка
Наш комплекс оценки измеряет производительность модели по четырем ключевым аспектам: точность передачи текста, использование контекста, просодия и задержка. Мы приводим как объективные, так и субъективные метрики — объективные тесты включают коэффициент ошибок в словах (WER) и новые тесты, такие как разрешение омографов, в то время как субъективная оценка опирается на исследование с участием людей по методу сравнительной средней оценки мнений (CMOS) с использованием набора данных Expresso.
Объективные метрики
Традиционные тесты, такие как коэффициент ошибок в словах (WER) и сходство голоса (SIM), стали насыщенными — современные модели, включая CSM, теперь достигают почти человеческого уровня производительности по этим метрикам.
Результаты объективных метрик для тестов на коэффициент ошибок в словах (вверху) и сходство голоса (внизу), показывающие, что метрики насыщены (соответствуют человеческой производительности).
Чтобы лучше оценить произношение и понимание контекста, мы вводим новый набор тестов, основанных на фонетической транскрипции.
- Понимание текста через разрешение омографов: оценивает, правильно ли модель произносит разные слова с одинаковым написанием (например, “lead” /lɛd/ как “металл” против “lead” /liːd/ как “вести”).
- Понимание аудио через последовательность произношения: оценивает, сохраняет ли модель последовательность произношения конкретного слова с несколькими вариантами произношения в многоходовой речи. Одним из примеров является “route” (/raʊt/ или /ruːt/), которое может варьироваться в зависимости от региона говорящего и контекста.
Результаты объективных метрик для тестов на разрешение омографов (слева) и последовательность произношения (справа), показывающие процент точности правильного произношения для каждой модели. Генерации Play.ht, Elevenlabs и OpenAI были сделаны с настройками по умолчанию и голосами из документации их соответствующих API.
На графике выше сравниваются результаты объективных метрик для трех размеров моделей. Для точности омографов мы сгенерировали 200 речевых образцов, охватывающих 5 различных омографов — lead, bass, tear, wound, row — с 2 вариантами для каждого, и оценили последовательность произношения с помощью wav2vec2-lv-60-espeak-cv-ft. Для последовательности произношения мы сгенерировали 200 речевых образцов, охватывающих 10 различных слов, имеющих общие варианты произношения — aunt, data, envelope, mobile, route, vase, either, adult, often, caramel.
В целом мы наблюдаем, что производительность улучшается с увеличением размера моделей, что подтверждает нашу гипотезу о том, что масштабирование улучшает синтез более реалистичной речи.
Субъективные метрики
Мы провели два исследования по методу сравнительной средней оценки мнений (CMOS) с использованием набора данных Expresso для оценки естественности и просодической уместности сгенерированной речи для CSM-Medium. Участникам-людям были представлены пары аудиообразцов — один, сгенерированный моделью, и другой, являющийся эталонной записью человека. Слушатели оценивали сгенерированный образец по 7-балльной шкале предпочтений относительно эталона. Разнообразные выразительные образцы TTS из Expresso, включая эмоциональные и просодические вариации, делают его сильным эталоном для оценки соответствия контексту.
В первом исследовании CMOS мы представили сгенерированные и человеческие аудиообразцы без контекста и попросили слушателей “выбрать, какое исполнение больше похоже на человеческую речь”. Во втором исследовании CMOS мы также предоставили предыдущие 90 секунд аудио и текстового контекста и попросили слушателей “выбрать, какое исполнение кажется более подходящим продолжением разговора”. Восемьдесят человек получили оплату за участие в оценке и оценили в среднем по 15 примеров каждый.
Результаты субъективной оценки на наборе данных Expresso. Без контекста: слушатели выбирали, “какое исполнение больше похоже на человеческую речь”, не зная контекста. С контекстом: слушатели выбирали, “какое исполнение кажется более подходящим продолжением разговора” при наличии аудио- и текстового контекста. Соотношение побед и поражений 50:50 предполагает, что у слушателей нет явных предпочтений.
На графике выше показан процент побед эталонных человеческих записей по сравнению со сгенерированными CSM речевыми образцами для обоих исследований. Без разговорного контекста (вверху) участники-люди не проявляют явных предпочтений между сгенерированной и реальной речью, что говорит о том, что естественность достигла насыщения. Однако при включении контекста (внизу) оценщики последовательно отдают предпочтение оригинальным записям. Эти результаты показывают, что между сгенерированной и человеческой просодией в разговорной речи сохраняется заметный разрыв.
Открытый исходный код нашей работы
Мы считаем, что развитие разговорного ИИ должно быть совместным усилием. С этой целью мы стремимся к открытому исходному коду ключевых компонентов наших исследований, что позволит сообществу экспериментировать, развивать и улучшать наш подход. Наши модели будут доступны по лицензии Apache 2.0.
Ограничения и будущие задачи
В настоящее время CSM обучается преимущественно на англоязычных данных; некоторые многоязычные способности проявляются из-за загрязнения набора данных, но модель пока работает недостаточно хорошо. Она также не использует информацию, содержащуюся в весах предварительно обученных языковых моделей.
В ближайшие месяцы мы намерены увеличить размер модели, объем набора данных и расширить поддержку языков до более чем 20. Мы также планируем изучить способы использования предварительно обученных языковых моделей, работая над созданием больших мультимодальных моделей, обладающих глубокими знаниями как в области речи, так и в области текста.
В конечном счете, хотя CSM генерирует высококачественную разговорную просодию, она может моделировать только текстовое и речевое содержание разговора, а не структуру самого разговора. Человеческое общение — это сложный процесс, включающий очередность реплик, паузы, темп и многое другое. Мы верим, что будущее ИИ-диалогов заключается в полнодуплексных моделях, способных неявно изучать эту динамику на основе данных. Такие модели потребуют фундаментальных изменений во всем стеке технологий, от подготовки данных до методологий пост-обучения, и мы рады двигаться в этих направлениях.
Присоединяйтесь к нам
Если вы хотите создавать самые естественные, приятные и вдохновляющие голосовые интерфейсы, свяжитесь с нами — мы нанимаем сотрудников. Ознакомьтесь с нашими открытыми вакансиями.