jina-ai/audio-embedding-kickstarter
GitHubjina-ai
Недавно компания Google выпустила Gemini Embedding 2, свою первую нативно мультимодальную модель эмбеддингов. Текст, изображения, видео, аудио, документы — всё это отображается в единое 3072-мерное векторное пространство. Это часть более широкой тенденции к созданию универсальных (omni) моделей эмбеддингов: унифицированных моделей, которые обрабатывают все модальности в рамках одной архитектуры, от jina-embeddings-v4 до Omni-Embed-Nemotron и Omni-5.
Наше внимание привлекло аудио. Большинство людей при упоминании «мультимодальных эмбеддингов» думают об изображениях, возможно, о видео. Аудио — это забытая модальность: её сложнее собирать, сложнее размечать, и над ней работает меньше людей. В Jina AI мы как раз исследовали эту проблему, создавая небольшие (менее 1,2 млрд параметров) модели аудиоэмбеддингов в рамках нашей работы над универсальными эмбеддингами. Выпуск Gemini Embedding 2 — хороший повод поделиться тем, что мы узнали в процессе.
Аудиоэмбеддинги
Аудиоэмбеддинг — это векторное представление аудиоклипа фиксированной длины. Получая на вход необработанную форму волны, модель выдает плотный вектор (обычно от 768 до 3072 измерений), который отражает семантическое содержание звука. Два клипа с похожим смыслом создают похожие эмбеддинги, а аудиоклип располагается близко к своему текстовому описанию в общем пространстве эмбеддингов. Это один из элементов головоломки универсальных эмбеддингов: как только вы сможете встраивать аудио наряду с текстом и изображениями в одно векторное пространство, вы откроете возможности для кросс-модального поиска по всем модальностям.
Доминирующим подходом с 2022 года является Contrastive Language-Audio Pretraining (CLAP), расширяющий CLIP на аудио. LAION-CLAP масштабировал этот подход с помощью 630 тыс. пар и слияния признаков. Самый мощный вариант (Elizalde et al., 2023), обученный на 4,6 млн пар с использованием аудиоэнкодера для 22 различных аудиозадач в сочетании с авторегрессионным декодером, достиг показателя 42.0 cvR@5 на AudioCaps при 250 млн параметров.
Мы выбрали другой путь: превратить мультимодальные LLM, которые уже понимают аудио, в модели эмбеддингов.
Архитектура
Сначала о том, что подается на вход и что получается на выходе. Входные данные — это необработанное аудио: форма волны, декодированная из любого стандартного формата (WAV, MP3, FLAC) и передискретизированная до 16 кГц моно. Аудиоэнкодер преобразует эту форму волны в 128-полосную лог-мел спектрограмму, а затем обрабатывает её в последовательность токенов признаков со скоростью примерно 150 токенов в секунду. 10-секундный клип превращается примерно в 1500 токенов. Максимальная длина входных данных составляет 30 секунд; более длинное аудио необходимо разбивать на фрагменты. На выходе получается один плотный вектор (эмбеддинг), обычно от 896 до 3584 измерений в зависимости от размера базовой LLM.
Мы начинаем с Qwen2.5-Omni, мультимодальной LLM с нативным пониманием аудио. Она состоит из трех компонентов: аудиоэнкодера (~0,6-0,8 млрд параметров), который преобразует формы волн в векторы признаков через линейную проекцию (~4,5 млн параметров), базовой LLM (0,5-7 млрд параметров), которая обрабатывает как аудиопризнаки, так и текстовые токены, при этом каждый слой трансформера добавляет ~0,2 млрд параметров, и слоя пулинга, который усредняет последнее скрытое состояние в единый вектор эмбеддинга. Обе модальности используют одну и ту же базовую LLM, поэтому они уже примерно выровнены в процессе предварительного обучения.
Целевая функция обучения — контрастивная функция потерь InfoNCE. Каждая модальность кодируется независимо, потери вычисляются в обоих направлениях и усредняются:
Данные для обучения
Пять наборов данных пар аудио-текст, всего 181 тыс. примеров:
В CLAP использовался полный набор AudioSet (более 2 млн аудиозаписей) плюс другие источники, всего 4,6 млн пар. Мы используем только AudioSetStrong (~100 тыс.). Использование предварительно обученной MLLM значительно сокращает объем необходимых данных.
Четыре подхода
Цель: модель аудиоэмбеддингов менее 1,2 млрд параметров, превосходящая CLAP.
Полная дообучение модели. Qwen2.5-Omni-7B на парах аудио-текст: AudioCaps T2A cvR@5 = 63.2, Clotho T2A = 39.2. Это верхний предел, но модель 7B невозможно развернуть. Tevatron 2.0 аналогично дообучалась только на AudioCaps (61.2, но только 11.9 на Clotho, что показывает слабую обобщающую способность при обучении на одном наборе данных). ColQwen-Omni дообучалась на задачах с визуальными документами без аудиоданных, достигнув 37.4 за счет кросс-модального переноса.
Прунинг слоев. Удаление слоев трансформера из модели 7B. Каждый слой составляет ~0,2 млрд, поэтому 10-слойная модель имеет всего ~3,5 млрд параметров.
Размер батча (32, 64, 128) не оказал существенного влияния. Большие батчи помогают на начальном этапе, но могут ухудшить результат позже: батч 128 достиг 31.3 NDCG на 2 тыс. шагов на Clotho, но упал до 29.3 на 10 тыс. шагов.
Перенос только текстовой модальности. Дообучение только на текстовых парах (MultiNLI, SNLI, FEVER, SciFact), опираясь на предварительно обученное кросс-модальное выравнивание. Это сработало на полной модели 7B (AudioCaps 46.1, превзойдя 42.0 у CLAP), но полностью провалилось на прунированной 10-слойной модели (cvR@5 = 5.9). Кросс-модальные связи распределены по всей сети и не сохраняются при прунинге.
Комбинация модулей. Прорыв: берем аудиоэнкодер от одной модели и небольшую LLM от другой, даже из разных семейств моделей. Qwen2.5-Omni обучается в три этапа: (1) аудио/визуальные энкодеры с замороженной LLM, (2) все параметры разморожены, (3) контекст 32 тыс. Мы комбинируем модули с разных этапов:
Деталь реализации: Qwen3-Omni использует Qwen3OmniMoePreTrainedModel, в то время как автономная Qwen3 использует Qwen3ForCausalLM. Мы инициализируем оболочку модели Omni с соответствующими размерностями и копируем веса в соответствующие места.
Оценка
Оценка аудиоэмбеддингов по сути сводится к качеству поиска: может ли модель найти нужный аудиоклип по текстовому запросу? Основная сложность заключается в том, что «правильный» результат зависит от набора данных. AudioCaps содержит конкретные описания («мужчина говорит, затем закрывается дверь»), в то время как Clotho содержит абстрактные подписи («спокойная атмосфера с отдаленным грохотом»). Модель, которая запоминает поверхностные аудиопризнаки, будет хорошо работать на AudioCaps, но столкнется с трудностями на Clotho. Нас больше всего интересует обобщение по разным стилям описания.
CV-Recall@5 (cvR@5): для каждого текстового запроса проверяется, появляется ли какой-либо правильный аудиоклип в топ-5 результатов. Бинарная оценка усредняется по всем запросам. Стандартная метрика в аудиопоиске MTEB.
Три оценочных набора данных из MTEB: AudioCaps (получен из видео, человеческие подписи), AudioSetStrong (с временной разметкой, описания GPT), Clotho (разнообразные, абстрактные подписи). В CLAP использовался полный AudioSet (более 2 млн), в то время как мы использовали AudioSetStrong (~100 тыс.), что частично объясняет преимущество CLAP в этом бенчмарке.
Приложения
Аудиоэмбеддинги становятся актуальными не только для традиционного поиска. В агентных системах аудиоэмбеддинги позволяют осуществлять маршрутизацию намерений: агент, получающий голосовой ввод, может встроить аудио и направить его нужному инструменту или субагенту на основе семантического сходства, не дожидаясь полной транскрипции. Классификация звуковых событий обеспечивает мониторинг в реальном времени на промышленных объектах, в системах автоматизации «умного дома» и безопасности. В мультимодальных агентных рабочих процессах аудиоэмбеддинги позволяют агентам искать, сравнивать и рассуждать об аудиоконтенте так же, как они уже работают с текстом и изображениями. Музыкальные и медиа-приложения используют их для поиска сходства, обнаружения авторских прав и рекомендаций контента. Поскольку голосовые интерфейсы становятся основным способом взаимодействия для ИИ-агентов, компактные аудиоэмбеддинги, работающие на устройстве, становятся критически важными для приложений с низкой задержкой и сохранением конфиденциальности.
Заключение
Использование предварительно обученной MLLM — это самый эффективный рычаг воздействия. Она обеспечивает кросс-модальное выравнивание, мощный текстовый кодировщик и функциональный аудиокодировщик в одном пакете. Комбинирование модулей — наиболее перспективное направление: смешивание аудиокодировщиков и LLM из разных моделей и этапов обучения открывает практически неисследованное пространство для проектирования. Наши модели превосходят аналоги в AudioCaps, но лишь соответствуют CLAP в Clotho, абстрактные описания которой выявляют недостатки, упускаемые в AudioCaps. Кросс-модальный перенос не сохраняется при сжатии модели.
Эта работа — один из шагов к созданию универсальной модели эмбеддингов: единой модели, которая преобразует текст, изображения, аудио, видео и документы в общее пространство поиска. Подход с комбинированием модулей показывает, что можно эффективно внедрять новые модальности путем повторного использования предварительно обученных компонентов. Следующие шаги включают архитектуры MoE с менее чем 500 млн параметров активации, сочетание комбинирования модулей с переносом модальностей, а также масштабирование данных с помощью WavCaps, MusicCaps и наборов речевых данных.








