jina-ai/audio-embedding-kickstarter
GitHubjina-ai
Недавно Google выпустила Gemini Embedding 2, свою первую нативно мультимодальную модель эмбеддингов. Текст, изображения, видео, аудио, документы — всё отображается в единое 3072-мерное векторное пространство. Это часть более широкого тренда на создание универсальных моделей эмбеддингов (omni embedding models): унифицированных архитектур, способных работать со всеми модальностями, от jina-embeddings-v4 до Omni-Embed-Nemotron и Omni-5.
Наше внимание привлекло аудио. Большинство людей при упоминании «мультимодальных эмбеддингов» думают об изображениях или, возможно, видео. Аудио — это забытая модальность: её сложнее собирать, сложнее размечать, и ею занимается меньше людей. В Jina AI мы исследовали именно эту проблему, создавая небольшие (менее 1,2 млрд параметров) модели аудиоэмбеддингов в рамках нашей работы над универсальными эмбеддингами. Выпуск Gemini Embedding 2 — отличный повод поделиться тем, что мы узнали в процессе.
Аудиоэмбеддинги
Аудиоэмбеддинг — это векторное представление аудиоклипа фиксированной длины. Получая на вход необработанную форму волны, модель генерирует плотный вектор (обычно от 768 до 3072 измерений), который отражает семантическое содержание звука. Два клипа с похожим смыслом создают похожие эмбеддинги, а аудиоклип располагается близко к своему текстовому описанию в общем векторном пространстве. Это одна из частей пазла универсальных эмбеддингов: как только вы можете поместить аудио в одно векторное пространство с текстом и изображениями, вы открываете возможности для кросс-модального поиска по всем типам данных.
Доминирующим подходом с 2022 года является Contrastive Language-Audio Pretraining (CLAP), расширяющий CLIP на аудио. LAION-CLAP масштабировал этот подход, используя 630 тыс. пар и слияние признаков. Самый мощный вариант (Elizalde et al., 2023) был обучен на 4,6 млн пар с использованием аудиоэнкодера для 22 различных аудиозадач в сочетании с авторегрессионным декодером, достигнув показателя 42,0 cvR@5 на AudioCaps при 250 млн параметров.
Мы выбрали другой путь: превратить мультимодальные LLM, которые уже понимают аудио, в модели эмбеддингов.
Архитектура
Сначала разберемся, что подается на вход и что получается на выходе. Входные данные — это необработанное аудио: форма волны, декодированная из любого стандартного формата (WAV, MP3, FLAC) и передискретизированная до 16 кГц моно. Аудиоэнкодер преобразует эту форму волны в 128-полосную лог-мел спектрограмму, а затем обрабатывает её в последовательность токенов признаков со скоростью примерно 150 токенов в секунду. 10-секундный клип превращается примерно в 1500 токенов. Максимальная длина входного сигнала — 30 секунд; более длинные аудио необходимо разбивать на фрагменты. На выходе получается один плотный вектор (эмбеддинг), обычно от 896 до 3584 измерений в зависимости от размера базовой LLM.
Мы начинаем с Qwen2.5-Omni, мультимодальной LLM с нативным пониманием аудио. Она состоит из трех компонентов: аудиоэнкодера (~0,6–0,8 млрд параметров), который преобразует формы волн в векторы признаков через линейную проекцию (~4,5 млн параметров), базовой LLM (0,5–7 млрд параметров), обрабатывающей как аудиопризнаки, так и текстовые токены (каждый слой трансформера добавляет ~0,2 млрд параметров), и слоя пулинга, который усредняет последнее скрытое состояние в единый вектор эмбеддинга. Обе модальности используют одну и ту же базовую LLM, поэтому они уже примерно выровнены в процессе предварительного обучения.
Целевая функция обучения — контрастивная функция потерь InfoNCE. Каждая модальность кодируется независимо, потери вычисляются в обоих направлениях и усредняются:
Данные для обучения
Пять наборов данных аудио-текстовых пар, всего 181 тыс. образцов:
CLAP использовал полный набор AudioSet (более 2 млн аудио) плюс другие источники, всего 4,6 млн пар. Мы используем только AudioSetStrong (~100 тыс.). Использование предварительно обученной MLLM радикально сокращает объем необходимых данных.
Четыре подхода
Цель: модель аудиоэмбеддингов менее 1,2 млрд параметров, превосходящая CLAP.
Полная дообучение модели. Qwen2.5-Omni-7B на аудио-текстовых парах: AudioCaps T2A cvR@5 = 63,2, Clotho T2A = 39,2. Это верхний предел, но модель 7B не подходит для развертывания. Tevatron 2.0, аналогично дообученная только на AudioCaps, показала 61,2, но только 11,9 на Clotho, что свидетельствует о плохой обобщающей способности при обучении на одном наборе данных. ColQwen-Omni, дообученная на визуально-документальных задачах без аудиоданных, достигла 37,4 за счет кросс-модального переноса.
Прунинг слоев. Удаление слоев трансформера из модели 7B. Каждый слой составляет ~0,2 млрд, поэтому 10-слойная модель имеет всего ~3,5 млрд параметров.
Размер батча (32, 64, 128) не оказал существенного влияния. Большие батчи помогают на начальном этапе, но могут ухудшить результат позже: батч 128 достиг 31,3 NDCG на 2 тыс. шагов на Clotho, но упал до 29,3 на 10 тыс. шагов.
Перенос только текстовой модальности. Дообучение только на текстовых парах (MultiNLI, SNLI, FEVER, SciFact), полагаясь на предварительно обученное кросс-модальное выравнивание. Это сработало на полной модели 7B (AudioCaps 46,1, превзойдя 42,0 у CLAP), но полностью провалилось на прунинговой 10-слойной модели (cvR@5 = 5,9). Кросс-модальные связи распределены по всей сети и не сохраняются при прунинге.
Комбинация модулей. Прорыв: берем аудиоэнкодер от одной модели и небольшую LLM от другой, даже из разных семейств моделей. Qwen2.5-Omni обучается в три этапа: (1) аудио/визуальные энкодеры с замороженной LLM, (2) все параметры разморожены, (3) контекст 32 тыс. Мы комбинируем модули с разных этапов:
Деталь реализации: Qwen3-Omni использует Qwen3OmniMoePreTrainedModel, в то время как автономная Qwen3 использует Qwen3ForCausalLM. Мы инициализируем оболочку модели Omni с соответствующими размерностями и копируем веса в соответствующие места.
Оценка
Оценка аудиоэмбеддингов по сути сводится к качеству поиска: может ли модель найти правильный аудиоклип по текстовому запросу? Ключевая проблема в том, что «правильность» зависит от набора данных. В AudioCaps есть конкретные описания («мужчина говорит, затем закрывается дверь»), в то время как в Clotho — абстрактные подписи («тихая атмосфера с отдаленным грохотом»). Модель, которая просто запоминает поверхностные аудиопризнаки, будет хорошо работать на AudioCaps, но столкнется с трудностями на Clotho. Нас больше всего интересует обобщение по разным стилям описания.
CV-Recall@5 (cvR@5): для каждого текстового запроса проверяется, появляется ли какой-либо правильный аудиоклип в топ-5 результатов. Бинарная оценка, усредненная по всем запросам. Стандартная метрика в MTEB для аудиопоиска.
Три оценочных набора данных из MTEB: AudioCaps (получен из видео, человеческие описания), AudioSetStrong (с временной разметкой, описания GPT), Clotho (разнообразные, абстрактные описания). CLAP использовал полный AudioSet (2 млн+), в то время как мы использовали AudioSetStrong (~100 тыс.), что частично объясняет преимущество CLAP в этом бенчмарке.
Приложения
Аудиоэмбеддинги становятся актуальными не только для традиционного поиска. В агентных системах аудиоэмбеддинги позволяют осуществлять маршрутизацию намерений: агент, получающий голосовой ввод, может эмбеддировать аудио и направлять его нужному инструменту или субагенту на основе семантического сходства, не дожидаясь полной транскрипции. Классификация звуковых событий обеспечивает мониторинг в реальном времени в промышленных условиях, автоматизацию умного дома и системы безопасности. В мультимодальных агентных рабочих процессах аудиоэмбеддинги позволяют агентам искать, сравнивать и рассуждать об аудиоконтенте так же, как они уже работают с текстом и изображениями. Музыкальные и медиа-приложения используют их для поиска сходства, обнаружения авторских прав и рекомендаций контента. Поскольку голосовые интерфейсы становятся основным способом взаимодействия с ИИ-агентами, компактные аудиоэмбеддинги, работающие на устройстве, становятся критически важными для приложений с низкой задержкой и сохранением конфиденциальности.
Заключение
Использование предварительно обученной MLLM — это самый эффективный рычаг. Она предоставляет кросс-модальное выравнивание, мощный текстовый энкодер и функциональный аудиоэнкодер в одном пакете. Комбинирование модулей является наиболее перспективным направлением: смешивание аудиоэнкодеров и LLM из разных моделей и этапов обучения открывает почти неисследованное пространство для проектирования. Наши модели доминируют в AudioCaps, но лишь соответствуют CLAP в Clotho, чьи абстрактные описания выявляют слабые места, которые упускает AudioCaps. Кросс-модальный перенос не сохраняется при сжатии модели.
Эта работа — один из шагов к созданию универсальной модели эмбеддингов: единой модели, которая встраивает текст, изображения, аудио, видео и документы в общее пространство поиска. Подход с комбинированием модулей показывает, что можно эффективно внедрять новые модальности путем повторного использования предварительно обученных компонентов. Следующие шаги включают архитектуры MoE с менее чем 500 млн параметров активации, объединение комбинирования модулей с переносом модальностей и масштабирование данных с помощью WavCaps, MusicCaps и наборов данных речи.
