Сегодня мы выпускаем Embed 5 — новое семейство моделей эмбеддингов, находящихся на переднем крае высококачественного корпоративного поиска.
Embed 5 обеспечивает более эффективный поиск по сложным корпоративным данным, предоставляя командам больше контроля над задержкой, стоимостью и развертыванием. Embed 5 Pro оптимизирована для достижения максимального качества при поиске по мультимодальным, многоязычным, финансовым данным, коду и разобранным документам. Embed 5 Fast обеспечивает высокую конкурентоспособность в задачах, чувствительных к задержке и стоимости. Оба уровня используют единое пространство эмбеддингов, поэтому команды могут индексировать данные с помощью Pro и выполнять запросы с любой из моделей без перестроения индекса.
Embed 5 закладывает основу поиска для RAG и агентных рабочих процессов, предоставляя более релевантный контекст и отсеивая шум до того, как он попадет в дорогостоящие генеративные модели. Используйте Embed для повышения качества ответов и удобства пользователей, помогая при этом контролировать расходы на последующий инференс.
Embed 5 уже доступна в API Cohere и Model Vault, Microsoft Foundry и Amazon SageMaker. Стоимость составляет $0,12 за миллион токенов для Pro и $0,08 за миллион токенов для Fast.
Снимок
Производительность
Embed 5 Pro демонстрирует нашу самую высокую производительность поиска на сегодняшний день. Она достигает наивысшего среднего балла среди всех протестированных нами моделей в ViDoRe V3, финансовых документах, разобранных PDF-файлах, поиске по изображениям и ключевым деловым языкам.
Embed 5 также является первым семейством моделей, оцененным с помощью RCP-nDCG@10 — нашей новейшей методологии поиска. Вместо оценки только по ограниченному набору фиксированных меток, она оценивает найденные документы по критериям релевантности для конкретного запроса, фиксируя релевантные результаты и предоставляя более полное представление о производительности на вашем собственном корпусе данных. Подробнее о RCP-nDCG@10.
Корпоративные документы
Embed 5 превосходно работает с визуально насыщенными документами, где смысл содержится в таблицах, графиках, диаграммах и макете, а не только в тексте. В ViDoRe V3, где представлены документы из ключевых корпоративных областей, включая финансовую отчетность, технические руководства, нормативные материалы, правительственные отчеты, учебники и лекции, Embed 5 Pro набирает в среднем 85,8 балла — впечатляющий прирост на 8,8 по сравнению с Embed 4.
Это ставит ее выше Voyage 4 Large (83,7), Gemini Embedding 2 (83,2) и OpenAI text-embedding-3-large (75,5). Pro лидирует в пяти из восьми областей и делит первое место с Voyage 4 Large в энергетике, при этом наибольший прирост по сравнению с Embed 4 наблюдается в HR (+11,4) и промышленности (+10,3). Embed 5 Fast набирает в среднем 84,5 балла, опережая как Gemini Embedding 2, так и Voyage 4 Large. Полные результаты см. here.
Качество поиска (RCP-nDCG@10) по восьми областям визуально насыщенных документов. Оценки состояли из результатов разбора текста, отобранных авторами ViDoRe.
Финансы
Embed 5 Pro зарекомендовала себя как ведущая модель эмбеддингов для поиска по финансовым документам.
Pro занимает первое место в трех ведущих публичных финансовых бенчмарках, а Fast — второе в каждом из них, несмотря на значительно меньший размер по сравнению с аналогами: FinanceBench (80,1 Pro, 80,0 Fast), FinQA (90,0, 88,8) и ViDoRe V3 Finance (85,0, 83,9).
В среднем Pro набирает на 3,3 балла больше, чем ближайший конкурент не от Cohere — Gemini Embedding 2. По сравнению с OpenAI text-embedding-3-large, преимущество на FinanceBench возрастает до 21,4 балла.
Качество поиска (RCP-nDCG@10) по восьми областям визуально насыщенных документов. Оценки состояли из результатов разбора текста, отобранных авторами ViDoRe.
Мультимодальность
Разобранные PDF-файлы
Большинство корпоративных поисковых конвейеров по-прежнему преобразуют PDF в текст перед созданием эмбеддингов, но этот процесс может нарушить структуру. Таблицы теряют связи между строками и столбцами, многоколоночные макеты могут исказить порядок чтения, повторяющиеся заголовки добавляют шум, а графики часто исчезают вовсе. Это делает поиск по разобранным документам более сложным испытанием, чем предполагают бенчмарки на чистом тексте.
Наш набор для разобранных документов охватывает сервисную документацию, корпоративные отчеты, отчеты SEC, руководства по продуктам и политики конфиденциальности. Embed 5 Pro достигает наивысшего среднего показателя по набору — 84,8, опережая Voyage 4 Large (83,6), Embed 5 Fast (83,4), Gemini Embedding 2 (80,8) и Embed 4 (78,6). На рисунке ниже выделена часть известных публичных бенчмарков, где Embed 5 Pro особенно сильна в финансовых документах, представленных FinanceBench и CoFiF.
Поиск по разобранным документам (RCP-nDCG@10) по репрезентативным публичным бенчмаркам. Документы были разобраны с помощью Gemini 1.5 Flash. «Среднее по полному набору» включает дополнительные наборы данных, не показанные здесь.
Изображения страниц и документы с объединенным текстом и изображениями
Некоторые документы лучше представлены визуально. Отсканированные страницы, слайды презентаций, схемы и диаграммы содержат информацию, которую извлечение текста может упустить. Embed 5 может создавать эмбеддинги изображений страниц напрямую (page-image) или объединять изображение с его метаданными в единый вектор (fused text-image).
На корпусах с объединенным текстом и изображениями Embed 5 Pro набирает в среднем 82,3 балла по пяти наборам данных, опережая Embed 5 Fast (81,2) и Gemini Embedding 2 (61,3). Pro превосходит Gemini Embedding 2 на каждом наборе данных в этом пакете. Поиск по изображениям страниц также надежен: Embed 5 Pro продолжает лидировать в финансовых наборах данных, набирая в среднем 77,0 по пяти наборам, опережая Embed 5 Fast (73,2), Embed 4 (71,1), Voyage Multimodal 3.5 (70,1) и Gemini Embedding 2 (56,7).
Поиск по мультимодальным документам (nDCG@10) с текстовыми запросами. Поиск по объединенным тексту и изображениям сочетает изображение страницы и метаданные документа в одном эмбеддинге. RepairBench сообщает среднее значение по нескольким многоязычным подмножествам запросов. High Finance — это внутренний набор вопросов, аннотированный Cohere, который требует от моделей поиска соответствующих материалов по инвестиционному банкингу и хедж-фондам.
Поиск по мультимодальным документам (nDCG@10) с текстовыми запросами. Поиск только по изображениям использует только изображение страницы для ответа на запрос. AR = арабский; JA = японский; KO = корейский.
Многоязычность
Embed 5 обучена на более чем 100 языках, с особым вниманием к языкам, наиболее часто используемым нашей глобальной клиентской базой.
Для немецкого, французского, испанского, итальянского и русского языков Embed 5 Pro достигает наивысшего среднего показателя среди протестированных нами моделей: 77 баллов по сравнению с 76 у Voyage 4 Large и 73 у Gemini Embedding 2. Она улучшает показатели Embed 4 в среднем примерно на 7 баллов, при этом наибольший прирост наблюдается для русского (+9) и итальянского (+7) языков.
Качество поиска по ключевым европейским языкам. Баллы представляют собой среднее значение по ряду составных бенчмарков. Бенчмарки измерялись в nDCG@10 или RCP-nDCG@10.
В таблице ниже представлены еще десять языков, на которых Embed 5 добилась значительных успехов по сравнению с Embed 4. Наибольший прирост Pro наблюдается в языках Ближнего Востока и Индийского субконтинента, в частности фарси (+13), телугу (+12) и хинди (+12). Полный список результатов многоязычной оценки см. здесь.
Знакомство с Embed 5 Fast
Embed 5 Fast — это более легкая модель, созданная для поиска с низкой задержкой и большими объемами данных. Она стоит на треть дешевле, чем Pro, сохраняя при этом тот же контекст в 128 тыс. токенов, поддержку мультимодальных входных данных, многоязычный охват и несколько форматов сжатого вывода.
Это наиболее важно на пути запроса, где задержка эмбеддинга оплачивается при каждом поиске — и умножается в агентских рабочих процессах, которые могут выполнять десятки поисковых запросов за одну задачу. Меньший размер Fast также снижает затраты на обслуживание при частных развертываниях и ускоряет выполнение крупных задач по загрузке и переиндексации данных.
Что касается пропускной способности документов — более точного показателя эффективности индексации — Fast неизменно эффективнее, обеспечивая в среднем в 2,4 раза более высокую пропускную способность, чем Pro, при различных размерах контекста.
Средняя пропускная способность документов для Fast и Pro при длине контекста около 200 и 1000 токенов, измеренная в количестве документов, обрабатываемых в секунду. Чем выше показатель, тем лучше.
Производительность
Fast устанавливает новую планку для компактных моделей эмбеддингов. В тесте ViDoRe V3 она опережает Voyage 4 Nano почти на семь пунктов, а Jina Embeddings v5 Text Small, Perplexity и Microsoft Harrier 0.6B — на десять и более. Она превосходит Qwen3-VL-Embedding-2B примерно на 20 пунктов, несмотря на то, что по размеру она примерно вдвое меньше. Как видно выше, ее средний показатель также превосходит Gemini Embedding 2 и Voyage 4 Large в тесте ViDoRe V3 и при поиске в финансовых документах. При работе с разобранными PDF-файлами она превосходит Gemini Embedding 2 (83,4 против 80,8) и немного уступает Voyage 4 Large (83,6).
Качество поиска (RCP-nDCG@10) по восьми доменам визуально насыщенных документов. Оценки основывались на результатах разбора текста, подготовленных авторами ViDoRe.
Две модели, одно пространство эмбеддингов
Pro и Fast используют единое пространство эмбеддингов, поэтому векторы любой из моделей можно сравнивать напрямую. Мы протестировали каждую пару корпус/запрос на 40 наборах данных для разработки, охватывающих поиск по тексту, изображениям, смешанным данным и разобранным документам.
Это общее пространство позволяет командам выбирать каждый уровень независимо: документы могут индексироваться с помощью Pro для максимального качества, в то время как запросы используют Fast для снижения задержки и затрат — без необходимости перестраивать индекс. Комбинации разных моделей остаются близкими к базовым показателям при использовании одной модели (в среднем потери составляют всего 1,6% и 2,7% для запросов Fast и Pro соответственно), при этом ни в одном наборе данных не наблюдалось серьезных сбоев.
Для многих клиентов мы рекомендуем следующую схему развертывания: индексация с помощью Pro, запрос с помощью Fast. Это позволяет получить большую часть прироста качества системы, полностью состоящей из Pro, сохраняя при этом низкую задержку и стоимость Fast во время выполнения запроса.
Поиск с использованием разных моделей. Среднее значение nDCG@10 по 40 наборам данных для разработки, нормализованное относительно корпуса Pro + запроса Pro = 100.
Хранение векторов
В масштабах предприятия эксплуатация векторного индекса может стоить дороже, чем работа модели, которая его создает. Embed 5 поддерживает обучение представлений Matryoshka и вывод с пониженной точностью, что позволяет командам уменьшать размер векторов и точно контролировать баланс между качеством, хранением и стоимостью поиска. Эта экономия может быть существенной: 2048-мерный вектор float32 требует 8 КБ; 1024-мерный вектор int8 использует 1 КБ; а 256-мерный бинарный вектор — всего 32 байта, что означает сокращение в 256 раз. Для 100 миллионов фрагментов это сокращает объем хранения необработанных векторов примерно с 819 ГБ до 3,2 ГБ.
Важно отметить, что int8 сохраняет почти полное качество поиска при использовании как Embed 5 Pro, так и Fast. Для большинства развертываний мы рекомендуем 1024-мерные векторы int8 как идеальную точку баланса между производительностью и эффективностью. Бинарные векторы обеспечивают наименьший объем при некотором снижении точности и хорошо подходят для быстрого предварительного поиска перед переранжированием с более высокой точностью.
Качество поиска (RCP-nDCG@10) в зависимости от стоимости хранения при различных размерностях и точности векторов. Стоимость хранения указана относительно 2048-мерного вектора FP32. Чем левее, тем эффективнее.
Начало работы
Разверните Embed 5 и Embed 5 Fast через Cohere API, Model Vault, Microsoft Foundry (, Fast) и Amazon SageMaker (Pro, Fast) или используйте Embed 5 напрямую в North. Для частных развертываний в вашем собственном VPC или локально обе модели могут обслуживаться с помощью vLLM. Пакетное создание эмбеддингов доступно для крупномасштабной загрузки данных.
Создавайте решения с помощью инструментов, которые вы уже используете. Embed 5 вписывается в существующие стеки поиска, имея интеграции с различными фреймворками и векторными базами данных, включая LangChain, Haystack, Weaviate, Qdrant, Pinecone, Elasticsearch, MongoDB, Redis, Milvus и OpenSearch. Ознакомьтесь с документацией.
Начните с создания ключа API, затем используйте приведенные ниже фрагменты кода, чтобы быстро выполнить свой первый запрос.
Что еще
Познакомьтесь с командой, создавшей Embed 5. Присоединяйтесь к нам в X 8 октября, чтобы услышать от наших руководителей по поиску и эмбеддингам о Embed 5, Parse 5 и о том, что еще мы готовили за кулисами.
Кроме того, Compass Cloud, наша управляемая платформа для поиска и извлечения данных, теперь находится в закрытом бета-тестировании. Запросите доступ, чтобы попробовать ее на своих задачах по поиску и агентских рабочих нагрузках.
Ключевые участники
Samarth Bhargav, Fabian Schmidt, Clifton Poth, Arthur Maciejewicz, Florian Schneider, David Rau, Dennis Zhao, Timothy Ang, Nils Reimers, Carlos Lassance.
Примечания
RCP-nDCG@10 требует оценки моделей эмбеддингов в двухэтапной схеме поиска, используя их оценки сходства для переупорядочивания фиксированного набора кандидатов. Таким образом, оценки отражают качество переранжирования, а не производительность первого этапа поиска, который мы тщательно оцениваем в других местах с помощью nDCG и Recall.
Аннотации и код, необходимые для оценки Vidore V3 с помощью RCP-nDCG, доступны here.
Обе стороны должны использовать одинаковую размерность вывода. Совместимость также сохраняется при использовании усечения Matryoshka и квантования int8, поэтому та же схема работает со сжатыми индексами.











