Мультимодальные открытые модели принятия решений d1 для периферийных вычислений

Источник: Hugging Face•

Мультимодальные открытые модели принятия решений d1 для периферийных вычислений

Запись в блоге Liquid AI на Hugging Face

Сегодня мы выпускаем две открытые модели принятия решений в нашем d1 decision model family: d1-3B и d1-omni-600M (экспериментальная).

  • Лучшая модель принятия решений размером менее 10 млрд параметров в Decision Index 0.2.1: d1-3B набирает 48,57 балла, опережая все модели на 4 млрд и 9 млрд параметров, а также Decider 35B-A3B (47,11).
  • Мультимодальность: d1-3B поддерживает текст и изображения, в то время как d1-omni-600M поддерживает текст и изображения или текст и аудио.
  • Скорость: d1-3B отвечает на вопрос за 16 мс на NVIDIA Jetson AGX Thor, за 26 мс на Jetson AGX Orin и за 50 мс на Jetson Orin Nano.

Как мы создавали модели принятия решений для периферийных вычислений

Эти открытые модели принятия решений d1 построены на базе наших Liquid Foundation Models (LFM). В отличие от наших генеративных моделей, модели принятия решений не создают токены, а отвечают за один прямой проход.

d1-3B и d1-omni-600M обучены на двух принципиально разных архитектурах:

  • d1-3B обучена на базе LFM2.5-VL-3B, нашей новейшей VLM, которая является декодером. Она принимает текст и изображения в качестве входных данных.
  • d1-omni-600M обучена на базе LFM2.5-Encoder-350M, двунаправленного энкодера. Она добавляет визуальные и аудио-энкодеры для обработки всех трех модальностей. Она принимает в качестве входных данных либо текст и изображение, либо текст и аудио. Эта модель в настоящее время находится на ранней стадии исследования и продолжает дорабатываться.

Результаты тестирования

Мы протестировали d1-3B и d1-omni-600M на семи общедоступных наборах данных, охватывающих понимание прочитанного, обнаружение токсичности, классификацию намерений, медицинские вопросы и ответы, а также межъязыковое понимание. d1-3B достигает среднего балла 82,9, что является самым высоким показателем в таблице и выше, чем у Decider 4B. d1-omni-600M набирает 78,4 балла, превосходя Decider 2B (77,1) при использовании лишь четверти параметров.

Мы подтвердили, что d1-3B сохраняет возможности визуального восприятия своей архитектуры LFM2.5-VL-3B на стандартных визуальных тестах, а d1-omni-600M справляется со всеми тремя модальностями. Мы не приводим никаких визуальных или аудио-тестов, поскольку Decision Index v0.3 включает только закрытый визуальный набор данных, а аудио-тесты для принятия решений в настоящее время являются открытой проблемой.

Скорость

В сотрудничестве с NVIDIA мы оценили d1-3B на стеке NVIDIA для устройств NVIDIA GeForce RTX 4090, NVIDIA Jetson AGX Thor, Jetson AGX Orin 64 GB и Jetson Orin Nano. Поскольку d1-omni-600M является ранним исследовательским релизом, мы не приводим для него показатели скорости в этом выпуске.

Периферийный инференс. d1-3B отвечает на один вопрос менее чем за 50 мс на каждом протестированном устройстве. Три вопроса занимают всего в 1,3 раза больше времени, чем один: на AGX Thor время увеличивается с 16 мс до 20 мс.

GPU-инференс. На GPU d1-3B отвечает на вопрос менее чем за 10 мс и обрабатывает изображение 384px менее чем за 18 мс на обеих платформах.

Как использовать открытые модели принятия решений d1

Выбирайте модели принятия решений d1, когда вам нужны быстрые, структурированные решения, включая работу с мультимодальными входными данными. d1-3B обеспечивает наивысшее качество принятия решений для своего размера, в то время как d1-omni-600M подходит там, где важен малый размер модели.

Установите зависимости (требуется transformers>=5.14):

Эти модели поставляются с собственным кодом, поэтому загружайте их с параметром trust_remote_code=True:

Для краткости мы приводим только пример для d1-3B. Инструкции по запуску d1-omni-600M см. в карточке модели.

Начало работы с открытыми моделями принятия решений d1

Обе модели принятия решений имеют открытые веса и доступны на Hugging Face уже сегодня:

  • Скачать: d1-3B и d1-omni-600M на Hugging Face.
  • Попробовать: запустите демо-версии в нашем пространстве System One Arcade на Hugging Face.

Нам не терпится увидеть, что вы создадите.

Цитирование

Если вы используете эту работу, пожалуйста, сошлитесь на блог о релизе:

О чём эта статья

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от Hugging Face