Сегодня мы выпускаем d1-3B и d1-omni-600M — две модели с открытыми весами из нашего семейства моделей принятия решений d1.
Модель d1-3B набирает 48,57 балла в Decision Index v0.2.1 (публичная выборка), опережая все модели размером менее 10 млрд параметров и находясь на одном уровне с Decider 35B-A3B — моделью принятия решений, которая в 12 раз больше. Она работает на полном стеке NVIDIA, от DGX в дата-центрах до Jetson на периферии: d1-3B отвечает на вопрос за 8 мс на NVIDIA GeForce RTX 4090, за 16 мс на Jetson AGX Thor и за 26 мс на Jetson AGX Orin. Даже Jetson Orin Nano выполняет её за 50 мс, что достаточно быстро для принятия решений в реальном времени на самом компактном граничном оборудовании.
d1-omni-600M — наш первый экспериментальный чекпоинт, работающий как с текстом и изображениями, так и с текстом и аудио. Она набирает 15,95 балла по тому же индексу.
Модели d1-3B и d1-omni-600M доступны уже сегодня на Hugging Face. Ознакомьтесь с нашей документацией, чтобы узнать, как запустить их локально.
Архитектура и обучение
В отличие от наших генеративных Liquid Foundation Models (LFM), наши модели принятия решений d1 не генерируют токены. Вместо этого они выдают ответ за один прямой проход.
d1-3B и d1-omni-600M обучены на основе двух совершенно разных архитектур:
- d1-3B обучена на основе LFM2.5-VL-3B, нашей новейшей VLM, которая является декодером. Она принимает на вход текст и изображения.
- d1-omni-600M обучена на основе LFM2.5-Encoder-350M, двунаправленного энкодера. Она дополняет его энкодерами для зрения и аудио, чтобы обрабатывать все три модальности. Она принимает на вход либо текст и изображение, либо текст и аудио.
d1-3B. Мы усреднили веса LFM2.5-2.6B и текстового бэкенда LFM2.5-VL-3B, чтобы создать более качественную базовую модель. Затем мы дообучили чекпоинты с разными случайными начальными числами и наборами данных, прежде чем снова объединить их. Обучение на длинных входных данных, перемешивание вариантов ответов и исправление «коротких путей» в данных дали больший эффект, чем более продвинутые методы.
d1-omni-600M. Сначала мы дообучили LFM2.5-Encoder-350M на задачах принятия решений, а затем поэтапно добавили аудио и зрение. Для аудио мы обучили энкодер FastConformer с адаптером для подключения к бэкенду, а затем дообучили аудио-энкодер с замороженным текстовым бэкендом. Для зрения мы взяли энкодер из LFM2.5-VL-450M и обучили адаптер плюс LoRA-обновления для бэкенда. Эти обновления были активны только тогда, когда входные данные включали изображения, а энкодер зрения оставался замороженным. Затем мы дообучили полную модель, объединили LoRA-обновления и усреднили веса с предыдущим чекпоинтом для регуляризации финальной модели.
Бенчмарки
Текстовые бенчмарки. Мы оценили d1-3B и d1-omni-600M по семи публичным бенчмаркам, охватывающим понимание прочитанного, определение токсичности, классификацию намерений, медицинские вопросы и ответы, а также межъязыковое понимание.
Бенчмарк
d1-omni-600M
d1-3B
Decider 2B
Decider 4B
SQuAD 2.0
74.0
85.3
67.7
76.0
Civil Comments
95.8
93.0
93.6
92.8
MASSIVE intent
86.1
87.3
81.1
88.3
PubMedQA
61.3
66.0
65.7
63.3
BoolQ
77.7
86.7
87.3
89.0
XNLI
74.7
85.0
85.0
88.6
PAWS-X
79.5
76.9
59.5
69.8
Среднее
78.4
82.9
77.1
81.1
d1-3B лидирует со средним показателем 82,9, что является самым высоким результатом в таблице и опережает Decider 4B (81,1). d1-omni-600M достигает 78,4, превосходя Decider 2B (77,1) при четверти параметров. Она также показывает лучший результат в таблице по определению токсичности (Civil Comments: 95,8) и идентификации перефразирования (PAWS-X: 79,5).
Производительность зрения и аудио. Индекс решений v0.3 включает закрытую выборку по зрению, которую мы не публикуем в этом релизе. Вместо этого мы подтвердили, что d1-3B сохраняет возможности зрения своего бэкенда LFM2.5-VL-3B на стандартных бенчмарках, а d1-omni-600M обрабатывает все три модальности. Их возможности визуального восприятия показаны в наших демо-версиях ниже. Специализированные бенчмарки для принятия решений на основе аудио в настоящее время являются открытой проблемой. Мы с нетерпением ждем, когда сообщество разработает их по мере развития категории мультимодальных моделей принятия решений.
Быстрый инференс повсюду
d1-3B и d1-omni-600M работают на полном стеке NVIDIA — от DGX в дата-центре до рабочих станций RTX и Jetson на периферии — с поддержкой llama.cpp с первого дня.
Поскольку модели принятия решений не генерируют выходные токены, мы измеряем сквозную задержку от ввода до вывода. Мы приводим показатели инференса для d1-3B. d1-omni-600M — это ранний исследовательский релиз, находящийся в активной разработке.
Граничный инференс. Мы измеряем задержку на Apple M5 Pro и, в сотрудничестве с NVIDIA, на NVIDIA Jetson AGX Thor, Jetson AGX Orin 64 GB и Jetson Orin Nano. Мы измеряем один запрос за раз, включая один вопрос, три вопроса по одному состоянию, состояние в 3,4 тыс. токенов и изображение 384px.
Один вопрос
3 вопроса
Состояние 3,4 тыс. токенов
Изображение 384px
64 состояния, упаковано
Apple M5 Pro
30 мс
41 мс
640 мс
62 мс
78 / с
Jetson AGX Thor
16 мс
20 мс
220 мс
35 мс
262 / с
Jetson AGX Orin 64 GB
26 мс
35 мс
560 мс
83 мс
110 / с
Jetson Orin Nano
50 мс
73 мс
1640 мс
202 мс
38 / с
d1-3B отвечает на один вопрос менее чем за 50 мс на каждом протестированном устройстве. Три вопроса занимают всего в 1,3 раза больше времени, чем один, при этом AGX Thor показывает результат от 16 мс до 20 мс.
GPU-инференс. Мы измеряем задержку на NVIDIA RTX 4090 и AMD MI325X, по одному запросу за раз, включая один вопрос, три вопроса по одному состоянию, состояние в 3,4 тыс. токенов и изображение 384px.
Один вопрос
3 вопроса
Состояние 3,4 тыс. токенов
Изображение 384px
64 состояния, упаковано
NVIDIA RTX 4090
8 мс
21 мс
102 мс
17 мс
475 / с
AMD MI325X
9 мс
14 мс
44 мс
18 мс
1106 / с
На GPU модель d1-3B отвечает на вопрос менее чем за 10 мс и обрабатывает изображение 384px менее чем за 18 мс на обеих платформах.
Open d1 в действии
Эти результаты делают наши компактные модели принятия решений d1 отличным выбором везде, где нужны быстрые структурированные решения, включая мультимодальные входные данные. d1-3B обеспечивает наилучшее качество решений для своего размера, а d1-omni-600M подходит там, где важен малый объем ресурсов.
Чтобы показать, как выглядят решения в реальном времени на практике, мы создали десять демо-версий, которые запускают нашу открытую d1-3B в цикле с потоковым видео с камеры: от игр с жестовым управлением до модерации контента в реальном времени, где ответы считываются за один проход на кадр. Вы можете попробовать их в нашем пространстве Hugging Face без какой-либо настройки.
В сотрудничестве с NVIDIA мы также демонстрируем, как d1-3B управляет навигацией в среде Isaac Sim, при этом модель работает на Jetson в конфигурации hardware-in-the-loop.
Начало работы
Начните разработку сегодня с и , доступными на Hugging Face.
С помощью d1 мы реализуем наше видение ИИ, который работает везде. Эти модели:
- С открытыми весами — скачивайте, дообучайте и развертывайте без ограничений
- Быстрые с первого дня — нативная поддержка llama.cpp для Apple, AMD, Qualcomm и NVIDIA с NVFP4
- Семейство — два размера позволяют выбирать баланс между точностью и занимаемыми ресурсами в зависимости от требований вашего развертывания.
Нам не терпится увидеть, что вы создадите.
Цитирование
Для цитирования, пожалуйста, используйте следующую ссылку или BibTeX:
Liquid AI, "Open d1: Edge decision models for text, vision, and audio", Liquid AI Blog, октябрь 2026 г.







