Представляем d1: самая функциональная модель принятия решений, теперь с поддержкой зрения

Источник: Liquid AI•

Представляем d1: самая функциональная модель принятия решений, теперь с поддержкой зрения

d1, модель принятия решений от Liquid AI, теперь работает с текстом и изображениями. Она не уступает или превосходит GPT-6.1 Sol в 4 из 6 реальных задач.

Сегодня мы представляем d1, нашу первую модель принятия решений, которая теперь поддерживает как текст, так и изображения. Благодаря экспериментальному выпуску на прошлой неделе, d1 стала первой моделью, способной конкурировать с Jev в принятии решений на основе текста, а теперь она первой распространяет эти возможности на изображения. Вы можете попробовать её сегодня на console.liquid.ai и в d1 Playground.

Мы протестировали d1 в сравнении с GPT-6.1 Sol и Claude Opus 5.5 на шести реальных задачах: от фильтрации заявок в службу поддержки до проверки печатных плат. d1 сравнивается или превосходит GPT-6.1 Sol в четырех из них. Она стоит в 19–200 раз дешевле обеих моделей и отвечает значительно быстрее в каждой задаче.

Как работает модель принятия решений d1

Модели принятия решений отвечают на вопросы о ситуации с указанием вероятности для каждого возможного ответа. Модель принятия решений d1 принимает на вход неструктурированные данные (например, текст, изображения или и то, и другое) и один или несколько вопросов, считывает их за один прямой проход и возвращает вероятности без генерации токенов. Принятие текстового решения занимает от 200 до 300 мс, что достаточно быстро для приложений реального времени.

d1 отвечает на три типа вопросов:

  • Noul: вопрос «да/нет», на который дается ответ с вероятностью от 0 до 1.
  • Choice: выбор одной метки из множества, ответ с вероятностью для каждой метки.
  • Score: позиция на шкале, взвешенная по вероятности каждого уровня.

Один запрос может содержать несколько вопросов об одном и том же состоянии, что экономит входные токены.

d1 в действии

Модели принятия решений могут заменить дорогостоящие вызовы языковых моделей, когда ответом является структурированное решение. Они также открывают множество новых сценариев использования, некоторые из которых показаны в этом разделе. Каждая демонстрация ниже работает в режиме реального времени в d1 Playground.

Визуальный контроль. Это промышленное приложение проверяет детали с четырех производственных линий, проходящие под камерой: печатные платы, свечи, кешью и жевательную резинку (публичный набор данных VisA). d1 сортирует хорошие и дефектные детали с точностью 85–97%. Самое интересное, что модель никогда не обучалась специально для этого. Благодаря своей превосходной способности к обобщению, она понимает задачу из краткого описания.

Текстовые приложения. Пять приложений используют d1 для каждого решения:

  • Умный фильтр: d1 становится функцией в SQL-запросе, WHERE d1(ticket, 'клиент хочет отменить заказ'). Она отвечает «да» или «нет» для каждой из 150 заявок в службу поддержки.
  • Поиск кода: d1 просматривает репозиторий Hugging Face transformers (6 511 файлов) по одной папке за раз, вплоть до функции, которая отвечает на вопрос.
  • Умные папки: d1 распределяет каждый новый документ по папкам, а затем по подпапкам. Она распределяет поисковые запросы таким же образом, поэтому поиск по ключевым словам выполняется только в одной подпапке.
  • Веб-агент: d1 управляет сайтом поиска авиабилетов на основе цели, сформулированной одним предложением. На каждом шаге она выбирает следующее действие из всего, что позволяет страница.
  • Сжатие контекста: d1 считывает каждый вывод инструмента в сессии агента кодирования и сохраняет, обрезает или отбрасывает его для следующей задачи. Она удаляет 52% токенов, сохраняя при этом все выходные данные, необходимые для задачи.

Мы адаптировали четыре из этих приложений из следующих проектов с открытым исходным кодом: pg-jev, jevgrep, jev-ultrafast и fast-jev-compaction.

Игры. d1 играет в восемь классических игр в реальном времени и выбирает каждый ход. Зрение помогает ей двумя способами:

  • Лучшие решения: Тетрис можно полностью описать текстом, но добавление экрана повышает результат d1 с 70 до 81 очищенной линии.
  • Более простая интеграция: В Wordle d1 считывает игровое поле прямо со скриншота. Разработчикам не нужно писать текстовую версию игры, и d1 все равно решила 12 из 12 игр в среднем за 3,8 попытки.

d1 также справляется с чисто визуальными задачами. В Quick, Draw! она угадывает, что изображено на рисунке игрока, среди 62 слов, и распознает 5,2 из 6 рисунков (случайное угадывание дает 0,6).

Доступность и цены

Начните разработку сегодня с моделью принятия решений d1, доступной через Liquid AI API как d1. Создайте API-ключ на console.liquid.ai (Панель управления > API-ключи).

Чтобы использовать зрение, вы можете просто отправлять изображения в виде base64 data URL в поле images:

Полная справочная информация по API находится в документации по моделям принятия решений.

d1 тарифицируется только по входным токенам, без выходных токенов. Изображения учитываются как входные токены по той же ставке, что и текст: 1,5 токена на патч 32×32 пикселя, поэтому изображение 1024×1024 стоит 1 536 токенов. Каждый вопрос тарифицируется как отдельный промпт, включая его текст и все изображения.

d1 также доступна через Vercel и OpenRouter, пока только для текста. Поддержка зрения скоро появится в обоих сервисах.

Это захватывающее время для творчества и исследований в области ИИ, и d1 — это только начало. Мы продолжаем работу над моделями принятия решений различных размеров, с новыми функциями, более высоким качеством решений и меньшей задержкой, и планируем вскоре выпустить открытые веса для будущих моделей на Hugging Face.

Цитирование

Для цитирования, пожалуйста, используйте следующую ссылку или BibTeX:

Liquid AI, "Introducing d1: The most capable decision model, now with vision", Liquid AI Blog, октябрь 2026 г.

Методология. Мы запускали каждое приложение по одному разу для каждой модели 5 октября 2026 года с помощью скрипта сравнения d1 Playground. GPT-6.1 Sol и Claude Opus 5.5 получают каждый запрос как одно сообщение в чате и отвечают в формате JSON с настройками рассуждения по умолчанию. Там, где несколько вопросов используют один вход, например, заявки для фильтра или фрагменты для папок, чат-модели отвечают на них пакетами. Стоимость указана по прейскурантным ценам, без учета скидок на кэширование промптов. Стоимость d1 составляет $0,04 за миллион входных токенов. Время указано за запуск, при этом в обработке находится до 8 запросов одновременно. Запуск «Умного фильтра» — это один запрос по 150 заявкам. Запуск «Умных папок» обрабатывает 105 фрагментов, а стоимость указана за 1000 фрагментов. Качество фильтра — это F1-мера по отношению к ручной разметке, которая учитывает как пропущенные, так и неверные совпадения. Другие текстовые приложения учитывают цели, вопросы, фрагменты или необходимые выходные данные, обработанные правильно. Мы написали шесть из 15 вопросов по коду и две из четырех сессий сжатия после того, как конвейер d1 был настроен. В визуальном контроле каждая модель видит качественную деталь с той же линии рядом с деталью для проверки.

О чём эта статья

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от Liquid AI