Сегодня мы выпускаем экспериментальную модель-черновик DSpark для нашей модели «зрение-язык» (VLM) LFM2.5-VL-3B. Как и в случае с недавно выпущенными моделями-черновиками LFM2.5-DSpark для текстовых Liquid Foundation Models (LFM), она жертвует минимальным увеличением объема памяти ради существенно более быстрого декодирования без изменения качества вывода. Мы достигаем увеличения пропускной способности декодирования до 2.66× на графических процессорах и 3.13× на периферийных устройствах, при этом прирост сквозной пропускной способности составляет до 2.27× и 2.62× соответственно.
В этой публикации рассказывается о том, как мы обучали черновик для работы с визуальными данными, какой прирост скорости он обеспечивает, а также о лимитах спекулятивного декодирования для визуальных нагрузок на периферийном оборудовании.
Визуальная модель DSpark доступна на Hugging Face с поддержкой в llama.cpp, SGLang и MLX-VLM.
Как работает спекулятивное декодирование для моделей «зрение-язык»
Визуальный черновик построен на тех же принципах, что и ранее выпущенные модели-черновики LFM2.5-DSpark [1]. Мы используем скрытые состояния модели на разных слоях, чтобы предсказывать следующие k токенов с помощью легковесной модели-черновика.
С точки зрения черновика входная модальность не имеет значения, поскольку к моменту попадания токенов на скрытые слои текст и фрагменты изображений представлены в виде многомерных тензоров. Кодируют ли эти состояния абзац текста или изображение, для вычислений черновика не имеет никакого значения. Это позволяет нам применять точно такой же алгоритм выводов для наших моделей «зрение-язык», как и для текстовых моделей.
Обучение
Мы провели серию абляционных исследований для выбора смеси обучающих данных для наших моделей-черновиков. Финальная смесь объединяет данные контролируемой тонкой настройки (SFT), включая распространенные задачи «зрение-язык», с упором на нагрузки, которые модель должна обслуживать.
Для архитектуры черновика мы использовали подход из нашего текстового релиза DSpark: упрощенные модели-черновики, состоящие только из механизма внимания, где количество слоев и размер блока выбирались путем абляционных тестов на подмножестве обучающих данных. Мы проводим обучение на корпусе в течение 10 эпох и фиксируем коэффициент принятия для целевых визуальных бенчмарков. Основываясь на экспериментах на целевом оборудовании, мы остановились на черновике с 4 слоями и размером блока 9. На этапе вывода мы рекомендуем использовать размер блока 8 или 9 в зависимости от оборудования (см. раздел «Вывод»).
Полученный черновик имеет примерно 280 млн параметров (Таблица 1) и увеличивает количество параметров развернутой модели всего на 8.9%. Все абляционные исследования и запуски обучения выполнялись исключительно на оборудовании AMD с использованием фреймворка обучения Liquid AI.
Компонент
LFM2.5-VL-3B
Стек декодера (4 слоя)
193.0 млн
Проекция скрытых состояний
21.0 млн
Голова Маркова
65.5 млн
Нормализация + голова уверенности
6.4 тыс.
Всего
279.5 млн
Вывод
Модель-черновик DSpark для LFM2.5-VL-3B поставляется с поддержкой «из коробки» в экосистеме вывода:
- — Чекпоинты GGUF для эффективного вывода на периферии
- — Оптимизированный вывод для Apple Silicon
- — высокопроизводительный фреймворк для обслуживания GPU
Во всех представленных числовых показателях вывода используется 16-битная обработка как для энкодера, так и для языковой основы. Ускорение квантованных моделей выходит за рамки данного релиза. Все запуски были собраны на Pipette — той же инфраструктуре бенчмаркинга, которая используется для публичных данных о производительности устройств Liquid AI.
Обе конфигурации оцениваются на шести различных визуальных задачах в соответствии с бенчмарком MMSpec (General VQA, Text VQA, Image Captioning, Chart VQA, Complex Reasoning, Multi-turn Conversation) [2].
Вывод на устройстве. Мы измеряем пропускную способность на устройстве с помощью MLX-VLM на MacBook Pro с M5 Max и llama.cpp на M3 Ultra с использованием весов FP16 при размере батча 1, температуре 0, размере блока 8 и количестве выходных токенов до 2048 (медианная длина ответа — 90 токенов).
Спекуляция улучшает пропускную способность во всех шести категориях задач на обоих стеках. С MLX на M5 Max декодирование выполняется в 2.30–3.13 раза быстрее в зависимости от задачи, а задержка «от конца до конца» улучшается в 1.56–2.62 раза. С llama.cpp на M3 Ultra декодирование улучшается в 1.57–2.14 раза, а сквозная задержка — в 1.30–1.77 раза. Показатель принятия находится в схожем диапазоне для обоих стеков: примерно от 3.2 до 4.5 токенов за проход верификации, что отражает зависимость принятия от черновика и рабочей нагрузки, а не от оборудования или среды выполнения.
Вывод на GPU. Мы измеряем пропускную способность GPU с помощью SGLang на одном H100 80GB в BF16 при размере батча 1 и температуре 0 с размером блока 9.
Тот же черновик обеспечивает ускорение декодирования на H100 в 2.04–2.66 раза, со сквозным улучшением в 1.64–2.27 раза. Количество принятых токенов составляет от 3.46 до 4.57 за проход верификации.
Интерактивность
Преимущества DSpark выходят за рамки размера батча 1 и сохраняются при более высокой степени параллелизма. Мы оцениваем границу «пропускная способность — интерактивность», которая отражает компромисс между совокупной пропускной способностью системы и скоростью генерации для каждого пользователя при изменении уровня параллелизма. По мере увеличения параллелизма более высокая арифметическая интенсивность постепенно переводит фазу декодирования из режима ограничения по памяти в режим ограничения по вычислениям. Поскольку DSpark проверяет несколько сгенерированных черновиком токенов за каждый проход целевой модели, арифметическая интенсивность пропорционально увеличивается вместе с размером блока.
Как показано на Рисунке 5, DSpark сохраняет преимущество в пропускной способности на всех измеренных уровнях параллелизма, хотя разрыв сокращается по мере роста параллелизма. Все тесты выполнялись в SGLang на одном H100 с фиксированным окном верификации.
Влияние сэмплирования на скорость и качество
При ненулевых температурах черновик сэмплирует токен из своего распределения, а целевая модель либо принимает его, либо выбирает скорректированную замену. При совпадающих настройках сэмплирования спекулятивное декодирование эквивалентно по распределению прямому сэмплированию из целевой модели [3], и, следовательно, полученный результат не имеет потерь.
При повышении температуры меняется коэффициент принятия и, следовательно, пропускная способность. При более низких температурах черновик и целевая модель склонны концентрироваться на одних и тех же топовых токенах. По мере роста температуры вероятностная масса смещается к кандидатным токенам с более низким рангом, где модели с большей вероятностью расходятся во мнениях. В наших экспериментах повышение температуры приводило к снижению коэффициента принятия и, как следствие, негативно влияло на пропускную способность.
Ограничения спекуляций для визуальных нагрузок на периферии
При выводе больших языковых моделей (LLM) префилл (предварительное заполнение) в значительной степени ограничен вычислительной мощностью, и его стоимость растет (суб)квадратично с длиной промпта. Вывод VLM усугубляет стоимость префилла: изображение сначала должно пройти через визуальный энкодер, после чего языковая основа должна обработать сотни созданных им визуальных токенов вместе с текстовым промптом.
Это становится более проблематичным на периферийных устройствах, где пропускная способность вычислений существенно ниже, чем на датацентровых графических процессорах. В результате префилл составляет более значительную долю сквозной задержки. Это наиболее отчетливо видно по измерениям времени до первого токена и декодирования на кремнии Apple и H100. Более новые чипы Apple Silicon частично сокращают этот разрыв за счет добавления нейронного ускорителя к каждому графическому ядру M5 [4].
Спекулятивное декодирование ускоряет только фазу декодирования при выводе LLM. Кодирование изображений и предварительное заполнение остаются без изменений. Когда эти этапы уже занимают значительную долю общего времени выполнения, даже значительное ускорение декодирования приводит лишь к скромному улучшению сквозной задержки. Это классический пример закона Амдала, согласно которому общее ускорение ограничивается той частью рабочей нагрузки, которая остается неускоренной.
Начало работы
Наша модель DSpark для визуализации доступна на Hugging Face в форматах и GGUF.
С выходом LFM2.5 мы воплощаем в жизнь наше видение ИИ, который работает везде. Эти модели:
- С открытыми весами — скачивайте, дообучайте и развертывайте без ограничений.
- Быстрые с первого дня — поддержка "из коробки" для llama.cpp, MLX и SGLang.
- Полноценное семейство — от базовых моделей для кастомизации до специализированных вариантов для работы с аудио и изображениями; единая архитектура охватывает самые разные сценарии использования
Мы с нетерпением ждем возможности увидеть, что вы создадите.
Цитирование
Для цитирования используйте следующую ссылку или BibTeX:
Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.
Ссылки
- [1]Cheng et al. (2026). DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation. https://arxiv.org/abs/2607.05147
- [2]Shen et al. (2026). MMSpec: Benchmarking Speculative Decoding for Vision-Language Models. https://arxiv.org/abs/2603.14989
- [3]Leviathan et al. (2023). Fast Inference from Transformers via Speculative Decoding. The equivalence proof appears in Appendix A.1, “Correctness of Speculative Sampling.” https://arxiv.org/abs/2211.17192
- [4]Apple Machine Learning Research (2025). Exploring LLMs with MLX and the Neural Accelerators in the M5 GPU.






