Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Uskorenie zritelno yazykovyh modeley s pomoschyu lfm25 vl dspark
Dev48

© 2026 · All rights reserved.

Ускорение зрительно-языковых моделей с помощью LFM2.5-VL-DSpark

Источник: Hugging Face

Ускорение зрительно-языковых моделей с помощью LFM2.5-VL-DSpark

Источник: Hugging Face

Запись в блоге Liquid AI на Hugging Face

25 сентября 2026 г.

Сегодня мы выпускаем экспериментальную модель черновика DSpark для нашей зрительно-языковой модели (VLM) LFM2.5-VL-3B. Как и в случае с нашими недавно выпущенными моделями-черновиками LFM2.5-DSpark, она добавляет путь спекулятивного декодирования, который обеспечивает значительное ускорение за счет минимального увеличения объема памяти без изменения качества вывода.

  • Более быстрая генерация: ускорение декодирования до 3,13 раза на локальном устройстве и до 2,66 раза на H100, при этом сквозной прирост (end-to-end) составляет до 2,62 и 2,27 раза соответственно.
  • Небольшие затраты памяти: модель-черновик добавляет 280 млн параметров, что составляет 8,9% поверх целевой модели на 3 млрд параметров.
  • Поддержка с первого дня: интеграции DSpark с поддержкой LFM для llama.cpp, MLX-VLM и SGLang.

Как работает спекулятивное декодирование для VLM

Зрительный черновик использует ту же архитектуру, что и наши текстовые черновики LFM2.5-DSpark: он перехватывает скрытые состояния целевой модели на фиксированном наборе прослушиваемых слоев и на их основе формирует блок из k кандидатных токенов. Изображения и текстовые токены проецируются в общее представление перед этими слоями, поэтому черновик работает с векторами скрытых состояний одинаковой размерности независимо от модальности ввода. Таким образом, алгоритм инференса остается неизменным по сравнению с текстовыми моделями.

Обучение и архитектура

Мы следуем рецепту DSpark, используя смесь данных SFT для зрительно-языковых задач с акцентом на рабочие нагрузки, которые модель должна обслуживать. На основе результатов абляционных исследований для 3, 4 и 5 слоев модель-черновик представляет собой упрощенный вариант только с механизмом внимания (attention-only), содержащий 4 слоя и размер блока 9. Мы провели 10 эпох на финальной смеси данных и измеряли коэффициент принятия после каждой из них; он улучшался с ростом числа обучающих токенов до наступления момента убывающей отдачи. На этапе инференса мы рекомендуем использовать размер блока 8 или 9 в зависимости от аппаратного обеспечения.

Полученный черновик имеет примерно 280 млн параметров и увеличивает количество параметров развертываемой модели всего на 8,9%.

Ускорение инференса на CPU и GPU

Модель-черновик DSpark для LFM2.5-VL-3B поставляется с поддержкой «из коробки» для llama.cpp, MLX-VLM и SGLang.

Мы измеряем инференс как на локальном устройстве, так и на GPU. Обе конфигурации используют размер блока DSpark, равный 8, и оцениваются на шести различных зрительных задачах, включая общие вопросы и ответы по изображениям (VQA), текстовые VQA, создание описаний изображений, VQA по графикам, сложные рассуждения и многоуровневый диалог, в соответствии с бенчмарком MMSpec.

Инференс на устройстве. При использовании MLX на чипе M5 Max скорость декодирования возрастает в 2,30–3,13 раза в зависимости от задачи. Сквозная задержка улучшается в 1,56–2,62 раза. При использовании llama.cpp на M3 Ultra декодирование ускоряется в 1,57–2,14 раза, а сквозные показатели — в 1,30–1,77 раза.

Инференс на GPU. На H100 тот же черновик обеспечивает ускорение декодирования в 2,04–2,66 раза, а сквозные улучшения составляют от 1,64 до 2,27 раза.

Ограничения спекулятивного подхода для зрительных задач

В LLM предварительное заполнение (prefill) в основном ограничено вычислительной мощностью, и его стоимость растет (суб)квадратично с ростом длины промпта. VLM добавляют к этому сложность, поскольку изображение сначала проходит через зрительный энкодер, после чего языковая основа обрабатывает сотни зрительных токенов вместе с текстовым промптом. Периферийные устройства обладают гораздо меньшей вычислительной мощностью, чем датацентровые GPU, поэтому этап префилла занимает большую долю в общей задержке (end-to-end latency), что хорошо видно по измерениям времени до первого токена и декодирования на кремнии Apple и H100. (Нейронные ускорители GPU на каждом ядре M5 сокращают этот разрыв).

Спекулятивное декодирование ускоряет только процесс декодирования, а не кодирование изображений или предварительное заполнение. Когда эти этапы уже занимают значительную часть времени выполнения, даже сильное ускорение декодирования дает лишь скромный общий прирост производительности. Это закон Амдала, согласно которому общее ускорение ограничивается той частью рабочей нагрузки, которая не ускоряется.

Как использовать LFM2.5-VL-DSpark

Запуск моделей-черновиков DSpark с помощью SGLang требует сборки SGLang с поддержкой DSpark для целей LFM2 (PR #40651). Запустите целевую модель с подключенным черновиком:

Затем отправьте запрос к совместимой с OpenAI конечной точке по адресу http://localhost:30000/v1. Размер блока считывается из файла config.json черновика; базовая конфигурация представляет собой ту же команду без трех флагов --speculative-*.

Для запуска с помощью llama.cpp требуется соответствующая сборка llama.cpp (PR#29339).

Для запуска с помощью MLX-VLM требуется соответствующая сборка (PR#2280).

Размер блока считывается из метаданных sidecar (параметр n-max ограничивается им). Спекулятивное декодирование является точным: целевая модель проверяет каждый предложенный токен, поэтому жадный вывод совпадает с выводом одной лишь целевой модели; в таймингах для каждого ответа указываются значения draft_n / draft_n_accepted.

Начало работы

Наша модель-черновик зрительного DSpark доступна на Hugging Face в форматах Safetensors и GGUF.

С помощью LFM2.5 мы воплощаем в жизнь наше видение ИИ, который работает везде. Эти модели:

  • С открытыми весами — скачивайте, дообучайте и развертывайте без ограничений.
  • Быстрые с первого дня — поддержка «из коробки» для llama.cpp, MLX и SGLang.
  • Полное семейство — от базовых моделей для настройки до специализированных аудио- и визуальных вариантов, одна архитектура охватывает самые разные сценарии применения.

Мы с нетерпением ждем возможности увидеть, что вы создадите.

Цитирование

Для цитирования используйте следующую ссылку или BibTeX: Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.

← Все статьи