Reka Edge — это мультимодальная визуально-языковая модель для зрительного восприятия и физической привязки. Она отличается исключительной эффективностью в понимании изображений, анализе видео и обнаружении объектов, не уступая по точности другим передовым моделям или превосходя их.
Мы объединяем преимущества Reka Edge с EdgeQ — оптимизированной реализацией для процессора Qualcomm Snapdragon 8 Elite, лидирующего процессора в телефонах на базе Android. Это делает модель уникально приспособленной для развертывания в реальных условиях на устройствах с жесткими ограничениями: от современных смартфонов до умных очков, XR-гарнитур и носимых ИИ-устройств в будущем. Сохранение высокого качества визуального понимания и оперативности в реальном времени в рамках практического теплового бюджета — сложная задача, но EdgeQ обеспечивает передовую производительность по точности, скорости и эффективности. Ниже мы используем Samsung S25 для демонстрации возможностей NPU Qualcomm Hexagon.
Точность
Бенчмарк
Reka Edge (BF16)
EdgeQ
Gemma 4 E4B (BF16)
RefCOCO-A
93.01
88.65
73.93
RefCOCO-B
85.72
77.19
63.10
MLVU
72.31
66.93
32.90
EdgeQ (средняя колонка) представляет собой более мощную готовую к использованию реализацию модели для ваших задач компьютерного зрения. EdgeQ на устройстве превосходит даже серверную версию Gemma в полной точности. В бенчмарках RefCOCO и MLVU, являющихся золотым стандартом для привязки объектов и понимания видео, EdgeQ на смартфоне Samsung S25 превосходит флагманскую модель телефона от Google — Gemma 4 E4B (правая колонка) — до 34 пунктов в понимании видео. EdgeQ использует квантование и оптимизации под конкретный процессор для работы на устройстве с минимальной потерь точности, показанной выше.
В таблице выше Gemma E4B и Reka Edge (левая колонка) запускались на сервере при их исходной 16-битной точности (BF16). Это дает щедрую оценку точности в наилучшем случае для целей сравнения, даже несмотря на то, что ни одна из моделей не может работать на S25 с полной точностью. В разделах скорости и эффективности используется сборка Gemma, пригодная только для S25.
Скорость
Время до первого токена (с)
EdgeQ
Gemma 4 E4B
Одно изображение
.73
1.6
Видео (6 кадров)
2.4
6.2
EdgeQ демонстрирует оперативность в реальном времени при понимании визуальных данных, превосходя задержку Gemma как для задач с одним изображением, так и для 6-кадровых видео. Мы используем 6-кадровые клипы, так как это соответствует MLVU — эталонному бенчмарку, и потому что это приемлемое временное разрешение для фиксации поведения в реальном мире. Нам удалось добиться ускорения более чем в 2 раза за счет раздельной настройки энкодера и декодера для NPU Qualcomm Hexagon в S25. Приведенные выше значения отражают задержку с момента поступления изображения или клипа до первого ответа ИИ-модели, иными словами, время до первого токена (TTFT). Это время отражает задержку на стороне модели для первичного обнаружения присутствия действия после захвата клипа.
Это сравнение выбиралось не для того, чтобы отдать предпочтение нашей работе. Хотя E4B является флагманской моделью телефона Android от Gemma, ее производственный конвейер не имеет пути для работы с NPU на устройстве. LiteRT-LM от Google работает только на графическом процессоре Adreno на S25. Насколько нам известно, EdgeQ — это первый визуальный энкодер ConvNeXt V2, обслуживающий производственную VLM на NPU от Qualcomm. Чтобы поместиться на устройстве, Gemma требуется квантованная сборка .litertlm. Время до первого токена указывает время на визуальное кодирование и префилл до первого токена, измеренное на устройстве, для однотайловых кадров в прогретом состоянии.
Эффективность
Постоянная нагрузка (240 с)
EdgeQ (NPU)
Gemma 4 E4B (GPU)
Выполнено выводов
Средний вывод (с)
3.0 с
8.8 с
Энергопотребление от батареи
8.25 Вт
8.32 Вт
Пиковая температура кожи
61 °C
71 °C
Дрейф задержки
+15%
+36%
Энергия на один вывод
6.9 мВт·ч
20.3 мВт·ч
Обе модели получали идентичные 6-кадровые входные данные с предварительной обработкой за измеренное время, из одинакового холодного состояния, без подключения к сети, в течение фиксированного окна в 240 с, с дисплеем на минимальной яркости и с проверкой правильности всех результатов.
Практические преимущества EdgeQ возрастают во время непрерывного восприятия — реальной рабочей нагрузки физического ИИ. При запуске нашего теста 6-кадрового вывода из описанного выше один за другим в течение 240 с модель Gemma разогревает телефон до пиковой температуры 71 °C при касании (зона температурного датчика). Между тем, температура перехода GPU достигает пика в 105 °C, что приводит к термотроссингу процессора и ухудшению задержки отклика на 36%. Накопление тепла замедляет непрерывный вывод, и к последним 5 выводам в этом бенчмарке постоянной нагрузки среднее время полного вывода составило 11.6 с на клип. На практике приложения запускают вывод по запросу или производят выборку из непрерывного потока с фиксированной частотой, чтобы предотвратить повышение контактной температуры выше 48 °C. Наш тест намеренно насыщает процессор, чтобы строго выявить предельные возможности каждого стека.
Для носимого устройства имеет значение тепловыделение на один вывод. Энергия на уровне устройства для одного вывода обходится EdgeQ в 6.9 мВт·ч — это треть тепла от Gemma, что означает, что при аккумуляторе класса умных очков EdgeQ может выполнять примерно в 3 раза больше выводов при том же энергопотреблении с течением времени. Для того же теста из 240 с непрерывного визуального восприятия температура корпуса телефона достигала пика всего в 61 °C, а 6-кадровая задержка оставалась относительно стабильной с минимальным увеличением на +15%. Реализация EdgeQ поддерживает GPU в бездействии, что на практике освобождает его для того, для чего он специализирован: графических нагрузок. Это оставляет принятие решений о тепловом бюджете за приложением в условиях дополненной реальности.
Эти эмпирические выводы отчасти обусловлены главным преимуществом самой архитектуры модели. Визуальный энкодер EdgeQ, ConvNeXt V2, обрабатывает 64 токена на тайл изображения, что позволяет получать примерно в 3 раза больше кадров на единицу контекста по сравнению с аналогичными VLM, как объясняется в нашей статье о Reka Edge здесь. Такая эффективность дизайна в сочетании с разработкой ядер для NPU, квантованием, специализированными средами выполнения и сфокусированным количеством параметров позволяет поддерживать понимание потокового видео в реальном времени на самом краю сети.
Создано для Snapdragon: преимущество Hexagon NPU
Наше демонстрационное устройство, Samsung Galaxy S25, работает на процессоре Qualcomm Snapdragon 8 Elite for Galaxy (SM8750). Его модуль Hexagon NPU обеспечивает примерно 45 TOPS. Snapdragon Reality Elite — преемник линейки Snapdragon XR2, созданный для умных очков нового поколения и XR-гарнитур — оснащен 48 TOPS Hexagon NPU того же архитектурного семейств и вычислительного класса. Визуальные и языковые ядра EdgeQ ориентированы непосредственно на Hexagon NPU, а не на GPU. Поэтому мы ожидаем, что эти результаты перенесутся на XR-устройства класса Reality Elite. То же самое относится к телефонам на базе Snapdragon 8 Elite Gen 5, которые поставляются с более новым и быстрым поколением того же семейства архитектур NPU. Премиальные XR-гарнитуры и умные очки сегодня поставляются практически исключительно на кремнии Snapdragon, поэтому результаты, переносимые на Reality Elite, охватывают этот новый класс устройств.
Специализированные развертывания
Вычислительный ландшафт меняется быстро. Приложения дополненной реальности уже здесь. EdgeQ — это лучший вариант, обеспечивающий приложения с низким временем отклика, такие как визуальная помощь в реальном времени, контекстная осведомленность и передовая дополненная реальность на смартфонах и умных очках. Свяжитесь с нашей командой, чтобы пополнить растущий список компаний с трансформационными мультимодальными развертываниями, требующими специализированной производительности.
Reka Edge, полноточная версия нашей модели, также доступна через несколько вариантов доступа, что позволяет легко изучить и развернуть ее в среде, которая наилучшим образом соответствует вашим потребностям.
Начните работу немедленно в Reka Playground для практического знакомства с Reka Edge. Для разработчиков, стремящихся интегрировать модель в приложения, наша документация по API предоставляет исчерпывающее руководство.
Для команд, которым требуется самостоятельное развертывание, Reka Edge можно запустить локально, используя собственные устройства. Пожалуйста, обратитесь к карточке модели для получения инструкций по доступу к модели через HuggingFace или ее развертыванию с помощью vLLM.
Благодарности
Мы благодарим Джона Салливана (адъюнкт-профессора электротехники, Тихоокеанский университет Сиэтла) и Сухейля Басаламу (постдокторанта в области компьютерных наук, Калифорнийский университет в Лос-Анджелесе) за их критические замечания к ранним черновикам. Любые оставшиеся ошибки являются нашими собственными.






