Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Reka edgeq na ustroystve
Dev48

© 2026 · All rights reserved.

Reka EdgeQ, На устройстве

Источник: Reka AI

Reka EdgeQ, На устройстве

Источник: Reka AI

EdgeQ переносит Reka Edge на Hexagon NPU от Qualcomm. На Samsung S25 модель обеспечивает визуальное понимание на уровне пограничных моделей с задержкой в реальном времени и остается термически стабильной при постоянной нагрузке, в то время как Gemma 4 E4B подвергается троттлингу.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

Reka Edge — это мультимодальная визуально-языковая модель для зрительного восприятия и физической привязки. Она отличается исключительной эффективностью в понимании изображений, анализе видео и обнаружении объектов, не уступая по точности другим передовым моделям или превосходя их.

Мы объединяем преимущества Reka Edge с EdgeQ — оптимизированной реализацией для процессора Qualcomm Snapdragon 8 Elite, лидирующего процессора в телефонах на базе Android. Это делает модель уникально приспособленной для развертывания в реальных условиях на устройствах с жесткими ограничениями: от современных смартфонов до умных очков, XR-гарнитур и носимых ИИ-устройств в будущем. Сохранение высокого качества визуального понимания и оперативности в реальном времени в рамках практического теплового бюджета — сложная задача, но EdgeQ обеспечивает передовую производительность по точности, скорости и эффективности. Ниже мы используем Samsung S25 для демонстрации возможностей NPU Qualcomm Hexagon.

Точность

Бенчмарк

Reka Edge (BF16)

EdgeQ

Gemma 4 E4B (BF16)

RefCOCO-A

93.01

88.65

73.93

RefCOCO-B

85.72

77.19

63.10

MLVU

72.31

66.93

32.90

EdgeQ (средняя колонка) представляет собой более мощную готовую к использованию реализацию модели для ваших задач компьютерного зрения. EdgeQ на устройстве превосходит даже серверную версию Gemma в полной точности. В бенчмарках RefCOCO и MLVU, являющихся золотым стандартом для привязки объектов и понимания видео, EdgeQ на смартфоне Samsung S25 превосходит флагманскую модель телефона от Google — Gemma 4 E4B (правая колонка) — до 34 пунктов в понимании видео. EdgeQ использует квантование и оптимизации под конкретный процессор для работы на устройстве с минимальной потерь точности, показанной выше.

В таблице выше Gemma E4B и Reka Edge (левая колонка) запускались на сервере при их исходной 16-битной точности (BF16). Это дает щедрую оценку точности в наилучшем случае для целей сравнения, даже несмотря на то, что ни одна из моделей не может работать на S25 с полной точностью. В разделах скорости и эффективности используется сборка Gemma, пригодная только для S25.

Скорость

Время до первого токена (с)

EdgeQ

Gemma 4 E4B

Одно изображение

.73

1.6

Видео (6 кадров)

2.4

6.2

EdgeQ демонстрирует оперативность в реальном времени при понимании визуальных данных, превосходя задержку Gemma как для задач с одним изображением, так и для 6-кадровых видео. Мы используем 6-кадровые клипы, так как это соответствует MLVU — эталонному бенчмарку, и потому что это приемлемое временное разрешение для фиксации поведения в реальном мире. Нам удалось добиться ускорения более чем в 2 раза за счет раздельной настройки энкодера и декодера для NPU Qualcomm Hexagon в S25. Приведенные выше значения отражают задержку с момента поступления изображения или клипа до первого ответа ИИ-модели, иными словами, время до первого токена (TTFT). Это время отражает задержку на стороне модели для первичного обнаружения присутствия действия после захвата клипа.

Это сравнение выбиралось не для того, чтобы отдать предпочтение нашей работе. Хотя E4B является флагманской моделью телефона Android от Gemma, ее производственный конвейер не имеет пути для работы с NPU на устройстве. LiteRT-LM от Google работает только на графическом процессоре Adreno на S25. Насколько нам известно, EdgeQ — это первый визуальный энкодер ConvNeXt V2, обслуживающий производственную VLM на NPU от Qualcomm. Чтобы поместиться на устройстве, Gemma требуется квантованная сборка .litertlm. Время до первого токена указывает время на визуальное кодирование и префилл до первого токена, измеренное на устройстве, для однотайловых кадров в прогретом состоянии.

Эффективность

Постоянная нагрузка (240 с)

EdgeQ (NPU)

Gemma 4 E4B (GPU)

Выполнено выводов

Средний вывод (с)

3.0 с

8.8 с

Энергопотребление от батареи

8.25 Вт

8.32 Вт

Пиковая температура кожи

61 °C

71 °C

Дрейф задержки

+15%

+36%

Энергия на один вывод

6.9 мВт·ч

20.3 мВт·ч

Обе модели получали идентичные 6-кадровые входные данные с предварительной обработкой за измеренное время, из одинакового холодного состояния, без подключения к сети, в течение фиксированного окна в 240 с, с дисплеем на минимальной яркости и с проверкой правильности всех результатов.

Практические преимущества EdgeQ возрастают во время непрерывного восприятия — реальной рабочей нагрузки физического ИИ. При запуске нашего теста 6-кадрового вывода из описанного выше один за другим в течение 240 с модель Gemma разогревает телефон до пиковой температуры 71 °C при касании (зона температурного датчика). Между тем, температура перехода GPU достигает пика в 105 °C, что приводит к термотроссингу процессора и ухудшению задержки отклика на 36%. Накопление тепла замедляет непрерывный вывод, и к последним 5 выводам в этом бенчмарке постоянной нагрузки среднее время полного вывода составило 11.6 с на клип. На практике приложения запускают вывод по запросу или производят выборку из непрерывного потока с фиксированной частотой, чтобы предотвратить повышение контактной температуры выше 48 °C. Наш тест намеренно насыщает процессор, чтобы строго выявить предельные возможности каждого стека.

Для носимого устройства имеет значение тепловыделение на один вывод. Энергия на уровне устройства для одного вывода обходится EdgeQ в 6.9 мВт·ч — это треть тепла от Gemma, что означает, что при аккумуляторе класса умных очков EdgeQ может выполнять примерно в 3 раза больше выводов при том же энергопотреблении с течением времени. Для того же теста из 240 с непрерывного визуального восприятия температура корпуса телефона достигала пика всего в 61 °C, а 6-кадровая задержка оставалась относительно стабильной с минимальным увеличением на +15%. Реализация EdgeQ поддерживает GPU в бездействии, что на практике освобождает его для того, для чего он специализирован: графических нагрузок. Это оставляет принятие решений о тепловом бюджете за приложением в условиях дополненной реальности.

Эти эмпирические выводы отчасти обусловлены главным преимуществом самой архитектуры модели. Визуальный энкодер EdgeQ, ConvNeXt V2, обрабатывает 64 токена на тайл изображения, что позволяет получать примерно в 3 раза больше кадров на единицу контекста по сравнению с аналогичными VLM, как объясняется в нашей статье о Reka Edge здесь. Такая эффективность дизайна в сочетании с разработкой ядер для NPU, квантованием, специализированными средами выполнения и сфокусированным количеством параметров позволяет поддерживать понимание потокового видео в реальном времени на самом краю сети.

Создано для Snapdragon: преимущество Hexagon NPU

Наше демонстрационное устройство, Samsung Galaxy S25, работает на процессоре Qualcomm Snapdragon 8 Elite for Galaxy (SM8750). Его модуль Hexagon NPU обеспечивает примерно 45 TOPS. Snapdragon Reality Elite — преемник линейки Snapdragon XR2, созданный для умных очков нового поколения и XR-гарнитур — оснащен 48 TOPS Hexagon NPU того же архитектурного семейств и вычислительного класса. Визуальные и языковые ядра EdgeQ ориентированы непосредственно на Hexagon NPU, а не на GPU. Поэтому мы ожидаем, что эти результаты перенесутся на XR-устройства класса Reality Elite. То же самое относится к телефонам на базе Snapdragon 8 Elite Gen 5, которые поставляются с более новым и быстрым поколением того же семейства архитектур NPU. Премиальные XR-гарнитуры и умные очки сегодня поставляются практически исключительно на кремнии Snapdragon, поэтому результаты, переносимые на Reality Elite, охватывают этот новый класс устройств.

Специализированные развертывания

Вычислительный ландшафт меняется быстро. Приложения дополненной реальности уже здесь. EdgeQ — это лучший вариант, обеспечивающий приложения с низким временем отклика, такие как визуальная помощь в реальном времени, контекстная осведомленность и передовая дополненная реальность на смартфонах и умных очках. Свяжитесь с нашей командой, чтобы пополнить растущий список компаний с трансформационными мультимодальными развертываниями, требующими специализированной производительности.

Reka Edge, полноточная версия нашей модели, также доступна через несколько вариантов доступа, что позволяет легко изучить и развернуть ее в среде, которая наилучшим образом соответствует вашим потребностям.

Начните работу немедленно в Reka Playground для практического знакомства с Reka Edge. Для разработчиков, стремящихся интегрировать модель в приложения, наша документация по API предоставляет исчерпывающее руководство.

Для команд, которым требуется самостоятельное развертывание, Reka Edge можно запустить локально, используя собственные устройства. Пожалуйста, обратитесь к карточке модели для получения инструкций по доступу к модели через HuggingFace или ее развертыванию с помощью vLLM.

Благодарности

Мы благодарим Джона Салливана (адъюнкт-профессора электротехники, Тихоокеанский университет Сиэтла) и Сухейля Басаламу (постдокторанта в области компьютерных наук, Калифорнийский университет в Лос-Анджелесе) за их критические замечания к ранним черновикам. Любые оставшиеся ошибки являются нашими собственными.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия
Lambda

Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в ИндииПресса
Google Gemini

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в Индии

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами
Пресса
OpenAI

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple WatchПресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лаборатории

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex
OpenAI

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex

Ещё от Reka AI

За пределами распознавания: как наши модели рассуждают о видео
Reka AI

За пределами распознавания: как наши модели рассуждают о видео

RekaDaily-10k: сбор более 10 000 часов эгоцентрических данных о манипуляциях в домашних условиях
Reka AI

RekaDaily-10k: сбор более 10 000 часов эгоцентрических данных о манипуляциях в домашних условиях

Генерация видео в реальном времени
Reka AI

Генерация видео в реальном времени

Эволюция LLM: Omni-World Models
Reka AI

Эволюция LLM: Omni-World Models