AI-инференс — это процесс использования обученной модели ИИ для генерации прогноза, ответа или другого результата на основе новых данных. Edge AI выполняет AI-инференс на устройствах или инфраструктуре вблизи места создания данных, вместо того чтобы отправлять каждый запрос в облако. Это означает, что модель, среда выполнения и необходимые ей данные находятся непосредственно на источнике или рядом с ним (например, на телефоне, датчике, киоске, промышленном шлюзе или периферийном сервере), а не в удаленном центре обработки данных.
Поставщики оборудования объясняют Edge AI через чипы и ускорители. Облачные провайдеры объясняют его через модели развертывания. В этой статье рассматриваются оба подхода, а также та часть, которую большинство поставщиков упускают из виду. Вы также узнаете, что на самом деле нужно приложениям Edge AI от уровня данных и почему этот уровень определяет, соответствует ли приложение бизнес-потребностям в реальных условиях.
Как работает Edge AI?
Edge AI следует одному и тому же основному рабочему процессу независимо от места развертывания:
- Обучение модели, как правило, в облаке или центре обработки данных, где достаточно вычислительных мощностей и большие наборы данных для обучения.
- Сжатие и квантование модели для уменьшения ее размера и объема занимаемой памяти, чтобы она могла работать на ограниченном аппаратном обеспечении на периферии.
- Развертывание сжатой модели на целевом устройстве, шлюзе или периферийном сервере.
- Запуск локального инференса на этом устройстве с использованием входящих данных без необходимости передачи запроса в облако.
Аппаратное обеспечение, выполняющее локальный инференс, быстро развивается. Нейронные процессоры (NPU), мобильные графические процессоры и ИИ-ускорители от таких компаний, как Qualcomm, Apple и NVIDIA, теперь делают инференс быстрым и эффективным на устройствах, которые еще несколько лет назад были бы непригодны для рабочих нагрузок ИИ.
Хотя некоторые продвинутые развертывания выполняют легкую локальную донастройку (fine-tuning), инференс остается основной рабочей нагрузкой на периферии. Обучение базовой модели остается там, где много вычислительных мощностей — в облаке или центре обработки данных.
Edge AI против облачного ИИ
Большинство производственных развертываний сочетают периферийные и облачные вычисления, а не выбирают что-то одно. Распространенный шаблон — выполнение инференса на периферии для скорости и автономной работы, при этом облако используется для обучения моделей, тяжелой аналитики, агрегации данных и управления.
Вот некоторые ключевые различия между периферийным и облачным ИИ:
Edge AI против периферийных вычислений (edge computing)
Периферийные вычисления — это архитектурный шаблон, который переносит обработку и хранение данных ближе к месту их создания, вместо того чтобы централизовать все в облаке. Edge AI — это рабочая нагрузка ИИ, которая выполняется на этой архитектуре. Другими словами, периферийные вычисления — это инфраструктура, а Edge AI — это то, что вы на ней запускаете. Можно иметь периферийные вычисления без ИИ, но Edge AI всегда требует периферийных вычислений.
Edge AI против ИИ на устройстве (on-device AI)
ИИ на устройстве — это наиболее узкая форма Edge AI, при которой модель работает полностью на самом конечном устройстве. Нет зависимости от близлежащего шлюза или периферийного сервера. Edge AI — это более широкая категория, охватывающая как развертывания на устройствах, так и близлежащие периферийные серверы и шлюзы, которые обрабатывают данные с нескольких устройств.
Edge AI против локального ИИ (on-premises AI)
Локальный ИИ выполняет инференс в собственном центре обработки данных организации, не передавая данные в публичное облако. Edge AI распределяет инференс туда, где происходит работа (например, на устройства, шлюзы и локальные площадки), часто в средах без надежного соединения с центральным центром обработки данных.
Хотя и локальный ИИ, и Edge AI позволяют хранить данные вне публичной инфраструктуры, они решают разные задачи. Локальный ИИ обеспечивает управление и контроль в централизованной модели. Edge AI решает задачу надежной работы, когда устройства и площадки не могут зависеть от связи с центром обработки данных.
Преимущества Edge AI
Низкая задержка: Поскольку инференс выполняется локально, нет сетевых задержек на передачу запроса. Приложениям, которым нужны результаты в реальном времени (например, системы помощи водителю, мониторинг промышленной безопасности, синхронный перевод), обеспечивается время отклика от долей миллисекунды до нескольких миллисекунд, чего облачный инференс не может надежно гарантировать.
Конфиденциальность и безопасность: Чувствительные данные остаются на устройстве или в пределах локальной инфраструктуры. Они не передаются через интернет и не хранятся в общей облачной среде. Это крайне важно для здравоохранения, финансовых услуг и любых приложений, работающих с персональной информацией.
Автономная работа: Приложения Edge AI могут продолжать работать при потере связи, если модель, среда выполнения и необходимые данные доступны локально. Для выездных сервисных работников, розничных точек, производственных цехов и транспортных средств это является обязательным требованием.
Экономия пропускной способности и затрат: Обрабатывая данные локально, Edge AI снижает объем данных, передаваемых в облако, уменьшает расходы на исходящий трафик и снижает нагрузку на общие сети. Для развертываний IoT, генерирующих большие объемы данных с датчиков, эта экономия существенна. Однако помните, что затраты на облако и время круговой передачи данных (RTT) могут быть непомерно высокими для других типов приложений.
Варианты использования и примеры Edge AI
Розничная торговля
Умные киоски с персональными рекомендациями, внутримагазинные системы камер, отслеживающие перемещение покупателей для учета запасов, и терминалы в точках продаж, которые продолжают обрабатывать транзакции во время сбоев связи, — все это практические примеры использования Edge AI. Автономная работа особенно важна для POS-терминалов в рознице, так как каждая неудачная транзакция означает потерю выручки.
Соблюдение планограмм в рознице — еще один ценный пример использования Edge AI, который сочетает модели компьютерного зрения с локальным поиском по базе данных. Менеджеры магазинов должны следить за тем, чтобы полки соответствовали корпоративным «золотым» планограммам (например, правильный порядок продуктов, целевое размещение и наличие запасов). Ручные проверки медленны, а отправка изображений полок высокого разрешения в облачные модели зрения создает огромные сетевые накладные расходы, затраты на облачную обработку и приводит к сбоям при отключении Wi-Fi в магазине. С помощью Edge AI мобильное приложение делает снимок полки, локально запускает модель зрения для идентификации продуктов и их размещения, а также запрашивает локальный векторный индекс для сопоставления обнаруженных товаров с планограммой. Пробелы в соблюдении стандартов выявляются мгновенно, даже в автономном режиме, без передачи ни одного байта данных изображений из магазина.
Мобильные устройства
Примеры мобильных приложений, выполняющих инференс на устройстве, включают голосовых помощников, которые обрабатывают речь локально, приложения для синхронного перевода, работающие без подключения к данным, и функции камеры, такие как улучшение фото в реальном времени и распознавание объектов. Эти варианты использования требуют низкой задержки и, во многих случаях, возможности автономной работы.
IoT и умный дом
Умные колонки, обрабатывающие голосовые команды, термостаты, принимающие автономные решения для комфорта, и умные замки, выполняющие биометрическую проверку локально, — все они используют Edge AI, чтобы избежать облачных запросов, которые вносят неприемлемую задержку или создают риски для конфиденциальности.
Промышленность и производство
Периферийные системы в промышленности и производстве включают предиктивное обслуживание, анализирующее данные датчиков оборудования, визуальный контроль дефектов на производственных линиях и оповещение о состоянии безопасности в реальном времени. Все это работает на периферии, потому что задержка при передаче данных в облако слишком высока, а последствия пропущенного обнаружения слишком значительны.
Здравоохранение
Типичные примеры внедрения Edge AI в здравоохранении включают носимые устройства для мониторинга биометрических данных, средства поддержки диагностики на устройствах для бригад скорой помощи и полевых медиков, а также системы мониторинга пациентов в больницах, которые обрабатывают данные локально для соблюдения нормативных требований по конфиденциальности. Скорость и управление данными критически важны для всех трех примеров.
Автомобильная промышленность
Усовершенствованные системы помощи водителю (ADAS), обнаружение полосы движения в реальном времени, предотвращение столкновений и мониторинг состояния водителя — все это требует выполнения логического вывода (inference) на периферии. Автомобиль не может ждать ответа от облака при принятии решения, от которого зависит безопасность.
Что нужно Edge AI от уровня данных
Производители оборудования описывают Edge AI в терминах чипов и сжатия моделей. Облачные провайдеры описывают его в терминах конвейеров развертывания. Ни те, ни другие не объясняют, что происходит, когда модели нужны данные для выполнения своей работы. Модели, выполняющей локальный логический вывод, нужен локальный контекст, такой как предпочтения пользователя, исторические записи, каталоги продуктов, базовые показатели датчиков и состояние сеанса. Уровень данных определяет, где эти данные хранятся и как они туда попадают.
Локальный логический вывод требует локальных данных
Приложению Edge AI, которое основывает свои ответы на локальном контексте, нужно где-то этот контекст хранить. Локальная генерация с дополнением (RAG) требует хранилища на устройстве, которое может выполнять запросы на сходство с низкой задержкой и содержать векторные представления (embeddings) и исходные документы — и все это без подключения к сети. Когда агенту Edge AI нужно извлечь релевантный контекст перед генерацией ответа, встроенная или периферийная база данных, к которой он обращается, определяет, возможно ли это извлечение.
Чтение и запись с низкой задержкой
Выигрыш в задержке от выполнения логического вывода локально исчезает, если уровень данных работает медленно. Встроенная база данных, обеспечивающая чтение из локального хранилища с задержкой менее миллисекунды, выполняет обещание Edge AI. Уровень данных, который выполняет сетевые вызовы, использует хранилище с интенсивным использованием диска или имеет высокие накладные расходы на запросы, сводит на нет преимущество, которое должен был обеспечить локальный логический вывод.
Постоянная работа
База данных Edge AI должна работать полностью автономно и правильно согласовывать данные при восстановлении соединения. Это отличается от «изящной деградации» (graceful degradation). Приложение не должно терять функциональность, ставить в очередь ошибки или выдавать несогласованные результаты при обрыве сети. Правильное поведение — это полноценная автономная работа с последующей надежной синхронизацией при повторном подключении приложения.
Синхронизация облако-периферия
Модели, векторные представления и операционные данные должны передаваться из облака на периферийные серверы и устройства, а обновленные данные должны возвращаться обратно. Этот уровень синхронизации должен обрабатывать двунаправленные обновления, разрешать конфликты, когда одна и та же запись обновляется в нескольких местах, и эффективно работать при прерывистых соединениях.
Безопасность и управление на периферии
Шифрование данных в состоянии покоя, аутентифицированный локальный доступ и возможность редактирования или фильтрации конфиденциальных данных перед их отправкой в LLM — все это требования для периферии, точно такие же, как и для облака. Данные, хранящиеся на устройствах, по-прежнему подпадают под действие правил конфиденциальности, требований аудита и контроля доступа, и уровень данных должен обеспечивать их соблюдение локально.
Как Couchbase обеспечивает работу Edge AI
Couchbase предоставляет связный уровень данных между облаком, периферийным сервером и устройством, который отвечает всем пяти вышеперечисленным требованиям. Он использует один и тот же язык запросов SQL++ и API на каждом уровне.
Встроенная база данных на устройстве с локальным векторным поиском: Couchbase Lite — это встроенная NoSQL база данных для мобильных и IoT-приложений. Она хранит JSON-документы и векторные представления локально, выполняет SQL++ запросы и поиск на сходство без сетевого подключения, а также поддерживает предиктивные запросы для прямого вызова локальных моделей ИИ. Это уровень данных для RAG на устройстве и локального логического вывода.
Couchbase Lite также дает разработчикам две возможности, важные для масштабирования на периферии: функции прогнозирования (Prediction Functions), которые генерируют векторные представления «на лету» во время запроса, чтобы приложению не требовался отдельный конвейер векторизации, и «ленивое» векторное индексирование (Lazy Vector Indexing), которое позволяет разработчикам планировать тяжелые обновления векторных индексов в фоновом режиме, не блокируя пользовательский интерфейс или производительность приложения. Оба аспекта важны в ограниченных периферийных средах, где вычислительные ресурсы и заряд батареи ограничены.
Синхронизация облако-периферия и peer-to-peer: Couchbase Mobile обрабатывает двунаправленную синхронизацию между Couchbase Lite на устройствах и облачным уровнем со встроенным разрешением конфликтов, детальным контролем доступа и поддержкой синхронизации между устройствами (peer-to-peer) в одной сети. Данные передаются корректно независимо от того, находятся ли устройства онлайн, офлайн или подключены только друг к другу.
Уровень периферийного центра обработки данных для площадок с ограниченными ресурсами: Couchbase Edge Server предоставляет легковесное развертывание базы данных для производственных цехов, бэк-офисов розничной торговли и других периферийных площадок, которым нужен локальный уровень данных, но которые не могут запустить полноценную инфраструктуру центра обработки данных. Он соединяет базы данных на устройствах и облако, агрегируя данные с нескольких устройств и поддерживая локальное хранилище для площадки.
Облачная магистраль: Couchbase Capella — это управляемый DBaaS-уровень, который служит авторитетным источником данных для периферийного развертывания. Он управляет распределением моделей, конвейерами обучающих данных, агрегированной аналитикой и обеспечением соблюдения политик управления. Capella работает в AWS, Azure и Google Cloud.
Семантический поиск на периферии: векторный поиск Couchbase работает нативно как в Couchbase Lite, так и в Capella, обеспечивая гибридный поиск (векторное сходство плюс ключевые слова плюс структурированные фильтры в одном запросе) на каждом уровне архитектуры. Приложениям Edge AI, которым нужен семантический поиск, не требуется отдельное векторное хранилище.
Такая согласованность устраняет скрытые затраты на поддержку логики синхронизации для каждой платформы, сокращает площадь операционного воздействия и позволяет командам создавать решение один раз, вместо того чтобы перестраивать его для каждой платформы. Это главное операционное преимущество унифицированной архитектуры данных от облака до периферии.
Часто задаваемые вопросы об Edge AI
Что такое Edge AI простыми словами?
Edge AI выполняет логический вывод ИИ на локальных устройствах или инфраструктуре рядом с местом создания данных, вместо того чтобы отправлять данные в удаленный облачный центр обработки данных для обработки. Модель и необходимые ей данные находятся непосредственно в точке использования или рядом с ней, что означает меньшую задержку, возможность работы в автономном режиме и лучшую конфиденциальность данных по сравнению с облачным ИИ.
Чем Edge AI отличается от облачного ИИ?
Edge AI выполняет логический вывод локально на устройстве, шлюзе или периферийном сервере, уменьшая задержку, поддерживая автономную работу и сохраняя конфиденциальные данные ближе к источнику. Облачный ИИ обрабатывает данные в удаленных центрах обработки данных, обеспечивая большую вычислительную мощность для обучения больших моделей и выполнения рабочих нагрузок, интенсивно использующих GPU. Большинство производственных развертываний используют оба подхода: периферия обрабатывает логический вывод в реальном времени и автономную работу, а облако — обучение, аналитику и управление.
Работает ли Edge AI в автономном режиме?
Да, если модель, среда выполнения и необходимые данные доступны локально. Для приложений, которые читают и записывают данные в автономном режиме, требуется локальная база данных, которая работает полностью без подключения и правильно синхронизируется при восстановлении соединения. Приложения, которые полагаются на доступ к облачным данным, не будут работать в автономном режиме, даже если сама модель развернута локально.
Какую базу данных использует приложение Edge AI?
Приложениям Edge AI требуется база данных, которая работает полностью в автономном режиме, выполняет запросы из локального хранилища за доли миллисекунды, осуществляет векторный поиск для RAG без подключения к сети, а также поддерживает двунаправленную синхронизацию с облаком с автоматическим разрешением конфликтов. Couchbase Lite специально разработана для этих требований. Это встроенная NoSQL-база данных для мобильных и IoT-развертываний, которая предоставляет локальное хранилище, векторный поиск, запросы SQL++ и облачную синхронизацию в рамках одной библиотеки. Она устраняет необходимость в использовании нескольких баз данных и написании пользовательской логики синхронизации для каждой платформы.
Является ли Edge AI тем же самым, что и On-device AI?
Нет. On-device AI — это подмножество Edge AI, при котором модель работает полностью на конечном устройстве без зависимости от близлежащего сервера. Edge AI — это более широкая категория, охватывающая как развертывания на устройствах, так и близлежащие периферийные серверы и шлюзы, обслуживающие несколько устройств. Весь On-device AI относится к Edge AI, но не весь Edge AI является On-device AI.
Каковы основные проблемы Edge AI?
Три наиболее значимые проблемы:
- Размер модели — сжатые модели жертвуют некоторой точностью ради возможности работы на аппаратном обеспечении с ограниченными ресурсами.
- Синхронизация данных — поддержание согласованности данных между устройствами, периферийными серверами и облаком требует наличия уровня синхронизации с механизмом разрешения конфликтов.
- Управление — требования к контролю доступа, шифрованию и комплаенсу применяются на периферии так же, как и в облаке, и инфраструктура должна обеспечивать их соблюдение локально.






