Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Pobeda nad ppo lstm bez obratnogo rasprostraneniya kak signal adaptivnye doverit
Dev48

© 2026 · All rights reserved.

Победа над PPO-LSTM без обратного распространения: как сигнал-адаптивные доверительные области превращают поиск политик на основе бинарных спайков в быструю и стабильную альтернативу для задач непрерывного управления

Источник: Sapient Intelligence

Победа над PPO-LSTM без обратного распространения: как сигнал-адаптивные доверительные области превращают поиск политик на основе бинарных спайков в быструю и стабильную альтернативу для задач непрерывного управления

Источник: Sapient Intelligence

В статье представлен новый математический подход, который достигает высокой эффективности выборки для задач управления с использованием бинарных спайковых сетей.

26 сентября 2026 г.

Обзор

PPO-LSTM долгое время оставалась одним из самых надежных базовых методов для рекуррентного обучения с подкреплением. Она стабильна, хорошо изучена и достаточно сильна для решения высокоразмерных задач непрерывного управления, таких как Humanoid, Hopper и Walker2d.

Итак, вот неожиданный результат: рекуррентная спайковая нейронная сеть, обученная без обратного распространения во времени и без суррогатных градиентов, может не уступать или превосходить PPO-LSTM при равных затратах на обучение в реальном времени.

Это главная идея, лежащая в основе сигнал-адаптивных доверительных областей (Signal-Adaptive Trust Regions, или SATR). Вместо того чтобы обучать рекуррентную спайковую политику путем дифференцирования через недифференцируемую динамику спайков, SATR идет по другому пути: она рассматривает спайковую сеть как «черный ящик» и оптимизирует распределение бинарных рекуррентных связей.

Результат — это не просто биологически вдохновленная политика, работающая в игрушечных средах. На высокоразмерных контрольных тестах управления Brax SATR-RSNN достигает конкурентоспособных или более высоких финальных наград по сравнению с PPO-LSTM при равном времени выполнения, сохраняя при этом преимущества, которые делают спайковые сети привлекательными с самого начала: бинарные события, разреженные вычисления и дружественное к аппаратному обеспечению исполнение.

Например, в задаче Humanoid заходы PPO-LSTM с равным временем выполнения достигают примерно 11,3–12,4 тыс. наград, в то время как SATR-RSNN* достигает примерно 13,1–13,9 тыс. в зависимости от размера популяции. В статье также сообщается, что SATR обеспечивает примерно в 5 раз более быстрое обучение по сравнению с PPO-LSTM при одинаковой производительности управления и ускорение до 8,9 раза по сравнению с ES при сравнении награды и времени выполнения.

Это вызывает вопрос: как политика на основе бинарных спайков без использования градиентов вообще может конкурировать с PPO-LSTM? Ответ заключается в том, что SATR устраняет главный недостаток обучения RSNN на основе популяций. Популяционные методы привлекательны тем, что позволяют избежать обратного распространения через спайки, однако их оценки обновлений могут быть зашумленными, особенно при небольшом размере популяции. Зашумленное обновление может сдвинуть все распределение выборки слишком далеко, вызывая резкие изменения в поведении сети и нестабильность обучения.

SATR решает эту проблему с помощью простого принципа: доверяйте популяции ровно настолько, насколько этот сигнал заслуживает доверия. Когда популяционное обновление является сильным и когерентным, SATR разрешает делать более крупный шаг в пространстве распределений. Когда обновление слабое или доминирует шум, SATR автоматически сужает доверительную область. В сочетании с реализацией на основе битовых наборов, использующей бинарные спайки и бинарные веса, это превращает поиск рекуррентной спайковой политики в практическую альтернативу PPO-LSTM.

Альтернатива: оптимизируйте распределение, а не сеть

Чтобы прийти к этому, мы сделали один ключевой выбор в дизайне:

Прекратите попытки использовать обратное распространение через спайковую сеть.

Вместо того чтобы рассматривать рекуррентное обучение с подкреплением на спайках как задачу дифференцируемого моделирования последовательностей, SATR рассматривает RSNN как политику в виде «черного ящика». Сеть-кандидат сэмплируется, запускается в среде, ранжируется по полученной награде, а затем используется для обновления распределения, которое ее породило.

Это меняет задачу обучения:

на следующий вопрос: Как эффективно осуществлять поиск по бинарным рекуррентным спайковым политикам?

Этот сдвиг имеет значение, поскольку RSNN по своей природе бинарны и управляются событиями. Спайки бинарны. Связность может быть бинарной. Политика не должна быть сглаженной просто для того, чтобы соответствовать алгоритму обучения.

Отправной точкой является эволюция связности (Evolving Connectivity, или EC). В EC каждый возможный синапс представлен как случайная величина Бернулли:

θᵢ ~ Bernoulli(ρᵢ)

Здесь θᵢ — сэмплированное бинарное соединение, а ρᵢ — вероятность существования этого соединения.

Обучение напрямую не оптимизирует одну фиксированную сеть. Вместо этого оно оптимизирует вектор вероятностей ρ. В каждом поколении мы сэмплируем популяции бинарных RSNN из этого распределения Бернулли, оцениваем их и обновляем ρ так, чтобы высокопроизводительные паттерны связности становились более вероятными.

Цикл прост:

Это отлично подходит для задач спайкового управления, поскольку полностью исключает обратное распространение во времени. Здесь нет суррогатных градиентов, нет дифференцирования через события спайков и нет необходимости хранить длинные графы рекуррентных вычислений.

Но EC также обнажает центральную проблему, для решения которой создана SATR.

Настоящее «узкое горлышко»: зашумленные популяционные обновления

Популяционное обучение звучит просто, но оно сильно зависит от качества популяционного сигнала.

При бесконечной популяции направление обновления было бы надежным. На практике популяция конечна. Иногда очень конечна.

Это означает, что оценка обновления может содержать шум. Несколько удачных или неудачных примеров могут сдвинуть распределение поиска в неправильном направлении. Это становится особенно губительным в высокоразмерных задачах управления, где каждый прогон стоит дорого, а популяционный бюджет нельзя увеличивать бесконечно.

Для RSNN, обученных с помощью связности Бернулли, эта проблема стоит еще острее. Оптимизатор не просто меняет вектор весов. Он меняет распределение выборки по бинарным сетям.

Плохое обновление не просто возмущает одну политику. Оно меняет то, какие политики будут сэмплироваться в следующий раз.

Именно здесь геометрия распределений Бернулли приобретает важное значение. Когда вероятность Бернулли ρᵢ близка к 0,5, ее небольшое изменение обычно безопасно. Но когда ρᵢ близка к 0 или 1, то же самое числовое изменение может представлять собой гораздо более крупное перемещение в пространстве распределений.

Для переменной Бернулли информация Фишера равна:

F(ρᵢ) = 1 / [ρᵢ(1 − ρᵢ)]

По мере приближения ρᵢ к 0 или 1 знаменатель стремится к нулю. Локальная кривизна становится большой. С точки зрения дивергенции Кульбака — Лейблера, распределение становится очень чувствительным вблизи границ.

Таким образом, сценарий сбоя выглядит следующим образом:

Именно поэтому простого использования популяционного метода недостаточно. Нам нужен способ контролировать, насколько далеко смещается распределение выборки.

Но фиксированная доверительная область также не идеальна.

Почему фиксированной доверительной области недостаточно

Естественное решение — заимствовать идею доверительной области из методов оптимизации политик.

В таких методах, как TRPO, мы ограничиваем дивергенцию Кульбака — Лейблера между старой и новой политиками так, чтобы одно обновление не могло изменить поведение слишком радикально. SATR использует ту же философию, но применяет ее к другому объекту:

распределению по сэмплированным связностям RSNN.

Другими словами, SATR не задает вопрос:

Как далеко сместилась политика действий?

Она спрашивает:

Как далеко сместилось распределение выборки по бинарным сетям?

Изменение распределения измеряется следующим образом:

D_KL(p_ρ || p_ρ′)

где p_ρ — текущее распределение связности Бернулли, а p_ρ′ — обновленное распределение.

Фиксированный бюджет дивергенции Кульбака — Лейблера означал бы:

Каждому поколению разрешено перемещаться на одинаковое расстояние.

Но популяционное обучение работает не так. Некоторые поколения производят сильный, когерентный сигнал. Другие поколения в основном состоят из шума. Относиться к ним одинаково — это неверный подход.

Когда сигнал силен, фиксированная доверительная область может оказаться слишком консервативной. Когда сигнал слаб, та же самая доверительная область может оказаться слишком снисходительной.

SATR заменяет этот фиксированный бюджет на сигнал-адаптивный.

Правило звучит так:

Сила сигнала измеряется квадратом нормы оценки популяционного обновления: E = ||g||²

Здесь g вычисляется на основе выборки паттернов связности и их нормализованных вознаграждений с центрированным рангом.

Отсюда вытекает основной принцип SATR:

Область доверия должна масштабироваться в зависимости от объема полезного сигнала в обновлении популяции.

В этом заключается главное алгоритмическое отличие. SATR — это не просто меньшая скорость обучения и не просто фиксированное ограничение KL. Он адаптирует разрешенное распределенное движение от поколения к поколению.

SATR для связности Бернулли

Для связности Бернулли обновление SATR становится особенно простым и понятным.

Локальное приближение KL для факторизованного распределения Бернулли выглядит следующим образом:

Это уравнение наглядно показывает, почему обычные обновления EC могут быть нестабильны вблизи границ. Если ρᵢ близко к 0 или 1, то ρᵢ(1 − ρᵢ) ничтожно мало, поэтому даже небольшое Δρᵢ может создать большое смещение KL.

SATR решает эту проблему, масштабируя каждую координату квадратным корнем из дисперсии Бернулли:

Δρ = η sqrt(ρ ⊙ (1 − ρ)) ⊙ g

где:

Это обновление имеет два полезных эффекта.

Во-первых, оно учитывает границы. Когда ρᵢ находится вблизи 0 или 1, множитель sqrt(ρᵢ(1 − ρᵢ)) становится малым. Обновление автоматически замедляется вблизи детерминированных решений о связности.

Во-вторых, оно адаптируется к сигналу. Подстановка обновления в локальное приближение KL дает:

D_KL(p_ρ || p_ρ+Δρ) ≈ η² / 2 · ||g||²

Таким образом, смещение KL пропорционально энергии сигнала. Если обновление популяции слабое, SATR действует консервативно. Если обновление популяции сильное, SATR допускает больший шаг.

Весь метод можно записать одной строкой:

ρ ← ρ + η sqrt(ρ ⊙ (1 − ρ)) ⊙ g

Этот единственный масштабирующий член выполняет основную работу. Он предотвращает взрывы KL, вызванные границами, и заставляет область доверия реагировать на реальный сигнал популяции.

Абляция из статьи подтверждает это проектное решение. Вариант EC+TR с фиксированным KL в некоторых сценариях может превосходить EC, но его лучший бюджет KL меняется в зависимости от размера популяции. SATR гораздо менее чувствителен, поскольку он не зависит от одного фиксированного радиуса KL, работающего везде. На задаче Humanoid SATR превосходит EC и протестированные варианты с фиксированной областью доверия при размерах популяции 256, 512 и 1024.

Цикл обучения

Полученный алгоритм обучения компактен.

Инициализируйте вероятности связности Бернулли ρ. Для каждого поколения:

  • Сделайте выборку из N бинарных паттернов связности: θ(1), …, θ(N) ~ Bernoulli(ρ)
  • Создайте по одному экземпляру политики RSNN для каждой выбранной θ.
  • Запустите каждую RSNN в среде.
  • Вычислите эпизодические вознаграждения.
  • Преобразуйте вознаграждения в центрированные ранги.
  • Оцените обновление популяции: g = 1/N Σn R̃(n) (θ(n) − ρ)
  • Примените обновление SATR: ρ ← ρ + η sqrt(ρ ⊙ (1 − ρ)) ⊙ g

Здесь нет обратного распространения ошибки во времени.

Здесь нет суррогатных градиентов.

Здесь нет плотной рекуррентной политики, оптимизируемой с помощью PPO.

Класс политики остается импульсным и бинарным. Оптимизатор просто производит поиск по распределению, которое генерирует полезную рекуррентную связность. Именно это делает SATR-RSNN реальной альтернативой PPO-LSTM, а не просто еще одним рекуррентным бейзлайном обучения с подкреплением. Он атакует проблему с другого направления: не за счет упрощения дифференцирования импульсных сетей, а за счет того, что неградиентный поиск импульсной политики становится достаточно стабильным для конкуренции.

Бинарные сети также заслуживают бинарного выполнения

Алгоритмическая часть объясняет, почему SATR обучается более стабильно. Но преимущество в производительности во время выполнения проистекает из другого наблюдения:

Если и спайки, и связность являются бинарными, мы не должны выполнять их как плотные матрицы с плавающей запятой.

В RSNN, обученной со связностью Бернулли, выбранный паттерн связности является бинарным. Импульсная активность также является бинарной. Это означает, что синаптическая интеграция может быть реализована с использованием побитовых операций вместо стандартного матричного умножения.

Для пресинаптического вектора спайков sₜ и бинарной маски связности mⱼ бинарное скалярное произведение может быть вычислено следующим образом:

где:

Вместо умножения и накопления плотных значений с плавающей запятой реализация упаковывает бинарные векторы в машинные слова и использует операции AND и popcount.

Это не меняет правило обучения. Это не меняет целевую функцию. Это не меняет класс политики.

Это лишь ускоряет выполнение запусков (rollouts).

Это важно, потому что методы на основе популяций проводят большую часть времени, оценивая выбранные политики. Более быстрые запуски напрямую улучшают соотношение между вознаграждением и временем выполнения.

В Humanoid бэкенд на битовых шкалах (bitset) существенно сокращает время выполнения. Например, при размере популяции 8192 время выполнения сокращается с 51 098 секунд для реализации бинарной RSNN без битовых шкал до 18 668 секунд с ускорением на битовых шкалах, что дает ускорение в 2.74 раза. Для протестированных размеров популяции заявленное ускорение составляет примерно от 1.6× до 2.75×.

Именно поэтому финальной системе необходимы оба компонента:

Вместе они превращают поиск рекуррентной импульсной политики в нечто не просто биологически или аппаратно мотивированное, но и практически конкурентоспособное.

Результат: импульсная политика на границе «вознаграждение — время выполнения»

Здесь история с PPO-LSTM возвращается.

Главный результат заключается вовсе не в том, что SATR может обучать рекуррентные импульсные нейронные сети. Главное в том, что неградиентная бинарная импульсная политика способна выйти на границу «вознаграждение — время выполнения», которую PPO-LSTM больше явно не доминирует.

В статье мы сообщаем о результатах на трех бенчмарках непрерывного управления Brax: Humanoid, Hopper и Walker2d. Это не игрушечные задачи. Humanoid, в частности, представляет собой задачу локомоции высокой размерности с 17 степенями свободы, что делает ее отличным тестовым примером для рекуррентного управления. Все методы реализованы на JAX и оценены в Brax по единому протоколу оценки, где финальная производительность измеряется недисконтированным эпизодическим вознаграждением.

Самый важный график — это Рисунок 1: итоговое вознаграждение в зависимости от реального времени обучения (wall-clock time). Ускоренная с помощью битсетов версия нашего метода, обозначенная как SATR-RSNN*, стабильно обеспечивает лучшее соотношение вознаграждения и времени выполнения по сравнению с популяционными бейзлайнами и достигает производительности, конкурентоспособной с PPO-LSTM или превосходящей ее при одинаковом времени обучения.

Это важно, поскольку реальное время (wall-clock time) является правильным критерием сравнения для систем такого рода. Популяционные методы могут оценивать множество политик, но эти оценки прекрасно распараллеливаются и в нашем случае могут использовать бинарное выполнение. PPO-LSTM использует зрелый конвейер обучения на основе градиентов, но опирается на плотные рекуррентные вычисления с плавающей запятой. Вопрос не в том, какой метод выглядит красивее на бумаге. Вопрос в том: при одинаковом времени обучения какой агент достигает лучших результатов управления?

При таком сравнении SATR-RSNN становится серьезной альтернативой.

Сравнение с PPO-LSTM

На Humanoid сравнение особенно наглядно.

В статье PPO-LSTM оценивается в рамках бюджетов с сопоставимым временем выполнения. Запуск PPO-LSTM на 500 тыс. итераций соответствует времени выполнения SATR-RSNN* с размером популяции 4096. Запуск PPO-LSTM на 850 тыс. итераций соответствует времени выполнения SATR-RSNN* с размером популяции 8192. В статье также приведен более длительный запуск PPO-LSTM на 2.2 млн итераций в качестве более сильного базового метода с полным бюджетом.

Вознаграждения для Humanoid составляют примерно:

Таким образом, результат заключается вовсе не в том, что модель PPO-LSTM обучалась недостаточно. В приложении это явно проверяется путем сравнения базовой PPO-LSTM с настроенным результатом PPO, о котором сообщил мейнтейнер Brax для задачи Humanoid — около 11 300 среднего вознаграждения по трем сидам. Запуск PPO-LSTM на 500k уже достигает этого уровня, а более длительное обучение улучшает его еще сильнее. Тем не менее, SATR-RSNN* достигает более высоких показателей вознаграждения при сравнении времени выполнения на задаче Humanoid в равных условиях.

В этом заключается главная мысль блога:

Нам не нужно делать рекуррентные импульсные нейросети похожими на LSTM, чтобы они могли успешно конкурировать с LSTM.

SATR идет по совершенно другому пути. Метод сохраняет политику бинарной и импульсной, избегает обратного распространения ошибки во времени (BPTT), избегает суррогатны градиентов и напрямую оптимизирует распределение выборки. В результате получается рекуррентный импульсный агент, который способен превзойти сильную базовую модель PPO-LSTM при реальном сравнении процессорного времени.

Режим малых популяций — это сценарий, где SATR раскрывается по-настоящему

Результаты для больших популяций важны, но они не являются самыми показательными.

Настоящая проверка — это то, что происходит при сокращении бюджета популяции.

Популяционная оптимизация становится хрупкой, когда популяция мала. Оценка обновления начинает содержать много шума, а зашумленное обновление может сместить распределение связности в неверную сторону. Именно эту проблему сбоев и был призван решить SATR.

На задаче Humanoid разница разительная:

Популяция 128: ES-RSNN: 750 ± 42 EC-RSNN: 765 ± 36 SATR-RSNN: 4,908 ± 32

При размере популяции 512 SATR получает примерно в 1,6 раза больше вознаграждения, чем EC. При размере популяции 128 алгоритм EC фактически терпит крах, в то время как SATR все еще успешно обучает осмысленную политику для Humanoid. Это служит самым весомым эмпирическим доказательством в пользу идеи доверительной области с адаптацией по сигналу.

Если бы SATR улучшал показатели только на больших популяциях, мы могли бы интерпретировать его как лучший оптимизатор в общем смысле. Но тот факт, что он помогает сильнее всего именно при малых популяциях, говорит о более конкретных вещах:

Именно такого поведения мы и добивались.

Тот же паттерн наблюдается на задачах Hopper и Walker2d. Во всех приведенных сравнениях ES / EC / SATR в Таблице 1 SATR достигает наибольших финальных показателей вознаграждения для каждой указанной задачи и каждой настройки популяции.

Дело не просто в хитрости с темпом обучения

Естественная реакция — задаться вопросом, не использует ли SATR просто более консервативный размер шага.

Это не так.

Меньший темп обучения может снизить нестабильность, но он также замедляет обучение при сильном сигнале. Фиксированная доверительная область может помочь, но она вводит еще один гиперпараметр — бюджет KL-дивергенции. Хуже того, оптимальный бюджет KL может меняться в зависимости от размера популяции.

В статье это проверяется напрямую с помощью абляция-теста под названием EC+TR, который добавляет фиксированную по KL доверительную область к базовому алгоритму EC. Это очевидная альтернатива SATR: вместо адаптации доверительной области под сигнал популяции выбирается фиксированный радиус KL и нормализуется обновление.

Результат получается неоднозначным. EC+TR может превосходить EC в некоторых сценариях, но его производительность чувствительна к выбору бюджета KL. Настройка, помогающая при одном размере популяции, ненадежно переносится на другой. При больших бюджетах метод все еще может давать сбои.

SATR позволяет избежать этого, устраняя необходимость в едином фиксированном бюджете KL, который должен работать везде.

На задаче Humanoid абляция показывает следующие результаты:

Популяция 512: EC: 5,462 ± 434 SATR: 8,928 ± 119

Популяция 1024: EC: 7,729 ± 1,028 SATR: 10,520 ± 457

Во всех этих сценариях SATR также превосходит протестированные варианты с фиксированной доверительной областью.

Это важно, поскольку меняет роль доверительной области. SATR не говорит: «Всегда двигайтесь меньше».

Он говорит:

Двигайтесь настолько далеко, насколько это оправдано сигналом популяции.

Это гораздо лучше подходит для популяционного обучения с подкреплением, где надежность обновлений меняется от поколения к поколению.

Выигрыш в производительности достигается за счет серьезного отношения к бинарным вычислениям

SATR улучшает оптимизатор. Бэкенд на битовых шкалах (bitset) улучшает систему.

Необходимо и то, и другое.

При одинаковом размере популяции и числе поколений SATR выполняет столько же запусков (rollouts), сколько и EC. Таким образом, SATR не получает ускорения по реальному времени за счет скрытого уменьшения объема работы. Ускорение достигается за счет изменения способа выполнения бинарной RSNN.

В статье приводится сравнение времени выполнения для Humanoid между бинарной RSNN без битовых шкал и ускоренной с помощью битовых шкал RSNN*:

Популяция 8192: RSNN*: 18,668 секунд RSNN без bitset: 51,098 секунд Ускорение: 2,74×

Для протестированных размеров популяций ускорение с помощью битовых шкал дает примерно в 1,6–2,75 раза более быстрое выполнение эпизодов.

Это имеет значение, поскольку выполнение эпизодов преобладает в популяционном обучении. Каждое поколение требует оценки множества выбранных политик. Если выполнение каждого эпизода политики ускоряется, весь цикл обучения начинает выполняться быстрее.

Общая системная картина выглядит следующим образом:

В статье сообщается, что EC уже обеспечивает ускорение по сравнению с ES благодаря более эффективной популяционной оптимизации. В сочетании с бэкендом на битовых шкалах SATR достигает до 8,9-кратного ускорения по сравнению с ES при сравнении вознаграждения и времени выполнения, а также примерно в 5 раз более быстрого обучения по сравнению с PPO-LSTM при сопоставимом качестве управления.

Именно поэтому данный результат — не просто алгоритмическая победа. Это результат совместного проектирования алгоритма и системы.

SATR делает обновление достаточно стабильным.

Битовые шкалы делают эпизоды достаточно быстрыми.

Вместе они делают рекуррентное импульсное обучение с подкреплением достаточно конкурентоспособным.

Компактный класс политик, а не просто трюк для ускорения обучения

Есть еще одна деталь, которая делает сравнение с PPO-LSTM более интересным: модели имеют сопоставимое число параметров.

В RSNN используется рекуррентный импульсный слой с 256 нейронами и примерно 193 тысячами параметров. Базовая модель PPO-LSTM использует скрытый слой размером 128 и около 191 тысячи параметров. Таким образом, сравнение идет не между огромной импульсной моделью и крошечной LSTM. Размеры рекуррентных политик намеренно поддерживаются сопоставимыми.

Но требования к памяти и вычислениям выглядят совершенно иначе.

Политика SATR-RSNN* использует бинарную связность и бинарные импульсы, что дает компактное 1-битное представление с объемом модели около 24 КБ в таблице архитектур из статьи. Базовая модель PPO-LSTM использует параметры FP32 и плотные матричные умножения, занимая около 764 КБ.

Это означает, что SATR-RSNN работает быстрее не только благодаря оптимизации реализации. Она использует иной вычислительный режим:

SATR-RSNN*: бинарные импульсы бинарная связность побитовое И + подсчет единичных бит (popcount)

Именно такая разница имеет значение при развертывании на периферийных устройствах (edge devices) и нейроморфном железе.

Энергоэффективность выглядит многообещающе, но действовать нужно осторожно

Статья также включает аналитическую оценку энергопотребления нейроморфных систем с использованием опубликованных данных об энергии операций чипа Loihi.

Для задачи Humanoid расчетное энергопотребление на кристалле для обучения RSNN на базе SATR варьируется примерно от 5,7 кДж до 45,6 кДж в зависимости от размера популяции. Измеренное энергопотребление графического процессора при обучении PPO-LSTM заявлено на уровне 18,4 МДж. Это указывает на потенциальное снижение энергопотребления в сотни и тысячи раз.

Тем не менее, к этим данным следует относиться с осторожностью.

Это аналитические оценки, а не прямые измерения на нейроморфном оборудовании. В статье прямо указано на это ограничение. Полученные цифры полезны для понимания возможного преимущества разреженных вычислений на основе событий по порядку величины, но реальные показатели энергии и задержки необходимо проверить на настоящих нейроморфных аппаратных платформах.

Таким образом, честная версия звучит так:

SATR-RSNN обладает правильной вычислительной структурой для значительного снижения энергопотребления, однако измерения на оборудовании — это задача на будущее.

Тем не менее, это весомый результат. Дело не в том, что вопрос энергопотребления решен полностью. Дело в том, что SATR предоставляет метод обучения RSNN, производительность которого наконец-то стала достаточно высокой, чтобы задать вопрос об оборудовании со всей серьезностью.

Читайте полную версию статьи

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в НевадеПресса
Tesla

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в Неваде

Ещё от Sapient Intelligence

PRAXIST: автоисследования, созданные для продакшна
Sapient Intelligence

PRAXIST: автоисследования, созданные для продакшна

Что такое латентное пространство?
Sapient Intelligence

Что такое латентное пространство?

Форма вычисления: геометрический взгляд на арифметику: Часть 1
Sapient Intelligence

Форма вычисления: геометрический взгляд на арифметику: Часть 1