Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Pobeda nad ppo lstm bez obratnogo rasprostraneniya kak adaptivnye k signalu dove
Dev48

© 2026 · All rights reserved.

Победа над PPO-LSTM без обратного распространения: как адаптивные к сигналу доверительные области превращают бинарный поиск импульсной политики в быструю и стабильную альтернативу для непрерывного управления

Источник: Sapient Intelligence

Победа над PPO-LSTM без обратного распространения: как адаптивные к сигналу доверительные области превращают бинарный поиск импульсной политики в быструю и стабильную альтернативу для непрерывного управления

Источник: Sapient Intelligence

Inside a new mathematical approach that achieves high sample efficiency for control tasks using binary spiking networks.

29 сентября 2026 г.•Обновлено: 29 сентября 2026 г.

Обзор

PPO-LSTM давно является одной из самых надежных базовых моделей для рекуррентного усилительного обучения. Он стабилен, хорошо изучен и достаточно силен, чтобы решать высокодименсиональные задачи непрерывного управления, такие как Humanoid, Hopper и Walker2d.

Итак, вот неожиданный результат: рекуррентная импульсная нейронная сеть, обученная без обратного распространения во времени и без суррогатных градиентов, может соответствовать или превосходить PPO-LSTM при сопоставимых бюджетах обучения по времени.

Это основная идея Signal-Adaptive Trust Regions, или SATR. Вместо обучения рекуррентной импульсной политики путем дифференциации через недифференцируемую динамику импульсов SATR выбирает другой путь: он рассматривает импульсную сеть как черный ящик и оптимизирует распределение над бинарной рекуррентной связностью.

Результат — это не просто биологически вдохновленная политика, которая работает в игрушечных средах. На высокодименсиональных эталонных задачах управления Brax SATR-RSNN достигает конкурентных или более высоких конечных значений вознаграждения, чем PPO-LSTM при сопоставимом времени выполнения, сохраняя при этом преимущества, которые делают импульсные сети привлекательными в первую очередь: бинарные события, разреженная вычислительная мощность и удобство выполнения на аппаратном уровне.

На Humanoid, например, время выполнения обученных моделей PPO-LSTM составляет примерно 11,3–12,4 тыс. единиц вознаграждения, в то время как SATR-RSNN* достигает примерно 13,1–13,9 тыс., в зависимости от размера популяции. В статье также сообщается, что SATR обеспечивает примерно в 5 раз более быстрое обучение, чем PPO-LSTM при сопоставимой эффективности управления, и до 8,9 раз более высокую скорость по сравнению с ES в сравнении вознаграждения и времени выполнения.

Это вызывает вопрос: как бинарная импульсная политика без градиентов может вообще конкурировать с PPO-LSTM? Ответ заключается в том, что SATR устраняет основной режим сбоя обучения популяционных RSNN. Популяционные методы привлекательны, потому что они избегают обратного распространения через импульсы, но их оценки обновлений могут быть шумными, особенно когда размер популяции невелик. Шумное обновление может сдвинуть все распределение выборки слишком далеко, вызывая резкие изменения в поведении сети и нестабильное обучение.

SATR решает эту проблему с помощью простого принципа: доверяйте сигналу популяции только столько, сколько он заслуживает. Когда обновление популяции сильное и согласованное, SATR позволяет сделать больший шаг распределения. Когда обновление слабое или доминируется шумом, SATR автоматически сжимает доверительную область. В сочетании с реализацией с использованием битового набора, которая использует бинарные импульсы и бинарные веса, это превращает поиск рекуррентной импульсной политики в практическую альтернативу PPO-LSTM.

Альтернатива: оптимизируйте распределение, а не сеть

Чтобы достичь этого, мы сделали один ключевой дизайнерский выбор:

Перестаньте пытаться выполнять обратное распространение через импульсную сеть.

Вместо того, чтобы рассматривать рекуррентное импульсное усилательное обучение как дифференцируемую задачу моделирования последовательностей, SATR рассматривает RSNN как черный ящик политики. Кандидатная сеть выбирается, развертывается в среде, ранжируется по вознаграждению, а затем используется для обновления распределения, которое ее произвело.

Это меняет задачу обучения с: Как нам дифференцировать через импульсы и рекуррентную мембранную динамику?

на: Как нам эффективно искать бинарные рекуррентные импульсные политики?

Это изменение важно, потому что RSNN естественно бинарны и основаны на событиях. Импульсы бинарны. Связность может быть бинарной. Политика не должна быть сделана гладкой только для удовлетворения алгоритма обучения.

Отправной точкой является Evolving Connectivity, или EC. В EC каждая возможная синапса представлена как Бернулли-случайная переменная:

θᵢ ~ Bernoulli(ρᵢ)

Здесь θᵢ — это выбранное бинарное соединение, а ρᵢ — вероятность того, что соединение существует.

Обучение не оптимизирует напрямую одну фиксированную сеть. Вместо этого оно оптимизирует вектор вероятностей ρ. На каждом поколении мы выбираем популяцию бинарных RSNN из этого Бернулли-распределения, оцениваем их и обновляем ρ так, чтобы высокопроизводительные паттерны связности становились более вероятными.

Цикл прост:

Это хорошее соответствие для импульсного управления, потому что оно полностью избегает обратного распространения во времени. Нет суррогатных градиентов, нет дифференциации через импульсные события и нет необходимости хранить длинные рекуррентные вычислительные графы.

Но EC также выявляет центральную проблему, которую SATR предназначен решить.

Настоящий узкий момент: шумные обновления популяции

Обучение на основе популяции звучит просто, но оно сильно зависит от качества сигнала популяции.

При бесконечной популяции направление обновления было бы надежным. На практике популяция конечна. Иногда очень конечна.

Это означает, что оценка обновления может быть шумной. Несколько удачных или неудачных выборок могут сдвинуть распределение поиска в неправильном направлении. Это становится особенно вредоносным в высокодименсиональных задачах управления, где каждый разверток дорог и бюджет популяции не может быть увеличен без ограничений.

Для RSNN, обученных с использованием Бернулли-связности, проблема еще более остра. Оптимизатор не просто изменяет вектор весов. Он изменяет распределение выборки над бинарными сетями.

Плохое обновление не просто нарушает одну политику. Оно меняет, какие политики будут выбраны в следующий раз.

Именно здесь геометрия Бернулли-распределений становится важной. Когда Бернулли-вероятность ρᵢ близка к 0,5, ее небольшое изменение обычно безопасно. Но когда ρᵢ близка к 0 или 1, то же численное изменение может представлять собой гораздо большее движение в пространстве распределения.

Для Бернулли-переменной информация Фишера равна:

F(ρᵢ) = 1 / [ρᵢ(1 − ρᵢ)]

По мере приближения ρᵢ к 0 или 1, знаменатель стремится к нулю. Местная кривизна становится большой. В терминах KL-расхождения распределение становится очень чувствительным вблизи границ.

Таким образом, режим сбоя выглядит следующим образом:

Вот почему простого использования популяционного метода недостаточно. Нам нужен способ контролировать, насколько далеко смещается распределение выборки.

Но фиксированная доверительная область также не идеальна.

Почему фиксированная доверительная область недостаточна

Естественное решение — позаимствовать идею доверительной области из оптимизации политики.

В методах, таких как TRPO, мы ограничиваем KL-расхождение между старой и новой политикой, чтобы одно обновление не могло изменить поведение слишком резко. SATR использует ту же философию, но применяет ее к другому объекту:

распределению над выбранными связностями RSNN.

Иными словами, SATR не спрашивает:

Насколько далеко сдвинулась политика действий?

Он спрашивает:

Насколько далеко сдвинулось распределение выборки над бинарными сетями?

Изменение распределения измеряется следующим образом:

D_KL(p_ρ || p_ρ′)

где p_ρ — текущее распределение Бернулли-связности, а p_ρ′ — обновленное распределение.

Фиксированный бюджет KL говорил бы:

Каждому поколению разрешено двигаться на одинаковое расстояние.

Но обучение на основе популяции работает не так. Некоторые поколения производят сильный, согласованный сигнал. Другие поколения в основном состоят из шума. Рассматривать их одинаково — это неправильный предубежденный подход.

Когда сигнал сильный, фиксированная доверительная область может быть слишком консервативной. Когда сигнал слабый, та же доверительная область может быть слишком permissive.

SATR заменяет этот фиксированный бюджет на адаптивный к сигналу бюджет.

Правило таково:

Сила сигнала измеряется квадратичной нормой оценки обновления популяции: E = ||g||²

Здесь g вычисляется на основе выборочных шаблонов связности и их нормализованных по центру ранговых возвращений.

Это дает основную идею SATR:

Трастовая область должна масштабироваться в зависимости от количества полезного сигнала в обновлении популяции.

Это основное алгоритмическое отличие. SATR — это не просто меньшая скорость обучения и не просто фиксированное ограничение KL. Он адаптирует допустимое движение распределения поколение за поколением.

SATR для бермуллианской связности

Для бермуллианской связности обновление SATR становится особенно чистым.

Локальная аппроксимация KL для факторизованного бермуллианского распределения имеет вид:

Это уравнение показывает, почему обычные обновления EC могут быть нестабильными вблизи границ. Если ρᵢ близко к 0 или 1, то ρᵢ(1 − ρᵢ) очень мало, поэтому даже небольшое Δρᵢ может создать большое смещение KL.

SATR исправляет это, масштабируя каждую координату на квадратный корень из дисперсии Бернулли:

Δρ = η sqrt(ρ ⊙ (1 − ρ)) ⊙ g

где:

Это обновление имеет два полезных эффекта.

Во-первых, оно учитывает границы. Когда ρᵢ близко к 0 или 1, фактор sqrt(ρᵢ(1 − ρᵢ)) становится маленьким. Обновление автоматически замедляется вблизи детерминированных решений о связности.

Во-вторых, оно адаптируется к сигналу. Подставив обновление в локальную аппроксимацию KL, получим:

D_KL(p_ρ || p_ρ+Δρ) ≈ η² / 2 · ||g||²

Таким образом, движение KL пропорционально энергии сигнала. Если обновление популяции слабое, SATR движется консервативно. Если обновление популяции сильное, SATR позволяет сделать больший шаг.

Это весь метод в одной строке:

ρ ← ρ + η sqrt(ρ ⊙ (1 − ρ)) ⊙ g

Этот один масштабный коэффициент делает большую часть работы. Он предотвращает взрывы KL, вызванные границами, и заставляет трастовую область реагировать на реальный сигнал популяции.

Абляция, приведенная в статье, подтверждает этот дизайн. Вариант EC+TR с фиксированным KL может улучшить результаты EC в некоторых настройках, но его лучший бюджет KL меняется в зависимости от размера популяции. SATR гораздо менее чувствителен, потому что он не полагается на один фиксированный радиус KL, работающий везде. На Humanoid SATR превосходит EC и протестированные варианты с фиксированной трастовой областью для размеров популяции 256, 512 и 1024.

Цикл обучения

Получившийся алгоритм обучения компактен.

Инициализируйте вероятности бермуллианской связности ρ. Для каждого поколения:

  • Выберите N бинарных шаблонов связности: θ(1), …, θ(N) ~ Bernoulli(ρ)
  • Создайте одну политику RSNN из каждого выбранного θ.
  • Запустите каждый RSNN в среде.
  • Вычислите эпизодические возвращения.
  • Преобразуйте возвращения в центрированные ранги.
  • Оцените обновление популяции: g = 1/N Σn R̃(n) (θ(n) − ρ)
  • Примените обновление SATR: ρ ← ρ + η sqrt(ρ ⊙ (1 − ρ)) ⊙ g

Нет обратного распространения во времени.

Нет суррогатных градиентов.

Нет плотной рекуррентной политики, оптимизируемой PPO.

Класс политики остается спайковым и бинарным. Оптимизатор просто ищет распределение, которое генерирует полезную рекуррентную связность. Это то, что делает SATR-RSNN реальной альтернативой PPO-LSTM, а не просто еще одной рекуррентной базовой линией RL. Он решает проблему с другого направления: не делая спайковые сети легче дифференцируемыми, а делая поиск градиентной бинарной спайковой политики достаточно стабильным, чтобы конкурировать.

Бинарные сети также заслуживают бинарного выполнения

Алгоритмическая часть объясняет, почему SATR обучается более стабильно. Но преимущество во времени выполнения связано с другим наблюдением:

Если и спайки, и связность являются бинарными, мы не должны выполнять их как плотные плавающие точки матрицы.

В RSNN, обученном с бермуллианской связностью, выбранный шаблон связности является бинарным. Спайковая активность также является бинарной. Это означает, что синаптическая интеграция может быть реализована с помощью битовых операций вместо стандартного умножения матриц.

Для вектора пресинаптических спайков sₜ и бинарной маски связности mⱼ бинарное скалярное произведение может быть вычислено как:

где:

Вместо умножения и накопления плотных плавающих точек значения реализации упаковывают бинарные векторы в машинные слова и используют AND + popcount.

Это не меняет правило обучения. Это не меняет цель. Это не меняет класс политики.

Это только ускоряет выполнение роллов.

Это важно, потому что методы, основанные на популяции, тратят большую часть своего времени на оценку выбранных политик. Более быстрое выполнение роллов напрямую улучшает соотношение награды и времени выполнения.

На Humanoid битовое ядро существенно сокращает время выполнения. Например, при размере популяции 8192 время выполнения снижается с 51 098 секунд для не битовой бинарной реализации RSNN до 18 668 секунд с битовой ускорительной реализацией, что составляет ускорение в 2,74 раза. Для протестированных размеров популяции ускорение составляет от примерно 1,6 до 2,75 раза.

Вот почему конечная система нуждается в обоих компонентах:

Вместе они превращают поиск рекуррентной спайковой политики в что-то, что не только биологически или аппаратно мотивировано, но и практически конкурентоспособно.

Результат: спайковая политика на границе награды и времени выполнения

Именно здесь история PPO-LSTM возвращается.

Главный результат заключается не просто в том, что SATR может обучать рекуррентные спайковые нейронные сети. Главный результат заключается в том, что градиентная бинарная спайковая политика может выйти на границу награды и времени выполнения, на которой PPO-LSTM больше не доминирует явно.

В статье мы приводим результаты на трех бенчмарках непрерывного управления Brax: Humanoid, Hopper и Walker2d. Это не игрушечные задачи. Humanoid, в частности, является высокодиментсиональной задачей по ходьбе с 17 степенями свободы, что делает ее сильным тестовым случаем для рекуррентного управления. Все методы реализованы в JAX и оценены с помощью Brax в соответствии с единым протоколом оценки, при этом конечная производительность измеряется недисконтированным эпизодическим возвращением.

Самая важная диаграмма — это Рисунок 1: конечное возвращение в зависимости от общего времени обучения по стене часов. Ускоренная битовая версия нашего метода, обозначенная как SATR-RSNN*, последовательно достигает лучшего соотношения награды и времени выполнения по сравнению с базовыми методами, основанными на популяции, и достигает производительности, конкурентоспособной или выше PPO-LSTM при одинаковом времени обучения.

Это важно, потому что время по стене часов — это правильное сравнение для такого рода системы. Методы, основанные на популяции, могут оценивать много политик, но эти оценки легко параллельны и, в нашем случае, могут использовать бинарное выполнение. PPO-LSTM использует зрелую градиентную обучающую трубку, но он полагается на плотные плавающие точки рекуррентных вычислений. Вопрос не в том, какой метод выглядит чище на бумаге. Вопрос в том: при одинаковом времени обучения, какой агент достигает лучшей производительности управления?

В этом сравнении SATR-RSNN становится серьезной альтернативой.

Против PPO-LSTM

На Humanoid сравнение особенно ясно.

В статье PPO-LSTM оценивается при бюджете, соответствующем времени выполнения. Запуск PPO-LSTM с 500 000 итерациями соответствует времени выполнения SATR-RSNN* с размером популяции 4096. Запуск PPO-LSTM с 850 000 итерациями соответствует времени выполнения SATR-RSNN* с размером популяции 8192. В статье также приведен более длительный запуск PPO-LSTM с 2,2 миллиона итерациями в качестве более сильного базового варианта с полным бюджетом.

Возвращения на Humanoid примерно равны:

Так что результат не в том, что PPO-LSTM был недостаточно обучен. В приложении это прямо проверяется сравнением базовой линии PPO-LSTM с настроенным результатом PPO, сообщённым сопровождающим Brax на задаче Humanoid, около 11 300 средней возврата за три сида. Запуск PPO-LSTM на 500 k уже достигает этого уровня, а более длительное обучение улучшает его дальше. Даже тогда SATR-RSNN* достигает более высокой отдачи в сравнениях Humanoid с совпадающим временем выполнения.

Это основное сообщение блога:

Нам не нужно делать рекуррентные спайковые сети похожими на LSTM, чтобы сделать их конкурентоспособными по отношению к LSTM.

SATR выбирает противоположный путь. Он сохраняет политику бинарной и спайковой, избегает обратного распространения во времени, избегает суррогатных градиентов и напрямую оптимизирует распределение выборки. Результатом является рекуррентный спайковый агент, который может превзойти сильную базовую линию PPO-LSTM в сравнении по wall-clock, которое действительно важно.

Режим малой популяции — там, где SATR действительно проявляет себя

Результаты для большой популяции важны, но они не являются наиболее диагностическими.

Настоящий тест — что происходит, когда бюджет популяции сокращается.

Оптимизация на основе популяции становится хрупкой, когда популяция мала. Оценка обновления становится шумной, а шумное обновление может сдвинуть распределение связности в нежелательном направлении. Это именно тот режим отказа, для исправления которого был разработан SATR.

На Humanoid разница драматична:

Популяция 128: ES-RSNN: 750 ± 42 EC-RSNN: 765 ± 36 SATR-RSNN: 4 908 ± 32

При размере популяции 512 SATR достигает примерно 1,6× доходности EC. При размере популяции 128 EC фактически рушится, тогда как SATR всё ещё обучает осмысленную политику Humanoid. Это самое сильное эмпирическое подтверждение идеи сигнально-адаптивного доверительного региона.

Если бы SATR улучшал только производительность при большой популяции, мы могли бы рассматривать его как лучший оптимизатор в общем смысле. Но тот факт, что он наиболее полезен при малой популяции, рассказывает более конкретную историю:

Это именно то поведение, которого мы хотели.

Тот же паттерн наблюдается на Hopper и Walker2d. По всем сравнениям ES / EC / SATR, приведённым в таблице 1, SATR достигает наивысшей конечной отдачи для каждой перечисленной задачи и настройки популяции.

Это не просто трюк с learning rate

Естественная реакция — спросить, не использует ли SATR просто более консервативный размер шага.

Это не так.

Меньший learning rate может уменьшить нестабильность, но также замедляет обучение, когда сигнал сильный. Фиксированный trust region может помочь, но вводит ещё один гиперпараметр: бюджет KL. Хуже того, оптимальный бюджет KL может меняться в зависимости от размера популяции.

В статье это проверяется напрямую с помощью ablation под названием EC+TR, который добавляет фиксированный trust region с KL к базовой линии EC. Это очевидная альтернатива SATR: вместо адаптации trust region к сигналу популяции выбирается фиксированный радиус KL и нормализуется обновление.

Результат смешанный. EC+TR может улучшить результаты по сравнению с EC в некоторых настройках, но его производительность чувствительна к выбору бюджета KL. Настройка, которая помогает при одном размере популяции, не надёжно переносится на другой. При больших бюджетах метод всё ещё может рухнуть.

SATR избегает этого, устраняя необходимость в одном фиксированном бюджете KL, который работал бы везде.

На Humanoid ablation показывает:

Популяция 512: EC: 5 462 ± 434 SATR: 8 928 ± 119

Популяция 1024: EC: 7 729 ± 1 028 SATR: 10 520 ± 457

Во всех этих настройках SATR также превосходит протестированные варианты с фиксированным trust region.

Это важно, потому что меняет роль trust region. SATR не говорит: Всегда двигайтесь меньше.

Он говорит:

Двигайтесь настолько далеко, насколько это оправдано сигналом популяции.

Это гораздо лучше подходит для RL на основе популяции, где надёжность обновления меняется от поколения к поколению.

Выигрыш во времени выполнения возникает из-за серьёзного отношения к бинарным вычислениям

SATR улучшает оптимизатор. Бэкенд на основе битов улучшает систему.

Оба нужны.

При одинаковом размере популяции и числе поколений SATR оценивает такое же количество rolloutов, как EC. Таким образом, SATR не получает ускорения по wall-clock тайком выполняя меньше работы. Ускорение возникает из-за изменения способа выполнения бинарного RSNN.

В статье приводится сравнение времени выполнения на Humanoid между бинарным RSNN без битов и бинарным RSNN* с ускорением через биты:

Популяция 8192: RSNN*: 18 668 секунд RSNN без битов: 51 098 секунд Ускорение: 2,74×

По протестированным размерам популяции ускорение через биты обеспечивает примерно 1,6×–2,75× более быстрое выполнение rollout.

Это важно, потому что выполнение rollout доминирует в обучении на основе популяции. Каждое поколение требует оценки множества образцовых политик. Если каждый rollout политики становится быстрее, весь цикл обучения ускоряется.

Более широкая картина на уровне системы выглядит так:

В статье говорится, что EC уже обеспечивает ускорение по сравнению с ES благодаря более эффективной оптимизации на основе популяции. В сочетании с бэкендом на основе битов SATR достигает до 8,9× ускорения по сравнению с ES в сравнении reward–runtime и примерно в 5 раз более быстрого обучения по сравнению с PPO-LSTM при сопоставимой производительности управления.

Это объясняет, почему результат больше, чем просто алгоритмическая победа. Это результат совместного проектирования алгоритма и системы.

SATR делает обновление достаточно стабильным.

Биты делают rollout достаточно быстрыми.

Вместе они делают рекуррентный спайковый RL достаточно конкурентоспособным.

Компактный класс политики, а не просто трюк для быстрого обучения

Есть ещё один деталь, которая делает сравнение с PPO-LSTM более интересным: модели подобраны по количеству параметров.

RSNN использует рекуррентный спайковый слой с 256 нейронами и примерно 193K параметров. Базовая линия PPO-LSTM использует скрытый размер 128 и примерно 191K параметров. Таким образом, сравнение не происходит между огромной спайковой моделью и крошечным LSTM. Размеры рекуррентной политики намеренно сделаны сопоставимыми.

Но хранилище и вычисления выглядят очень по-разному.

Политика SATR-RSNN* использует бинарную связность и бинарные спайки, обеспечивая компактное представление в 1 бит с объёмом модели около 24 КБ в таблице архитектуры статьи. Базовая линия PPO-LSTM использует параметры FP32 и плотные умножения матриц, с объёмом около 764 КБ.

Это означает, что SATR-RSNN быстрее не только благодаря настройке реализации. Он использует иной вычислительный режим:

SATR-RSNN*: бинарные спайки бинарная связность побитовое AND + popcount

Это именно тот вид различий, который имеет значение для развертывания на периферийных устройствах и нейроморфном железе.

Энергетическая история многообещающая, но нужно быть осторожным

В статье также включена аналитическая оценка потребления энергии нейроморфного чипа на основе опубликованных данных о потреблении операций Loihi.

Для Humanoid estimated on-chip энергия для обучения RSNN на основе SATR составляет от примерно 5,7 кДж до 45,6 кДж в зависимости от размера популяции. Измеренная энергия GPU для обучения PPO-LSTM составляет 18,4 МДж. Это указывает на потенциальное снижение энергопотребления на порядки сотен до тысяч раз.

Но это следует формулировать осторожно

Это аналитические оценки, а не прямые измерения на нейроморфном оборудовании. В статье четко указано это ограничение. Эти цифры полезны для понимания возможного порядкового преимущества разреженной событийно-ориентированной вычислительной системы, но фактическая энергия и задержка должны быть подтверждены на реальных нейроморфных системах.

Таким образом, честный вариант таков:

SATR-RSNN обладает правильной вычислительной структурой для значительного снижения энергопотребления, но измерения на оборудовании все еще являются задачей будущего.

Это все еще убедительная история. Суть не в том, что проблема энергии полностью решена. Суть в том, что SATR дает нам метод обучения RSNN, чья производительность наконец-то достаточно высока, чтобы сделать вопрос о оборудовании достойным серьезного рассмотрения.

Прочитайте полную статью

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведениемПресса
OpenAI

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведением

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языковПресса
ElevenLabs

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языков

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИПресса
Amazon

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИ

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов
LangChain

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое
LangChain

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое

Ещё от Sapient Intelligence

PRAXIST: Автономные исследования, созданные для производства
Sapient Intelligence

PRAXIST: Автономные исследования, созданные для производства

Что такое латентное пространство?
Sapient Intelligence

Что такое латентное пространство?

Форма вычисления: геометрический взгляд на арифметику: Часть 1
Sapient Intelligence

Форма вычисления: геометрический взгляд на арифметику: Часть 1

Форма вычисления: геометрический взгляд на арифметику: Часть 1
Sapient Intelligence

Форма вычисления: геометрический взгляд на арифметику: Часть 1

PRAXIST: автоисследования, созданные для продакшна
Sapient Intelligence

PRAXIST: автоисследования, созданные для продакшна