Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Tehnicheskiy otchet sensenova u15 na puti k nativnoy unifitsirovannoy vizualnoy
Dev48

© 2026 · All rights reserved.

Технический отчет SenseNova U1.5: на пути к нативной унифицированной визуальной интеллектуальности

Фото: Lenzatic (Pixabay) — https://pixabay.com/photos/antelope-canyon-arizona-canyon-8045244/

Технический отчет SenseNova U1.5: на пути к нативной унифицированной визуальной интеллектуальности

Источник: SenseTime

Мы представили SenseNova U1.5, нативно унифицированную мультимодальную модель, построенную на архитектуре 8B-MoT, которая способна понимать, анализировать и генерировать визуальный контент без использования внешних визуальных энкодеров или вариационных автокодировщиков (VAE). Мы улучшили…

28 сентября 2026 г.•Обновлено: 28 сентября 2026 г.

SenseTimeSenseTime2026/09/1750

Мы представляем SenseNova U1.5, нативно унифицированную мультимодальную модель, построенную на архитектуре 8B-MoT, которая понимает, анализирует и генерирует визуальный контент без использования внешних визуальных энкодеров или вариационных автокодировщиков (VAE). Мы улучшили визуальный интерфейс с помощью подхода реконструкции, который сохраняет пространственную согласованность между фрагментами изображения, а также масштабировали обучение с использованием отобранных данных для генерации и редактирования, улучшенного моделирования задач, структурированного дополнения промптов и обучения при нативном разрешении до 4K. В процессе пост-обучения мы отдельно оптимизировали специалистов по визуальной эстетике, двуязычному рендерингу текста, созданию инфографики и редактированию изображений, а затем интегрировали их возможности с помощью многоэкспертной дистилляции on-policy.

Комплексные оценки показывают, что SenseNova U1.5 демонстрирует значительный прогресс в точности воспроизведения изображений, рендеринге текста, сложных композициях, редактировании изображений с несколькими референсами и чередующейся генерации, одновременно улучшая следование инструкциям и поддерживая согласованность идентичности объектов, геометрической структуры и нередактируемых областей. Несмотря на ограниченный охват структурированных форматов в данных для обучения генерации, модель эффективно обобщает длинные и сложные структурированные визуальные инструкции, дополнительно доказывая, что мультимодальное понимание может переноситься на визуальное планирование и создание.

Эти результаты показывают, что нативное унифицированное моделирование открывает перспективный путь к сквозным системам, объединяющим восприятие, рассуждение и создание. Мы откроем исходный код обучения, включая контролируемую донастройку, обучение с подкреплением и on-policy дистилляцию. Код и дополнительная информация о модели: https://www.sensenova.cn/

Обзор оценки SenseNova U1.5

Рисунок 1. Примеры генерации инфографики и людей с помощью SenseNova U1.5.

Рисунок 2. Примеры редактирования изображений и генерации изображений с несколькими референсами с помощью SenseNova U1.5.

1 Введение

В последние годы визуальная генерация быстро вышла за рамки традиционного синтеза изображений, став универсальным средством визуального творчества. Теперь она охватывает многоязычную типографику и верстку, насыщенный информацией дизайн, рендеринг высокого разрешения, композицию изображений с несколькими референсами, тонкое редактирование объектов и фона, а также чередующуюся генерацию. Однако это расширение выявило фундаментальный архитектурный разрыв: большинство систем воспринимают изображения через предварительно обученные визуальные энкодеры (VE), но генерируют их через вариационные автокодировщики (VAE). В результате понимание и генерация работают в разных пространствах представлений — первое оптимизировано для семантической абстракции, а второе — для точности на уровне пикселей. Хотя это разделение эффективно, оно ограничивает возможности бесшовной совместной работы восприятия, рассуждения и генерации в рамках единой визуальной структуры для различных форм визуального творчества.

Нативное унифицированное моделирование использует другой подход, обучаясь непосредственно на пикселях и тексте. SenseNova U1 продемонстрировала жизнеспособность этой парадигмы с помощью своей архитектуры NEO-unify, которая не полагается на внешние энкодеры или VAE и объединяет восприятие, рассуждение и генерацию в пиксельном пространстве в единую сквозную модель. Однако ее намеренно облегченный визуальный интерфейс реконструирует каждый визуальный токен как независимый фрагмент изображения RGB. Несмотря на эффективность, этот факторизованный подход препятствует обмену информацией между соседними фрагментами на финальной стадии формирования изображения, из-за чего швы, разрывы текстур и геометрические несоответствия становятся все более заметными при высоких разрешениях.

В этой статье представлена SenseNova U1.5, нативно унифицированная мультимодальная модель 8B-MoT для визуального понимания, рассуждения и генерации. Ее первый крупный вклад — фундаментальный архитектурный сдвиг: от предсказания независимых фрагментов изображения к пространственной совместной реконструкции. Вместо того чтобы сопоставлять каждый визуальный токен с пикселями изолированно, мы проецируем токены в двумерное поле признаков и постепенно реконструируем изображение с помощью пространственных сверток и апсемплинга Pixel Shuffle. Это позволяет соседним областям обмениваться информацией до того, как пиксели будут окончательно сформированы, совместно определяя цвет, текстуру и геометрическую структуру вместо обработки каждого фрагмента по отдельности. Полученная конструкция сохраняет эффективность компактной визуальной последовательности, существенно улучшая пространственную согласованность и поддерживая нативную генерацию при разрешении до 4K.

Второе крупное достижение — переход от совместной оптимизации вознаграждения к стратегии «сначала специализация, затем унификация». Визуальное творчество охватывает принципиально разные возможности, включая генерацию изображений для визуальной эстетики, двуязычный рендеринг текста, дизайн инфографики и редактирование изображений. Каждая возможность включает в себя различные сигналы вознаграждения, динамику траектории выборки и проблемы оптимизации. Совместная оптимизация этих возможностей в рамках одной политики может привести к запутыванию конкурирующих целей и снижению эффективности конкретных задач. Поэтому мы сначала специализируемся, а затем унифицируем: для каждой возможности мы отдельно оптимизируем специализированных экспертов по обучению с подкреплением (RL), используя адаптированные данные, вознаграждения, стратегии выборки и методы регуляризации, а затем интегрируем их взаимодополняющие сильные стороны с помощью многоэкспертной on-policy дистилляции. Эта дистилляция выполняется вдоль собственных траекторий генерации модели-студента, сохраняя взаимодополняющие сильные стороны экспертов при переносе их возможностей в единую политику.

Обширные оценки дополнительно показывают, что единое нативное визуальное представление может служить общей основой для понимания, рассуждения, генерации и редактирования — без параллельных путей визуальной обработки или многократного преобразования между признаками энкодера и латентными переменными VAE. Хотя каждая область 32×3 пикселя сжимается в один визуальный токен, это компактное представление по-прежнему поддерживает эффективный вывод, обеспечивая высокую производительность в точности воспроизведения изображений, двуязычной верстке текста, сложных композициях, редактировании изображений с несколькими референсами, чередующейся генерации, следовании инструкциям, сохранении визуального контента и тонком контроле. Более примечательно, что, несмотря на ограниченную опору на фиксированные шаблоны генерации во время обучения, SenseNova U1.5 обобщает более длинные, композиционные и высокоструктурированные визуальные инструкции. Это говорит о том, что структурные знания и способности к планированию, приобретенные благодаря мультимодальному пониманию и рассуждению, могут естественным образом переноситься на визуальное творчество. В совокупности эти результаты показывают, что нативная унификация — это нечто большее, чем архитектурное упрощение: компактное, общее визуальное представление может эффективно поддерживать как «видение», так и «созидание», позволяя возможностям, изученным через одну форму визуального интеллекта, усиливать другую.

2 Сопутствующие работы

2.1 Нативная унификация данных генерации изображений в мультимодальных моделях

Нативные визуально-языковые модели (VLM) обрабатывают визуальные входные данные напрямую, без использования внешних энкодеров. Такие модели, как Fuyu-8B, EVE, Mono-InternVL, NEO, Gemma4-12B и Inkling, неуклонно сокращают разрыв в производительности с ведущими модульными VLM. Параллельная тенденция наметилась в области визуальной генерации: в недавних исследованиях пикселы моделируются напрямую, что доказывает отсутствие необходимости в высоко сжатых латентных пространствах для высокоточной генерации. Опираясь на эти достижения, все больше нативных унифицированных мультимодальных моделей стремятся объединить понимание и генерацию в рамках единой архитектуры. Дискретные нативные модели унифицируют мультимодальное обучение посредством авторегрессии на уровне токенов, в то время как непрерывные нативные подходы исследуют сквозное моделирование без явных токенайзеров или латентных «узких мест». Опираясь на NEO-unify, наша серия SenseNova-U развивает это направление в сторону полностью нативной базовой архитектуры, в которой понимание, рассуждение и генерация возникают из общей визуальной основы.

2.2 Обучение с подкреплением для диффузионных моделей

В языковом моделировании обучение с подкреплением на основе отзывов человека (RLHF) сформировало общую парадигму пострефлексивного обучения, в которой выученные награды направляют оптимизацию стратегии, а PPO обеспечивает стабильные обновления относительно опорной стратегии. Примечательно, что GRPO и DAPO повышают эффективность и масштабируемость за счет отказа от явной модели ценности, внедрения внутригрупповых относительных преимуществ и перехода к улучшенным стратегиям онлайн-оптимизации. Онлайн-обучение с подкреплением также получило распространение в визуальной генерации: ReFL, DDPO и DPOK оптимизируют диффузионные модели с использованием наград на основе предпочтений или градиентов стратегии, в то время как AlignProp и D3PO повышают эффективность и снижают зависимость от явных моделей наград. Совсем недавно Flow-GRPO и DanceGRPO распространили внутригрупповую относительную оптимизацию на диффузионные модели и модели сопоставления потоков (flow-matching), улучшив согласование предпочтений, композиционную точность, отрисовку текста и визуальное качество.

Для моделей сопоставления потоков онлайн-обучение с подкреплением должно обеспечивать стохастическое исследование помимо детерминированного вывода с помощью обыкновенных дифференциальных уравнений (ОДУ). Flow-GRPO обеспечивает такое исследование посредством выборки траекторий на основе стохастических дифференциальных уравнений (СДУ). Выборка с сохранением коэффициентов (CPS) и Precise улучшают малоголевую выборку за счет лучшего сохранения базовой динамики потоков и балансировки исследования с точностью распределения. Помимо выборки, GRPO-Guard смягчает чрезмерную оптимизацию наград посредством контролируемого отсечения и пересчета градиентов с учетом шума. Существующие подходы к визуальному обучению с подкреплением также опираются на специфичные для задач награды, включая модели предпочтений, оценивающие перцептивное качество и выравнивание текста и изображения, а также специализированные награды за типографику и редактирование. Вдохновленные этими достижениями, мы используем пострефлексивное обучение с подкреплением, зависящее от задачи, которое объединяет выборку CPS или Precise с чередующимися наградами или наградами для конкретных задач, чтобы удовлетворить различные требования к оптимизации генерации и редактирования.

2.3 Дистилляция on-policy для унифицированных моделей

Недавно дистилляция on-policy (OPD) решила проблему несовпадения распределений в традиционной дистилляции знаний, предоставляя студентам плотный надзор от учителей на траекториях, сгенерированных самими студентами. Опираясь на эту парадигму, MOPD расширяет OPD для интеграции возможностей нескольких учителей: независимо оптимизированные эксперты предметных областей контролируют траектории on-policy-выборки студента, тем самым консолидируя множество возможностей рассуждения в единой модели. Помимо языкового моделирования, OPD также применяется к мультимодальному пониманию и рассуждениям, причем учителя контролируют мультимодальные траектории, сгенерированные студентами. Недавно ее приложения распространились на визуальную генерацию. В частности, Flow-OPD, DiffusionOPD и DanceOPD дистиллируют специализированные для задач генераторы вдоль сгенерированных студентом траекторий шумоподавления с использованием сигналов согласованности учителя, сопоставления переходов и регрессии поля скоростей соответственно. Тем временем DiffusionOPSD удаляет внешнего учителя и использует дифференцируемые градиенты наград для построения ограниченной цели самодистилляции. Наш подход дополняет эти методы: вместо того чтобы заставлять все задачи использовать единую схему дистилляции, мы сохраняем четырех специализированных по задачам внешних экспертов и используем жесткую маршрутизацию для направления их сигналов контроля в ту же нативную модель пиксельного пространства. Такой дизайн интегрирует специализированные возможности, сохраняя при этом зависящие от задачи условные входные данные, методы руководства и стратегии разрешения каждого эксперта.

3 Метод

3.1 Архитектура модели

Практически безпотерьный визуальный интерфейс SenseNova U1.5 сохраняет легкий нативный визуальный интерфейс, предложенный NEO, преобразуя исходные изображения или зашумленные визуальные входные данные непосредственно в компактные последовательности токенов без внешнего визуального энкодера или VAE. В частности, две сверточные проекции с активациями GELU выполняют соответственно 16-кратное и 2-кратное уменьшение дискретизации, так что каждая область изображения 32 × 32 соответствует одному визуальному токену. Двумерные синусоидальные позиционные вложения сохраняют пространственные координаты, в то время как специальные токены разделяют отдельные визуальные блоки. Текст токенизируется с помощью исходного языкового токенайзера, после чего визуальные и текстовые представления проецируются в общее скрытое пространство и совместно обрабатываются унифицированной магистральной сетью (backbone). Этот дизайн сохраняет практически безпотерьную визуальную информацию, удерживая при этом длины последовательностей в диапазоне, управляемом для крупномасштабного мультимодального моделирования.

Рисунок 3. Обзор SenseNova U1.5. По сравнению с SenseNova U1, модель U1.5 дополнительно улучшает практически безпотерьный визуальный интерфейс как на этапе кодирования, так и на этапе декодирования. Обусловливание шумом с учетом разрешения расширено до 4096 × 4096, а исходная выходная «голова» MLP для каждого блока изображения заменена легким пространственным декодером, использующим Pixel Shuffle и свертки 3 × 3. Эти улучшения сохраняют компактное представление, в котором каждая область пикселей 32 × 32 соответствует одному визуальному токену, одновременно повышая пространственную непрерывность, точность при высоком разрешении и надежность при решении последующих задач.

Таблица 1. Конфигурация SenseNova U1.5. Модель использует более высокий коэффициент пространственного сжатия, дизайн Pre-Buffer, нативную RoPE для унифицированного пространственно-временного кодирования и архитектуру Mixture-of-Transformers для совместного мультимодального понимания и генерации.

Для задач генерации эффективная амплитуда шума варьируется в зависимости от разрешения изображения, что делает разрешение важным условием для процесса деноизинга. SenseNova U1.5 явно внедряет эмбеддинги масштаба шума, зависящие от разрешения, и расширяет разрешение эталонного изображения с 2048 × 2048 до 4096 × 4096 для лучшей поддержки нативной генерации высокого разрешения. Модель нормализует и кодирует соответствующий масштаб шума, а затем объединяет его с представлением временного шага диффузии. Это позволяет деноизеру учитывать как текущую стадию деноизинга, так и характеристики шума, связанные с разрешением, что дает ему возможность более стабильно адаптироваться к различным разрешениям и соотношениям сторон.

Компактное разбиение изображения на блоки снижает затраты на моделирование изображений, однако независимое декодирование каждого блока изображения с помощью MLP может нарушать локальную непрерывность, приводя к появлению швов, сеточных артефактов и разрывов текстур при высоких разрешениях. Чтобы решить эту проблему, SenseNova U1.5 заменяет исходную выходную голову MLP на легковесный пространственно-связанный декодер. Как показано на Рисунке 3, декодер сначала восстанавливает визуальные токены, выведенные базовой сетью, в двумерную карту признаков, а затем постепенно реконструирует полноразмерное RGB-изображение с помощью трех этапов апсемплинга Pixel Shuffle. Локальные свёртки между этапами позволяют соседним областям обмениваться информацией и совместно определять пиксели вблизи границ блоков изображения, вместо того чтобы предсказывать каждый блок независимо.

Декодер восстанавливает локальные пространственные взаимодействия до синтеза пикселей, что позволяет совместно оптимизировать глобальную семантику, композицию и мелкозернистую структуру в рамках единого сквозного фреймворка. Он обучается вместе с базовой сетью в рамках задачи сопоставления потоков (flow-matching). При лишь умеренном увеличении вычислительных затрат это улучшает согласованность между патчами и локальную непрерывность, уменьшает граничные артефакты и повышает стабильность генерации высокого разрешения и нисходящей адаптации.

Нативная смесь трансформеров (Mixture-of-Transformers). SenseNova U1.5 сохраняет нативный дизайн Mixture-of-Transformers (MoT), интегрируя понимание и генерацию в рамках единой базовой сети Transformer, вместо того чтобы разделять их на две полностью независимые сети. Чистый контекст «изображение-текст» и визуальные состояния с условным шумом чередуются в единой последовательности, что позволяет семантическим представлениям, визуальным свидетельствам и динамике генерации взаимодействовать напрямую через разделяемый механизм self-attention. Такой дизайн позволяет процессу генерации непрерывно использовать представления, сформированные в ходе мультимодального понимания, без внедрения вспомогательных модулей слияния или межпространственных трансформаций признаков.

Паттерны внимания структурно спроектированы так, чтобы координировать причинное языковое моделирование с двунаправленным визуальным взаимодействием. Текстовые токены обращают внимание только на предшествующий контекст, в то время как токены внутри каждого чистого патча изображения взаимодействуют двунаправленно для захвата пространственных зависимостей. Токены генерации с условным шумом аналогичным образом взаимодействуют двунаправленно в пределах своих соответствующих паттеров изображения и обращаются ко всему предшествующему чистому мультимодальному контексту. Обратный путь информации явно маскируется, что предотвращает доступ чистых представлений к случайно сгенерированным состояниям. Этот асимметричный поток информации позволяет процессу генерации использовать богатый семантический и визуальный контекст, сохраняя при этом целостность представлений, используемых для понимания и рассуждений.

Что особенно важно, архитектурная унификация не означает, что все позиции разделяют одни и те же параметры. Понимание и генерация сохраняют раздельные проекции внимания, слои нормализации и полносвязные модули, причем токены динамически маршрутизируются по типам на каждом слое Transformer. Таким образом, разделяемое внимание служит интерфейсом для связи между потоками, в то время как специфичные для потоков параметры сохраняют уникальные вычисления, необходимые для восприятия и синтеза. Эта комбинация плотного взаимодействия и специализации параметров позволяет обоим направлениям извлекать выгоду из общего пространства представлений, не принуждая их различные цели оптимизации следовать по одному и тому же вычислительному пути.

Унифицированные цели обучения. SenseNova U1.5 объединяет авторегрессионное языковое моделирование, сопоставление потоков в пространстве пикселей (pixel-space flow matching) и перцептивное супервизирование для совместного обучения возможностей понимания и генерации в рамках одной модели.

Для мультимодального понимания модель последовательно предсказывает последующие текстовые токены на основе существующего контекста «изображение-текст» и предшествующего текста. Повышая вероятность правильных предсказаний, она осваивает семантическое понимание и мультимодальные рассуждения.

Для визуальной генерации модель изучает непрерывное преобразование из шума в изображения непосредственно в пространстве пикселей RGB. Во время обучения реальные изображения смешиваются с гауссовским шумом, масштаб которого настраивается под целевое разрешение, создавая зашумленные состояния, соответствующие различным этапам генерации. На основе этих состояний модель предсказывает чистое изображение и использует его для оценки скорости траектории генерации, после чего минимизирует разницу между предсказанной и целевой скоростями с помощью функции потерь сопоставления потоков (flow-matching loss).

Опираясь на этот фундамент, модель внедряет перцептивные потери LPIPS для сравнения предсказанных и истинных изображений в пространстве признаков. Это дополнительно ограничивает структурную согласованность, локальную текстуру и визуальную когерентность, дополняя контролирующий сигнал в пространстве пикселей. Эти три типа потерь объединяются с помощью весов и оптимизируются совместно, что позволяет семантическому пониманию, генерации изображений и ограничениям визуального качества работать в унисон, благодаря чему высокоуровневая семантика и низкоуровневая визуальная генерация изучаются совместно в рамках единого представления.

3.2 Процесс обучения

SenseNova U1.5 постепенно развивает нативные мультимодальные способности посредством генеративного предварительного обучения, унифицированного промежуточного обучения и унифицированной супервизируемой доводки (Этапы 1–3), как подробно описано в Таблице 2. Затем она проходит обучение, специфичное для конкретных возможностей (Этап 4), и дистилляцию с единой политикой для нескольких экспертов (Этап 5).

Таблица 2. Конфигурация обучения для SenseNova U1.5.

Этап 1: Генеративное предварительное обучение. Опираясь на предварительно обученную ветку понимания, мы случайным образом инициализируем генеративную ветку и обучаем ее с помощью сопоставления потоков в пространстве пикселей, обусловленного представлениями, предоставляемыми замороженной веткой понимания. SenseNova U1.5 увеличивает вычислительный бюджет и вводит специальный этап нативного обучения в разрешении 4K. На начальном этапе обучение использует данные «текст-изображение» с разрешением от 256×256 до 1024×1024. На этом этапе мы проводим обучение в течение 180 тыс. шагов с постоянной скоростью обучения 2×10 и длиной последовательности 8196. Затем мы расширяем данные «текст-изображение» до более высоких разрешений в диапазоне от 512×512 до 4096×4096 для улучшения возможностей нативной генерации 4K модели. Этот этап длится 100 тыс. шагов с постоянной скоростью обучения 1×10 и увеличивает длину последовательности до 20 480. На финальном этапе мы внедряем задачи редактирования изображений и чередования генерации и продолжаем обучение в течение 185 тыс. шагов, расширяя генеративные возможности модели на различные сценарии downstream. Смешанные обучающие данные состоят из 60% данных «текст-изображение», 30% данных редактирования изображений и 10% чередующихся данных «изображение-текст». Мы используем косинусное расписание скорости обучения, снижая скорость обучения с 1×10 до 2×10, при этом сохраняя длину последовательности 20 480. Начиная с этого этапа, мы добавляем перцептивную потерю на основе LPIPS к целевой функции сопоставления потоков с весом 0,1 для улучшения генерации мелкозернистых визуальных деталей и локальной визуальной когерентности. Примечательно, что эта комбинированная генеративная цель остается неизменной на последующих этапах унифицированного промежуточного обучения и управляемой тонкой настройки.

Этап 2: Унифицированное промежуточное обучение. Мы совместно оптимизируем обе ветки, используя совместное внимание для облегчения обмена информацией между ветками при сохранении специфичных для задач представлений. Чтобы сбалансировать универсальные мультимодальные возможности с разнообразными генеративными возможностями, мы создаем смешанный корпус, состоящий из 30% чисто текстовых и мультимодальных данных понимания, 40% данных «текст-изображение», 20% данных редактирования изображений и 10% чередующихся данных «изображение-текст». Эта смесь знакомит модель с взаимодополняющими формами восприятия, синтеза, редактирования и мультимодального взаимодействия во время унифицированного обучения. Модель обучается в течение 80 тыс. шагов с максимальной длиной последовательности 32 768 токенов и постоянной скоростью обучения 2×10. Веса потерь понимания и генерации составляют 0,1 и 1,0 соответственно. Это взвешивание помогает сохранить предварительно обученные возможности понимания, одновременно назначая больший вес оптимизации для более сложной генеративной цели, обеспечивая стабильное совместное обучение и более эффективную интеграцию возможностей.

Этап 3: Унифицированная управляемая тонкая настройка. Мы провели дальнейшую тонкую настройку модели на тщательно отобранных высококачественных данных следования инструкциям с составом задач, аналогичным Этапу 2. Этот этап еще больше улучшил следование инструкциям и закрепил возможности, приобретенные в ходе раннего обучения, в единую модель. Обучение длилось 10,5 тыс. шагов с использованием косинусного расписания скорости обучения, снижая скорость обучения с 2×10 до 0 при сохранении тех же коэффициентов потерь, что и на Этапе 2, для поддержания баланса между целями понимания и генерации.

Рисунок 4. Процесс пост-обучения для SenseNova U1.5, включая многоэкспертное обучение с подкреплением и дистилляцию on-policy.

Этап 4: Многоэкспертное обучение с подкреплением. Как показано на рисунке 4, мы обучили четырех экспертов отдельно для эстетики, рендеринга текста, генерации инфографики и редактирования изображений. Каждый эксперт использовал специфичные для задачи данные, награды, настройки выборки и регуляризации.

(1) Эксперт по эстетике. Оптимизация только под визуальные предпочтения может улучшить общий вид в ущерб читаемости текста. Поэтому мы чередовали данные эстетических предпочтений и данные типографики в разных эпохах обучения, чтобы обучить эксперта по эстетике. Выборки из каждого раздела данных направлялись на специфичные для задачи награды: HPSv3++ оценивала перцептивное качество и соответствие промпта и изображения, в то время как двуязычная награда OCR на базе PaddleOCR измеряла точность текста. Такая маршрутизация позволила избежать смешивания наград с разными масштабами и семантикой при сохранении типографской точности во время оптимизации предпочтений.

Для каждого промпта мы сгенерировали 16 кандидатных результатов, используя траектории из 30 шагов, коэффициент руководства 4.0 и сдвиг временных шагов 3. Мы использовали выборку с сохранением коэффициентов (CPS) с η = 0,7, чтобы уменьшить артефакты ограниченного числа шагов, связанные с обычной выборкой SDE, одновременно вводя стохастическое исследование.

3.3 Моделирование наград

4 Построение данных

4.1 Данные генерации изображений

4.2 Данные редактирования изображений

4.3 Чередующиеся данные «изображение-текст»

4.4 Данные обучения с подкреплением

5 Эксперименты

5.2 Генерация изображений

5.3 Редактирование изображений

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведениемПресса
OpenAI

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведением

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языковПресса
ElevenLabs

Новая модель речи v4 от ElevenLabs поддерживает больше контроля выражения и 90 языков

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИПресса
Amazon

Meta, Google, Amazon, Microsoft вызывают вопросы сенатора Уоррен о налоговых субсидиях на ИИ

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов
LangChain

Кастомные приложения LangSmith: создавайте собственные интерфейсы для данных ваших агентов

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое
LangChain

Новое в LangSmith: Engine v2, управляемые Deep Agents, тонкая настройка и многое другое

Ещё от SenseTime

Премьер Госсовета Ли Цян посетил выставку WorldSkills, где SenseTime представила свои технологии и решения
SenseTime

Премьер Госсовета Ли Цян посетил выставку WorldSkills, где SenseTime представила свои технологии и решения

Он использовал SenseTime Seko, чтобы превратить кошмар в популярный мини-сериал
SenseTime

Он использовал SenseTime Seko, чтобы превратить кошмар в популярный мини-сериал

№ 1 на рынке Neocloud в Китае! SenseCore лидирует по всем направлениям
SenseTime

№ 1 на рынке Neocloud в Китае! SenseCore лидирует по всем направлениям

Выделяясь среди более чем 30 поставщиков: Omdia отмечает SenseTime Raccoon Work как эталон корпоративного ИИ-рабочего места благодаря сквозной реализации
SenseTime

Выделяясь среди более чем 30 поставщиков: Omdia отмечает SenseTime Raccoon Work как эталон корпоративного ИИ-рабочего места благодаря сквозной реализации

Превосходя более чем 30 вендоров: Omdia выделяет SenseTime Raccoon Work в качестве эталона ИИ-рабочего места благодаря сквозной реализации
SenseTime

Превосходя более чем 30 вендоров: Omdia выделяет SenseTime Raccoon Work в качестве эталона ИИ-рабочего места благодаря сквозной реализации

Премьер Госсовета КНР Ли Цян посетил выставку WorldSkills Expo, где компания SenseTime представила свои технологии и приложения
SenseTime

Премьер Госсовета КНР Ли Цян посетил выставку WorldSkills Expo, где компания SenseTime представила свои технологии и приложения