Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Tehnicheskiy otchyot o sensenova u15 na puti k nativnoy unifitsirovannoy vizualn
Dev48

© 2026 · All rights reserved.

Технический отчёт о SenseNova U1.5: на пути к нативной унифицированной визуальной интуиции

Фото: Lenzatic (Pixabay) — https://pixabay.com/photos/antelope-canyon-arizona-canyon-8045244/

Технический отчёт о SenseNova U1.5: на пути к нативной унифицированной визуальной интуиции

Источник: SenseTime

Мы представляем Sen eNova U1.5, нативно унифицированную мультимодальную модель на базе архитектуры 8B-MoT, которая способна понимать, рассуждать и генерировать визуальный контент без внешних визуальных энкодеров или вариационных автоэнкодеров (VAE). Мы усовершенствовали визуальный интерфейс с пом…

26 сентября 2026 г.

SenseTimeSenseTime2026/09/1750

Мы представляем SenseNova U1.5 — нативно унифицированную мультимодальную модель на базе архитектуры 8B-MoT, которая понимает, анализирует и генерирует визуальный контент без использования внешних визуальных энкодеров или вариационных автоэнкодеров (VAE). Мы усовершенствовали визуальный интерфейс с помощью подхода реконструкции, сохраняющего пространственную когерентность между патчами изображения, а также масштабировали обучение за счет тщательно отобранных данных генерации и редактирования, улучшенного моделирования задач, структурированного дополнения промптов и обучения при нативных разрешениях до 4K. На этапе последующего обучения мы раздельно оптимизируем специализированные модули для визуальной эстетики, двуязычного рендеринга текста, генерации инфографики и редактирования изображений, а затем интегрируем их возможности с помощью он-полиси дистилляции на основе множества экспертов.

Всесторонние оценки показывают, что SenseNova U1.5 достигает значительного прогресса в точности изображения, рендеринге текста, сложных композициях, редактировании с использованием нескольких референсов и чередующейся генерации, одновременно улучшая следование инструкциям и сохраняя согласованность идентичности объектов, геометрической структуры и неизмененных областей. Несмотря на ограниченное покрытие структурированных форматов в обучающих данных для генерации, модель эффективно обобщает данные для длинных и сложных структурированных визуальных инструкций, что дополнительно демонстрирует способность мультимодального понимания переноситься на визуальное планирование и создание.

Эти результаты показывают, что нативное унифицированное моделирование открывает многообещающий путь к сквозным системам, объединяющим восприятие, рассуждение и созидание. Мы откроем исходный код обучения, включая управляемую тонкую настройку (SFT), обучение с подкреплением и он-полиси дистилляцию. Код и дополнительная информация о модели: https://www.sensenova.cn/

Обзор оценки SenseNova U1.5

Рисунок 1. Примеры генерации инфографики и людей с помощью SenseNova U1.5.

Рисунок 2. Примеры редактирования изображений и генерации на основе нескольких референсов с помощью SenseNova U1.5.

1 Введение

В последние годы визуальная генерация стремительно вышла за рамки традиционного синтеза изображений, превратившись в универсальную среду визуального творчества. Теперь она включает в себя многоязычную типографику и верстку, дизайн с высокой плотностью информации, рендеринг высокого разрешения, композицию изображений по нескольким референсам, мелкозернистое редактирование объектов и фона, а также чередующуюся генерацию. Однако такое расширение выявило фундаментальный архитектурный разрыв: большинство систем воспринимают изображения через предварительно обученные визуальные энкодеры (VE), но генерируют их через вариационные автоэнкодеры (VAE). В результате понимание и генерация функционируют в различных пространствах представлений: первое оптимизировано для семантической абстракции, а второе — для точности на пиксельном уровне. Хотя такое разделение эффективно, оно ограничивает возможности бесшовной совместной работы восприятия, рассуждения и генерации в рамках единой визуальной структуры для различных форм визуального творчества.

Нативное унифицированное моделирование использует другой подход, обучаясь напрямую на пикселях и тексте. SenseNova U1 продемонстрировала жизнеспособность этой парадигмы благодаря архитектуре NEO-unify, которая не зависит от внешних энкодеров или VAE и объединяет восприятие, рассуждение и генерацию в пространстве пикселей в единую сквозную модель. Тем не менее, ее намеренно облегченный визуальный интерфейс реконструирует каждый визуальный токен как независимый патч RGB-изображения. Несмотря на эффективность, этот факторизованный подход препятствует обмену информацией между соседними патчами на финальном этапе формирования изображения, из-за чего швы, разрывы текстур и геометрические несоответствия становятся все более заметными при высоких разрешениях.

В этой статье представлена SenseNova U1.5 — нативная унифицированная мультимодальная модель с 8B-MoT для визуального понимания, рассуждения и генерации. Ее первый крупный вклад заключается в фундаментальном архитектурном сдвиге: от независимого прогнозирования патчей изображения к пространственной совместной реконструкции. Вместо изолированного маппинга каждого визуального токена в пиксели мы проецируем токены в двумерное поле признаков и постепенно реконструируем изображение с помощью пространственных сверток и апсемплинга Pixel Shuffle. Это позволяет соседним областям обмениваться информацией до окончательной отрисовки пикселей, совместно определяя цвет, текстуру и геометрическую структуру вместо обработки каждого патча по отдельности. Полученный дизайн сохраняет эффективность компактной визуальной последовательности, существенно улучшая пространственную согласованность и поддерживая нативную генерацию с разрешением до 4K.

Вторым важным достижением является переход от оптимизации совместной награды к стратегии «сначала специализация, затем унификация». Визуальное творчество охватывает принципиально разные возможности, включая генерацию изображений для визуальной эстетики, двуязычный рендеринг текста, дизайн инфографики и редактирование изображений. Каждая возможность задействует различные сигналы награды, динамику траекторий выборки и проблемы оптимизации. Совместная оптимизация этих возможностей в рамках единой политики может запутать конкурирующие цели и снизить прирост производительности для конкретных задач. Поэтому мы сначала специализируемся, а затем унифицируем: для каждого направления мы раздельно оптимизируем специализированных экспертов по обучению с подкреплением (RL), используя индивидуальные данные, награды, стратегии выборки и методы регуляризации, а затем интегрируем их взаимодополняющие сильные стороны с помощью он-полиси дистилляции на основе множества экспертов. Эта дистилляция выполняется вдоль собственных траекторий генерации модели-студента, сохраняя взаимодополняющие сильные стороны экспертов и перенося их возможности в единую политику.

Обширные оценки дополнительно показывают, что единое нативное визуальное представление может служить общей основой для понимания, рассуждения, генерации и редактирования — без параллельных путей визуальной обработки или повторяющегося преобразования между признаками энкодера и латентными переменными VAE. Несмотря на то, что каждая область размером 32×3 пикселя сжимается в единственный визуальный токен, это компактное представление по-прежнему поддерживает эффективный вывод, обеспечивая при этом высокую производительность в отношении точности изображений, двуязычной текстовой верстки, сложной композиции, редактирования изображений по нескольким референсам, чередующейся генерации, следования инструкциям, сохранения визуального контента и детального контроля. Более того, несмотря на ограниченную зависимость во время обучения от фиксированных шаблонов генерации, SenseNova U1.5 обобщается на более длинные, композиционные и высокоструктурированные визуальные инструкции. Это говорит о том, что структурные знания и навыки планирования, приобретенные посредством мультимодального понимания и рассуждения, могут естественным образом переноситься на визуальное создание. В совокупности эти результаты показывают, что нативная унификация — это больше, чем просто архитектурное упрощение: компактное, общее визуальное представление способно эффективно поддерживать как «видение», так и «создание», позволяя возможностям, усвоенным через одну форму визуального интеллекта, усиливать другую.

2 Похожие работы

2.1 Нативная унификация данных генерации изображений в мультимодальных моделях

Нативные визуально-языковые модели (VLM) обрабатывают визуальные входные данные напрямую, без использования внешних энкодеров. Такие модели, как Fuyu-8B, EVE, Mono-InternVL, NEO, Gemma4-12B и Inkling, неуклонно сокращают разрыв в производительности с ведущими модульными VLM. Параллельная тенденция наметилась в области визуальной генерации: в недавних исследованиях пиксели моделируются напрямую, что доказывает отсутствие необходимости в высоко сжатых латентных пространствах для высокоточной генерации. Опираясь на эти достижения, все больше нативных унифицированных мультимодальных моделей стремятся объединить понимание и генерацию в рамках единой архитектуры. Дискретные нативные модели объединяют мультимодальное обучение с помощью авторегрессии на уровне токенов, в то время как подходы на основе непрерывных нативных моделей исследуют сквозное моделирование без явных токенайзеров или латентных «узких мест». Основываясь на NEO-unify, наша серия SenseNova-U развивает это направление в сторону полностью нативной базовой архитектуры, в которой понимание, рассуждение и генерация возникают из общей визуальной основы.

2.2 Обучение с подкреплением для диффузионных моделей

В языковом моделировании обучение с подкреплением на основе отзывов людей (RLHF) сформировало общую парадигму пост-обучения, в которой полученные награды направляют оптимизацию политики, а алгоритм PPO обеспечивает стабильные обновления относительно эталонной политики. Примечательно, что GRPO и DAPO повышают эффективность и масштабируемость за счет отказа от явной модели ценности, введения относительных преимуществ внутри группы и использования улучшенных стратегий онлайн-оптимизации. Онлайн-обучение с подкреплением также получило распространение в визуальной генерации: ReFL, DDPO и DPOK оптимизируют диффузионные модели с использованием наград на основе предпочтений или градиентов политики, в то время как AlignProp и D3PO повышают эффективность и снижают зависимость от явных моделей наград. Совсем недавно Flow-GRPO и DanceGRPO распространили групповую относительную оптимизацию на диффузионные модели и модели сопряжения потоков (flow-matching), улучшив выравнивание по предпочтениям, точность композиции, отрисовку текста и визуальное качество.

Для моделей сопряжения потоков онлайн-обучение с подкреплением должно обеспечивать стохастическое исследование в дополнение к детерминированному выводу на основе обыкновенных дифференциальных уравнений (ОДУ). Flow-GRPO делает такое исследование возможным благодаря выборке траекторий на основе стохастических дифференциальных уравнений (СДУ). Выборка с сохранением коэффициентов (CPS) и Precise улучшают многошаговую выборку за счет лучшего сохранения лежащей в основе динамики потока и балансировки между исследованием и точностью распределения. Помимо выборки, GRPO-Guard снижает чрезмерную оптимизацию наград посредством контролируемого усечения и пересчета градиентов с учетом шума. Существующие подходы к визуальному обучению с подкреплением также опираются на специфические для конкретных возможностей награды, включая модели предпочтений, оценивающие перцептивное качество и соответствие текста изображению, а также специализированные награды за типографику и редактирование. Вдохновленные этими достижениями, мы используем пост-обучение с подкреплением, зависящим от задачи, которое объединяет выборку CPS или Precise с чередующимися наградами или наградами для конкретных задач, чтобы удовлетворить различные требования к оптимизации генерации и редактирования.

2.3 Дистилляция на основе текущей политики для унифицированных моделей

Недавние методы дистилляции на основе текущей политики (OPD) решили проблему несоответствия распределений в традиционной дистилляции знаний, предоставляя моделям-ученикам плотный контроль со стороны учителей на траекториях, сгенерированных самими учениками. Опираясь на эту парадигму, MOPD расширяет OPD для интеграции возможностей от нескольких учителей: независимо оптимизированные эксперты в определенных доменах контролируют траектории выборки ученика на основе текущей политики, тем самым консолидируя множество возможностей рассуждения в одной модели. Помимо языкового моделирования, OPD также применяется для мультимодального понимания и рассуждения, где учителя контролируют мультимодальные траектории, созданные учениками. Недавно эти приложения распространились и на визуальную генерацию. В частности, Flow-OPD, DiffusionOPD и DanceOPD дистиллируют специализированные под конкретные задачи генераторы вдоль траекторий удаления шума, сгенерированных учениками, используя соответственно сигналы согласованности учителей, сопоставление переходов и регрессию поля скоростей. В то же время DiffusionOPSD исключает внешнего учителя и использует дифференцируемые градиенты наград для построения ограниченной цели самодистилляции. Наш подход дополняет эти методы: вместо того чтобы заставлять все задачи использовать единую схему дистилляции, мы сохраняем четырех специализированных под задачи внешних экспертов и используем жесткую маршрутизацию (hard routing) для передачи их сигналов контроля в ту же нативную модель пиксельного пространства. Такой дизайн объединяет специализированные возможности, сохраняя при этом условные входные данные, методы руководства и стратегии разрешения каждого эксперта, зависящие от задачи.

3 Метод

3.1 Архитектура модели

Визуальный интерфейс SenseNova U1.5 с практически нулевыми потерями сохраняет облегченный нативный визуальный интерфейс, предложенный в NEO, напрямую преобразуя исходные изображения или зашумленные визуальные входные данные в компактные последовательности токенов без внешнего визуального энкодера или VAE. В частности, две сверточные проекции с активациями GELU выполняют понижающую дискретизацию в 16 и 2 раза соответственно, так что каждый регион изображения размером 32 × 32 соответствует одному визуальному токену. Двумерные синусоидальные позиционные вложения сохраняют пространственные координаты, а специальные токены разграничивают отдельные визуальные блоки. Текст токенизируется с помощью исходного языкового токенайзера, после чего визуальные и текстовые представления проецируются в общее скрытое пространство и совместно обрабатываются единым бэкбоном. Такой подход сохраняет визуальную информацию практически без потерь, поддерживая при этом длину последовательностей в пределах, управляемых для крупномасштабного мультимодального моделирования.

Рисунок 3. Обзор SenseNova U1.5. По сравнению с SenseNova U1, в U1.5 усовершенствован визуальный интерфейс с практически нулевыми потерями как на этапе кодирования, так и на этапе декодирования. Обусловливание шумом с учетом разрешения расширено до 4096 × 4096, а исходная голова вывода MLP для каждого блока изображения заменена на легкий пространственный декодер, использующий Pixel Shuffle и свертки 3 × 3. Эти улучшения сохраняют компактное представление, в котором каждый регион размером 32 × 32 пикселя соответствует одному визуальному токену, одновременно повышая пространственную непрерывность, высокую точность разрешения и устойчивость при решении последующих задач.

Таблица 1. Конфигурация SenseNova U1.5. Модель использует более высокий коэффициент пространственного сжатия, концепцию Pre-Buffer, нативный метод RoPE для унифицированного пространственно-временного кодирования и архитектуру Mixture-of-Transformers для совместного мультимодального понимания и генерации.

Для задач генерации эффективная амплитуда шума зависит от разрешения изображения, что делает разрешение важным условием для процесса денойзинга. SenseNova U1.5 явно внедряет эмбеддинги масштаба шума, зависящие от разрешения, и расширяет разрешение эталонного изображения с 2048 × 2048 до 4096 × 4096 для лучшей поддержки нативной генерации высокого разрешения. Модель нормализует и кодирует соответствующий масштаб шума, а затем объединяет его с представлением временного шага диффузии. Это позволяет шумоподавителю учитывать как текущую стадию денойзинга, так и характеристики шума, связанные с разрешением, что позволяет ему более стабильно адаптироваться к различным разрешениям и соотношениям сторон.

Компактное разбиение изображений на блоки снижает затраты на моделирование изображений, однако независимое декодирование каждого блока изображения с помощью многослойного перцептрона (MLP) может нарушить локальную непрерывность, приводя к швам, сетчатым артефактам и разрывам текстур при высоких разрешениях. Чтобы решить эту проблему, SenseNova U1.5 заменяет исходный выходной слой MLP на легковесный пространственно-связанный декодер. Как показано на рисунке 3, декодер сначала восстанавливает визуальные токены, выведенные базовой сетью, в двумерную карту признаков, а затем постепенно реконструирует полноразмерное RGB-изображение в три этапа повышения дискретизации Pixel Shuffle. Локальные свертки между этапами позволяют соседним областям обмениваться информацией и совместно определять пиксели вблизи границ блоков изображения, вместо прогнозирования каждого блока независимо.

Декодер восстанавливает локальные пространственные взаимодействия перед синтезом пикселей, что позволяет совместно оптимизировать глобальную семантику, композицию и мелкозернистую структуру в рамках единой сквозной (end-to-end) архитектуры. Он обучается вместе с базовой сетью в рамках задачи сопоставления потоков (flow-matching). При лишь умеренном увеличении вычислительных затрат он улучшает согласованность между патчами и локальную непрерывность, уменьшает краевые артефакты и повышает стабильность генерации высокого разрешения и последующей адаптации.

Нативная смесь трансформеров (Mixture-of-Transformers). SenseNova U1.5 сохраняет нативный дизайн Mixture-of-Transformers (MoT), объединяя понимание и генерацию в единой базовой сети Transformer, вместо разделения их на две полностью независимые сети. Контекст «чистое изображение-текст» и обусловленные шумом визуальные состояния чередуются в единой последовательности, что позволяет семантическим представлениям, визуальным данным и динамике генерации взаимодействовать напрямую через общее самовнимание. Такой подход позволяет процессу генерации постоянно использовать представления, сформированные в ходе мультимодального понимания, без введения вспомогательных модулей слияния или межпространственных трансформаций признаков.

Паттерны внимания структурно разработаны для координации авторегрессионного языкового моделирования с двунаправленным визуальным взаимодействием. Текстовые токены учитывают только предшествующий контекст, в то время как токены внутри каждого чистого патча изображения учитывают двунаправленный контекст для захвата пространственных зависимостей. Токены генерации, обусловленные шумом, также взаимодействуют двунаправленно внутри своих соответствующих патчей изображений и учитывают весь предшествующий чистый мультимодальный контекст. Обратный путь информации явно маскируется, что предотвращает доступ чистых представлений к случайно сгенерированным состояниям. Этот асимметричный поток информации позволяет процессу генерации использовать богатый семантический и визуальный контекст, сохраняя при этом целостность представлений, используемых для понимания и рассуждения.

Что особенно важно, архитектурная унификация не означает, что все позиции разделяют одни и те же параметры. Понимание и генерация сохраняют раздельные проекции внимания, слои нормализации и полносвязные модули, причем токены динамически маршрутизируются по типу на каждом слое Transformer. Таким образом, общее внимание служит интерфейсом для связи между потоками, в то время как параметры, специфичные для каждого потока, сохраняют уникальные вычисления, необходимые для восприятия и синтеза. Эта комбинация плотного взаимодействия и специализации параметров позволяет обоим возможностям извлекать выгоду из общего пространства представлений, не принуждая их различные цели оптимизации следовать по одному и тому же вычислительному пути.

Унифицированные цели обучения. SenseNova U1.5 объединяет авторегрессионное языковое моделирование, сопоставление потоков в пространстве пикселей и перцептивный надзор для совместного обучения возможностей понимания и генерации в рамках одной модели.

Для мультимодального понимания модель последовательно прогнозирует последующие текстовые токены на основе существующего контекста изображения и текста, а также предшествующего текста. Повышая вероятность правильных предсказаний, она осваивает семантическое понимание и мультимодальные рассуждения.

Для визуальной генерации модель изучает непрерывное преобразование из шума в изображения непосредственно в пространстве пикселей RGB. Во время обучения реальные изображения смешиваются с гауссовским шумом, масштаб которого настраивается под целевое разрешение, создавая зашумленные состояния, соответствующие различным этапам генерации. На основе этих состояний модель предсказывает чистое изображение и использует его для оценки скорости траектории генерации, после чего минимизирует разницу между предсказанной и целевой скоростью с помощью функции потерь сопоставления потоков.

Опираясь на эту основу, модель вводит перцептивные потери LPIPS для сравнения предсказанных и эталонных изображений в пространстве признаков. Это дополнительно ограничивает структурную согласованность, локальную текстуру и визуальную когерентность, дополняя сигнал надзора в пространстве пикселей. Эти три типа потерь объединяются с помощью весов и оптимизируются совместно, что позволяет семантическому пониманию, генерации изображений и ограничениям визуального качества работать в унисон, благодаря чему высокоуровневая семантика и низкоуровневая визуальная генерация изучаются совместно в рамках единого представления.

3.2 Процесс обучения

SenseNova U1.5 постепенно развивает нативные мультимодальные возможности посредством генеративного претренинга, унифицированного промежуточного обучения и унифицированной доработки с учителем (этапы 1–3), как подробно описано в таблице 2. Затем она проходит обучение, специфичное для конкретных возможностей (этап 4), и дистилляцию на основе единой политики с участием нескольких экспертов (этап 5).

Таблица 2. Конфигурация обучения для SenseNova U1.5.

Этап 1: Генеративное предварительное обучение. Опираясь на ветвь предварительно обученного понимания, мы случайно инициализируем генеративную ветвь и обучаем ее с использованием сопоставления потоков в пространстве пикселей (pixel-space flow matching), обусловленного представлениями, предоставляемыми замороженной ветвью понимания. SenseNova U1.5 увеличивает вычислительный бюджет и вводит специальный этап нативного обучения в разрешении 4K. На начальном этапе обучение использует данные «текст-изображение» в разрешениях от 256×256 до 1024×1024. На этом этапе мы проводим обучение в течение 180 тыс. шагов с постоянной скоростью обучения 2×10-4 и длиной последовательности 8196. Затем мы расширяем данные «текст-изображение» до более высоких разрешений от 512×512 до 4096×4096, чтобы улучшить возможности модели по нативной генерации в разрешении 4K. Этот этап длится 100 тыс. шагов при постоянной скорости обучения 1×10-4 и увеличивает длину последовательности до 20 480. На заключительном этапе мы добавляем задачи редактирования изображений и чередования генерации, продолжая обучение в течение 185 тыс. шагов, что расширяет генеративные возможности модели на широкий спектр сценариев последующего применения. Смешанные обучающие данные состоят на 60% из данных «текст-изображение», на 30% из данных редактирования изображений и на 10% из чередованных данных «изображение-текст». Мы используем косинусное расписание скорости обучения, уменьшая скорость обучения с 1×10-4 до 2×10-5, сохраняя при этом длину последовательности 20 480. Начиная с этого этапа, мы добавляем перцептивную потерю на основе LPIPS к целевой функции сопоставления потоков с весом 0,1 для улучшения генерации мелкозернистых визуальных деталей и локальной визуальной когерентности. Примечательно, что эта комбинированная генеративная цель остается неизменной на последующих этапах унифицированного промежуточного обучения и управляемой тонкой настройки.

Этап 2: Унифицированное промежуточное обучение. Мы совместно оптимизируем обе ветви, используя общее внимание для облегчения обмена информацией между ветвями при сохранении специфических для задач представлений. Чтобы сбалансировать универсальные мультимодальные возможности с разнообразными генеративными способностями, мы создаем смешанный корпус, состоящий на 30% из чисто текстовых и мультимодальных данных понимания, на 40% из данных «текст-изображение», на 20% из данных редактирования изображений и на 10% из чередованных данных «изображение-текст». Эта смесь знакомит модель с взаимодополняющими формами восприятия, синтеза, редактирования и мультимодального взаимодействия в ходе унифицированного обучения. Модель обучается в течение 80 тыс. шагов с максимальной длиной последовательности 32 768 токенов и постоянной скоростью обучения 2×10-5. Веса потерь понимания и генерации составляют соответственно 0,1 и 1,0. Такое взвешивание помогает сохранить предварительно обученные возможности понимания, одновременно уделяя больше внимания оптимизации более сложной генеративной цели, что обеспечивает стабильное совместное обучение и более эффективную интеграцию возможностей.

Этап 3: Унифицированная управляемая тонкая настройка. Мы провели дальнейшую тонкую настройку модели на тщательно отобранных высококачественных данных следования инструкциям со структурой задач, аналогичной Этапу 2. Этот этап дополнительно улучшил следование инструкциям и закрепил возможности, приобретенные в ходе раннего обучения, в единую модель. Обучение длилось 10,5 тыс. шагов с использованием косинусного расписания скорости обучения, уменьшая скорость обучения с 2×10-5 до 0 при сохранении тех же коэффициентов потерь, что и на Этапе 2, для поддержания баланса между целями понимания и генерации.

Рисунок 4. Процесс пост-обучения для SenseNova U1.5, включая многоэкспертное обучение с подкреплением и дистилляцию on-policy.

Этап 4: Многоэкспертное обучение с подкреплением. Как показано на рисунке 4, мы обучили четырех экспертов отдельно для эстетики, рендеринга текста, генерации инфографики и редактирования изображений. Каждый эксперт использовал специфичные для задачи данные, награды, настройки выборки и регуляризации.

(1) Эстетический эксперт. Оптимизация только под визуальные предпочтения может улучшить общий внешний вид в ущерб читаемости текста. Поэтому мы чередовали данные эстетических предпочтений и данные типографики в разных эпохах обучения, чтобы обучить эстетического эксперта. Обработка образцов из каждого раздела данных направлялась на специфичные для задач награды: HPSv3++ оценивал перцептивное качество и соответствие промпта и изображения, в то время как двуязычная награда OCR на базе PaddleOCR измеряла точность текста. Такая маршрутизация позволила избежать смешивания наград с разными масштабами и семантикой, сохранив при этом типографическую точность во время оптимизации предпочтений.

Для каждого промпта мы сгенерировали 16 вариантов-кандидатов, используя 30-шаговые траектории, масштаб руководства 4.0 и сдвиг временного шага 3. Мы использовали выборку с сохранением коэффициентов (CPS) с η = 0,7, чтобы уменьшить артефакты ограниченного числа шагов, связанные с традиционной SDE-выборкой, одновременно вводя стохастическое исследование.

3.3 Моделирование наград

4 Построение данных

4.1 Данные генерации изображений

4.2 Данные редактирования изображений

4.3 Чередованные данные «изображение-текст»

4.4 Обучающие данные для обучения с подкреплением

5 Эксперименты

6 Заключение

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в НевадеПресса
Tesla

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в Неваде

Ещё от SenseTime

Премьер Госсовета КНР Ли Цян посетил выставку WorldSkills Expo, где компания SenseTime представила свои технологии и приложения
SenseTime

Премьер Госсовета КНР Ли Цян посетил выставку WorldSkills Expo, где компания SenseTime представила свои технологии и приложения

Он использовал SenseTime Seko, чтобы превратить кошмар в популярный мини-сериал
SenseTime

Он использовал SenseTime Seko, чтобы превратить кошмар в популярный мини-сериал

№ 1 на рынке неоклауда Китая! SenseCore лидирует по всем направлениям
SenseTime

№ 1 на рынке неоклауда Китая! SenseCore лидирует по всем направлениям

Превосходя более чем 30 вендоров: Omdia выделяет SenseTime Raccoon Work в качестве эталона ИИ-рабочего места благодаря сквозной реализации
SenseTime

Превосходя более чем 30 вендоров: Omdia выделяет SenseTime Raccoon Work в качестве эталона ИИ-рабочего места благодаря сквозной реализации