Почему оценка моделей редактирования изображений является одновременно критически важной и сложной задачей
Редактирование изображений на основе текстовых инструкций становится ключевой возможностью мультимодальных базовых моделей. Пользователи могут всё чаще редактировать изображения, просто описывая то, что они хотят: «удали человека на заднем плане», «сделай машину красной» или «передвинь стул ближе к столу».
Однако для команд, создающих эти модели, генерация более качественных изображений — это лишь полдела. Им также необходимо понимать, действительно ли модель становится лучше.
Разработка базовых моделей — это итеративный процесс:
Обучение → Оценка → Выявление сбоев → Улучшение → Повторное обучение
Оценка замыкает этот цикл. Исследователям она нужна для сравнения контрольных точек, проверки новых стратегий обучения, обнаружения регрессий и принятия решений о том, что улучшать дальше.
В случае редактирования изображений оценка представляет особую сложность. Успешное редактирование должно точно отражать запрошенное изменение, сохранять всё остальное в неизменном виде и поддерживать высокое визуальное качество. При многошаговом редактировании модель также должна сохранять предыдущие изменения по мере поступления новых инструкций.
Люди-оценщики способны выявлять такие сбои, но ручная проверка тысяч результатов для разных моделей, контрольных точек, изображений и шагов редактирования — это медленный и дорогостоящий процесс. Существующие автоматизированные метрики также с трудом охватывают все эти требования с помощью единой оценки.
Это порождает закономерный вопрос:
Можем ли мы использовать ИИ-агентов для автоматизации оценки базовых моделей редактирования изображений?
EdiVal-Agent: автоматизация оценки с помощью агентного ИИ
В сотрудничестве с Техасским университетом в Остине, UCLA и Microsoft исследователи из Lambda разработали EdiVal-Agent — фреймворк, который превращает оценку базовых моделей редактирования изображений в рабочий процесс агентного ИИ. Эта работа была принята в качестве доклада на конференцию ICLR 2026.
Вместо того чтобы просить одну модель оценивать всё отредактированное изображение целиком, EdiVal-Agent декомпозирует оценку на более мелкие, поддающиеся проверке задачи. Сначала он определяет семантически значимые объекты на изображении и интерпретирует инструкцию по редактированию на уровне объектов, определяя, что должно измениться, а что должно остаться прежним. На протяжении нескольких шагов редактирования он поддерживает динамический пул объектов, который отслеживает эти изменения с течением времени.
Затем фреймворк координирует специализированные ИИ-модели и визуальные инструменты для проверки различных аспектов редактирования. Например, при получении инструкции «замени синюю машину на красную» EdiVal-Agent может определить, присутствует ли на месте нужная машина, убедиться, что её цвет изменился в соответствии с запросом, проверить, что не связанные с ней объекты и фон остались неизменными, а также оценить, выглядит ли финальное изображение убедительно.
Эта оценка строится вокруг трех взаимодополняющих измерений:
- Следование инструкциям (EdiVal-IF): выполнила ли модель запрошенное редактирование? EdiVal-Agent объединяет рассуждения на основе зрения и языка, обнаружение объектов с открытым словарем и правила проверки для инспекции конкретных объектов, атрибутов и изменений.
- Согласованность контента (EdiVal-CC): остался ли неизменным тот контент, который должен был остаться прежним? Используя свой динамический пул объектов, фреймворк отслеживает объекты на разных шагах редактирования и сравнивает семантические признаки для обнаружения непреднамеренных изменений.
- Визуальное качество (EdiVal-VQ): остается ли отредактированное изображение визуально убедительным? Модели человеческих предпочтений оценивают перцептивное качество и визуальные артефакты независимо от того, было ли выполнено запрошенное редактирование.
В совокупности эти компоненты образуют конвейер агентной оценки:
Понять инструкцию → Декомпозировать на требования к объектам → Отслеживать состояние между шагами → Применить специализированные инструменты → Проверить каждое требование → Агрегировать оценку
Именно это отличает EdiVal-Agent от единого ИИ-судьи или набора метрик изображений. Он декомпозирует проблему, поддерживает состояние между взаимодействиями, координирует специализированные ИИ-инструменты и объединяет их результаты для обеспечения детальной оценки того, в чем базовая модель редактирования изображений преуспевает, а где терпит неудачу.
Результаты
Ключевой вопрос заключается в том, действительно ли агентная оценка отражает человеческие суждения.
Для наиболее агентного компонента фреймворка, EdiVal-IF, мы оцениваем, насколько его суждения совпадают с оценками людей. EdiVal-IF достиг 81,3% согласия с человеческими оценками, превзойдя оценщик только на базе VLM с результатом 75,2% и пороговую метрику на основе CLIP с результатом 68,9%.
Это улучшение демонстрирует ценность сочетания рассуждений ИИ со специализированными визуальными инструментами. Модель «зрение-язык» способна понять семантический смысл инструкции, в то время как детекторы объектов и другие визуальные модели могут более точно проверить, были ли выполнены конкретные требования к редактированию.
Затем мы используем EdiVal-Agent для бенчмаркинга ведущих базовых моделей редактирования изображений в различных задачах редактирования и при многошаговых взаимодействиях.
Оценка выявляет важную проблему: высокая производительность на одном шаге не обязательно означает высокую производительность на нескольких шагах. По мере накопления инструкций по редактированию модели должны следовать каждому новому запросу, сохраняя при этом предыдущие правки и несвязанный контент. Таким образом, ошибки могут накапливаться со временем.
Для разработчиков такая детализированная оценка дает нечто большее, чем просто таблицу лидеров. Она помогает выявить, связаны ли улучшения или регрессии со следованием инструкциям, сохранением контента или визуальным качеством.
Замыкание цикла разработки базовой модели
Таким образом, EdiVal-Agent может служить не просто бенчмарком. Агентная оценка может стать частью самого процесса разработки базовой модели редактирования изображений. Когда создается новая контрольная точка, модель может автоматически генерировать изменения на наборе для оценки. EdiVal-Agent может проверить эти результаты, измерить производительность в различных измерениях и выявить конкретные типы сбоев.
Эти результаты могут послужить основой для следующей итерации обучения. Например, новая контрольная точка может улучшить способность следовать инструкциям по редактированию, но ухудшить способность сохранять несвязанные объекты. Другая может хорошо справляться с отдельными правками, но быстро деградировать при более длинных последовательностях редактирования.
Автоматизированная детализированная оценка позволяет проще выявлять такие компромиссы и сокращать цикл обратной связи между созданием новой модели и пониманием того, как она себя ведет.
Место Lambda в этой экосистеме
EdiVal-Agent является частью более масштабной работы Lambda в области агентного ИИ — разработки систем ИИ, способных рассуждать о сложных задачах, координировать специализированные модели и инструменты, а также выполнять многошаговые рабочие процессы.
Большинство дискуссий об агентном ИИ сосредоточено на агентах, выполняющих задачи для пользователей. EdiVal-Agent исследует другое важное направление: использование ИИ-агентов для оценки других ИИ-моделей.
Оценка базовых моделей естественным образом подходит для агентного подхода. Способный оценщик должен понимать задачу, декомпозировать ее на требования, поддерживать состояние на протяжении нескольких взаимодействий, выбирать подходящие инструменты, проверять результаты и выдавать полезную обратную связь.
Таким образом, EdiVal-Agent расширяет работу Lambda в области агентного искусственного интеллекта на цикл разработки базовых моделей. Агентные системы выступают не просто приложением, созданным на базе фундаментальных моделей, но также могут становиться частью инфраструктуры, используемой для бенчмаркинга, валидации и улучшения этих моделей.
Это направление приобретает все большее значение по мере того, как базовые модели становятся все более мультимодальными, интерактивными и способными к долгосрочному планированию. Их результаты становится все сложнее оценивать с помощью одной метрики или даже одного ИИ-судьи. Сама оценка все больше требует задействования рассуждений, памяти, декомпозиции и использования инструментов.
В сочетании с GPU-инфраструктурой Lambda агентная оценка также может масштабироваться по моделям, контрольным точкам, изображениям, итерациям редактирования и оценщикам, что делает непрерывную оценку практичной в процессе разработки моделей.
EdiVal-Agent указывает на более широкое направление исследований Lambda в области агентного ИИ: это ИИ-агенты, которые не только выполняют сложные задачи, но и помогают разработчикам понимать, оценивать и совершенствовать другие системы искусственного интеллекта.
По мере того как базовые модели становятся все более функциональными, системы, используемые для их оценки, также должны развиваться. Агентный ИИ предоставляет путь к замыканию цикла между обучением, оценкой и улучшением, помогая разработчикам понять не только то, стала ли новая модель лучше, но и где именно она улучшилась и почему.
Paper: arxiv.org/pdf/2509.13399Credits: The University of Texas at Austin, UCLA, Microsoft, and Lambda.Authors: Tianyu Chen, Yasi Zhang, Zhi Zhang, Peiyu Yu, Shu Wang, Zhendong Wang, Kevin Lin, Xiaofei Wang, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Jianwen Xie, Oscar Leong, Lijuan Wang, Ying Nian Wu, Mingyuan Zhou. ICLR 2026.









