Если вы работаете в компании AEC и хотите понять, что означают эти результаты для вашей практики, прочитайте нашу сопроводительную статью: Что означает AEC-Bench для компаний AEC?
Архитектура, инженерия и строительство — это глобальная отрасль стоимостью 13 триллионов долларов. Хотя ИИ‑агенты изменили рабочие процессы разработки программного обеспечения (сейчас агенты кода поддерживают десятки миллионов разработчиков), построенный мир представляет собой следующую большую границу для ИИ — которую ещё предстоит открыть. Не из‑за отсутствия амбиций, а из‑за фундаментального несоответствия между тем, как ИИ‑агенты воспринимают информацию, и тем, как построенный мир её передаёт.
Сегодня мы выпускаем AEC-Bench — первый мультимодальный бенчмарк для оценки ИИ‑агентов на реальных задачах архитектуры, инженерии и строительства. С 196 экземплярами задач из 9 семей задач AEC-Bench предоставляет первую в отрасли строгую систему измерения возможностей ИИ‑агентов в рабочих процессах координации строительства. Наши результаты показывают, что специализированный дизайн агента для конкретной области — а не просто большие модели — является ключом к раскрытию потенциала ИИ в построенном мире.
Мы открыто публикуем наш набор данных бенчмарка, harness‑агента и код оценки на github.com/nomic-ai/aec-bench под лицензией Apache 2.0 для полной воспроизводимости.
Документы строительства являются одними из самых информационно насыщенных артефактов, создаваемых в любой отрасли. Один набор чертежей может занимать сотни страниц с плотными аннотациями, указаниями, линиями и перекрестными ссылками, которые требуют сложного визуального рассуждения для интерпретации. Это не цифровые документы, как исходный код — это 2D‑виды, экспортированные из 3D‑моделирующего ПО, где смысл передаётся через структурированные визуальные и текстовые элементы, включая планы, детали, указания, заметки и заголовки.
Неудачи в координации между архитекторами, инженерами и строительными командами являются основными причинами задержек графика и перерасхода бюджета в строительных проектах. Во время предстроительной, проектной, инженерной и передачи работы многие задержки возникают из‑за несоответствий, введённых при создании и пересмотре наборов чертежей и проектных документов. В ответ отраслевые команды полагаются на стандартизированные процессы проверки и координации, требующие глубокого профессионального опыта и мультимодального рассуждения — именно тот тип работы, который ИИ‑агенты должны помогать выполнять, но пока не могут надёжно выполнять.
Стандартные агенты кода — системы как Claude Code и Codex, которые превосходят в навигации по репозиториям исходного кода — подходят к документам строительства теми же стратегиями, которые используют для кода: извлечение текста, поиск ключевых слов и рендеринг изображений. Но документы строительства фундаментально отличаются. Инструменты извлечения текста, как pdftotext, сворачивают пространственный макет и геометрические отношения в линейный текст, игнорируя визуальную структуру, несущую критический смысл. Инструменты на основе зрения не обладают точностью, необходимой для надёжного геометрического рассуждения. В результате возникает систематический режим отказа: агенты получают неполный или неверный контекст, что приводит к накопительным ошибкам.
Наше оценивание показывает, насколько укоренено это поведение: среди всех оценённых моделей 77 % траекторий агентов использовали pdftotext как основную стратегию извлечения информации, фактически рассматривая сложные мультимодальные документы строительства как плоские текстовые файлы. Агенты на основе Codex полностью полагались на Bash (100 % взаимодействий), выполняя каждое действие как команду оболочки. Такой набор инструментов, ориентированный на код, фундаментально несовместим с требованиями мультимодальной координации документов AEC.
AEC-Bench — это мультимодальный бенчмарк, основанный на реальных рабочих процессах координации строительства, разработанный в сотрудничестве с экспертами отрасли, включая практикующих архитекторов и инженеров. Мы собрали 196 экземпляров задач из 9 семей задач, организованных в три уровня сложности, основанные на том, сколько контекста документа требуется агенту для выполнения координационной задачи:
Intra-Sheet — задачи, решаемые с одной страницы. Проверка того, совпадают ли указания с ссылочными элементами, проверка названий деталей или обзор локальной сборки. Фокус — понимание отношений между текстом и мультимодальными элементами чертежа на одной странице.
Intra-Drawing — задачи, требующие рассуждения через несколько листов в одном наборе чертежей. Проверка перекрестных ссылок, сравнение индексов листов с заголовками и отслеживание деталей через виды. Это требует навигации между страницами и отслеживания связанной информации по всему набору.
Intra-Project — задачи, включающие несколько документов: чертежи, спецификации и подачки. Идентификация конфликтов между спецификациями и чертежами или оценка подачек на соответствие. Это отражает реальную координацию на уровне проекта, где релевантная информация распределена по разным документам.
Каждый экземпляр задачи состоит из инструкции на естественном языке, изолированной среды выполнения с реальными документами строительства, полученными из проектов государственного сектора, и автоматического проверяющего, оценившего по фактическим данным, установленным профессиональными инженерами и архитекторами.
AEC Bench
Состав бенчмарка
196 экземпляров · 9 семей задач · 3 уровня сложности
Одна страница
Много документов
Мы оценили производительность агентов в двух общих harness‑ах для агентов кода — Codex (GPT-5.2, GPT-5.4) и Claude Code (Opus 4.6, Sonnet 4.6) — в двух конфигурациях: H (базовый harness с стандартными инструментами) и H+N (базовый harness, дополненный инструментами Nomic, включая Nomic Parse и Nomic Embeddings). Мы также оценили полностью интегрированного Nomic Agent, наш специализированный harness, созданный с нуля для рабочих процессов построенного мира.
Nomic Agent достигает наивысшей общей производительности, становясь ведущим harness‑ом для задач AEC:
- Intra-Sheet: средняя награда 70.6 — 8.1 очка выше следующей лучшей конфигурации, демонстрируя превосходное понимание мультимодальных задач одной страницы
- Intra-Project: средняя награда 62.0 — превосходит все остальные конфигурации на самых сложных задачах кросс‑документной координации
- Intra-Drawing: средняя награда 88.3 — лидирует среди всех конфигураций harness‑ов в рассуждении по нескольким листам
AEC-Bench
Симуляции задач
v1.0 · 3 типа задач
Агент получает:
CivicCenter_ArchDrawings_PermitSet.pdf· 47 стр.
Sheet IndexIntra-Drawing
No.Description
G-001
Общие заметки и сокращения
A-101
План участка
A-201
План этажа — Уровень 1
A-202
План этажа — Уровень 2
A-301
Внешние фасады
Title Block — A-201Sheet
Проект
Реновация городского центра
Портленд, OR · Набор разрешений 2024-03
Sheet Title
Первый план этажа
Sheet No.
A-201
Drawn by
Date
2024-03-15
Scale
1/8"=1'-0"
Task: Найти все записи индекса листа, которые не совпадают с фактическим заголовком на этом листе.
Самое важное открытие из AEC-Bench — это то, что поиск является основным узким местом для ИИ‑агентов в AEC. Агенты часто не достигают этапа основного рассуждения, потому что не могут надёжно найти соответствующий лист, деталь или документ. Как только правильный контекст найден, производительность значительно улучшается.
Дополнение базовых систем инструментами Nomic — структурированными представлениями чертежей, созданными с использованием специализированных моделей, таких как Nomic Parse и Nomic Embeddings, — привело к значительному улучшению результатов в задачах, чувствительных к поиску, для всех семейств базовых моделей:
- Детальный технический обзор: среднее улучшение на 32,2 балла для всех моделей
- Синхронизация спецификаций и чертежей: среднее улучшение на 20,8 балла
- Навигация по чертежам: среднее улучшение на 18,75 балла, при этом несколько моделей достигли идеального результата в 100%
Эти достижения были стабильными для всех семейств базовых моделей — от GPT-5.4 до Sonnet 4.6, — что доказывает: структурированное, предметно-ориентированное представление документов неизменно повышает производительность агентов независимо от используемой модели.
Однако задачи, требующие точного визуально-пространственного обоснования, такие как точность примечаний-выносок и отслеживание перекрестных ссылок, показали, что одного лишь парсинга документов недостаточно. Эти задачи требуют отслеживания выносных линий и интерпретации геометрических отношений исключительно визуально, что остается конкретной точкой отказа для текущих систем базовых моделей. Этот вывод указывает на необходимость более глубоких возможностей визуального обоснования в агентных системах следующего поколения.
Мы считаем, что отрасль AEC заслуживает строгих открытых бенчмарков для стимулирования прогресса во внедрении ИИ. По мере развития агентских бенчмарков включение реалистичных структур документов и рабочих процессов станет критически важным для понимания поведения агентов в прикладных условиях. AEC-Bench — это наш вклад в достижение этой цели.
Полный бенчмарк, агентские системы и код для оценки доступны на github.com/nomic-ai/aec-bench по лицензии Apache 2.0. Мы призываем исследователей и практиков развивать эту работу и расширять границы того, чего могут достичь ИИ-агенты в сфере строительства.
В будущих работах мы планируем расширить бенчмарк, включив в него более крупные наборы чертежей, больше дисциплин AEC и дополнительные семейства задач. Мы разрабатываем улучшенные верификаторы, которые оценивают обоснованность доказательств и этапы рассуждений, а также проектируем агентные системы, созданные специально для навигации по документам — системы, которые итеративно исследуют наборы чертежей, поддерживают пространственную память на листах и извлекают области с доказательствами перед началом рассуждений.
Чтобы узнать больше о том, как Nomic создает ИИ-платформу для строительной отрасли, посетите нашу платформу или закажите демонстрацию.
Харш Манкодия, Чейз Галлик, Теодорос Галанос (Aurecon), Андрей Муляр, Nomic
