Когда мы представили GPT‑6 Astra, мы продемонстрировали, как далеко продвинулись наши модели в использовании компьютеров для профессиональной работы — от подготовки документов до тестирования веб-сайтов. Наша следующая цель — сделать агентов более способными и эффективными в использовании специализированного программного обеспечения для решения сложных бизнес-задач. Мы изучаем, как обучать модели понимать бизнес-правила компании, выполнять многоэтапные рабочие процессы и проверять, соответствует ли их работа исходным требованиям.
Чтобы ускорить эти исследования, мы напрямую сотрудничаем с небольшим числом разработчиков программного обеспечения, которые лучше всего понимают эти рабочие процессы. Вместе мы выявляем сложные и ценные задачи и превращаем их в исследовательские проблемы для обучения и оценки наших моделей, что в конечном итоге делает их более функциональными и полезными в реальных бизнес-приложениях.
Нашим первым партнером стала компания Ironclad, лидер в области создания контрактов с помощью ИИ. Тесно сотрудничая с командой Ironclad, мы разработали задачи, которые требуют от агентов настройки соглашений, согласований и повторно используемых юридических условий, а также продемонстрировали прогресс в этих сложных рабочих процессах. Опыт Ironclad сыграл ключевую роль в определении того, как выглядит успех, и в переносе реальных потребностей клиентов непосредственно в процесс разработки передовых моделей. Мы признательны за их партнерство и рады поделиться тем, чего мы достигли вместе.
GPT‑6 Astra — наша первая передовая модель, обученная на задачах Ironclad. В ходе нашей исследовательской оценки ее средний балл оказался на 32% выше, чем у GPT‑5.6 Sol, в то время как расчетное время на одну попытку было на 48% ниже.
Превращение рабочих процессов по заключению контрактов в обучающие задачи
Представьте себе команду юридического обеспечения, которая настраивает процесс покупки ПО. Финансовый отдел может потребовать одобрения покупок на сумму, превышающую определенный лимит, служба безопасности — проверить определенные запросы, а юридический отдел — изучить нестандартные условия. Человек, настраивающий этот процесс, должен превратить этот краткий список в форму заявки, шаблоны документов, правила согласования и запись об итоговом соглашении.
ИИ-агент, выполняющий ту же работу, должен держать эти требования в поле зрения по мере продвижения по программе. Например, он должен настроить финансовое одобрение при превышении лимита расходов и проверить, что запросы выше и ниже него идут по правильным путям. Правильного выполнения отдельных шагов недостаточно: готовый процесс должен корректно работать во всех ситуациях, для обработки которых он был создан.
Сотрудники Ironclad и специалисты, использующие Ironclad в OpenAI, помогли нашим исследователям определить 11 задач в области юридической, коммерческой и закупочной деятельности. Сюда вошли такие задачи, как составление соглашений о неразглашении, создание процессов утверждения закупок и обновление повторно используемого юридического пункта таким образом, чтобы он отражал юрисдикцию, выбранную инициатором запроса. По нашим оценкам, у опытного пользователя выполнение такой работы заняло бы в среднем от 30 до 40 минут на задачу.
Мы оценивали каждую задачу по 8–50 критериям в зависимости от ее сложности. Это позволило нам увидеть, какие части модель выполнила правильно, а где потерпела неудачу. Ironclad также предоставила размещенные в облаке программные среды своего продукта, где модели могли практиковаться в решении этих задач. Наши исследователи разработали синтетические обучающие задачи на основе типичных рабочих процессов и использовали обучение с подкреплением, чтобы помочь моделям совершенствоваться посредством практики и обратной связи. Эта комбинация — задачи, отобранные совместно со знающими работу людьми, подробные критерии и площадка для практики моделей — гарантирует, что мы совершенствуемся в решении реальных задач, наиболее важных для наших клиентов.
Результаты Astra
Мы сравнили Astra и GPT‑5.6 Sol, используя режим максимального рассуждения (Max reasoning) для Astra и режим высокого рассуждения (High reasoning) для Sol — настройки, при которых каждая модель набрала наибольшее количество баллов. По результатам 11 исследовательских задач средний балл Astra составил 55,0% по сравнению с 41,6% у GPT‑5.6 Sol, в то время как расчетное среднее время на одну попытку сократилось с 37,0 минут у Sol до 19.2 минут у Astra. Внутренняя модель, использовавшаяся при разработке Astra, показала еще более высокий результат — 63.7% по этим задачам, и мы стремимся перенести эти дальнейшие достижения на будущие модели.
Astra выполнила больше требований задач при меньшем симуляционном времени на попытку. Два видеоролика ниже показывают, как модели справились с одной и той же исследовательской задачей. Astra (первая) выполнила около 94% критериев задачи примерно за 20 минут; GPT‑5.6 Sol (вторая) выполнила около 85% примерно за 32 минуты.
GPT‑6 Astra выполнила около 94% критериев задачи примерно за 20 минут.
GPT‑5.6 Sol выполнила около 85% критериев задачи примерно за 32 минуты.
Что это сотрудничество означает для Ironclad
Роль Ironclad в этой работе отражает хорошо известную ее клиентам проблему: процесс заключения контрактов должен обрабатывать исключения, сохраняя при этом правила, от которых зависит бизнес. Если агент теряет из виду одно из таких правил на середине задачи, это ограничивает возможности программного обеспечения, которые компания может с уверенностью поручить ему выполнить. Это подчеркивает, почему человеческий контроль по-прежнему важен по мере того, как агенты становятся лучше в решении сложных задач по заключению контрактов, и почему полноценная платформа для работы с контрактами остается незаменимой. Сотрудничество с нашими исследователями дает Ironclad возможность перенести эти проблемы на этап разработки базовой модели, где мы можем изучать их вместе.
По мере того как модели становятся более способными, у Ironclad появляется возможность использовать их в большем числе собственных продуктов. Для юридических и бизнес-команд это может означать, что ИИ возьмет на себя большую часть усилий, связанных со сложным заключением контрактов, при сохранении элементов контроля, на которые полагаются эти команды.
Сотрудничайте с нами для развития ИИ в сложной профессиональной деятельности
Мы приглашаем небольшое число компаний, разрабатывающих программное обеспечение, напрямую поработать с нашими исследовательскими и инженерными командами над важными профессиональными задачами, которые современные агенты пока не могут надежно решать. Если у вашей команды есть такая задача, мы хотели бы увидеть конкретный пример: что вы просите агента сделать, доказательства того, где он терпит неудачу, и как вы оцениваете успешный результат. Партнеры также должны иметь возможность привлечь людей, глубоко разбирающихся в этой работе, предоставить безопасную среду для тестирования и данные, которые можно безопасно использовать для исследований. Это послужит отправной точкой для расследования сбоев и измерения того, улучшается ли модель.











