Используя GPT‑6 Astra в Codex для проведения экспериментов, компания Asana оптимизировала рабочий процесс своего браузерного агента на базе GPT‑6.1 Sol, добившись снижения затрат в 76 раз и ускорения работы в 5 раз.
Asana помогает клиентам автоматизировать работу в бизнес-приложениях с помощью StackAI(opens in a new window) — платформы, которую она приобрела(opens in a new window). Используя StackAI, клиенты могут создавать рабочие процессы для навигации по веб-сайтам, заполнения форм и сбора информации без написания кода. В масштабах Asana даже небольшие неэффективности в этих процессах приводят к значительным потерям.
Технический директор StackAI в Asana, доктор Фрэнк Идальго, поставил задачу сделать браузерного агента быстрее и дешевле в эксплуатации. Он поручил GPT‑6 Astra в Codex исследовать работу агента, протестировать улучшения и сравнить результаты. Работа, которая, по его оценкам, заняла бы от одного до двух месяцев при ручном выполнении, заняла около недели.
Asana’s 144-run study(opens in a new window) протестировала GPT‑6.1 Sol и три другие передовые модели, которые здесь называются Моделями A, B и C. Оптимизированный рабочий процесс, созданный на базе GPT‑6.1 Sol, показал средние оценочные затраты на модель в размере $0,47 и время выполнения около четырех минут, что в 76 раз дешевле и в 5 раз быстрее, чем исходная производственная конфигурация на Модели B.
«Вот как выглядят команды людей и агентов на практике. Инженер задал направление, GPT-6 Astra провела эксперименты, а результаты были внедрены в производство через Command. Это демонстрирует, как Asana воплощает в жизнь работу команд, состоящих из людей и агентов».
— Арнаб Боуз, директор по продукту (CPO) в Asana
Выявление неэффективности браузерного агента с помощью GPT‑6 Astra
Чтобы действовать быстро, Идальго начал с использования GPT‑6 Astra в Codex для анализа кодовой базы и объяснения того, как агент формировал каждый запрос к модели. GPT‑6 Astra обнаружила, что агент кэшировал свои фиксированные инструкции и определения инструментов, но не растущую историю текста страниц и скриншотов, которые он собирал, поэтому каждый запрос повторно отправлял эту историю по полной стоимости.
Агент также удалял старые скриншоты и сокращал текст практически на каждом шаге. Каждое изменение влияло на историю, поэтому простое кэширование истории не помогло бы, а потеря этих данных могла потребовать от агента повторного посещения страниц, которые он уже прочитал.
От двух месяцев исследований до одной недели с GPT‑6 Astra
Идальго изучил предложенные GPT‑6 Astra исправления и выбрал три для тестирования:
- Расширение кэширования на историю просмотров агента
Расширение кэширования на историю просмотров агента
- Увеличение объема текста, который он может хранить
Увеличение объема текста, который он может хранить
- Удаление скриншотов пакетами, а не на каждом шаге
Удаление скриншотов пакетами, а не на каждом шаге
GPT‑6 Astra начала с быстрых тестов, чтобы определить, какие переменные имеют значение. Поскольку код не был изначально спроектирован для контролируемых экспериментов, она выполнила рефакторинг кода, чтобы один интерфейс и бэкенд могли поддерживать множество рабочих процессов параллельно, каждый со своими настройками.
Astra провела полное исследование: бюджеты истории в 120 000 и 480 000 символов, а также шесть политик кэширования и работы со скриншотами, каждая из которых была протестирована трижды на каждой из четырех моделей (см. таблицу ниже). Наиболее эффективная политика позволяла накапливать до 20 скриншотов перед тем, как оставить только самый последний. Это позволяло дольше сохранять раннюю историю без изменений между удалениями. В сочетании с увеличенным бюджетом истории это стало оптимизированным рабочим процессом. Каждая конфигурация выполняла одну и ту же задачу: сбор шести полей для каждой из 32 книг из публичного демо-каталога, что типично для задач, которые некоторые клиенты Asana выполняют в StackAI.
Модель
Описание
Цена
Модель A
Меньшая, менее дорогая модель от другой передовой лаборатории, выпущенная осенью 2025 года
Половина цены GPT‑6.1 Sol
Модель B
Модель, изначально использовавшаяся в производстве, от той же лаборатории, что и Модель A, выпущенная летом 2026 года
Такая же цена, как у GPT‑6.1 Sol
Модель C
Обновленная версия Модели B, выпущенная осенью 2026 года
Такая же цена, как у GPT‑6.1 Sol
GPT‑6.1 Sol
Модель от OpenAI
GPT‑6 Astra запускала рабочие процессы и анализировала запросы, записи использования и выходные данные, а отдельные сессии модели проверяли выполненную работу. Запросы, трассировки данных и результаты каждой сессии записывались в Command(opens in a new window), платформу доставки программного обеспечения Asana, чтобы команда могла просмотреть полное исследование позже. На основе Command выводы превращались в тикеты, затем в пулл-реквесты, и изменения отправлялись в производство.
«Это заняло бы у меня от одного до двух месяцев при ручной работе. С GPT-6 Astra в Codex это заняло около недели: я ставил /цель перед сном и проверял результаты утром».
— Фрэнк Идальго, доктор философии, технический директор StackAI в Asana
Снижение стоимости модели ниже $0,50 за запуск
Для Модели B оптимизация снизила оценочную стоимость модели с как минимум $36,21 (некоторые исходные запуски достигали лимита шагов до завершения) до $1,24 за запуск, что является сокращением в 29 раз. Оптимизированный рабочий процесс на GPT‑6.1 Sol оказался еще в 2,6 раза дешевле — $0,47. Каждый запуск в оптимизированном рабочем процессе успешно завершал задачу и возвращал правильный ответ.
Среднее значение по 3 запускам. ≥: базовый показатель включает ограниченные запуски, поэтому его среднее значение является нижней границей.
Две правые группы сравниваются с оптимизированной Моделью B. Модель B работала в фазе 1, Модель C и Sol 6.1 — в фазе 2 того же исследования (пунктирная линия).
Только на GPT‑6.1 Sol, с увеличенным бюджетом истории, новая политика кэширования и работы со скриншотами снизила стоимость в 4 раза, с $1,97 до $0,47 за запуск. Каждый вызов стал примерно в 3 раза дешевле, поскольку 89% входных данных поступало из кэша по цене 5% от стоимости без кэширования. Запуски также стали быстрее: не менее 22,5 минут в исходной настройке на Модели B и около четырех минут с оптимизированным рабочим процессом на GPT‑6.1 Sol.
Среднее значение по 3 запускам, усы стандартного отклонения. ≥: среднее значение включает ограниченный или незавершенный запуск, поэтому истинное значение как минимум такое.
Столбцы используют синюю тему. Эффекты кэширования чтения следует оценивать относительно столбца с увеличенным бюджетом 480k.
Маркеры запуска и усы стандартного отклонения являются приблизительными реконструкциями на основе исходного изображения; базовые значения запусков и стандартные отклонения были недоступны.
Среднее значение по 3 запускам, усы стандартного отклонения. ≥: среднее значение включает ограниченный или незавершенный запуск, поэтому истинное значение как минимум такое.
Столбцы используют синюю тему. Эффекты кэширования чтения следует оценивать относительно столбца с увеличенным бюджетом 480k.
Маркеры запуска и усы стандартного отклонения являются приблизительными реконструкциями на основе исходного изображения; базовые значения запусков и стандартные отклонения были недоступны.
Исследование также показало, как управление историей влияет на то, выдает ли агент ответ вообще. Предоставление GPT‑6.1 Sol большего пространства для хранения истории просмотров увеличило количество успешных запусков с трех из 18 при меньшем бюджете истории до всех 18 при большем бюджете, причем каждый из них дал правильный ответ. Для Идальго бизнес-ценность заключается в предоставлении клиентам доступа к более быстрым и мощным моделям при сохранении устойчивых операционных расходов.
«Раньше стоимость ограничивала выбор моделей, которые мы могли предложить клиентам для этих задач. Сделав агента более эффективным, мы можем предоставить клиентам лучшую и более быструю модель, одновременно снижая наши операционные расходы».
— Фрэнк Идальго, доктор философии, технический директор StackAI в Asana
Масштабирование экспериментов и тестирование продуктов
Asana выпустила изменения в навигации браузера в StackAI и разрабатывает инструменты, которые упростят повторение подобных экспериментов. Со временем команда планирует интегрировать это тестирование в систему оценки платформы, чтобы клиенты и внутренние команды могли сравнивать стоимость, время выполнения и качество ответов при настройке своих агентов.
«Скорость поставки больше не является узким местом; им стало внимание человека. Мы близки к миру, где каждый инженер будет менеджером продукта, управляющим парком агентов».
— Фрэнк Идальго, доктор философии, технический директор StackAI в Asana
Asana теперь использует GPT-6 Astra в Codex для тестирования функций продукта перед выпуском: Astra перемещается по платформе, пробует различные входные данные и сообщает об ошибках для проверки специалистами по контролю качества. Идальго рассматривает это как основу для нового жизненного цикла разработки программного обеспечения, где множество сессий облачных агентов тестируют функции параллельно.










