Корпорациям нужны агенты, которые эффективно работают в их собственных средах. Работа, которую они поручают этим агентам, определяется используемыми системами, правилами, которым они следуют, и состоянием их данных. Модель может обладать широкими возможностями, но при этом испытывать трудности с конкретной средой: рабочим процессом, с которым она плохо справляется, комбинацией инструментов, которые она использует неверно, или ограничением, которое она не соблюдает. Именно эти слабые места корпорации необходимо устранить.
Сложность заключается в превращении этих слабых мест в обучающие данные. Отдельный сбой дает нам некоторую информацию, но для обучения модели требуется множество новых задач, которые задействуют одну и ту же способность в различных ситуациях. Эти задачи также должны быть выполнимы в данной среде, напоминать работу, которую действительно мог бы запросить пользователь, и иметь надежный способ проверки того, справился ли агент.
В ServiceNow CoreAI мы создали AutoSynthData, чтобы превращать такие пробелы в возможностях в обучающие данные. Система использует сбои целевой модели и успехи более сильной «учительской» модели, чтобы определить, чему модель должна научиться дальше, а затем генерирует и проверяет новые задачи, которые тренируют эти способности. По мере совершенствования модели учебная программа смещается в сторону того, что ей все еще дается с трудом. Мы иллюстрируем этот конвейер с помощью EnterpriseOps Gym (Malay et al., 2026), используя выпущенный набор данных. Мы начинаем с описания среды, в которой работает агент, и того, что делает задачу полезной для обучения.
Что делает агентную задачу полезной?
Агентная среда определяет мир, в котором действует агент: состояние, которое он может наблюдать и изменять, инструменты и API, которые он может вызывать, и переходы состояний, вызванные его действиями.
Задача инстанцируется внутри этой среды. Мы используем следующую абстракцию:
Спецификация системы
Спецификация системы определяет ограничения, в рамках которых работает агент, включая системные инструкции, политики среды и, при необходимости, инициализацию конкретной задачи, такую как начальное состояние базы данных или набор статей базы знаний.
Спецификация должна быть совместима с инструментами, состоянием и поддерживаемыми действиями среды. Ее инструкции должны быть ясными и не содержать произвольных ограничений, введенных исключительно для создания сложности.
Задача для агента
Пользовательский запрос определяет, что пользователь хочет получить от агента, вместе с любыми ограничениями на уровне пользователя. Сгенерированная задача должна обладать тремя свойствами.
Осуществимость. Должна существовать хотя бы одна траектория в текущей среде, которая удовлетворяет пользовательскому запросу при соблюдении спецификации системы. Это исключает задачи, зависящие от недоступных инструментов, недоступных знаний, невозможных переходов состояний или действий, запрещенных политикой.
Реалистичность. Пользовательский запрос должен напоминать то, о чем пользователь мог бы правдоподобно попросить в целевой среде. Пространство исполняемых моделей поведения обычно намного больше, чем пространство реалистичных рабочих процессов.
Сложность. Для обучения задача должна выявлять слабость текущего агента. Задачи, которые уже надежно решены, дают мало нового обучающего сигнала. Таким образом, полезная область — это задачи, которые осуществимы и реалистичны, но еще не решаются стабильно.
Верификатор
Верификатор определяет, успешно ли завершает задачу полученная траектория. Он должен обладать тремя свойствами.
Согласованность. Он должен соответствовать пользовательскому запросу, спецификации системы и состоянию среды, специфичному для задачи.
Обоснованность. Он должен отклонять траектории, которые не выполняют задачу или нарушают соответствующие ограничения.
Полнота. Он должен принимать допустимые решения, а не кодировать одну конкретную эталонную траекторию.
Эти свойства имеют прямое значение во время обучения. Слабый верификатор может поощрять неправильное поведение, в то время как слишком строгий верификатор может штрафовать за допустимые решения.
Обзор
Имея среду и целевую модель, AutoSynthData генерирует обучающие задачи, состоящие из спецификации системы, пользовательского запроса и верификатора. Сгенерированные задачи основаны на среде и выбраны так, чтобы обеспечить полезный обучающий сигнал для текущей модели.
AutoSynthData сначала оценивает целевую модель в среде с помощью диагностических задач и выявляет закономерности в задачах, с которыми она испытывает трудности. Более сильная модель-учитель помогает определить, какие из этих задач решаемы и как выглядит успешное поведение. AutoSynthData превращает полученные пробелы в возможностях в новые исполняемые задачи, проверяет каждую задачу в среде и использует принятые образцы для дообучения. Оценка обновленной модели показывает, какие пробелы остались, и может служить руководством для следующего цикла генерации.
От сбоев модели к учебной программе
AutoSynthData использует прогоны оценки в целевой среде, чтобы определить, чему модель должна научиться дальше. В нашем эксперименте с EnterpriseOps Gym мы запускаем как целевую модель, так и более сильную модель-учитель на задачах оценки. Мы изучаем эти прогоны, чтобы определить:
- тестируемую способность;
- задействованные инструменты и структуру рабочего процесса;
- где целевая модель терпит неудачу и как учитель добивается успеха;
- свойства, которым должно удовлетворять правильное конечное состояние;
- параметры, которые могут варьироваться при сохранении тестируемой способности.
Мы дистиллируем эти выводы в очищенные карточки спецификации возможностей. Задачи оценки определяют, чему модель должна научиться, но генератор не получает их исходные запросы, сущности, траектории или детали верификатора. Он получает карточки и использует их для создания новых задач с другими запросами, состояниями и путями решения.
Генерация и масштабирование задач
Выявление пробела в возможностях говорит нам, чему учить, но для обучения требуется множество разнообразных задач, которые тренируют эту способность. AutoSynthData использует карточку спецификации для генерации этих задач.
Предположим, целевая модель испытывает трудности с задачами, требующими следующего рабочего процесса:
Генератор создает новые задачи, которые тренируют этот рабочий процесс, варьируя сущности, начальное состояние среды, состав рабочего процесса, комбинации инструментов, формулировки и сложность. Затем более сильный учитель демонстрирует успешную траекторию для каждой задачи. Для обучения с учителем (SFT) эти демонстрации учат целевую модель применять способность в новых ситуациях.
AutoSynthData создает набор данных в два этапа: сначала генерирует и проверяет основные образцы, а затем расширяет их до новых вариантов.
Цель (Target)
Этап «Цель» создает основной набор обучающих образцов на основе спецификаций возможностей. Исполнители генерируют независимые задачи параллельно, выбирая новую цель, когда заканчивают предыдущую. Каждый кандидат проходит проверку, выполнение, оценку решателем и исправление перед принятием. Результатом является пакет проверенных примеров, построенных вокруг того, чему должна научиться целевая модель.
Умножение (Multiply)
Этап «Умножение» расширяет набор данных путем создания новых вариантов принятых целевых образцов. Каждый вариант имеет свой собственный запрос пользователя, состояние среды, конфигурацию сущностей, эталонную траекторию и верификатор, и должен пройти те же проверки валидации и выполнения. Умноженный образец не может служить основой для другого умноженного образца. Это закрепляет расширение за проверенным целевым набором и ограничивает дрейф между поколениями.
Детали реализации
Для поддержки обеих фаз AutoSynthData разделяет управление генерацией и выполнение, зависящее от среды. Общий контроллер координирует генерацию, контроль качества, покрытие и создание набора данных, в то время как адаптер отвечает за выполнение в среде, управление задачами и состояниями, повторное воспроизведение эталонных данных, детерминированную верификацию, выполнение решателей и профилирование задач.
В совокупности параллельная генерация целей и их умножение обеспечивают путь к созданию наборов данных масштаба обучения. Их полезность зависит от проверок, применяемых к каждому кандидату: задача должна быть выполнимой, решение должно работать, а верификатор должен уметь отличать успех от неудачи.
Для получения качественных синтетических данных недостаточно просто генерации
Генерации правдоподобного запроса недостаточно для создания полезных обучающих данных. Задача может оказаться невыполнимой в целевой среде, ее эталонное решение может дать сбой при выполнении, или верификатор может поощрять неверное конечное состояние. AutoSynthData проверяет эти свойства перед принятием задачи для обучения.
AutoSynthData проверяет качество на двух уровнях: отдельные кандидаты должны пройти верификацию, а пакеты должны обеспечивать полезное покрытие и разнообразие.
Верификация и исправление на уровне образцов
Каждый кандидат должен пройти цикл контроля качества перед попаданием в обучающий набор данных. Мы начинаем с оценки решателем для измерения сложности. В используемой здесь конфигурации мы отдаем предпочтение задачам, которые целевая модель решает не более чем в одной из трех попыток, а более сильный решатель — как минимум в двух из трех. Кандидаты также проходят позитивную и негативную верификацию, а также ограниченный процесс исправления.
Позитивная верификация
Позитивный фильтр задает вопрос: решает ли предполагаемое решение сгенерированную задачу?
Конвейер выполняет эталонную траекторию в целевой среде и проверяет полученное состояние с помощью верификатора кандидата. Это выявляет несоответствия между промптом, начальным состоянием, решением и критериями успеха.
Негативная верификация
Негативный фильтр задает вопрос: приводят ли соответствующие неверные результаты к сбою?
Например, он может мутировать части ожидаемого результата и подтвердить, что эти состояния больше не проходят верификацию. Это позволяет выявить слабые верификаторы, которые засчитывают успех без выполнения требуемого поведения.
Критика и исправление
Неудачные кандидаты перед удалением отправляются критику. Критик изучает образец и причину сбоя, выявляя несогласованное состояние, невозможные рабочие процессы, некорректное построение задачи, плохие эталонные траектории, слабую логику верификатора или несоответствие предполагаемым возможностям. Выводы критика направляют исправления с фиксированным ограничением на количество повторных попыток:
Исправленная задача должна снова пройти соответствующие проверки. Диагностика направляет исправления существующего кандидата, а не требует начинать генерацию заново.
Прохождение этих проверок делает образец пригодным для обучения, но индивидуально валидные образцы все равно могут сформировать повторяющийся или несбалансированный набор данных. Поэтому AutoSynthData также проверяет генерацию на уровне пакетов.
Проверка на уровне пакетов
Пакет может содержать избыток нескольких простых семейств задач, упускать какую-либо возможность или отражать слишком большие усилия по генерации, затраченные на малоэффективный шаблон.
Мета-обзор изучает принятые образцы, отклоненные образцы и поведение генерации для каждого пакета. Он задает вопросы:
- Какие семейства задач представлены избыточно, а какие измерения возможностей отсутствуют?
- Появляются ли одни и те же типы примеров повторно?
- Продолжают ли определенные цели постоянно проваливать генерацию?
- Появляются ли систематические проблемы в критических замечаниях?
- Какие рекомендации следует изменить для следующего пакета?
Контроллер отслеживает покрытие в принятом наборе данных, сокращает генерацию в избыточно представленных областях и направляет больше усилий на устранение пробелов. Когда область постоянно выдает плохих кандидатов, критика и мета-обзор направляют изменения в стратегии генерации. Эти корректировки балансируют полезный обучающий сигнал, качество задач, покрытие, разнообразие и низкую избыточность в рамках доступного бюджета генерации и требований к размеру набора данных.
В совокупности эти петли обратной связи улучшают как отдельные задачи, так и набор данных, который они формируют: проверки на уровне образцов направляют исправление кандидатов, а проверка на уровне пакетов направляет будущую генерацию.
Сдвиг границы обучения
Полезное распределение для обучения меняется по мере совершенствования модели. AutoSynthData рассматривает генерацию синтетических данных как поиск задач вблизи границы возможностей целевой модели: достаточно сложных, чтобы выявить слабые места, но достаточно решаемых, чтобы учитель мог предоставить надежные демонстрации.
После пост-обучения мы оцениваем обновленную модель в той же среде. Задачи, которые она теперь решает надежно, менее полезны для следующего раунда обучения; постоянные сбои указывают на возможности, которые все еще требуют внимания. Эти результаты могут направить следующий раунд генерации.
Наши эксперименты сосредоточены на SFT, но тот же механизм может поддерживать обучение с подкреплением (RL): генерировать задачи, которые бросают вызов текущей политике и предоставляют надежный обучающий сигнал, обучать, а затем перемещать цель генерации с обновленной политикой. Мы планируем протестировать эту движущуюся, откалиброванную по сложности границу за пределами SFT.
Эксперименты с EnterpriseOps Gym
Мы используем EnterpriseOps Gym, чтобы проверить, улучшает ли этот подход модель на задачах в контексте корпоративной среды с сохранением состояния. Мы генерируем обучающие задачи в средах Hybrid и ITSM Gym, дообучаем целевую модель на принятых образцах и оцениваем полученные чекпоинты.
Hybrid
Мы протестировали конвейер в домене Hybrid среды EnterpriseOps Gym, используя Gemma-4-26B-A4B-it в качестве целевой модели и Qwen3.8-27B в качестве учителя.
AutoSynthData сгенерировала 2000 синтетических обучающих образцов примерно за 18 часов. Мы дообучили Gemma на этом наборе данных и оценили полученные чекпоинты на бенчмарке. Лучшим чекпоинтом стала 5-я эпоха.
Результаты Hybrid
Синтетический чекпоинт SFT улучшает средний показатель Pass@1 на 7,2 процентных пункта, что составляет 35% относительного улучшения, и повышает успех верификатора с 63,01% до 68,55%. Он закрывает 59% исходного разрыва Pass@1 между Gemma и эталонной моделью.
Обучающие задачи были заново сгенерированы на основе спецификаций возможностей; генератор не получал исходные задачи оценки. Результат демонстрирует улучшение в EnterpriseOps Gym Hybrid, среде, использованной для этого эксперимента.
ITSM
Мы также применили AutoSynthData к домену ITSM среды EnterpriseOps Gym, используя Gemma-4-26B-A4B-it в качестве целевой модели и DeepSeek-V4.1-Flash в качестве учителя. AutoSynthData сгенерировала 1994 синтетических обучающих образца за 66 часов. Генерация заняла больше времени, чем в последующем запуске Hybrid, описанном выше, главным образом потому, что в запуске ITSM использовалась более крупная модель-учитель и он предшествовал оптимизациям конвейера, которые улучшили пропускную способность.
В ITSM синтетический SFT повышает средний показатель Pass@1 с 18,77% до 27,18%, показывая, что этот подход также улучшает производительность во втором домене.
Замыкание цикла
Задачи, наиболее полезные для обучения, зависят как от среды, так и от работающей в ней модели. AutoSynthData использует ошибки модели для выбора того, что нужно генерировать, проверяет новые задачи на соответствие среде и делает эти задачи доступными для последующего обучения. Наши результаты в EnterpriseOps Gym демонстрируют ценность этого подхода в контролируемых условиях. По мере изменения модели тот же процесс может быть сосредоточен на остающихся пробелах.






