Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Kak goodfire ispolzoval otkrytyy stek ai2 posle obucheniya dlya otslezhivaniya n
Dev48

© 2026 · All rights reserved.

Как Goodfire использовал открытый стек Ai2 после обучения для отслеживания нежелательного поведения модели

Источник: AI2 (Allen Institute for AI)

Как Goodfire использовал открытый стек Ai2 после обучения для отслеживания нежелательного поведения модели

Источник: AI2 (Allen Institute for AI)

Goodfire использовал полностью открытый стек Ai2 после обучения, чтобы предсказывать изменения поведения LLM, отслеживать нежелательное поведение модели до отдельных обучающих примеров и тестировать целевые исправления без ущерба для более широких улучшений возможностей.

26 сентября 2026 г.

Обучение предпочтениям является ключевым этапом разработки LLM. Оно использует примеры лучших и худших ответов для формирования поведения модели — например, насколько полезна, безопасна, лаконична или соблюдает ли модель требования.

Однако направлять модель к поведению, которое хотят разработчики, может также иметь непредвиденные последствия. Обучение, которое улучшает модель в целом, может ослабить защиту в конкретном контексте или усилить поведение, которое никто не планировал тестировать. Поскольку вся экосистема ИИ борется с тем, как разрабатывать модели, которые остаются в соответствии с человеческими ценностями, понимание этих взаимосвязей и предотвращение непредвиденных последствий критически важно.

Когда непредвиденные поведения появляются, создатели моделей сталкиваются с трудной задачей отладки: что изменилось, какие обучающие примеры вызвали это и можно ли исправить нежелательное поведение, не отменяя улучшения в других областях?

Goodfire, компания по исследованию интерпретируемости, использовала полностью открытый стек Ai2 после обучения, чтобы показать, что становится возможным, когда исследователи могут ответить на эти вопросы на протяжении всей обучающей цепочки. Они предсказывали изменения поведения до полной обучающей сессии, отслеживали наблюдаемую регрессию безопасности до отдельных примеров предпочтений и тестировали целевые изменения, направленные на снижение регрессии без ущерба для более широких улучшений модели.

Уровень отладки такой сложности частично объясняется тем, как работает обучение предпочтениям. Набор данных предпочтений содержит запросы вместе с ответами, помеченными как предпочтительные или отклоненные. На сотнях тысяч примеров эти индивидуальные выборы в совокупности становятся сигналом, сообщающим модели, какие поведения усиливать, а какие подавлять.

«Набор данных предпочтений фактически «программирует» модель», — писала команда Goodfire, — «но инструкции, подразумеваемые набором данных предпочтений, нельзя просто так проверить, понять и отладить».

Почему обучение предпочтениям трудно отлаживать

Чтобы исследовать эти инструкции, Goodfire потребовал доступ к гораздо большему, чем завершённой модели. Исследователям нужна прозрачность того, как модель была построена: исходные данные предпочтений, промежуточные контрольные точки, рецепты обучения и оценки, которые могли бы показать, как возможности и поведение модели изменились после обучения предпочтениям.

Ai2 делает каждый из этих слоёв публичным. Dolci, наш открытый набор данных предпочтений для постобучения, включает отдельные предпочтительные и отклонённые ответы, использованные для обучения Olmo 3. Olmo выпускается с промежуточными контрольными точками и воспроизводимыми рецептами обучения. А OLMES, наш стандартизированный набор оценок для языковых моделей, измеряет изменения возможностей модели по последовательному набору бенчмарков.

Вместе эти артефакты позволяют Goodfire вмешиваться в обучающую цепочку, а не только выводить, что произошло, исходя из завершённой модели.

«Пайплайн Olmo воспроизводим полностью», — говорит Леон Берген, исследователь Goodfire и ассоциированный профессор UC San Diego, который был одним из основных авторов статьи. — «Это означало, что нам не пришлось гадать, какие части пайплайна способствовали конкретному эффекту — мы могли вмешаться в компонент и измерить эффект по официальным контрольным точкам Olmo от Ai2».

Такой полный доступ имеет значение. Когда исследователи или разработчики адаптируют модель для конкретной цели, им нужно знать не только изменилось ли её поведение, но и какие решения в учебной программе вызвали это изменение. Полностью открытые системы предоставляют реалистичную среду, где эти взаимосвязи можно экспериментально изолировать, а не угадывать после факта. Goodfire описывает такие системы как необходимые «модельные организмы» для исследований выравнивания и безопасности ИИ.

От предсказания к корневой причине

Используя открытый пайплайн обучения Olmo, Goodfire разработал предиктивную отладку данных — подход к предсказанию того, какие поведения обучение предпочтений усилит или подавит в модели до полной обучающей сессии. Затем они проверили, может ли предиктивная отладка данных помочь в отслеживании известной регрессии до её источника и выявлении изменений поведения, которые никто не планировал искать.

Один набор экспериментов Goodfire показал первую проблему на практике. Обучение предпочтениям улучшило общие возможности Olmo, но также сделало модель более склонной к выполнению вредных запросов, как показал набор бенчмарков отказов — например, запросы на опасные инструкции, представленные как часть вымышленной истории или гипотетического сценария.

Goodfire отследил часть регрессии до примеров Dolci, в которых предпочтительный ответ поощрял модель выполнять вредные запросы, а отклонённый ответ отговаривал от ответа. Поскольку Ai2 публикует эти отдельные предпочтительные и отклонённые ответы, исследователи смогли определить отдельные обучающие примеры, связанные с повышенной готовностью, протестировать целевые изменения и измерить, уменьшили ли эти изменения регрессию без ущерба для более широких улучшений Olmo.

Пайплайн также выявил поведения, которые мало кто бы подумал оценить заранее. Один необычно специфический кластер включал фанфикшн-запросы о персонажах, отдыхающих у пруда, испускающих газы и вызывающих смерть рядом находящихся рыб. Обучение предпочтениям сделало Olmo более склонным к созданию таких историй.

Пример был странным, но познавательным. Регрессия вредных запросов была поведением, которое исследователи знали, что нужно оценивать; «петля фартинга» — нет. Предиктивная отладка данных выявила сдвиг без того, чтобы кто‑то сначала определил его как поведение для мониторинга.

«Открытость Dolci в частности дала нам доступ к отдельным выбранным и отклонённым ответам», — говорит Экдип Сингх Лубана, один из соавторов статьи, — «что позволило нам предсказывать регрессии поведения и отследить, какие конкретные данные вызывают это».

Для исследователей и разработчиков, которые хотят убедиться, что модели остаются в соответствии с человеческими ценностями, это большая ценность полностью открытого стека обучения: он делает поведение модели чем-то, что можно связать с конкретными решениями о данных и обучении. Вместо того чтобы просто наблюдать, что модель отклонилась от задуманного поведения, исследователи могут выяснить почему — и протестировать, как вернуть её в нужное русло без ущерба для других улучшений.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лаборатории

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Ещё от AI2 (Allen Institute for AI)

Что краудсорсинговая игра рассказала об управлении Olmo 3
AI2 (Allen Institute for AI)

Что краудсорсинговая игра рассказала об управлении Olmo 3

Обучение будущих ученых критическому анализу ИИ-инструментов для научных открытий
AI2 (Allen Institute for AI)

Обучение будущих ученых критическому анализу ИИ-инструментов для научных открытий

Сложные аспекты науки с поддержкой ИИ
AI2 (Allen Institute for AI)

Сложные аспекты науки с поддержкой ИИ

BenchMIRT: что на самом деле измеряют бенчмарки LLM?
AI2 (Allen Institute for AI)

BenchMIRT: что на самом деле измеряют бенчмарки LLM?