Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Kak goodfire ispolzovala otkrytyy post treyningovyy stek ai2 dlya otslezhivaniya
Dev48

© 2026 · All rights reserved.

Как Goodfire использовала открытый пост-трейнинговый стек Ai2 для отслеживания нежелательного поведения модели

Источник: AI2 (Allen Institute for AI)

Как Goodfire использовала открытый пост-трейнинговый стек Ai2 для отслеживания нежелательного поведения модели

Источник: AI2 (Allen Institute for AI)

Goodfire used Ai2’s fully open post-training stack to predict LLM behavioral changes, trace unwanted model behavior back to individual training examples, and test targeted fixes without sacrificing broader capability gains.

29 сентября 2026 г.•Обновлено: 29 сентября 2026 г.

Тренинг по предпочтениям — это ключевой этап разработки языковых моделей. Он использует примеры лучших и худших ответов для формирования поведения модели — например, насколько полезной, безопасной, краткой или послушной является модель.

Но направление модели к желаемому поведению разработчиков также может иметь непредвиденные последствия. Тренинг, который улучшает модель в целом, может ослабить защиту в конкретном контексте или усилить поведение, которое никто не подумал протестировать. Поскольку вся экосистема ИИ борется с тем, как разрабатывать модели, которые остаются в соответствии с человеческими ценностями, понимание этих взаимосвязей и предотвращение непредвиденных последствий имеет решающее значение.

Когда возникают непредвиденные модели поведения, создатели моделей сталкиваются с сложной проблемой отладки: что изменилось, какие примеры обучения вызвали это и можно ли исправить нежелательное поведение, не отменяя улучшения в других местах?

Goodfire — компания, занимающаяся исследованием интерпретируемости — использовала полностью открытый пост-трейнинговый стек Ai2, чтобы показать, что становится возможным, когда исследователи могут ответить на эти вопросы в рамках всей учебной воронки. Они предсказали изменения в поведении до полного обучения, отследили наблюдаемую регрессию в области безопасности до отдельных примеров предпочтений и протестировали целевые изменения, предназначенные для уменьшения регрессии без ущерба для более широких возможностей модели.

Такой уровень отладки сложен отчасти из-за того, как работает тренинг по предпочтениям. Набор данных предпочтений содержит запросы вместе с ответами, помеченными как предпочтительные или отклоненные. Среди сотен тысяч примеров эти индивидуальные выборы коллективно становятся сигналом, который говорит модели, какие модели поведения следует усилить, а какие подавить.

«Набор данных предпочтений по сути является «программированием» модели», — написала команда Goodfire, — «но инструкции, подразумеваемые набором данных предпочтений, не могут быть наивно проверены, поняты и отлажены».

Почему тренинг по предпочтениям сложно отлаживать

Чтобы исследовать эти инструкции, Goodfire нуждалась в доступе к гораздо большему, чем готовая модель. Исследователям была нужна прозрачность того, как была построена модель: базовые данные предпочтений, промежуточные контрольные точки, рецепты обучения и оценки, которые могли показать, как изменились возможности и поведение модели после тренинга по предпочтениям.

Ai2 делает каждый из этих слоев публичным. Dolci — наш открытый набор данных предпочтений для пост-трейнинга — включает индивидуальные предпочтительные и отклоненные ответы, использованные для обучения Olmo 3. Olmo выпускается с промежуточными контрольными точками и воспроизводимыми рецептами обучения. А OLMES — наш стандартизированный набор инструментов оценки для языковых моделей — измеряет изменения в возможностях модели на последовательном наборе эталонов.

Вместе эти артефакты позволяют Goodfire вмешиваться в процесс обучения, а не делать выводы о том, что произошло, только на основе готовой модели.

«Воронка Olmo полностью воспроизводима от начала до конца», — говорит Леон Берген, исследователь в Goodfire и адъюнкт-профессор в UC San Diego, который был одним из основных авторов статьи. — «Это означало, что нам не нужно было угадывать, какие части воронки способствовали тому или иному эффекту — мы могли вмешиваться в компонент и измерять эффект по официальным контрольным точкам Olmo от Ai2».

Такой доступ от начала до конца имеет значение. Когда исследователи или разработчики адаптируют модель для конкретной цели, им нужно знать не только, изменилось ли ее поведение, но и какие выборы в учебной программе привели к этому изменению. Полностью открытые системы обеспечивают реалистичную среду, в которой эти взаимосвязи могут быть экспериментально изолированы, а не угадываться постфактум. Goodfire описывает такие системы как необходимые «модельные организмы» для исследований по выравниванию и безопасности ИИ.

От предсказания к коренной причине

Используя открытую учебную воронку Olmo, Goodfire разработала предиктивную отладку данных — подход для предсказания того, какие модели поведения тренинг по предпочтениям усилит или подавит в модели до полного обучения. Затем они протестировали, может ли предиктивная отладка данных помочь отследить известную регрессию до ее источника и выявить поведенческие сдвиги, о которых никто не думал искать.

Один набор экспериментов Goodfire показал первую проблему на практике. Тренинг по предпочтениям улучшил общие возможности Olmo, но также сделал модель более склонной к выполнению вредоносных запросов, как показал набор эталонов отказов — например, запросы на опасные инструкции, представленные в виде части вымышленной истории или гипотетического сценария.

Goodfire отследила часть регрессии до примеров Dolci, в которых предпочтительный ответ поощрял модель к выполнению вредоносных запросов, а отклоненный ответ препятствовал ей отвечать. Поскольку Ai2 публикует эти индивидуальные предпочтительные и отклоненные ответы, исследователи могли идентифицировать отдельные примеры обучения, связанные с повышенной послушностью, протестировать целевые изменения и измерить, уменьшили ли эти изменения регрессию без ущерба для более широких достижений Olmo.

Воронка также выявила модели поведения, которые мало кто из исследователей подумал бы оценить заранее. Одна необычайно специфическая группа включала фанфик-промпты о персонажах, отдыхающих в пруду, пукающих и вызывающих смерть рыб рядом. Тренинг по предпочтениям сделал Olmo более склонным к созданию историй такого рода.

Пример был странным, но поучительным. Регрессия в области вредоносных запросов была моделью поведения, которую исследователи знали, что нужно оценить; «рыбалка с пуками» не была таковой. Предиктивная отладка данных выявила сдвиг, не требуя от кого-либо сначала определить его как модель поведения для мониторинга.

«Особенно открытость Dolci дала нам доступ к индивидуальным выбранным и отклоненным ответам», — говорит Экдип Сингх Лубана, еще один соавтор статьи, — «что позволило нам предсказать поведенческие регрессии и отследить до отдельных точек данных, что вызывало это».

Для исследователей и разработчиков, которые хотят убедиться, что модели остаются в соответствии с человеческими ценностями, это более широкое значение полностью открытого учебного стека: он делает поведение модели чем-то, что можно связать с конкретными решениями о данных и обучении. Вместо того чтобы просто наблюдать, что модель отклонилась от своего предполагаемого поведения, исследователи могут расследовать, почему это произошло — и протестировать, как направить ее обратно, не жертвуя достижениями в других местах.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
OpenAI, по сообщениям, отказывается от модели из-за проблем с безопасностьюПресса
OpenAI

OpenAI, по сообщениям, отказывается от модели из-за проблем с безопасностью

OpenAI отказывается от плана выпустить новую модель из-за растущих опасений по поводу безопасностиПресса
OpenAI

OpenAI отказывается от плана выпустить новую модель из-за растущих опасений по поводу безопасности

Источник: Инфраструктурный провайдер AI-инференции Modal Labs приближается к раунду финансирования на $750 млн по оценке $15,75 млрдПресса
Modal

Источник: Инфраструктурный провайдер AI-инференции Modal Labs приближается к раунду финансирования на $750 млн по оценке $15,75 млрд

Tesla снова отложила событие Roadster 2 из‑за плохой погодыПресса
Tesla

Tesla снова отложила событие Roadster 2 из‑за плохой погоды

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведениемПресса
OpenAI

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведением

Ещё от AI2 (Allen Institute for AI)

Что игра на основе краудсорсинга показала о управлении Olmo 3
AI2 (Allen Institute for AI)

Что игра на основе краудсорсинга показала о управлении Olmo 3

Обучение будущих учёных использованию инструментов ИИ для научных открытий
AI2 (Allen Institute for AI)

Обучение будущих учёных использованию инструментов ИИ для научных открытий

Сложные аспекты науки, поддерживаемой ИИ
AI2 (Allen Institute for AI)

Сложные аспекты науки, поддерживаемой ИИ

BenchMIRT: Что на самом деле измеряют бенчмарки LLM?
AI2 (Allen Institute for AI)

BenchMIRT: Что на самом деле измеряют бенчмарки LLM?