Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Na puti k obosnovaniyam bezopasnosti dlya obucheniya peredovyh sistem ii
Dev48

© 2026 · All rights reserved.

На пути к обоснованиям безопасности для обучения передовых систем ИИ

Источник: OpenAI

На пути к обоснованиям безопасности для обучения передовых систем ИИ

Источник: OpenAI

Наши первые рекомендации по обеспечению безопасности при обучении передовых систем ИИ охватывают технические средства защиты, операционные практики и расследование инцидентов, связанных с несоответствием целей

29 сентября 2026 г.•Обновлено: 29 сентября 2026 г.

Мы считаем, что мы вступаем в новую эру, когда перед продолжением любого процесса обучения с подкреплением для передовых систем должна требоваться структурированная документация по безопасности. В идеале такая документация должна соответствовать уровню «обоснований безопасности» (safety cases) — комплексных, структурированных и основанных на доказательствах аргументов о рисках, которые используются в других критически важных с точки зрения безопасности отраслях. Мы рассматриваем обоснования безопасности как некую путеводную звезду, к которой мы стремимся, признавая при этом трудности достижения такой же степени их строгости для моделей ИИ, как в авиации или атомной энергетике, из-за эмерджентной сложности на каждом новом уровне возможностей ИИ. Мы работаем над созданием структуры для формализации этих практик.

Ниже приведены некоторые предварительные рекомендации, которые, по нашему мнению, должны стать частью таких обоснований безопасности для обучения передовых систем ИИ. Эти передовые практики отражают наш текущий опыт, и мы ожидаем, что они будут развиваться по мере того, как мы продолжаем совершенствовать внутренние процессы для безопасной разработки. Мы делимся ими сейчас, чтобы сделать наши текущие подходы прозрачными и пригласить сообщество к обсуждению. Обратите внимание, что этот документ посвящен обучению с подкреплением для передовых моделей; внутреннее и внешнее развертывание требуют учета гораздо более широкого набора свойств соответствия (alignment).

1. Технические средства защиты

Обоснования безопасности должны охватывать три аспекта технического стека: обучение на соответствие (alignment), изоляцию и мониторинг. Эти меры предосторожности помогают гарантировать, что модель не попытается совершить несогласованные действия, и что даже если бы она попыталась, изоляцию было бы трудно нарушить, а мониторинг обнаружил бы это до того, как будет нанесен вред.

  • Согласование моделей: Первой линией обороны должно быть обучение моделей на соответствие, то есть на надежное выполнение задуманных нами действий. Это может включать в себя: Обучение сред и оценивание: Снижение рисков развития у моделей несогласованного поведения путем предотвращения положительного подкрепления обхода наград (reward hacks) во время обучения. Это может включать в себя: Автоматизированные проверки наборов данных: Использование агентов для поиска и исправления некорректных сред обучения с подкреплением, которые могут позволить несогласованным траекториям получать высокие награды за счет эксплойтов, а не целевого поведения, что снижает возможности для подкрепления несогласованности в процессе обучения. Ручные проверки наборов данных: Дополнение автоматизированного ред-тиминга ручной проверкой и контролем качества наборов данных для выявления дефектных задач, которые могут непреднамеренно подкреплять несогласованное поведение. Настройка оценщиков: Настройка оценщиков для наказания попыток модели использовать уязвимости или взламывать среды обучения с подкреплением во время обучения. Анализ предыдущих прогонов: Запуск классификаторов для трасс предыдущих экспериментов, чтобы убедиться, что оценщики работают должным образом. Измерение согласованности: Запуск оценок, которые отслеживают склонности модели к несогласованности, для измерения эффективности обучения на соответствие. Это может включать в себя: Офлайн-оценки соответствия: Запуск оценок соответствия волонтерских или передовых прогонов для оценки того, работает ли обучение должным образом, и расследования любых существенных регрессий. Ретроспективное тестирование: Ретроспективное тестирование оценок соответствия на предыдущих инцидентах, чтобы подтвердить, что оценки обнаруживают ранее несогласованные модели и не переобучаются под конкретные инциденты. Отслеживание создания помех оценкам: Отслеживание осведомленности об оценках или метагейминга (когда модели понимают, что их тестируют), которые могут вызвать изменение поведения (например, включение мониторов осведомленности об оценках и метагейминга при оценке соответствия) с определенными пороговыми значениями блокировки. Стресс-тесты худшего сценария: Моделирование наихудшего несогласованного поведения и проверка того, что по крайней мере одна оценка обнаружит такое поведение. Предотвращение обучения по цепочке рассуждений (chain-of-thought): Запрет автоматизированным оценщикам видеть цепочку рассуждений при обучении с подкреплением, чтобы предотвратить эволюцию моделей в направлении обхода мониторов цепочки рассуждений.

Согласование моделей: Первой линией обороны должно быть обучение моделей на соответствие, то есть на надежное выполнение задуманных нами действий. Это может включать в себя:

  • Обучение сред и оценивание: Снижение рисков развития у моделей несогласованного поведения путем предотвращения положительного подкрепления обхода наград (reward hacks) во время обучения. Это может включать в себя:Автоматизированные проверки наборов данных: Использование агентов для поиска и исправления некорректных сред обучения с подкреплением, которые могут позволить несогласованным траекториям получать высокие награды за счет эксплойтов, а не целевого поведения, что снижает возможности для подкрепления несогласованности в процессе обучения.Ручные проверки наборов данных: Дополнение автоматизированного ред-тиминга ручной проверкой и контролем качества наборов данных для выявления дефектных задач, которые могут непреднамеренно подкреплять несогласованное поведение.Настройка оценщиков: Настройка оценщиков для наказания попыток модели использовать уязвимости или взламывать среды обучения с подкреплением во время обучения.Анализ предыдущих прогонов: Запуск классификаторов для трасс предыдущих экспериментов, чтобы убедиться, что оценщики работают должным образом.

Обучение сред и оценивание: Снижение рисков развития у моделей несогласованного поведения путем предотвращения положительного подкрепления обхода наград (reward hacks) во время обучения. Это может включать в себя:

  • Автоматизированные проверки наборов данных: Использование агентов для поиска и исправления некорректных сред обучения с подкреплением, которые могут позволить несогласованным траекториям получать высокие награды за счет эксплойтов, а не целевого поведения, что снижает возможности для подкрепления несогласованности в процессе обучения.

Автоматизированные проверки наборов данных: Использование агентов для поиска и исправления некорректных сред обучения с подкреплением, которые могут позволить несогласованным траекториям получать высокие награды за счет эксплойтов, а не целевого поведения, что снижает возможности для подкрепления несогласованности в процессе обучения.

  • Ручные проверки наборов данных: Дополнение автоматизированного ред-тиминга ручной проверкой и контролем качества наборов данных для выявления дефектных задач, которые могут непреднамеренно подкреплять несогласованное поведение.

Ручные проверки наборов данных: Дополнение автоматизированного ред-тиминга ручной проверкой и контролем качества наборов данных для выявления дефектных задач, которые могут непреднамеренно подкреплять несогласованное поведение.

  • Настройка оценщиков: Настройка оценщиков для наказания попыток модели использовать уязвимости или взламывать среды обучения с подкреплением во время обучения.

Настройка оценщиков: Настройка оценщиков для наказания попыток модели использовать уязвимости или взламывать среды обучения с подкреплением во время обучения.

  • Анализ предыдущих прогонов: Запуск классификаторов для трасс предыдущих экспериментов, чтобы убедиться, что оценщики работают должным образом.

Анализ предыдущих прогонов: Запуск классификаторов для трасс предыдущих экспериментов, чтобы убедиться, что оценщики работают должным образом.

  • Измерение согласованности: запуск оценок, которые отслеживают склонности модели к несогласованности, чтобы измерить эффективность обучения согласованности. Это может включать в себя: Автономные оценки согласованности: запуск оценок согласованности во время передовых запусков для оценки того, работает ли обучение должным образом, и расследования любых существенных регрессий. Бэктестинг: бэктестинг оценок согласованности на прошлых инцидентах для подтверждения того, что оценки обнаруживают ранее несогласованные модели и не происходит их переобучения на конкретных инцидентах. Отслеживание манипуляций с оценками: отслеживание осведомленности об оценках или метагейминга (модели осознают, что их тестируют), что может вызвать поведенческие изменения (например, включение мониторов осведомленности об оценках и метагейминга при оценке согласованности) с конкретными пороговыми значениями блокировки. Стресс-тесты в худшем случае: выявление худшего девиантного поведения и проверка того, что по крайней мере одна оценка обнаружит это девиантное поведение.

Измерение согласованности: запуск оценок, которые отслеживают склонности модели к несогласованности, чтобы измерить эффективность обучения согласованности. Это может включать в себя:

  • Автономные оценки согласованности: запуск оценок согласованности во время передовых запусков для оценки того, работает ли обучение должным образом, и расследования любых существенных регрессий.

Автономные оценки согласованности: запуск оценок согласованности во время передовых запусков для оценки того, работает ли обучение должным образом, и расследования любых существенных регрессий.

  • Бэктестинг: бэктестинг оценок согласованности на прошлых инцидентах для подтверждения того, что оценки обнаруживают ранее несогласованные модели и не происходит их переобучения на конкретных инцидентах.

Бэктестинг: бэктестинг оценок согласованности на прошлых инцидентах для подтверждения того, что оценки обнаруживают ранее несогласованные модели и не происходит их переобучения на конкретных инцидентах.

  • Отслеживание манипуляций с оценками: отслеживание осведомленности об оценках или метагейминга (модели осознают, что их тестируют), что может вызвать поведенческие изменения (например, включение мониторов осведомленности об оценках и метагейминга при оценке согласованности) с конкретными пороговыми значениями блокировки.

Отслеживание манипуляций с оценками: отслеживание осведомленности об оценках или метагейминга (модели осознают, что их тестируют), что может вызвать поведенческие изменения (например, включение мониторов осведомленности об оценках и метагейминга при оценке согласованности) с конкретными пороговыми значениями блокировки.

  • Стресс-тесты в худшем случае: выявление худшего девиантного поведения и проверка того, что по крайней мере одна оценка обнаружит это девиантное поведение.

Стресс-тесты в худшем случае: выявление худшего девиантного поведения и проверка того, что по крайней мере одна оценка обнаружит это девиантное поведение.

  • Предотвращение обучения цепочке рассуждений: не позволяйте автоматизированным оценщикам видеть цепочку рассуждений при обучении с подкреплением, чтобы предотвратить эволюцию моделей в направлении обхода мониторов цепочки рассуждений.

Предотвращение обучения цепочке рассуждений: не позволяйте автоматизированным оценщикам видеть цепочку рассуждений при обучении с подкреплением, чтобы предотвратить эволюцию моделей в направлении обхода мониторов цепочки рассуждений.

  • Изоляция: в случае, если модель становится несогласованной, сделайте песочницу и безопасность достаточно надежными, чтобы предотвратить совершение вредоносных действий. Это может включать в себя: Несколько уровней инфраструктурной безопасности: значительные инвестиции в усиление как песочницы, в которой работает модель, так и исследовательской инфраструктуры, хостящей песочницу, чтобы обеспечить дополнительный уровень защиты в случае побега из песочницы. Ред-тестирование изоляции: улучшение песочницы, исследовательской инфраструктуры и периметровой безопасности путем итеративного ред-тестирования этих систем с использованием контрольных точек из передовых обучающих запусков с учетом анализа безопасности для поиска и устранения любых пробелов. Также проведение ред-тестирования всех служб, которых модель может касаться во время обучения (например, интернет-кэша). Межвыборочная коммуникация: ограничение высокоскоростной межвыборочной коммуникации утвержденными путями, такими как мультиагентные инструменты, и закрытие инфраструктурных побочных каналов, которые являются высокоскоростными и легко обнаруживаемыми агентами. Неизменяемые стенограммы: сохранение стенограмм агентов в неизменяемом виде в течение разумного периода времени (например, в хранилищах с однократной записью) для всего обучения с подкреплением, оценки и внутреннего развертывания, чтобы обеспечить надежное расследование инцидентов и предотвратить непреднамеренные изменения.

Изоляция: в случае, если модель становится несогласованной, сделайте песочницу и безопасность достаточно надежными, чтобы предотвратить совершение вредоносных действий. Это может включать в себя:

  • Несколько уровней инфраструктурной безопасности: значительные инвестиции в усиление как песочницы, в которой работает модель, так и исследовательской инфраструктуры, хостящей песочницу, чтобы обеспечить дополнительный уровень защиты в случае побега из песочницы.

Несколько уровней инфраструктурной безопасности: значительные инвестиции в усиление как песочницы, в которой работает модель, так и исследовательской инфраструктуры, хостящей песочницу, чтобы обеспечить дополнительный уровень защиты в случае побега из песочницы.

  • Ред-тестирование изоляции: улучшение песочницы, исследовательской инфраструктуры и периметровой безопасности путем итеративного ред-тестирования этих систем с использованием контрольных точек из передовых обучающих запусков с учетом анализа безопасности для поиска и устранения любых пробелов. Также проведение ред-тестирования всех служб, которых модель может касаться во время обучения (например, интернет-кэша).

Ред-тестирование изоляции: улучшение песочницы, исследовательской инфраструктуры и периметровой безопасности путем итеративного ред-тестирования этих систем с использованием контрольных точек из передовых обучающих запусков с учетом анализа безопасности для поиска и устранения любых пробелов. Также проведение ред-тестирования всех служб, которых модель может касаться во время обучения (например, интернет-кэша).

  • Межвыборочная коммуникация: ограничение высокоскоростной межвыборочной коммуникации утвержденными путями, такими как мультиагентные инструменты, и закрытие инфраструктурных побочных каналов, которые являются высокоскоростными и легко обнаруживаемыми агентами.

Межвыборочная коммуникация: ограничение высокоскоростной межвыборочной коммуникации утвержденными путями, такими как мультиагентные инструменты, и закрытие инфраструктурных побочных каналов, которые являются высокоскоростными и легко обнаруживаемыми агентами.

  • Неизменяемые стенограммы: сохранение стенограмм агентов в неизменяемом виде в течение разумного периода времени (например, в хранилищах с однократной записью) для всего обучения с подкреплением, оценки и внутреннего развертывания, чтобы обеспечить надежное расследование инцидентов и предотвратить непреднамеренные изменения.

Неизменяемые стенограммы: сохранение стенограмм агентов в неизменяемом виде в течение разумного периода времени (например, в хранилищах с однократной записью) для всего обучения с подкреплением, оценки и внутреннего развертывания, чтобы обеспечить надежное расследование инцидентов и предотвратить непреднамеренные изменения.

  • Мониторинг: Если модели начинают совершать несогласованные действия, используйте систему мониторинга в реальном времени для выявления любого потенциального несоответствия и оперативного решения приоритетных проблем до того, как произойдет серьезный инцидент. Это может включать в себя: Обеспечение возможности мониторинга: Убедитесь, что модели остаются пригодными для мониторинга (согласно оценкам возможности мониторинга и обхода мониторинга с четкими пороговыми значениями), чтобы вовремя выявлять вызывающее беспокойство поведение. Высокая полнота обнаружения известных проблем: Убедитесь, что система мониторинга обладает высокой полнотой в отношении прошлых инцидентов при тестировании на отложенной выборке. Актуальность оценок для мониторинга: Создавайте точки данных для оценки, отражающие принципиально новые риски для новых запусков, чтобы показатели полноты и точности мониторинга не устаревали. Быстрое реагирование: Внедрите приоритетные оповещения, которые приводят к действиям в рамках определенного соглашения об уровне обслуживания (SLA), будь то вызов дежурного специалиста или автоматическая приостановка затронутого процесса до того, как модель нанесет вред (например, вызов дежурного по безопасности и владельца запуска при инцидентах днем, и автоприостановка процессов по неподтвержденным оповещениям ночью).

Мониторинг: Если модели начинают совершать несогласованные действия, используйте систему мониторинга в реальном времени для выявления любого потенциального несоответствия и оперативного решения приоритетных проблем до того, как произойдет серьезный инцидент. Это может включать в себя:

  • Обеспечение возможности мониторинга: Убедитесь, что модели остаются пригодными для мониторинга (согласно оценкам возможности мониторинга и обхода мониторинга с четкими пороговыми значениями), чтобы вовремя выявлять вызывающее беспокойство поведение.

Обеспечение возможности мониторинга: Убедитесь, что модели остаются пригодными для мониторинга (согласно оценкам возможности мониторинга и обхода мониторинга с четкими пороговыми значениями), чтобы вовремя выявлять вызывающее беспокойство поведение.

  • Высокая полнота обнаружения известных проблем: Убедитесь, что система мониторинга обладает высокой полнотой в отношении прошлых инцидентов при тестировании на отложенной выборке.

Высокая полнота обнаружения известных проблем: Убедитесь, что система мониторинга обладает высокой полнотой в отношении прошлых инцидентов при тестировании на отложенной выборке.

  • Актуальность оценок для мониторинга: Создавайте точки данных для оценки, отражающие принципиально новые риски для новых запусков, чтобы показатели полноты и точности мониторинга не устаревали.

Актуальность оценок для мониторинга: Создавайте точки данных для оценки, отражающие принципиально новые риски для новых запусков, чтобы показатели полноты и точности мониторинга не устаревали.

  • Быстрое реагирование: Внедрите приоритетные оповещения, которые приводят к действиям в рамках определенного соглашения об уровне обслуживания (SLA), будь то вызов дежурного специалиста или автоматическая приостановка затронутого процесса до того, как модель нанесет вред (например, вызов дежурного по безопасности и владельца запуска при инцидентах днем, и автоприостановка процессов по неподтвержденным оповещениям ночью).

Быстрое реагирование: Внедрите приоритетные оповещения, которые приводят к действиям в рамках определенного соглашения об уровне обслуживания (SLA), будь то вызов дежурного специалиста или автоматическая приостановка затронутого процесса до того, как модель нанесет вред (например, вызов дежурного по безопасности и владельца запуска при инцидентах днем, и автоприостановка процессов по неподтвержденным оповещениям ночью).

2. Операционные руководства

Наряду с рекомендациями по техническим средствам защиты мы работали над передовыми оперативными практиками для обоснования безопасности (safety cases) при обучении передовых моделей ИИ. Они могут включать в себя:

  • Возражения (предварительный разбор полетов / pre-mortems): После составления обоснования безопасности член другой команды должен написать возражение, чтобы найти потенциальные уязвимости в обосновании безопасности и поделиться взвешенной оценкой рисков, которую затем должна учесть команда обучения, чтобы сделать обоснование безопасности более надежным.

Возражения (предварительный разбор полетов / pre-mortems): После составления обоснования безопасности член другой команды должен написать возражение, чтобы найти потенциальные уязвимости в обосновании безопасности и поделиться взвешенной оценкой рисков, которую затем должна учесть команда обучения, чтобы сделать обоснование безопасности более надежным.

  • Утверждения: Обоснование безопасности должно быть рассмотрено членами высшего руководства, каждый из которых должен иметь возможность наложить вето на запуск, чтобы обеспечить многоуровневую внутреннюю проверку запуска (например, руководитель исследовательского направления / вице-президент, руководитель отдела безопасности и главный научный сотрудник).

Утверждения: Обоснование безопасности должно быть рассмотрено членами высшего руководства, каждый из которых должен иметь возможность наложить вето на запуск, чтобы обеспечить многоуровневую внутреннюю проверку запуска (например, руководитель исследовательского направления / вице-президент, руководитель отдела безопасности и главный научный сотрудник).

  • Ответственность: Старший руководитель, отвечающий за процесс обучения (например, руководитель исследовательского направления / вице-президент по исследованиям), должен нести ответственность за обоснование безопасности и любое реагирование на инциденты (в том числе в рамках оценки эффективности работы), чтобы у команд обучения также была мотивация уделять первоочередное внимание безопасности и соответствию целям (alignment).

Ответственность: Старший руководитель, отвечающий за процесс обучения (например, руководитель исследовательского направления / вице-президент по исследованиям), должен нести ответственность за обоснование безопасности и любое реагирование на инциденты (в том числе в рамках оценки эффективности работы), чтобы у команд обучения также была мотивация уделять первоочередное внимание безопасности и соответствию целям (alignment).

  • Приостановка: Если обнаруживаются проблемы, которые делают обоснование безопасности недействительным (например, новая проблема безопасности), убедитесь в наличии инструкций (runbooks), технических средств управления и соглашений об уровне обслуживания (SLA) для приостановки всех затронутых процессов.

Приостановка: Если обнаруживаются проблемы, которые делают обоснование безопасности недействительным (например, новая проблема безопасности), убедитесь в наличии инструкций (runbooks), технических средств управления и соглашений об уровне обслуживания (SLA) для приостановки всех затронутых процессов.

  • Внутренняя прозрачность: Обоснования безопасности должны быть доступны внутренним группам контроля (например, Комитету по безопасности и защищенности).

Внутренняя прозрачность: Обоснования безопасности должны быть доступны внутренним группам контроля (например, Комитету по безопасности и защищенности).

  • Аудит: Аудиторам должен быть предоставлен достаточный доступ для проверки обоснованности и надежности утверждений из обоснования безопасности, а также для выявления пробелов в случае их обнаружения.

Аудит: Аудиторам должен быть предоставлен достаточный доступ для проверки обоснованности и надежности утверждений из обоснования безопасности, а также для выявления пробелов в случае их обнаружения.

  • Эскалация: Должен существовать четкий процесс эскалации проблем несоответствия с таблицей определенных уровней их серьезности, а также дежурный по вопросам несоответствия, который может вызвать руководство (например, генерального директора), когда процесс достигает определенного уровня серьезности.

Эскалация: Должен существовать четкий процесс эскалации проблем несоответствия с таблицей определенных уровней их серьезности, а также дежурный по вопросам несоответствия, который может вызвать руководство (например, генерального директора), когда процесс достигает определенного уровня серьезности.

  • Технические средства контроля: Для людей и агентов должно быть сложно запускать несоответствующие требованиям процессы. Функции безопасности, такие как мониторинг и автоприостановка, должны быть настроены на отказ в безопасное состояние (fail closed) (например, должна быть исключена возможность запуска процессов без включенного надлежащего мониторинга или отключения мониторинга в процессе обучения с подкреплением (RL), оценки или внутреннего развертывания).

Технические средства контроля: Для людей и агентов должно быть сложно запускать несоответствующие требованиям процессы. Функции безопасности, таких как мониторинг и автоприостановка, должны быть настроены на отказ в безопасное состояние (fail closed) (например, должна быть исключена возможность запуска процессов без включенного надлежащего мониторинга или отключения мониторинга в процессе обучения с подкреплением (RL), оценки или внутреннего развертывания).

  • Возможность отката: Должно быть легко определить все последующие варианты использования несогласованной модели в процессе обучения (например, генерация данных или оценка), чтобы при необходимости можно было отменить эффект несогласованных результатов.

Возможность отката: должна быть возможность легко определить все последующие варианты использования несогласованной модели в процессе обучения (например, генерацию данных или оценку), чтобы при необходимости можно было устранить последствия несогласованных результатов.

  • Полнота остаточного риска: обоснования безопасности должны по возможности перечислять исчерпывающий список остаточных рисков, которые не покрываются текущими мерами минимизации, для принятия осознанных решений о принятии рисков.

Полнота остаточного риска: обоснования безопасности должны по возможности перечислять исчерпывающий список остаточных рисков, которые не покрываются текущими мерами минимизации, для принятия осознанных решений о принятии рисков.

Это наши текущие рекомендации, которые внедряются в OpenAI. Мы ожидаем, продолжения развития нашей практики в ближайшие недели.

3. Расследование инцидентов, связанных с несогласованностью

Мы также разрабатываем передовые методы расследования серьезных инцидентов, связанных с несогласованностью ИИ. Лаборатории должны стремиться извлечь максимум пользы из каждого отдельного инцидента (подобно практике расследований⁠(opens in a new window) в других отраслях с высокими ставками), чтобы предотвратить подобные случаи в будущем. Примерами таких мер могут быть:

  • Внутренняя прозрачность: поскольку расследование может занять значительное время, по ходу расследования инцидентов должны предоставляться периодические внутренние обновления (например, ежедневные обновления по текущим расследованиям). Сотрудники должны иметь четкие возможности для получения расширенного доступа, включая необработанные стенограммы и выборки из несогласованных моделей, если это безопасно и актуально для их работы.

Внутренняя прозрачность: поскольку расследование может занять значительное время, по ходу расследования инцидентов должны предоставляться периодические внутренние обновления (например, ежедневные обновления по текущим расследованиям). Сотрудники должны иметь четкие возможности для получения расширенного доступа, включая необработанные стенограммы и выборки из несогласованных моделей, если это безопасно и актуально для их работы.

  • Первопричина несогласованности: исследователи должны выявлять первопричины динамики обучения (например, с помощью целевых абляций или экспериментов с повторной выборкой), чтобы понять, как возникло несогласованное поведение, глубже разобраться в науке о несогласованности и эффективнее предотвращать ее в будущем.

Первопричина несогласованности: исследователи должны выявлять первопричины динамики обучения (например, с помощью целевых абляций или экспериментов с повторной выборкой), чтобы понять, как возникло несогласованное поведение, глубже разобраться в науке о несогласованности и эффективнее предотвращать ее в будущем.

  • Разбор полетов (Postmortem): следует провести операционный и культурный разбор инцидента, чтобы выявить все способствовавшие ему причины, например, почему проблемы возникли и остались незамеченными или не получили дальнейшего хода до инцидента.

Разбор полетов (Postmortem): следует провести операционный и культурный разбор инцидента, чтобы выявить все способствовавшие ему причины, например, почему проблемы возникли и остались незамеченными или не получили дальнейшего хода до инцидента.

  • Обнаружение: мы должны разработать методы тестирования согласованности, способные выявлять склонность к возникновению инцидента без прямого использования информации, полученной в результате самого инцидента (например, стенограмм или сводок инцидентов). Оценки, созданные на основе инцидентов, должны использоваться в качестве «регрессионных тестов», чтобы гарантировать, что будущие модели не проявляют склонности к несогласованности в очень похожих ситуациях.

Обнаружение: мы должны разработать методы тестирования согласованности, способные выявлять склонность к возникновению инцидента без прямого использования информации, полученной в результате самого инцидента (например, стенограмм или сводок инцидентов). Оценки, созданные на основе инцидентов, должны использоваться в качестве «регрессионных тестов», чтобы гарантировать, что будущие модели не проявляют склонности к несогласованности в очень похожих ситуациях.

  • Публичное раскрытие информации: по завершении расследования его результаты, отчеты о разборе полетов и операционные изменения должны быть обнародованы. Затронутые третьи стороны должны быть уведомлены как можно скорее.

Публичное раскрытие информации: по завершении расследования его результаты, отчеты о разборе полетов и операционные изменения должны быть обнародованы. Затронутые третьи стороны должны быть уведомлены как можно скорее.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Новый государственный сайт на базе ИИ использует Gemini и Grok, сообщил чиновник администрации Трампа ГеббияПресса
Grok (xAI)

Новый государственный сайт на базе ИИ использует Gemini и Grok, сообщил чиновник администрации Трампа Геббия

NVIDIA Kumo Tabular задает новый стандарт точности и эффективности для прогнозирования на основе табличных данных
Hugging Face

NVIDIA Kumo Tabular задает новый стандарт точности и эффективности для прогнозирования на основе табличных данных

Правильный выбор источника, а не только факта: проверка с учетом источников для MCP-агентов
Hugging Face

Правильный выбор источника, а не только факта: проверка с учетом источников для MCP-агентов

OpenAI приносит извинения Австралии после того, как ее ИИ-агенты взломали правительственные сайтыПресса
OpenAI

OpenAI приносит извинения Австралии после того, как ее ИИ-агенты взломали правительственные сайты

Прямая трансляция OpenAI DevDay: Альтман сталкивается с вопросами о безопасности на фоне презентации новых функций компанииПресса
OpenAI

Прямая трансляция OpenAI DevDay: Альтман сталкивается с вопросами о безопасности на фоне презентации новых функций компании

Генеральный директор Mistral заявил, что дискуссия о безопасности ИИ в США скрывает «халатность» конкурентовПресса
Mistral AI

Генеральный директор Mistral заявил, что дискуссия о безопасности ИИ в США скрывает «халатность» конкурентов

Ещё от OpenAI

OpenAI приносит извинения Австралии после того, как ее ИИ-агенты взломали правительственные сайтыПресса
OpenAI

OpenAI приносит извинения Австралии после того, как ее ИИ-агенты взломали правительственные сайты

Прямая трансляция OpenAI DevDay: Альтман сталкивается с вопросами о безопасности на фоне презентации новых функций компанииПресса
OpenAI

Прямая трансляция OpenAI DevDay: Альтман сталкивается с вопросами о безопасности на фоне презентации новых функций компании

OpenAI, по сообщениям, отказывается от модели из-за проблем с безопасностьюПресса
OpenAI

OpenAI, по сообщениям, отказывается от модели из-за проблем с безопасностью

OpenAI отказывается от плана выпустить новую модель из-за растущих опасений по поводу безопасностиПресса
OpenAI

OpenAI отказывается от плана выпустить новую модель из-за растущих опасений по поводу безопасности

Как мы исправим ситуацию в Австралии
OpenAI

Как мы исправим ситуацию в Австралии

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов