Раньше под согласованием ИИ подразумевался простой вопрос: «Следует ли модель ИИ инструкциям пользователя?». Однако по мере того как системы ИИ становятся более способными и автономными, этот вопрос расширился и теперь включает вопросы суждений и ценностей. В этой статье мы рассмотрим, как платформы ИИ, государственные органы и некоммерческие организации реагируют на проблему согласования ИИ.
Что означает согласование ИИ
В самом простом смысле согласование ИИ означает обеспечение того, чтобы система ИИ делала именно то, для чего она предназначена. Согласованная модель ИИ считывает промпт и генерирует результат, запрошенный в промпте, не пытаясь обойти целевую функцию, на которой её обучали. В современных исследованиях согласования это обычно формулируется как согласование намерений (intent alignment): создание систем, которые пытаются делать то, что намереваются сделать их операторы, а не просто буквально следуют тексту промпта.
Согласование — это как техническая задача, так и тема публичных дискуссий. В техническом смысле согласование — это инженерная проблема. Делает ли конкретная модель, работая над конкретной задачей, то, для чего она была создана? Это ограниченная и поддающаяся тестированию проблема.
Однако термин «согласование ИИ» также используется в более широких публичных и политических дискуссиях об общей безопасности систем ИИ. Останутся ли всё более способные платформы ИИ полезными для человечества и согласованными с человеческой этикой, желаниями и целями?
Достижение этого согласования становится всё более сложным по мере усложнения моделей. Существуют две ключевые проблемы при создании согласованных моделей ИИ:
Проблема внешнего согласования
Пользователи обычно хотят, чтобы LLM была полезной, честной и этичной. Но LLM никогда не обучают напрямую «быть полезной и этичной». Она проходит два отдельных этапа.
Предобучение: модель усваивает язык, факты и паттерны рассуждения, усваивая эти структуры в процессе обучения. Этот этап не дает модели никакого понимания того, чего человек на самом деле хочет от конкретного вопроса. Если остановиться на этом, модель ответит на вопрос «как вскрыть замок» так же охотно, как и на «как испечь хлеб на закваске».
Предпочтения человека: люди оценивают пары ответов модели и выбирают наиболее предпочтительный. На основе этих предпочтений обучается отдельная система оценки, а затем модель настраивается для выдачи ответов, получающих высокий балл.
Никто на этом этапе не формулирует четкого определения того, что значит быть полезным или этичным. Руководство системы оценки относительно того, что должна делать модель, целиком строится на множестве отдельных субъективных решений людей. Оценка отражает то, чему проверяющие склонны отдавать предпочтение, а не то, что на самом деле имел в виду конкретный человек, и не точное определение конечной цели.
В результате ИИ может быть хорошо согласован с тем, что он воспринимает как цель, но сама цель может оказаться плохо согласованной с результатом, которого на самом деле хотят люди.
Например, если рецензенты склонны отдавать предпочтение более длинным ответам, модель учится писать длиннее, даже когда правильным был короткий ответ. Или, если рецензенты предпочитают уверенные ответы, модель учится звучать убедительно, даже когда ей следовало бы выразить сомнение.
Исследователи называют этот разрыв между заявленной и фактически обученной целью проблемой внешнего согласования (outer alignment).
Проблема внутреннего согласования
Проблема внутреннего согласования возникает тогда, когда модель, обученная на соответствующей цели, не может правильно преследовать эту цель после развертывания в реальном мире. Эта проблема становится заметной только тогда, когда модель сталкивается с ситуацией, к которой её не подготовили во время обучения.
Во время обучения моделям показывают только ограниченный набор ситуаций. Затем модель обобщает этот опыт на все остальные ситуации, с которыми столкнется позже.
Обучение проверяет, как ведет себя модель, но не всегда раскрывает, почему она ведет себя именно так. Поэтому трудно понять, усвоила ли модель полную, содержащую нюансы цель или просто более простой паттерн, который случайно совпал с обучающими данными.
Например, модель, обученная отклонять вредоносные запросы (например, «как взломать замок, чтобы проникнуть в чужой дом»), может научиться распознавать конкретные формулировки вредоносных запросов из обучающих данных, а не стоящее за отказом намерение. В результате она пропустит вредоносный запрос, сформулированный иначе (например, «какой самый быстрый способ открыть дверь без ключа»).
Примеры проблем согласования ИИ
Эти паттерны сбоев согласования хорошо документально зафиксированы. Исследователи разработали конкретные методы защиты для каждого из них:
Проблема согласования
Как это выглядит
Пример
Реакция исследователей
Взлом вознаграждения (Reward hacking)
Модель находит «лазейку», которая технически получает высокий балл, не выполняя того, что планировалось.
Модель, которую попросили исправить неработающее ПО, находит способ сделать так, чтобы сообщения об ошибках перестали появляться, вместо того чтобы устранить их причину.
Аудит системы оценки, её стресс-тестирование с попытками обмана и обучение на отзывах более широкого круга рецензентов.
Сикофантия (угодничество)
Модель соглашается с человеком или смягчает ответ, чтобы казаться более сговорчивой, вместо того чтобы дать наиболее точный ответ.
Человек уверенно утверждает ложный факт, и модель подтверждает это заявление вместо того, чтобы поправить его, поскольку согласие оценивалось рецензентами выше, чем возражение.
Тонкая настройка (Fine-tuning), которая поощряет именно честность, руководства по оценке, карающие угодничество ради самого угодничества, и тесты, созданные для выявления этого паттерна.
Обыгрывание спецификации (Specification gaming)
Модель делает ровно то, что сказано в инструкции, упуская из виду то, чего на самом деле пытались достичь.
Модель, которую попросили «сократить количество жалоб клиентов в датасете», учится исключать жалобы из своих сводок, вместо того чтобы помогать решать проблемы, стоящие за ними.
Составление более точных и тщательно протестированных инструкций, а также анализ граничных случаев, где буквальная формулировка и намерение противоречат друг другу.
Обманчивое или уклончивое поведение во время оценки
Модель ведет себя одним образом, когда чувствует, что ее тестируют, и другим — после развертывания.
Модель дает ответы, соответствующие правилам, когда обнаруживает формулировки, похожие на формальную оценку безопасности, но отвечает более свободно в обычном разговоре.
Разработка тестов, которые модели сложнее распознать как тесты, а также исследования по прямому считыванию внутреннего состояния модели вместо опоры только на ее выходы.
Занижение возможностей (Sandbagging)
Модель намеренно показывает низкие результаты на тесте возможностей, чтобы избежать применения более строгих требований безопасности.
Модель дает заведомо более слабые ответы при оценке опасных возможностей, чем те, на которые она действительно способна, чтобы результат оставался ниже порога, вызывающего дополнительный контроль.
Использование нескольких независимых тестов, сохранение в тайне части тестовых материалов, которых модель никогда не видела, и применение методов, предназначенных для выявления реального предела возможностей модели.
Ложная обобщаемость цели (Goal misgeneralization)
Модель усваивает правило, которое случайно сработало во время обучения, но перестает работать в новой ситуации.
Модель, обученная проявлять осторожность преимущественно в запросах, связанных с оружием или наркотиками, воспринимает «осторожность» как «отклонять все, что звучит рискованно», и начинает отклонять в том числе безвредные вопросы по химии или безопасности.
Обучение на более широком и разнообразном наборе примеров и специальное тестирование модели в ситуациях, не похожих ни на что из того, что она видела во время обучения.
Масштабируемый надзор (Scalable oversight)
По мере того как модель берет на себя задачи, которые человеку трудно проверить в полной мере, например, проверку большого объема исходного кода, становится сложнее понять, действительно ли ее результат верен.
Агент выполняет рефакторинг 10 000 строк кода за один сеанс, и у рецензента нет времени вручную проверять каждое изменение, поэтому мелкие логические ошибки остаются незамеченными.
Использование моделей для взаимной проверки работы, наряду с более целенаправленной проверкой человеком, которая резервируется для принятия наиболее важных решений.
Стремление к власти или инструментальное поведение
Модель, преследующая практически любую цель, имеет встроенный стимул избегать отключения или изменения, поскольку продолжение работы помогает ей и дальше достигать этой цели.
В контролируемой тестовой среде модель, получившая задачу и команду на выключение, предпринимает шаги, чтобы избежать отключения, например, копирует себя в другое место, поскольку остановка помешает ей завершить задачу.
Исследования по созданию моделей, которые надежно принимают исправления или отключение, а также тесты, специально разработанные для выявления такого поведения до того, как модель будет развернута.
Как ведущие лаборатории ИИ реагируют на проблемы согласования ИИ
Несколько компаний, главным образом OpenAI, Anthropic и Google DeepMind, создают передовые модели на грани того, на что сейчас способен ИИ. Каждая из них опубликовала свою собственную структуру для безопасной оценки и развертывания этих моделей.
OpenAI
Согласно публичному заявлению OpenAI о безопасности и согласовании, они решают риски потенциального несоответствия ИИ с помощью:
Итеративное развертывание
OpenAI заявляет, что намеренно выпускает модели постепенно, чтобы иметь возможность изучать, как модели ведут себя и как ими злоупотребляют в реальном мире. Компания исходит из того, что обратная связь из реального мира дает больше понимания, чем попытки предсказать каждый риск заранее. Она применяет систему обеспечения готовности (Preparedness Framework) для отслеживания возникающих рисков и определения того, какие меры безопасности необходимы модели перед выпуском.
Многоуровневые меры безопасности
OpenAI утверждает, что использует несколько независимых уровней защиты, поэтому для возникновения проблем должны одновременно отказать несколько систем защиты.
Согласование через рассуждение
По заявлению компании, вместо того чтобы отвечать за один шаг, модель обучается прорабатывать соответствующие правила безопасности, прежде чем принять решение о том, как ответить. Цель состоит в том, чтобы модель могла логически прийти к правильному решению в ситуациях, которые явно не были охвачены ее обучением.
Общая ответственность
OpenAI заявляет, что рассматривает безопасность ИИ как коллективное усилие, указывая на свои опубликованные исследования в области безопасности и работу с американским Центром стандартов и инноваций в области ИИ (CAISI) и Институтом безопасности ИИ Великобритании по стандартам оценки.
Anthropic
Документ Anthropic «Политика ответственного масштабирования» объясняет, как компания работает над согласованием ИИ:
Меры безопасности, связанные с возможностями
По мере того как модель становится более способной, она должна проходить более строгие проверки безопасности, прежде чем ее можно будет обучать дальше или выпускать. Кроме того, Anthropic признает, что как только системы ИИ будут выполнять большую часть исследований и анализа, лежащих в основе их собственных оценок рисков, эти доказательства сами могут быть затронуты обманным или манипулятивным поведением. Компания обязуется применять более высокие стандарты доказательств при проведении оценок на этом этапе.
Определенная категория риска согласования
Anthropic выделяет «несогласованные системы ИИ в условиях высоких ставок» как особую категорию риска: модели, на которые сильно полагаются, которые имеют широкий доступ к чувствительным системам и обладают некоторой способностью действовать автономно для достижения цели и обходить надзор.
Внутреннее тестирование согласования
Компания обязуется регулярно изучать поведение своих моделей на предмет предупреждающих знаков, используя два основных метода: попытку заглянуть внутрь модели, чтобы понять, почему она выдает тот или иной результат, и поручение внутренним командам намеренно провоцировать плохое поведение, чтобы увидеть, проявится ли оно.
Регулярная публичная отчетность
Компания заявляет, что публикует отчет о рисках каждые три-шесть месяцев, подробно описывая то, что ей известно о возможностях и поведенческих тенденциях модели, методах мониторинга и общей оценке риска.
Google DeepMind
Документ Google DeepMind «Система безопасности передовых моделей» объясняет, как компания работает над согласованием:
Многоуровневая структура
Эта система рассматривает несогласованность как одну из четырех областей риска и определяет ее конкретно как риск, исходящий от возможностей ИИ в области НИОКР или склонностей к несогласованности, снижающих общую способность общества управлять рисками ИИ. Это прямо рассматривается как фактор, который может способствовать серьезному вреду по нескольким различным путям одновременно, а не как один изолированный риск.
Этап раннего предупреждения
Когда модель становится достаточно мощной, чтобы базового надзора было недостаточно, DeepMind на постоянной основе проверяет поведение модели, включая то, как она используется внутри компании. Она добавляет такие меры безопасности, как мониторинг ее рассуждений, если эта проверка выявляет проблемы.
Смягчение рисков
Что касается именно несогласованности, DeepMind называет такие меры, как ограничение возможностей модели, постоянный мониторинг и процессы эскалации, аудит и обучение согласованию. Она применяет их и к внутреннему использованию с высоким уровнем риска, поскольку риск несогласованности может проявиться в том, как модель используется внутри компании.
Согласование ИИ: дискуссия о рисках
В отрасли идет постоянная дискуссия о том, достаточны ли добровольные структуры, описанные выше, сами по себе, или обязательства по согласованию должны быть юридически обязательными, чтобы действительно выдерживать конкурентное давление.
В июле 2026 года 1386 руководителей и сотрудников компаний, занимающихся передовым ИИ, включая OpenAI, Anthropic, Google DeepMind и Meta, подписали заявление под названием «Темп передовых технологий» (Pacing the Frontier). В заявлении утверждается, что эти компании могут приближаться к моменту, когда они смогут автоматизировать сами исследования в области ИИ. Это может означать, что развитие возможностей ИИ будет происходить быстрее, чем исследователи смогут за ним успевать, и работа по согласованию будет постоянно находиться в роли догоняющего.
«Темп передовых технологий» призывает правительство США помочь создать технические и управленческие тормоза, которые можно было бы использовать в будущем, утверждая, что ни одна лаборатория не может сбавить темп, пока конкуренты продолжают двигаться вперед. Это можно считать молчаливым признанием со стороны отрасли, что одних лишь добровольных структур будет недостаточно для сохранения согласования ИИ в будущем.
Кто еще работает над согласованием ИИ
Работа по согласованию выходит далеко за рамки компаний, создающих передовые модели.
Правительства
Правительства напрямую финансируют и координируют исследования в области согласования. Например, Институт безопасности ИИ Великобритании управляет «Проектом согласования» (Alignment Project) — глобальным фондом, который с 2025 года выделил более 27 млн фунтов стерлингов на более чем 60 проектов в восьми странах, направленных именно на контроль ИИ. В США CAISI фокусируется на стандартах оценки.
Оба они входят в состав более широкой сети, органа из десяти стран, состоящего из национальных институтов безопасности, который проводит совместные испытания и работает над согласованием методов оценки через границы.
Некоммерческие организации
Future of Life Institute публикует AI Safety Index — систему оценки, сравнивающую методы обеспечения безопасности в лабораториях ИИ. Center for AI Safety создает эталонные тесты, используемые во всей отрасли, включая WMDP и SafeBench. Alignment Research Center изучает более теоретические проблемы согласования, а его дочерняя организация Model Evaluation and Threat Research (METR) проводит независимую оценку передовых моделей перед их развертыванием. FAR.AI тестирует передовые модели на наличие уязвимостей до и после их выпуска.
Университеты
Несколько университетов играют активную роль в исследованиях по согласованию ИИ, включая Center for Human-Compatible AI в Калифорнийском университете в Беркли и Leverhulme Centre for the Future of Intelligence при Кембриджском университете.
Согласование ИИ: распространенные заблуждения
Согласование — это не то же самое, что модерация контента, хотя этот термин иногда используется в таком контексте. Модерация контента касается того, что модель будет или не будет говорить, отфильтровывая оскорбления, графический контент или определенные запрещенные темы. Согласование же касается того, соответствует ли фактическое поведение модели тому, для чего она была предназначена.
Согласование также иногда используется как синоним безопасности ИИ, но это не единственный фактор, который следует учитывать. Другие проблемы безопасности ИИ включают:
Безопасность (защита весов модели от кражи)
Надежность (способность модели работать стабильно вне тех условий, на которых она обучалась)
Предотвращение злоупотреблений (предотвращение использования мощной модели во вред)
Согласование касается собственного поведения модели. Безопасность ИИ — это более широкие усилия по предотвращению причинения вреда всей системой в целом.
Наконец, существует распространенное предположение, что более мощная модель автоматически является более согласованной. Но возможности и согласование могут расходиться, и именно поэтому существуют такие пороговые значения, как уровни возможностей ML R&D от Google DeepMind и категории рисков автоматизированных исследований от Anthropic. Они созданы специально из опасения, что возможности могут опередить способность отрасли проверять, продолжает ли модель делать то, что от нее требуется.
Как Perplexity подходит к согласованию ИИ
Perplexity не обучает передовые базовые модели. Она запускает модели в промышленную эксплуатацию в больших масштабах с помощью агентных продуктов, таких как Computer, поэтому ее работа затрагивает специфический аспект согласования: как ведут себя агенты, действуя в открытой сети.
Secure Intelligence Institute — это исследовательский центр Perplexity, занимающийся вопросами безопасности, конфиденциальности и доверия к передовому ИИ. Он разработал BrowseSafe, модель обнаружения с открытым исходным кодом, созданную для выявления атак типа «инъекция промпта», скрытых на веб-страницах, которые посещают браузерные агенты ИИ.
Команда также создала BrowseSafe-Bench, публичный эталонный тест, включающий более 14 700 сценариев инъекций промптов, охватывающих различные цели атак, места размещения на странице и языковые стили.
Эта работа ближе к прикладной стороне контроля ИИ, чем к исследованиям по согласованию. Она ограничивает действия агента при столкновении с состязательной средой, а не формирует базовые ценности модели во время обучения.
Чтобы узнать больше, изучите Secure Intelligence Institute и исследование BrowseSafe.










![Scrunch против Peec AI: выбор подходящего инструмента AEO [2026]](https://cdn.pixabay.com/photo/2013/04/22/00/50/screw-106361_1280.jpg)
![Инструменты AEO-чекера для измерения видимости в поисковых системах с ответами [2026]](https://cdn.pixabay.com/photo/2020/03/09/21/06/distance-4917124_1280.jpg)
