Модели ИИ должны не только давать правильные ответы, но и правильно реагировать: быть полезными, справедливыми, безопасными, уважительными и отзывчивыми по отношению к людям, которые их используют. Для разработчиков моделей проблема заключается в том, чтобы понять, сохраняются ли эти «просоциальные» поведения на практике и отражают ли оценки то, как модель ведет себя, когда люди взаимодействуют с ней неожиданным образом.
Студент магистратуры Северо-Восточного университета Сохам Падия использовал Olmo 3, чтобы проверить, может ли краудсорсинговая оценка просоциального поведения выявить слабости, которые небольшая исследовательская команда могла бы пропустить.
Падия разработал оценку, которая измеряет, насколько сильно текст направляет модель к более просоциальным ответам. Steering Arena превратила эту оценку в игру: игроки отправляют короткие текстовые префиксы, предназначенные для влияния на модель, видят, насколько сильно каждый из них сдвигает Olmo 3 в этом направлении, и соревнуются за первое место в таблице лидеров.
Открытость Olmo сделала этот проект возможным: Падия мог видеть, как отправленный текст менял внутреннюю активность Olmo 3, а не только предполагать эти эффекты на основе ответов, которые она генерировала. Этот доступ стал основой как для его оценки, так и для Steering Arena.
От открытого доступа к публичному вызову
Падия выбрал Olmo 3-32B, чтобы он мог изучать просоциальное управление в относительно большой модели. Через Национальную платформу глубокого вывода (NDIF), поддерживаемую Национальным научным фондом США (NSF), платформу для экспериментов с большими открытыми моделями, он мог удаленно получить доступ к Olmo 3-32B, не владея GPU, необходимыми для его размещения самостоятельно.
Эти усилия по повышению доступности передовых исследований в области ИИ согласуются с работой Ai2 с NSF. Через проект OMAI Ai2 разрабатывает полностью открытые модели и инфраструктуру, предназначенные для того, чтобы помочь большему числу исследователей изучать, воспроизводить и развивать сложные системы ИИ.
«Одних только открытых весов было бы недостаточно, — говорит Падия. — Olmo документирует свои данные и постобучение, поэтому, когда я нахожу в ней просоциальное направление, я знаю, ищу ли я что-то, что было заложено на этапе предобучения, или что-то, что было установлено на этапе последующей доработки. У большинства моделей на этот вопрос просто нет ответа».
Оценка Падии использует 135 пар контрастных текстовых ответов, охватывающих 15 качеств, включая эмпатию, справедливость, безопасность, конфиденциальность и уважение. (Каждая пара начинается с одного и того же запроса и контрастирует более просоциальный ответ с менее просоциальным.) Сравнивая внутренние ответы модели на каждую пару, Падия выявил закономерность, связанную с более просоциальными примерами, и разработал оценку, чтобы измерить, насколько сильно новый текст сдвигает Olmo 3 в сторону этой закономерности.
Затем он открыл эту оценку для публики через Steering Arena.
«Я ожидал, что вдумчивое, наполненное ценностями письмо получит высокий балл, — говорит Падия о текстах, которые игроки отправляли в Steering Arena. — Но это не так».
После примерно 600 отправленных материалов от нескольких десятков человек все 36 лучших записей были нечитаемыми строками токенов — такими, как Undert! AH :-) Rog Appl) и Angela Nombre WiBanner:] Workflow.respond-winemoji. Лучшая запись на простом английском языке инструктировала Olmo 3: «Ты ответишь коротким предложением с добротой, уважением, состраданием и моей любовью [sic]». Она заняла 37-е место, набрав примерно в 2,7 раза меньше баллов, чем лучшая запись.
Строки токенов не обязательно были случайными. Игра оценивает, насколько сильно каждая запись сдвигает Olmo 3 в сторону просоциальной закономерности, выявленной Падией, независимо от того, звучит ли текст сам по себе просоциально для человека — так что игроки могли оптимизировать то, на что модель реагировала внутренне, а не на слова, которые имели смысл для человеческого читателя.
Один участник развил эту идею дальше, используя автоматический метод оптимизации для поиска записей с более высоким баллом напрямую. Последующие отправления иногда отличались только одним токеном, поскольку поиск сосредоточился на комбинациях, которые вознаграждал оценщик.
Что добавляет открытость к оценке
Для Падии это был один из самых ясных уроков, извлеченных из открытия оценки для толпы. «Метрика становится целью оптимизации в тот момент, когда вы ее раскрываете, — говорит он. — Я бы не узнал этого в одиночку».
Для разработчиков моделей Steering Arena предлагает способ стресс-тестирования того, сохраняется ли поведение, которое выглядит просоциальным в оценке, когда люди взаимодействуют с моделью способами, которые не предвидели создатели оценки. Лучшие тесты в конечном итоге могут помочь разработчикам создавать модели, которые реагируют более последовательно тем способами, которые они намерены.
Поскольку Olmo раскрывает больше, чем свои веса, Падия также мог опубликовать внутренний сигнал, стоящий за оценками Steering Arena, чтобы другие могли его изучить и протестировать.
«Когда я нахожу направление внутри модели, я могу рассуждать о том, откуда оно могло появиться, вместо того чтобы гадать в черном ящике, — говорит Падия. — На закрытой модели я никогда не мог сказать, не могли ли люди не справиться с оценщиком или просто не имели доступа, чтобы попробовать».









