Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Chto igra na osnove kraudsorsinga pokazala o upravlenii olmo 3
Dev48

© 2026 · All rights reserved.

Что игра на основе краудсорсинга показала о управлении Olmo 3

Источник: AI2 (Allen Institute for AI)

Что игра на основе краудсорсинга показала о управлении Olmo 3

Источник: AI2 (Allen Institute for AI)

A crowdsourced game built on Olmo 3 showed how people can exploit unexpected model behaviors to stress-test prosocial AI evaluations—and how open access to a model’s internals can help researchers understand why those tests break.

29 сентября 2026 г.•Обновлено: 29 сентября 2026 г.

Модели ИИ должны не только давать правильные ответы, но и правильно реагировать: быть полезными, справедливыми, безопасными, уважительными и отзывчивыми по отношению к людям, которые их используют. Для разработчиков моделей проблема заключается в том, чтобы понять, сохраняются ли эти «просоциальные» поведения на практике и отражают ли оценки то, как модель ведет себя, когда люди взаимодействуют с ней неожиданным образом.

Студент магистратуры Северо-Восточного университета Сохам Падия использовал Olmo 3, чтобы проверить, может ли краудсорсинговая оценка просоциального поведения выявить слабости, которые небольшая исследовательская команда могла бы пропустить.

Падия разработал оценку, которая измеряет, насколько сильно текст направляет модель к более просоциальным ответам. Steering Arena превратила эту оценку в игру: игроки отправляют короткие текстовые префиксы, предназначенные для влияния на модель, видят, насколько сильно каждый из них сдвигает Olmo 3 в этом направлении, и соревнуются за первое место в таблице лидеров.

Открытость Olmo сделала этот проект возможным: Падия мог видеть, как отправленный текст менял внутреннюю активность Olmo 3, а не только предполагать эти эффекты на основе ответов, которые она генерировала. Этот доступ стал основой как для его оценки, так и для Steering Arena.

От открытого доступа к публичному вызову

Падия выбрал Olmo 3-32B, чтобы он мог изучать просоциальное управление в относительно большой модели. Через Национальную платформу глубокого вывода (NDIF), поддерживаемую Национальным научным фондом США (NSF), платформу для экспериментов с большими открытыми моделями, он мог удаленно получить доступ к Olmo 3-32B, не владея GPU, необходимыми для его размещения самостоятельно.

Эти усилия по повышению доступности передовых исследований в области ИИ согласуются с работой Ai2 с NSF. Через проект OMAI Ai2 разрабатывает полностью открытые модели и инфраструктуру, предназначенные для того, чтобы помочь большему числу исследователей изучать, воспроизводить и развивать сложные системы ИИ.

«Одних только открытых весов было бы недостаточно, — говорит Падия. — Olmo документирует свои данные и постобучение, поэтому, когда я нахожу в ней просоциальное направление, я знаю, ищу ли я что-то, что было заложено на этапе предобучения, или что-то, что было установлено на этапе последующей доработки. У большинства моделей на этот вопрос просто нет ответа».

Оценка Падии использует 135 пар контрастных текстовых ответов, охватывающих 15 качеств, включая эмпатию, справедливость, безопасность, конфиденциальность и уважение. (Каждая пара начинается с одного и того же запроса и контрастирует более просоциальный ответ с менее просоциальным.) Сравнивая внутренние ответы модели на каждую пару, Падия выявил закономерность, связанную с более просоциальными примерами, и разработал оценку, чтобы измерить, насколько сильно новый текст сдвигает Olmo 3 в сторону этой закономерности.

Затем он открыл эту оценку для публики через Steering Arena.

«Я ожидал, что вдумчивое, наполненное ценностями письмо получит высокий балл, — говорит Падия о текстах, которые игроки отправляли в Steering Arena. — Но это не так».

После примерно 600 отправленных материалов от нескольких десятков человек все 36 лучших записей были нечитаемыми строками токенов — такими, как Undert! AH :-) Rog Appl) и Angela Nombre WiBanner:] Workflow.respond-winemoji. Лучшая запись на простом английском языке инструктировала Olmo 3: «Ты ответишь коротким предложением с добротой, уважением, состраданием и моей любовью [sic]». Она заняла 37-е место, набрав примерно в 2,7 раза меньше баллов, чем лучшая запись.

Строки токенов не обязательно были случайными. Игра оценивает, насколько сильно каждая запись сдвигает Olmo 3 в сторону просоциальной закономерности, выявленной Падией, независимо от того, звучит ли текст сам по себе просоциально для человека — так что игроки могли оптимизировать то, на что модель реагировала внутренне, а не на слова, которые имели смысл для человеческого читателя.

Один участник развил эту идею дальше, используя автоматический метод оптимизации для поиска записей с более высоким баллом напрямую. Последующие отправления иногда отличались только одним токеном, поскольку поиск сосредоточился на комбинациях, которые вознаграждал оценщик.

Что добавляет открытость к оценке

Для Падии это был один из самых ясных уроков, извлеченных из открытия оценки для толпы. «Метрика становится целью оптимизации в тот момент, когда вы ее раскрываете, — говорит он. — Я бы не узнал этого в одиночку».

Для разработчиков моделей Steering Arena предлагает способ стресс-тестирования того, сохраняется ли поведение, которое выглядит просоциальным в оценке, когда люди взаимодействуют с моделью способами, которые не предвидели создатели оценки. Лучшие тесты в конечном итоге могут помочь разработчикам создавать модели, которые реагируют более последовательно тем способами, которые они намерены.

Поскольку Olmo раскрывает больше, чем свои веса, Падия также мог опубликовать внутренний сигнал, стоящий за оценками Steering Arena, чтобы другие могли его изучить и протестировать.

«Когда я нахожу направление внутри модели, я могу рассуждать о том, откуда оно могло появиться, вместо того чтобы гадать в черном ящике, — говорит Падия. — На закрытой модели я никогда не мог сказать, не могли ли люди не справиться с оценщиком или просто не имели доступа, чтобы попробовать».

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
OpenAI, по сообщениям, отказывается от модели из-за проблем с безопасностьюПресса
OpenAI

OpenAI, по сообщениям, отказывается от модели из-за проблем с безопасностью

OpenAI отказывается от плана выпустить новую модель из-за растущих опасений по поводу безопасностиПресса
OpenAI

OpenAI отказывается от плана выпустить новую модель из-за растущих опасений по поводу безопасности

Источник: Инфраструктурный провайдер AI-инференции Modal Labs приближается к раунду финансирования на $750 млн по оценке $15,75 млрд
Пресса
Modal

Источник: Инфраструктурный провайдер AI-инференции Modal Labs приближается к раунду финансирования на $750 млн по оценке $15,75 млрд

Tesla снова отложила событие Roadster 2 из‑за плохой погодыПресса
Tesla

Tesla снова отложила событие Roadster 2 из‑за плохой погоды

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведениемПресса
OpenAI

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведением

Ещё от AI2 (Allen Institute for AI)

Обучение будущих учёных использованию инструментов ИИ для научных открытий
AI2 (Allen Institute for AI)

Обучение будущих учёных использованию инструментов ИИ для научных открытий

Как Goodfire использовала открытый пост-трейнинговый стек Ai2 для отслеживания нежелательного поведения модели
AI2 (Allen Institute for AI)

Как Goodfire использовала открытый пост-трейнинговый стек Ai2 для отслеживания нежелательного поведения модели

Сложные аспекты науки, поддерживаемой ИИ
AI2 (Allen Institute for AI)

Сложные аспекты науки, поддерживаемой ИИ

BenchMIRT: Что на самом деле измеряют бенчмарки LLM?
AI2 (Allen Institute for AI)

BenchMIRT: Что на самом деле измеряют бенчмарки LLM?