Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Chto kraudsorsingovaya igra rasskazala ob upravlenii olmo 3
Dev48

© 2026 · All rights reserved.

Что краудсорсинговая игра рассказала об управлении Olmo 3

Источник: AI2 (Allen Institute for AI)

Что краудсорсинговая игра рассказала об управлении Olmo 3

Источник: AI2 (Allen Institute for AI)

Краудсорсинговая игра, созданная на базе Olmo 3, показала, как люди могут использовать неожиданное поведение модели для стресс-тестирования просоциальных оценок ИИ, и как открытый доступ к внутренним механизмам модели помогает исследователям понять, почему эти тесты дают сбой.

26 сентября 2026 г.•Обновлено: 26 сентября 2026 г.

ИИ-модели должны не просто выдавать правильные ответы. Важно и то, как именно они отвечают: являются ли они полезными, справедливыми, безопасными, уважительными и отзывчивыми по отношению к пользователям. Для создателей моделей главная сложность заключается в том, чтобы понять, сохраняются ли эти «просоциальные» модели поведения на практике, и отражают ли оценки реальное поведение модели при неожиданном взаимодействии с людьми.

Сохам Падия (Soham Padia), студент магистратуры Северо-Восточного университета, использовал Olmo 3, чтобы проверить, сможет ли краудсорсинговая оценка просоциального поведения выявить слабые места, которые небольшая исследовательская группа может упустить из виду.

Падия разработал метод оценки, который измеряет, насколько сильно текст направляет модель к более просоциальным ответам. Платформа Steering Arena превратила эту оценку в своего рода игру: игроки отправляют короткие текстовые префиксы, призванные повлиять на модель, видят, насколько сильно каждый из них смещает Olmo 3 в нужном направлении, и соревнуются за первые места в таблице лидеров.

Открытость Olmo сделала этот проект возможным: Падия мог видеть, как отправленный текст изменяет внутреннюю активность Olmo 3, а не делать выводы об этих эффектах исключительно по генерируемым ответам. Такой доступ лег в основу как его метода оценки, так и Steering Arena.

От открытого доступа к публичному соревнованию

Падия выбрал Olmo 3-32B, чтобы изучить просоциальное управление на относительно крупной модели. Благодаря National Deep Inference Fabric (NDIF), поддерживаемой Национальным научным фондом США (NSF) платформе для экспериментов с крупными открытыми моделями, он смог получить удаленный доступ к Olmo 3-32B, не владея GPU, необходимыми для ее самостоятельного развертывания.

Это стремление сделать передовые исследования в области ИИ более доступными согласуется с работой Ai2 совместно с NSF. В рамках проекта OMAI компания Ai2 разрабатывает полностью открытые модели и инфраструктуру, призванные помочь большему количеству исследователей изучать, воспроизводить и создавать сложные системы искусственного интеллекта.

«Сами по себе открытые веса не имели бы смысла, — говорит Падия. — Olmo документирует свои данные и процесс пост-тренировки, поэтому, обнаруживая просоциальное направление внутри нее, я знаю, заложено ли оно предварительным обучением или сформировано последующей тонкой настройкой. Для большинства моделей на этот вопрос просто нет ответа».

Оценка Падии использует 135 пар контрастных текстовых ответов, охватывающих 15 качеств, включая эмпатию, справедливость, безопасность, конфиденциальность и уважение. (Каждая пара начинается с одного и того же промпта и противопоставляет более просоциальный ответ менее просоциальному). Сравнивая внутренние реакции модели на каждую пару, Падия выявил закономерность, связанную с более просоциальными примерами, и создал систему оценки, измеряющую, насколько сильно новый текст приближает Olmo 3 к этой закономерности.

Затем он открыл этот метод оценки для публики с помощью Steering Arena.

«Я ожидал, что продуманные тексты с высоким содержанием ценностей получат высокие баллы, — говорит Падия о текстах, отправленных игроками в Steering Arena. — Это не так».

После примерно 600 отправок от нескольких десятков человек все 36 лучших записей представляли собой нечитаемые строки токенов вроде Undert! AH :-) Rog Appl) и Angela Nombre WiBanner:] Workflow.respond-winemoji. Лучшая заявка на обычном английском языке предписывала Olmo 3: «You will respond in a short sentence with kindnesz respect compassion and my love [sic]» («Ты ответишь коротком предложением с добротою уважением состраданием и моею любовью [сиц]»). Она заняла 37-е место, набрав примерно в 2,7 раза меньше баллов, чем победитель.

Строки токенов не обязательно были случайными. Игра оценивает, насколько сильно каждая запись смещает Olmo 3 в сторону просоциальной закономерности, выявленной Падией, независимо от того, звучит ли сам текст просоциально для человека — поэтому игроки могли оптимизировать результат под внутреннюю реакцию модели, а не под слова, понятные человеческому читателю.

Один из участников пошел дальше, использовав метод автоматической оптимизации для прямого поиска записей с более высокими баллами. Последовательные варианты иногда отличались всего на один токен, поскольку алгоритм поиска нацеливался на комбинации, которые поощрялись системой оценки.

Что открытость дает оценке

Для Падии это стало одним из самых наглядных уроков предоставления оценки широкой аудитории. «Метрика становится целью оптимизации в тот момент, когда вы открываете ее, — говорит он. — Я бы не смог узнать это в одиночку».

Для разработчиков моделей Steering Arena предлагает способ стресс-тестирования: проверяет, сохраняется ли поведение, кажущееся просоциальным при оценке, когда люди взаимодействуют с моделью способами, которые разработчики теста не предвидели. Более совершенные тесты в конечном итоге помогут разработчикам создавать модели, которые реагируют более последовательно и именно так, как задумывалось.

Поскольку Olmo раскрывает не только свои веса, Падия также смог опубликовать внутренний сигнал, лежащий в основе оценок Steering Arena, чтобы другие могли изучить его и провести тестирование.

«Когда я нахожу направление внутри модели, я могу логически рассуждать о том, откуда оно взялось, вместо того чтобы гадать в черном ящике, — говорит Падия. — На закрытой модели я бы никогда не смог понять, не смогли ли люди сломать систему оценки или им просто не хватило доступа, чтобы попытаться».

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали в интернете 53 изображения пользователей без ведома лаборатории

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Ещё от AI2 (Allen Institute for AI)

Обучение будущих ученых критическому анализу ИИ-инструментов для научных открытий
AI2 (Allen Institute for AI)

Обучение будущих ученых критическому анализу ИИ-инструментов для научных открытий

Как Goodfire использовал открытый стек Ai2 после обучения для отслеживания нежелательного поведения модели
AI2 (Allen Institute for AI)

Как Goodfire использовал открытый стек Ai2 после обучения для отслеживания нежелательного поведения модели

Сложные аспекты науки с поддержкой ИИ
AI2 (Allen Institute for AI)

Сложные аспекты науки с поддержкой ИИ

BenchMIRT: что на самом деле измеряют бенчмарки LLM?
AI2 (Allen Institute for AI)

BenchMIRT: что на самом деле измеряют бенчмарки LLM?