Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Obuchenie otkrytoy modeli dlya nauchnoy raboty
Dev48

© 2026 · All rights reserved.

Обучение открытой модели для научной работы

Источник: Arcee AI

Обучение открытой модели для научной работы

Источник: Arcee AI

Пост-обучение открытой модели для использования инструментов, биологических рассуждений и проверяемых исследовательских рабочих процессов

29 сентября 2026 г.•Обновлено: 29 сентября 2026 г.

Пост-обучение открытой модели для использования инструментов, биологических рассуждений и проверяемых исследовательских рабочих процессов.

Гостевой пост от Loka, разработанный в сотрудничестве с Arcee AI и AWS.

Наша предыдущая работа Trinity Mini научила компактную модель классифицировать связи «лекарство-белок» на основе биомедицинских аннотаций. В этом проекте перед той же открытой моделью была поставлена более сложная задача: исследовать научный вопрос с помощью инструментов, рассуждать в условиях неполных данных и предоставлять результаты, которые может проверить другой исследователь.

Компании Loka, AWS, Arcee и Prime Intellect создали две среды обучения с подкреплением для достижения этой цели. Одна учит модель искать доказательства с помощью биомедицинских инструментов. Другая учит её выводить аннотации Gene Ontology на основе данных о белках и возвращать результат в строгом формате JSON. Затем мы провели 21 контролируемый эксперимент по пост-обучению и выбрали конфигурацию, которая показала наилучшие результаты в обеих задачах.

Контрольной точкой был выбран запуск 120.

  • В ходе оценки на отложенной выборке Drug Tool её показатель вырос с 70,8% до 81,2%, увеличиваясь на каждом этапе оценки.
  • В задаче BioReason на отложенной выборке модель достигла показателя 0,863 по комбинированной метрике, которая включает F1-меру терминов GO, сходство деревьев GO, охват аспектов и валидность JSON.
  • До начала обучения с подкреплением один проход поиска промптов GEPA улучшил валидацию базовой модели примерно на 84% в BioReason и на 7,7% в Drug Tool. Эти цифры отражают валидацию поиска промптов до пост-обучения и не входят в итоговые результаты.

Выбор также зависел от трассировок инструментов, выводов верификатора, цитирований, идентификаторов, структурированных ответов и поведения внутри работающего научного приложения.

Научная работа редко начинается как простая задача классификации. Исследователь может начать с болезни и мишени, а не с набора ответов. Первый запрос может оказаться неудачным. У белка может быть несколько идентификаторов. Одна статья может подтверждать гипотезу, а другая — опровергать её. Полезная система должна решать, какие доказательства искать дальше, отличать отсутствующие доказательства от отрицательных и сохранять запись о том, как она пришла к своему выводу.

Промпт может описывать процедуру, но он не делает эту процедуру надежной при многошаговом выполнении. Инструкции отдавать предпочтение первичным доказательствам, разрешать идентификаторы, использовать инструменты и возвращать валидный JSON конфликтуют с частичными результатами и ограничениями форматирования. Модели также склонны выдавать внешне полезный ответ, когда доказательств недостаточно.

Этот режим сбоя особенно дорого обходится в науке. Невалидный JSON легко обнаружить. А вот отполированный синтез по неверному белку может незаметно пройти на следующий этап рабочего процесса.

Поэтому мы сосредоточили исследование на двух вопросах:

  • Какая обратная связь поощряла бы желаемое научное поведение?
  • Какие отложенные оценки показали бы, улучшилось ли это поведение?

Дизайн вознаграждения следовал из этих вопросов. В Drug Tool оценивались выбор инструментов, аргументы, извлеченные факты, завершенность, эффективность и лаконичность наряду с итоговым текстом. В BioReason оценивались биологическое содержание, структура вывода и валидность JSON.

Существует также операционная причина для специализации открытой модели. Компактная модель и небольшой адаптер LoRA могут работать внутри облачного контура организации, оставаться привязанными к известной версии политики и обновляться в соответствии с доказательствами и стандартами этой организации. Команда контролирует путь данных, вознаграждение, оценку, стоимость обслуживания и реагирование на инциденты. Этот операционный аспект дополняет научный аргумент в пользу более качественной обратной связи.

Смесь для обучения использовала две опубликованные среды Prime RL в равной пропорции. Вместе они охватывают исследование и заключение.

Набор данных Loka Drug Tool SFT был получен из банка промптов, используемого в приложении Loka для поиска лекарств. Arcee Trinity Large Thinking генерировала траектории помощника и инструментов через интерфейс OpenRouter, совместимый с OpenAI. Каждый пример сохраняет биомедицинский вопрос, схемы инструментов, действия помощника и сериализованные результаты инструментов.

Набор данных содержит 800 обучающих промптов и 200 отложенных промптов по 17 категориям рабочих процессов, всего 5 049 структурированных вызовов инструментов. Категории включают доказательства связи «болезнь-путь», сортировку литературы, проверку противоречий, скрининг биомаркеров GEO, разрешение KEGG, записи о белках, сети взаимодействий, сравнение ортологов, генерацию молекул, фолдинг белков и планирование докинга.

Среда lokahq/drug-tool-rl@3 представляет биомедицинский вопрос, каталог инструментов и контракт на завершение. Модель должна выбирать и параметризовать инструменты, восстанавливаться при сбоях поиска и завершать работу кратким синтезом. Семь инструментов поиска охватывают PubMed, GEO, KEGG, UniProt и STRING. При включении инструменты на базе NVIDIA NIM добавляют фолдинг белков, докинг лигандов и генерацию молекул. Идентичные вызовы кэшируются в рамках одного прогона, а структурные артефакты могут перемещаться между инструментами с сохранением состояния.

Вознаграждение сочетает в себе обоснованные факты, успешное использование инструментов, правильный выбор инструментов и аргументов, завершенность, эффективность, лаконичность и качество итогового ответа. Диагностика фиксирует галлюцинированные идентификаторы, ошибки инструментов, ограничения по частоте запросов, дублирующиеся вызовы и перекрытие доказательств. Связный ответ после неудачного поиска должен оцениваться иначе, чем синтез, основанный на найденных доказательствах. Вызов множества инструментов без достижения полезного вывода также должен приводить к снижению оценки.

Корпус BioReason RL содержит 8 630 курируемых записей, разделенных на обучающую и отложенную выборки. Он основан на BioReason-Pro и объединяет метаданные и последовательности белков с данными InterPro, взаимодействий и субклеточной локализации. Каждая запись также включает кандидатные термины GO-GPT. Модель должна оценивать эти зашумленные гипотезы, а не просто копировать их в качестве меток.

В lokahq/bioreason-go-rl@1 модель должна вывести функциональное резюме и списки идентификаторов Gene Ontology для молекулярной функции, биологического процесса и клеточного компонента. Она должна вернуть ровно один объект JSON.

Верификатор оценивает F1-меру GO по аспектам, среднюю F1-меру GO, сходство деревьев, наличие аспектов и строгую валидность JSON. Итоговая цель подчеркивала точность для аспектов, присутствующих в доказательствах, при сохранении проверки формата.

Протокол оценки запускал 200 отложенных примеров Drug Tool и 512 отложенных примеров BioReason каждые 20 шагов обучения. Эти результаты измеряют поведение в заданных средах и верификаторах. Они не являются утверждениями о клинической валидности, результатах лабораторных исследований или успехе всей программы разработки лекарств.

Системный промпт является частью среды RL. Он меняет действия, которые рассматривает политика, и ошибки, которые может заметить верификатор. Перед пост-обучением GRPO мы провели один проход оптимизации промптов GEPA для каждой среды.

Trinity Mini создала прогоны базовой модели. Модель рефлексии Claude Sonnet 5 использовала эти прогоны и обратную связь верификатора, чтобы предложить пересмотренные инструкции для задач. Выбранные промпты улучшили валидацию базовой модели примерно на 84% в BioReason и на 7,7% в Drug Tool.

Затем мы провели повторное обучение с выбранными промптами и повторили полную отложенную оценку. Среды отреагировали по-разному: одна сохранила преимущество пост-обучения, в то время как другая в значительной степени поглотила прирост от промптов во время RL. Этот результат определил то, как мы использовали GEPA.

Мы выполнили поиск промптов один раз, до обучения с подкреплением (RL), чтобы улучшить определение задачи. Мы не занимались постоянной переработкой промптов вокруг уже обученного чекпоинта. Остальная часть исследовательского бюджета была направлена на изменения в данных, функциях вознаграждения и оптимизации.

Trinity Mini — это модель типа «смесь экспертов» (MoE) с 26 миллиардами параметров, 3 миллиардами активных параметров и нативным контекстным окном в 128 тысяч токенов. В ней 128 экспертов; для каждого токена активны восемь маршрутизируемых экспертов и один общий эксперт. Каждый эксперимент начинался с одного и того же исходного чекпоинта arcee-ai/Trinity-Mini.

Для обучения использовался метод GRPO с адаптерами LoRA. Инструмент prime-rl от Prime Intellect разделил оптимизацию политики и логику вывода (rollout inference), подключив обе части к двум верифицируемым средам. Воркеры для обучения и генерации работали отдельно, в то время как среды возвращали вознаграждения и диагностические данные.

Активный контекст обучения составлял 16 тысяч токенов. Генерация (rollouts) допускала до 7168 токенов завершения. Обучение Drug Tool допускало 12 шагов, в то время как отложенная оценка Drug Tool — восемь. На протяжении всей серии мы сохраняли неизменными исходный чекпоинт модели, оптимизатор Muon, протокол отложенной оценки и топологию «четыре плюс четыре» GPU.

Такие элементы контроля облегчали интерпретацию каждого запуска. Изменение конфигурации можно было сравнить с известным базовым уровнем, а не с постоянно меняющейся системой.

Панель продвижения, ограниченное пространство поиска и постоянные записи экспериментов направляли 21 запуск. Итоговый рецепт возник в результате этого процесса.

Файл GOAL.md определял пороговые значения для обеих сред. CONTEXT.md хранил фиксированный протокол, известные режимы сбоев и важные измерения. PLAN.md устанавливал правило «одна гипотеза на запуск». Каждый запуск имел версионированную конфигурацию в папке rl/. Файл runs.jsonl фиксировал настройки, метрики, гипотезы и решения, а отчеты в папке analysis/ содержали графики, метрики компонентов и репрезентативные примеры генерации. THREAD.md содержал текущее состояние и следующую гипотезу между запусками.

Цикл был простым:

  • Изучить графики отложенной оценки, метрики компонентов и репрезентативные примеры генерации.
  • Сформулировать одну гипотезу о режиме сбоя или возможности для улучшения.
  • Изменить ограниченную часть конфигурации или среды.
  • Повторно выполнить обе оценки и отделить поведение модели от сбоев инфраструктуры.
  • Сохранить, отклонить, перезапустить или перенастроить изменение, затем записать решение.

Каждый запуск оставлял достаточно доказательств, чтобы другой человек мог понять, что изменилось и почему. В последней записи журнала для запуска 120 было зафиксировано:

Эта запись имела значение при передаче дел и перезапусках. Следующий запуск начинался с письменных доказательств, а не по памяти, а отклоненные направления оставались видимыми.

Запуск 120 достиг порога продвижения в обеих средах. Показатель Drug Tool вырос с 70,8% до 81,2% во время обучения. BioReason достиг 0,863 по своей комбинированной метрике отложенной оценки.

Именно здесь запуск 120 проявляет себя лучше всего. Он достиг точности BioReason около 86% — комбинированного показателя, построенного на основе F1-меры терминов GO, сходства деревьев и валидности структуры JSON, в то время как точность Drug Tool росла.

Показатель BioReason объединяет несколько проверок. Он измеряет перекрытие с эталонными терминами GO, сходство внутри иерархии GO, покрытие трех аспектов онтологии и валидность структуры JSON. Это составная мера биологической аннотации и соответствия выходных данных.

Оценки сузили круг кандидатов, но для развертывания потребовались три проверки.

Во-первых, отложенная оценка измеряла поведение, закодированное средами. Во-вторых, проверка трассировок и верификаторов тестировала, были ли оценки получены в результате обоснованного использования инструментов и валидных структурированных выводов. В-третьих, кандидаты запускались внутри научного приложения для качественного тестирования рабочих процессов.

Этот последний этап проверял поведение, которое могли упустить агрегированные метрики: был ли поиск доказательств целенаправленным, были ли цитаты и идентификаторы пригодными для использования, справлялась ли модель с двусмысленностью и признавала ли она неопределенность в своем синтезе. Команда называла это «тестированием на ощущения» (vibe testing), но критерии были конкретными.

Запуск 120 прошел все три этапа. Вот почему он стал продвигаемым чекпоинтом.

Продвигаемый адаптер работает в сопутствующем приложении AI Scientist, созданном с использованием Strands, FastAPI и React. Специализированные задачи направляются на адаптер запуска 120. Базовая модель Trinity Mini остается доступной для оркестрации и маршрутизации, которые выигрывают от ее большего контекстного окна.

Оркестратор верхнего уровня делегирует задачи шести именованным специалистам. Двое из этих специалистов координируют более узких субспециалистов. Если посчитать трех плоских специалистов, критика и четырех вложенных специалистов, получится восемь агентов под оркестратором верхнего уровня. У каждого есть ограниченная работа и свои собственные видимые инструменты, источники и идентификаторы артефактов.

Четыре параметра среды выполнения облегчают проверку этого делегирования:

  • ask_user позволяет только оркестратору верхнего уровня приостанавливать работу для уточнения. Делегирование специалистам происходит без участия пользователя и завершается за один проход.
  • execute_python_code выполняется в изолированной «песочнице» AWS Bedrock AgentCore, а не в хост-процессе.
  • /plan, /report и /hypothesize вызывают фиксированные потоки вместо свободного чата. Они создают загружаемые планы, отчеты со ссылками или конкурирующие гипотезы, основанные на доказательствах.
  • Предметные навыки загружаются только при необходимости. Примеры включают научное критическое мышление и мозговой штурм у оркестратора, литературную строгость для специалиста по литературе, рассуждения ADMET для биомедицинского интеллекта и экспертную оценку для критика.

Репозиторий включает топологию ECS Fargate с Cognito, балансировщик нагрузки приложений, управляемое обслуживание моделей с поддержкой LoRA, артефакты сессий, секреты и наблюдаемость. Уровень обслуживания может размещать адаптеры Trinity Mini, не привязывая приложение к одному семейству моделей.

Этот проект предлагает практический путь для команд, которым нужно специализированное поведение модели, но которые не хотят предварительно обучать базовую модель.

Начните с рабочего процесса, который имеет значение. Определите, как выглядит полезное поведение в этом процессе. Постройте вокруг него отложенные тесты и проверяемые вознаграждения. Затем обучите небольшой адаптер, изучите трассировки и разверните его в рамках операционной границы, которую контролирует организация.

Для команды в области медико-биологических наук рабочим процессом может быть синтез доказательств, биологические рассуждения на основе внутренней базы знаний или анализ с помощью инструментов. Тот же метод можно применить к другой регулируемой или технической работе, где у организации уже есть свои данные, процедуры и стандарты оценки доказательств.

Используемый здесь стек остается открытым на каждом уровне: базовые веса, код обучения, среды, вознаграждение и развертывание. Это дает команде контроль над версиями политик, потоком данных, оценкой, обслуживанием и будущими обновлениями.

Открытая модель с 3 миллиардами активных параметров, обученная в ходе программы из 21 запуска в двух научных средах, достигла 81,2% на отложенной оценке Drug Tool и 0,863 на композитной оценке BioReason. Анализ трассировок и тестирование рабочих процессов подтвердили решение о продвижении этого чекпоинта.

Метод — это то, что можно использовать повторно: закодируйте научный рабочий процесс как действия и верифицируемые результаты, сохраняйте воспроизводимость экспериментов и продвигайте модель только тогда, когда оценки и поведение согласуются друг с другом.

Arcee предоставила Trinity Mini, адаптируемую открытую модель с практичным набором активных параметров. Prime Intellect предоставила систему обучения с открытым исходным кодом prime-rl. AWS предоставила инфраструктуру для ускоренного обучения, хранения артефактов, обслуживания моделей, прикладных сервисов, безопасности и наблюдаемости. Loka создала биомедицинские наборы данных, среды, верификаторы, исследовательский процесс и научное приложение.

Более ранний проект Петара Калиновского Trinity Mini DrugProt-Think показал, что компактная открытая модель может освоить научную специализацию и задать направление для этого сотрудничества.

Если вы находите эту работу полезной, пожалуйста, процитируйте ее ниже.

  • Amazon Web Services. Инфраструктурная основа для ускоренного обучения, хранения артефактов, операций, обслуживания моделей и архитектуры агентной обвязки промышленного уровня, описанной в этом отчете.
  • Карточка модели Arcee Trinity Mini. Архитектура, длина контекста, лицензия, настройки вывода и примеры обслуживания.
  • DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. Представляет метод групповой относительной оптимизации политики (Group Relative Policy Optimization, GRPO).
  • LoRA: Low-Rank Adaptation of Large Language Models. Метод адаптеров, используемый для эффективного по параметрам пост-обучения.
  • Prime RL. Система обучения с подкреплением (RL) с открытым исходным кодом, лежащая в основе пакета экспериментов.
  • Статья BioReason-Pro. Бенчмарк биологических рассуждений и источник данных.
  • Данные рассуждений BioReason-Pro RL и тестовые данные.
  • Набор данных Loka BioReason RL. Курируемый набор данных, используемый в финальных конфигурациях.
  • Набор данных Loka Drug Tool SFT. Эталонные промпты и трассировки использования инструментов.
  • Среда Prime RL Drug Tool и среда BioReason.
  • Представляем GeneBench-Pro. Исследовательская оценка вычислительной биологии, требующей принятия сложных решений.
  • GPT-Rosalind. Специализированная модель OpenAI для рассуждений в области наук о жизни, синтеза доказательств, использования научных инструментов и многошаговых исследовательских рабочих процессов.
  • Claude Science. Научная рабочая среда Anthropic для подключенных инструментов, вычислений, кода и проверяемых исследовательских артефактов.
  • Создание AI-ученого с помощью NVIDIA BioNeMo Agent Toolkit. Рабочий процесс агента в области наук о жизни с подключением инструментов.
  • Обучение воспроизведению экспертных суждений в финансовых задачах. Пост-обучение для конкретных задач и экспертные суждения.
  • Автономные исследования ИИ для спидрана nanoGPT. Цикл автоматических исследований с использованием надежной обвязки от Prime Intellect.
  • Заявление Anthropic о доступе к Fable и Mythos. Конкретный пример изменения доступа к передовым моделям из-за внешней политики.
  • GPT-5.6 availability. Официальное руководство OpenAI по ограничениям планов, продуктов, рабочих пространств, региональным ограничениям и мерам безопасности.
  • Trinity Mini DrugProt-Think. Более ранний проект, который привел к этому сотрудничеству.
  • GEPA. Рефлексивная эволюция промптов для оптимизации текстовых компонентов на основе оценки конкретных задач.
← Все статьи

Ещё в разделе «Разработка ПО»

Все →
Air Teams: внедрите лучшие агентные рабочие процессы во всей команде и автоматизируйте повторяющиеся задачи
JetBrains

Air Teams: внедрите лучшие агентные рабочие процессы во всей команде и автоматизируйте повторяющиеся задачи

Выпущен Rider 2026.2.3!
JetBrains

Выпущен Rider 2026.2.3!

Более надежная схема компиляции для модулей Kotlin Multiplatform
JetBrains

Более надежная схема компиляции для модулей Kotlin Multiplatform

BOB в гостиничном бизнесе: руководство по Business on Books и OTB
Hotelogix

BOB в гостиничном бизнесе: руководство по Business on Books и OTB

Insyde® Software подтверждает лидерство в области безопасности микропрограмм на конференции FTA 2026
Insyde Software

Insyde® Software подтверждает лидерство в области безопасности микропрограмм на конференции FTA 2026

Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссовПресса
Momentum

Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссов

Ещё от Arcee AI

Arcee AI привлекла финансирование серии B для создания американских открытых моделей
Arcee AI

Arcee AI привлекла финансирование серии B для создания американских открытых моделей

Arcee начинает сотрудничество с Bolt в рамках проекта Forge
Arcee AI

Arcee начинает сотрудничество с Bolt в рамках проекта Forge

Представляем NAC, open-source среду для длительных агентных задач
Arcee AI

Представляем NAC, open-source среду для длительных агентных задач

Представляем бета-версию API открытых моделей Arcee
Arcee AI

Представляем бета-версию API открытых моделей Arcee