Пост-обучение открытой модели для использования инструментов, биологических рассуждений и проверяемых исследовательских рабочих процессов.
Гостевой пост от Loka, разработанный в сотрудничестве с Arcee AI и AWS.
Наша предыдущая работа Trinity Mini научила компактную модель классифицировать связи «лекарство-белок» на основе биомедицинских аннотаций. В этом проекте перед той же открытой моделью была поставлена более сложная задача: исследовать научный вопрос с помощью инструментов, рассуждать в условиях неполных данных и предоставлять результаты, которые может проверить другой исследователь.
Компании Loka, AWS, Arcee и Prime Intellect создали две среды обучения с подкреплением для достижения этой цели. Одна учит модель искать доказательства с помощью биомедицинских инструментов. Другая учит её выводить аннотации Gene Ontology на основе данных о белках и возвращать результат в строгом формате JSON. Затем мы провели 21 контролируемый эксперимент по пост-обучению и выбрали конфигурацию, которая показала наилучшие результаты в обеих задачах.
Контрольной точкой был выбран запуск 120.
- В ходе оценки на отложенной выборке Drug Tool её показатель вырос с 70,8% до 81,2%, увеличиваясь на каждом этапе оценки.
- В задаче BioReason на отложенной выборке модель достигла показателя 0,863 по комбинированной метрике, которая включает F1-меру терминов GO, сходство деревьев GO, охват аспектов и валидность JSON.
- До начала обучения с подкреплением один проход поиска промптов GEPA улучшил валидацию базовой модели примерно на 84% в BioReason и на 7,7% в Drug Tool. Эти цифры отражают валидацию поиска промптов до пост-обучения и не входят в итоговые результаты.
Выбор также зависел от трассировок инструментов, выводов верификатора, цитирований, идентификаторов, структурированных ответов и поведения внутри работающего научного приложения.
Научная работа редко начинается как простая задача классификации. Исследователь может начать с болезни и мишени, а не с набора ответов. Первый запрос может оказаться неудачным. У белка может быть несколько идентификаторов. Одна статья может подтверждать гипотезу, а другая — опровергать её. Полезная система должна решать, какие доказательства искать дальше, отличать отсутствующие доказательства от отрицательных и сохранять запись о том, как она пришла к своему выводу.
Промпт может описывать процедуру, но он не делает эту процедуру надежной при многошаговом выполнении. Инструкции отдавать предпочтение первичным доказательствам, разрешать идентификаторы, использовать инструменты и возвращать валидный JSON конфликтуют с частичными результатами и ограничениями форматирования. Модели также склонны выдавать внешне полезный ответ, когда доказательств недостаточно.
Этот режим сбоя особенно дорого обходится в науке. Невалидный JSON легко обнаружить. А вот отполированный синтез по неверному белку может незаметно пройти на следующий этап рабочего процесса.
Поэтому мы сосредоточили исследование на двух вопросах:
- Какая обратная связь поощряла бы желаемое научное поведение?
- Какие отложенные оценки показали бы, улучшилось ли это поведение?
Дизайн вознаграждения следовал из этих вопросов. В Drug Tool оценивались выбор инструментов, аргументы, извлеченные факты, завершенность, эффективность и лаконичность наряду с итоговым текстом. В BioReason оценивались биологическое содержание, структура вывода и валидность JSON.
Существует также операционная причина для специализации открытой модели. Компактная модель и небольшой адаптер LoRA могут работать внутри облачного контура организации, оставаться привязанными к известной версии политики и обновляться в соответствии с доказательствами и стандартами этой организации. Команда контролирует путь данных, вознаграждение, оценку, стоимость обслуживания и реагирование на инциденты. Этот операционный аспект дополняет научный аргумент в пользу более качественной обратной связи.
Смесь для обучения использовала две опубликованные среды Prime RL в равной пропорции. Вместе они охватывают исследование и заключение.
Набор данных Loka Drug Tool SFT был получен из банка промптов, используемого в приложении Loka для поиска лекарств. Arcee Trinity Large Thinking генерировала траектории помощника и инструментов через интерфейс OpenRouter, совместимый с OpenAI. Каждый пример сохраняет биомедицинский вопрос, схемы инструментов, действия помощника и сериализованные результаты инструментов.
Набор данных содержит 800 обучающих промптов и 200 отложенных промптов по 17 категориям рабочих процессов, всего 5 049 структурированных вызовов инструментов. Категории включают доказательства связи «болезнь-путь», сортировку литературы, проверку противоречий, скрининг биомаркеров GEO, разрешение KEGG, записи о белках, сети взаимодействий, сравнение ортологов, генерацию молекул, фолдинг белков и планирование докинга.
Среда lokahq/drug-tool-rl@3 представляет биомедицинский вопрос, каталог инструментов и контракт на завершение. Модель должна выбирать и параметризовать инструменты, восстанавливаться при сбоях поиска и завершать работу кратким синтезом. Семь инструментов поиска охватывают PubMed, GEO, KEGG, UniProt и STRING. При включении инструменты на базе NVIDIA NIM добавляют фолдинг белков, докинг лигандов и генерацию молекул. Идентичные вызовы кэшируются в рамках одного прогона, а структурные артефакты могут перемещаться между инструментами с сохранением состояния.
Вознаграждение сочетает в себе обоснованные факты, успешное использование инструментов, правильный выбор инструментов и аргументов, завершенность, эффективность, лаконичность и качество итогового ответа. Диагностика фиксирует галлюцинированные идентификаторы, ошибки инструментов, ограничения по частоте запросов, дублирующиеся вызовы и перекрытие доказательств. Связный ответ после неудачного поиска должен оцениваться иначе, чем синтез, основанный на найденных доказательствах. Вызов множества инструментов без достижения полезного вывода также должен приводить к снижению оценки.
Корпус BioReason RL содержит 8 630 курируемых записей, разделенных на обучающую и отложенную выборки. Он основан на BioReason-Pro и объединяет метаданные и последовательности белков с данными InterPro, взаимодействий и субклеточной локализации. Каждая запись также включает кандидатные термины GO-GPT. Модель должна оценивать эти зашумленные гипотезы, а не просто копировать их в качестве меток.
В lokahq/bioreason-go-rl@1 модель должна вывести функциональное резюме и списки идентификаторов Gene Ontology для молекулярной функции, биологического процесса и клеточного компонента. Она должна вернуть ровно один объект JSON.
Верификатор оценивает F1-меру GO по аспектам, среднюю F1-меру GO, сходство деревьев, наличие аспектов и строгую валидность JSON. Итоговая цель подчеркивала точность для аспектов, присутствующих в доказательствах, при сохранении проверки формата.
Протокол оценки запускал 200 отложенных примеров Drug Tool и 512 отложенных примеров BioReason каждые 20 шагов обучения. Эти результаты измеряют поведение в заданных средах и верификаторах. Они не являются утверждениями о клинической валидности, результатах лабораторных исследований или успехе всей программы разработки лекарств.
Системный промпт является частью среды RL. Он меняет действия, которые рассматривает политика, и ошибки, которые может заметить верификатор. Перед пост-обучением GRPO мы провели один проход оптимизации промптов GEPA для каждой среды.
Trinity Mini создала прогоны базовой модели. Модель рефлексии Claude Sonnet 5 использовала эти прогоны и обратную связь верификатора, чтобы предложить пересмотренные инструкции для задач. Выбранные промпты улучшили валидацию базовой модели примерно на 84% в BioReason и на 7,7% в Drug Tool.
Затем мы провели повторное обучение с выбранными промптами и повторили полную отложенную оценку. Среды отреагировали по-разному: одна сохранила преимущество пост-обучения, в то время как другая в значительной степени поглотила прирост от промптов во время RL. Этот результат определил то, как мы использовали GEPA.
Мы выполнили поиск промптов один раз, до обучения с подкреплением (RL), чтобы улучшить определение задачи. Мы не занимались постоянной переработкой промптов вокруг уже обученного чекпоинта. Остальная часть исследовательского бюджета была направлена на изменения в данных, функциях вознаграждения и оптимизации.
Trinity Mini — это модель типа «смесь экспертов» (MoE) с 26 миллиардами параметров, 3 миллиардами активных параметров и нативным контекстным окном в 128 тысяч токенов. В ней 128 экспертов; для каждого токена активны восемь маршрутизируемых экспертов и один общий эксперт. Каждый эксперимент начинался с одного и того же исходного чекпоинта arcee-ai/Trinity-Mini.
Для обучения использовался метод GRPO с адаптерами LoRA. Инструмент prime-rl от Prime Intellect разделил оптимизацию политики и логику вывода (rollout inference), подключив обе части к двум верифицируемым средам. Воркеры для обучения и генерации работали отдельно, в то время как среды возвращали вознаграждения и диагностические данные.
Активный контекст обучения составлял 16 тысяч токенов. Генерация (rollouts) допускала до 7168 токенов завершения. Обучение Drug Tool допускало 12 шагов, в то время как отложенная оценка Drug Tool — восемь. На протяжении всей серии мы сохраняли неизменными исходный чекпоинт модели, оптимизатор Muon, протокол отложенной оценки и топологию «четыре плюс четыре» GPU.
Такие элементы контроля облегчали интерпретацию каждого запуска. Изменение конфигурации можно было сравнить с известным базовым уровнем, а не с постоянно меняющейся системой.
Панель продвижения, ограниченное пространство поиска и постоянные записи экспериментов направляли 21 запуск. Итоговый рецепт возник в результате этого процесса.
Файл GOAL.md определял пороговые значения для обеих сред. CONTEXT.md хранил фиксированный протокол, известные режимы сбоев и важные измерения. PLAN.md устанавливал правило «одна гипотеза на запуск». Каждый запуск имел версионированную конфигурацию в папке rl/. Файл runs.jsonl фиксировал настройки, метрики, гипотезы и решения, а отчеты в папке analysis/ содержали графики, метрики компонентов и репрезентативные примеры генерации. THREAD.md содержал текущее состояние и следующую гипотезу между запусками.
Цикл был простым:
- Изучить графики отложенной оценки, метрики компонентов и репрезентативные примеры генерации.
- Сформулировать одну гипотезу о режиме сбоя или возможности для улучшения.
- Изменить ограниченную часть конфигурации или среды.
- Повторно выполнить обе оценки и отделить поведение модели от сбоев инфраструктуры.
- Сохранить, отклонить, перезапустить или перенастроить изменение, затем записать решение.
Каждый запуск оставлял достаточно доказательств, чтобы другой человек мог понять, что изменилось и почему. В последней записи журнала для запуска 120 было зафиксировано:
Эта запись имела значение при передаче дел и перезапусках. Следующий запуск начинался с письменных доказательств, а не по памяти, а отклоненные направления оставались видимыми.
Запуск 120 достиг порога продвижения в обеих средах. Показатель Drug Tool вырос с 70,8% до 81,2% во время обучения. BioReason достиг 0,863 по своей комбинированной метрике отложенной оценки.
Именно здесь запуск 120 проявляет себя лучше всего. Он достиг точности BioReason около 86% — комбинированного показателя, построенного на основе F1-меры терминов GO, сходства деревьев и валидности структуры JSON, в то время как точность Drug Tool росла.
Показатель BioReason объединяет несколько проверок. Он измеряет перекрытие с эталонными терминами GO, сходство внутри иерархии GO, покрытие трех аспектов онтологии и валидность структуры JSON. Это составная мера биологической аннотации и соответствия выходных данных.
Оценки сузили круг кандидатов, но для развертывания потребовались три проверки.
Во-первых, отложенная оценка измеряла поведение, закодированное средами. Во-вторых, проверка трассировок и верификаторов тестировала, были ли оценки получены в результате обоснованного использования инструментов и валидных структурированных выводов. В-третьих, кандидаты запускались внутри научного приложения для качественного тестирования рабочих процессов.
Этот последний этап проверял поведение, которое могли упустить агрегированные метрики: был ли поиск доказательств целенаправленным, были ли цитаты и идентификаторы пригодными для использования, справлялась ли модель с двусмысленностью и признавала ли она неопределенность в своем синтезе. Команда называла это «тестированием на ощущения» (vibe testing), но критерии были конкретными.
Запуск 120 прошел все три этапа. Вот почему он стал продвигаемым чекпоинтом.
Продвигаемый адаптер работает в сопутствующем приложении AI Scientist, созданном с использованием Strands, FastAPI и React. Специализированные задачи направляются на адаптер запуска 120. Базовая модель Trinity Mini остается доступной для оркестрации и маршрутизации, которые выигрывают от ее большего контекстного окна.
Оркестратор верхнего уровня делегирует задачи шести именованным специалистам. Двое из этих специалистов координируют более узких субспециалистов. Если посчитать трех плоских специалистов, критика и четырех вложенных специалистов, получится восемь агентов под оркестратором верхнего уровня. У каждого есть ограниченная работа и свои собственные видимые инструменты, источники и идентификаторы артефактов.
Четыре параметра среды выполнения облегчают проверку этого делегирования:
- ask_user позволяет только оркестратору верхнего уровня приостанавливать работу для уточнения. Делегирование специалистам происходит без участия пользователя и завершается за один проход.
- execute_python_code выполняется в изолированной «песочнице» AWS Bedrock AgentCore, а не в хост-процессе.
- /plan, /report и /hypothesize вызывают фиксированные потоки вместо свободного чата. Они создают загружаемые планы, отчеты со ссылками или конкурирующие гипотезы, основанные на доказательствах.
- Предметные навыки загружаются только при необходимости. Примеры включают научное критическое мышление и мозговой штурм у оркестратора, литературную строгость для специалиста по литературе, рассуждения ADMET для биомедицинского интеллекта и экспертную оценку для критика.
Репозиторий включает топологию ECS Fargate с Cognito, балансировщик нагрузки приложений, управляемое обслуживание моделей с поддержкой LoRA, артефакты сессий, секреты и наблюдаемость. Уровень обслуживания может размещать адаптеры Trinity Mini, не привязывая приложение к одному семейству моделей.
Этот проект предлагает практический путь для команд, которым нужно специализированное поведение модели, но которые не хотят предварительно обучать базовую модель.
Начните с рабочего процесса, который имеет значение. Определите, как выглядит полезное поведение в этом процессе. Постройте вокруг него отложенные тесты и проверяемые вознаграждения. Затем обучите небольшой адаптер, изучите трассировки и разверните его в рамках операционной границы, которую контролирует организация.
Для команды в области медико-биологических наук рабочим процессом может быть синтез доказательств, биологические рассуждения на основе внутренней базы знаний или анализ с помощью инструментов. Тот же метод можно применить к другой регулируемой или технической работе, где у организации уже есть свои данные, процедуры и стандарты оценки доказательств.
Используемый здесь стек остается открытым на каждом уровне: базовые веса, код обучения, среды, вознаграждение и развертывание. Это дает команде контроль над версиями политик, потоком данных, оценкой, обслуживанием и будущими обновлениями.
Открытая модель с 3 миллиардами активных параметров, обученная в ходе программы из 21 запуска в двух научных средах, достигла 81,2% на отложенной оценке Drug Tool и 0,863 на композитной оценке BioReason. Анализ трассировок и тестирование рабочих процессов подтвердили решение о продвижении этого чекпоинта.
Метод — это то, что можно использовать повторно: закодируйте научный рабочий процесс как действия и верифицируемые результаты, сохраняйте воспроизводимость экспериментов и продвигайте модель только тогда, когда оценки и поведение согласуются друг с другом.
Arcee предоставила Trinity Mini, адаптируемую открытую модель с практичным набором активных параметров. Prime Intellect предоставила систему обучения с открытым исходным кодом prime-rl. AWS предоставила инфраструктуру для ускоренного обучения, хранения артефактов, обслуживания моделей, прикладных сервисов, безопасности и наблюдаемости. Loka создала биомедицинские наборы данных, среды, верификаторы, исследовательский процесс и научное приложение.
Более ранний проект Петара Калиновского Trinity Mini DrugProt-Think показал, что компактная открытая модель может освоить научную специализацию и задать направление для этого сотрудничества.
Если вы находите эту работу полезной, пожалуйста, процитируйте ее ниже.
- Amazon Web Services. Инфраструктурная основа для ускоренного обучения, хранения артефактов, операций, обслуживания моделей и архитектуры агентной обвязки промышленного уровня, описанной в этом отчете.
- Карточка модели Arcee Trinity Mini. Архитектура, длина контекста, лицензия, настройки вывода и примеры обслуживания.
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. Представляет метод групповой относительной оптимизации политики (Group Relative Policy Optimization, GRPO).
- LoRA: Low-Rank Adaptation of Large Language Models. Метод адаптеров, используемый для эффективного по параметрам пост-обучения.
- Prime RL. Система обучения с подкреплением (RL) с открытым исходным кодом, лежащая в основе пакета экспериментов.
- Статья BioReason-Pro. Бенчмарк биологических рассуждений и источник данных.
- Данные рассуждений BioReason-Pro RL и тестовые данные.
- Набор данных Loka BioReason RL. Курируемый набор данных, используемый в финальных конфигурациях.
- Набор данных Loka Drug Tool SFT. Эталонные промпты и трассировки использования инструментов.
- Среда Prime RL Drug Tool и среда BioReason.
- Представляем GeneBench-Pro. Исследовательская оценка вычислительной биологии, требующей принятия сложных решений.
- GPT-Rosalind. Специализированная модель OpenAI для рассуждений в области наук о жизни, синтеза доказательств, использования научных инструментов и многошаговых исследовательских рабочих процессов.
- Claude Science. Научная рабочая среда Anthropic для подключенных инструментов, вычислений, кода и проверяемых исследовательских артефактов.
- Создание AI-ученого с помощью NVIDIA BioNeMo Agent Toolkit. Рабочий процесс агента в области наук о жизни с подключением инструментов.
- Обучение воспроизведению экспертных суждений в финансовых задачах. Пост-обучение для конкретных задач и экспертные суждения.
- Автономные исследования ИИ для спидрана nanoGPT. Цикл автоматических исследований с использованием надежной обвязки от Prime Intellect.
- Заявление Anthropic о доступе к Fable и Mythos. Конкретный пример изменения доступа к передовым моделям из-за внешней политики.
- GPT-5.6 availability. Официальное руководство OpenAI по ограничениям планов, продуктов, рабочих пространств, региональным ограничениям и мерам безопасности.
- Trinity Mini DrugProt-Think. Более ранний проект, который привел к этому сотрудничеству.
- GEPA. Рефлексивная эволюция промптов для оптимизации текстовых компонентов на основе оценки конкретных задач.









