🤗 Модель | 📊 Данные
Языковые модели уже могут помогать исследователям искать литературу, синтезировать доказательства и прорабатывать сложные вопросы. Но научная работа предъявляет к таким моделям особые требования: ответы должны оставаться обоснованными, модели должны сохранять то, что действительно подтверждается доказательствами, а не незаметно расширять выводы исследования, и исследователи должны иметь возможность проверять итоговые результаты.
Мы видим это в том, как ученые используют Asta, нашу агентную платформу для научной работы. Вместо простых поисковых запросов по ключевым словам пользователи часто предоставляют значительный контекст и множество ограничений — например, просят Asta сравнить подходы в ряде литературных источников, учитывая конкретный метод, популяцию или условия. Многие также возвращаются к созданным отчетам позже, рассматривая их как рабочие исследовательские материалы, а не как разовые ответы.
Мы хотели помочь ученым быстрее создавать отчеты со ссылками на источники с помощью модели, которую они могли бы загрузить и запустить самостоятельно. Для этого мы проверили, может ли небольшая открытая модель, обученная специально для создания научных отчетов, соответствовать качеству отчетов проприетарных моделей, которые мы использовали, при этом сокращая время генерации и затраты на обслуживание.
Мы создали AstaBrief 8B — модель, которая превращает исследовательский вопрос и извлеченные фрагменты литературы в отчет со ссылками. AstaBrief доступна в функции «Создать отчет» в Asta уже сегодня как быстрый режим наряду с режимом «Размышление» (Thinking mode) на базе Claude. Мы также открываем исходный код модели и данные для обучения, чтобы другие могли изучать, воспроизводить и развивать наш подход.
Разработка AstaBrief потребовала использования десятков тысяч реальных исследовательских запросов, фильтрации с упором на цитирование, данных о предпочтениях и переработанного конвейера генерации отчетов, который пишет полный отчет за один проход, а не по разделам. Результатом стало сокращение времени генерации отчетов почти на порядок по сравнению с проприетарными моделями, которые мы отслеживали: во всем конвейере Asta быстрый режим в среднем занимает 51,1 секунды на отчет по сравнению со 178,5 секундами в режиме «Размышление», что примерно в 3,5 раза быстрее.
В совокупности эти показатели эффективности сделали AstaBrief полезным тестовым примером для более широкой цели: создания открытых языковых моделей, которые можно адаптировать к специфическим требованиям научной работы.
Открытые веса также позволят учреждениям запускать AstaBrief на собственной инфраструктуре, что необходимо, когда исследовательские вопросы касаются конфиденциальных или неопубликованных работ. Наряду с весами модели мы выпускаем an example workflow that researchers can adapt to create reports from their own PDFs, предоставляя отправную точку для локальной генерации отчетов.
В этой статье рассказывается о том, как мы обучали AstaBrief, что узнали об обосновании ответов научными доказательствами и какие части нашего подхода, по нашему мнению, можно перенести на будущие модели для науки. Большая часть описанного обучения и оценки была завершена в 2025 году, поэтому проприетарные модели, использованные для генерации обучающих данных и в качестве точек сравнения, отражают уровень технологий на тот момент. Мы не проводили повторную полную оценку в сравнении с современными передовыми моделями; приведенные ниже результаты лучше всего рассматривать как доказательство эффективности конкретных решений в области обучения и проектирования систем, которые мы протестировали.
Обучение модели
Наша цель при создании AstaBrief заключалась в создании модели с открытыми весами, обладающей всеми качествами, наиболее важными для долгого научного синтеза: качеством ответов, релевантностью, структурой и обоснованностью ссылок. Мы начали с Qwen3-8B и сосредоточили большую часть наших усилий на данных после обучения, оценке и сопутствующей инфраструктуре генерации отчетов.
Адаптация моделей общего назначения для научной работы — и обучение новых научных моделей с нуля — это то, что мы широко исследуем в Ai2. Через NSF OMAI, национальную инициативу США под руководством Ai2 по созданию полностью открытой инфраструктуры ИИ и моделей для научных открытий, наши исследователи работают напрямую с научными сообществами, чтобы понять, что им нужно от будущих открытых моделей и в чем сегодняшние модели общего назначения не справляются. Это включает изучение того, как потребности различаются в зависимости от научных областей и рабочих процессов, и мы поделимся новыми результатами этого исследования в будущем.
Недавние работы, включая нашу DR Tulu, показали, что методы на основе обучения с подкреплением (RL) могут улучшить создание длинных отчетов для моделей с открытыми весами, особенно когда в цикле обучения участвуют модели-судьи. Мы рассматривали этот путь для AstaBrief, но в конечном итоге сосредоточились на более простом рецепте, основанном на контролируемом дообучении (SFT) и прямой оптимизации предпочтений (DPO).
Обучение на основе RL может быть нестабильным и дорогостоящим. Мы хотели посмотреть, насколько далеко мы сможем продвинуться в качестве генерации отчетов с помощью более дешевой и операционно управляемой настройки — той, которую также легче отлаживать и итерировать.
Это сделало качество обучающих данных особенно важным. Вместо того чтобы полагаться на более сложный метод оптимизации для компенсации зашумленных примеров, мы потратили большую часть проекта на то, чтобы выяснить, как генерировать, отбирать и фильтровать примеры, которые действительно демонстрировали желаемое поведение при написании отчетов.
Мы также хотели, чтобы AstaBrief работал быстрее, чтобы пользователи могли быстро получать предварительные отчеты, которые затем можно было бы дорабатывать в последующих итерациях. Для повышения скорости мы решили обучить AstaBrief напрямую генерировать итоговый отчет за один проход, учитывая запрос пользователя и соответствующие извлеченные фрагменты, минуя дорогостоящие этапы суммаризации и кластеризации фрагментов, которые использует наш режим «Размышление» на базе Claude, и не записывая ответ по разделам. Интересно, что мы обнаружили, что это возможно сделать без ущерба для производительности.
Сбор обучающих данных SFT
Конвейер обучения начался с реальных запросов пользователей, отправленных через систему, описанную в нашей статье «Synthesizing scientific literature with retrieval-augmented LMs» и ScholarQA, инфраструктуре, которая теперь лежит в основе функции «Создать отчет» в Asta. Вместо того чтобы обучать модель только на синтетических подсказках или задачах типа бенчмарков, мы хотели, чтобы AstaBrief учился на реальных запросах от реальных ученых.
Наше исследование показывает, что ученые часто требуют от языковых моделей другого, нежели пользователи от чат-ботов общего назначения или традиционных поисковых инструментов. В нашем анализе сотен тысяч запросов Asta эксперты-исследователи часто предоставляли значительный контекст, многочисленные ограничения и связи между концепциями, а не полагались на короткие запросы в стиле ключевых слов.
Более недавние исследования пользователей Asta также выявили различия в том, как исследователи хотят видеть ИИ в своей работе: некоторые комфортно используют модели для генерации идей или экспериментов, в то время как другие предпочитают более узкую роль в синтезе, мониторинге литературы или поиске закономерностей. Несмотря на эти различия, участники хотят более четкой прослеживаемости источников, большей прозрачности того, что делает модель, и большего контроля над контекстом, который она использует.
Мы отфильтровали собранные логи пользователей по критериям качества, релевантности и конфиденциальности, удалив трафик бета-тестеров и ботов, отсеяв слишком короткие запросы, не несущие смысловой нагрузки, и применив фильтрацию на базе LLM для исключения запросов не на английском языке, ненаучных запросов и промптов, содержащих персональные данные. В результате мы получили пул из 90 тысяч запросов, ориентированных на исследования.
Для SFT мы сгенерировали целевые полные отчеты на основе отфильтрованных запросов, используя многоэтапный конвейер ScholarQA, лежащий в основе генерации отчетов Asta. Конвейер извлекал соответствующую литературу, структурировал материал по разделам и использовал вспомогательную модель для синтеза доказательств в отчет со ссылками. Мы использовали комбинацию проприетарных систем: Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT-4.1. После фильтрации качества это дало 47 тысяч пригодных для обучения примеров.
Создание пар для DPO
Для DPO потребовались другие данные для обучения. Вместо одного целевого отчета на запрос нам нужны были пары отчетов, где один предпочтительнее другого.
Мы создали эти пары из отдельного подмножества запросов, не использовавшихся при генерации данных SFT. Один отчет на запрос поступал из существующего конвейера ScholarQA, обычно на базе Claude 3.5 Sonnet или 3.7 Sonnet. Конкурирующий отчет генерировался путем подачи извлеченных фрагментов литературы ScholarQA в другую модель: o3, o4-mini, DeepSeek-V3 или DeepSeek-R1, в зависимости от примера.
Две модели-судьи — GPT-4.1 и DeepSeek-R1 — сравнивали каждую пару и выбирали победителя. Мы убедились, что LLM-судьи соответствуют человеческим предпочтениям (согласованность 95%), и сохранили только те пары, в которых оба судьи были согласны. Это позволило получить более чистый набор предпочтений и устранить значительную часть шума, который обычно возникает при генерации данных о предпочтениях в больших масштабах.
После фильтрации качества итоговый набор данных DPO составил около 6 тысяч примеров.
Использование нескольких генераторов и требование согласия между двумя судьями дали нам относительно простой способ формирования данных о предпочтениях, не полагаясь на вывод или суждение какой-либо одной модели как на истину в последней инстанции.
Фильтрация данных для улучшения атрибуции
Нашей основной целью оценки был SQABench-CS2, набор из 200 исследовательских вопросов по информатике, написанных пользователями. В процессе разработки AstaBrief мы отслеживали четыре метрики:
- Оценка по рубрикам, которая измеряет, насколько необходимый контент охвачен отчетом.
- Точность ответа, которая измеряет, относится ли каждый абзац к вопросу.
- Точность цитирования, которая измеряет, подтверждает ли каждая цитата утверждение, к которому она привязана.
- Полнота цитирования, которая измеряет, полностью ли подтверждаются утверждения отчета предоставленными цитатами.
Для нашей финальной модели мы также провели вторичные оценки: DeepScholarBench, бенчмарк из 63 запросов для синтеза длинных исследований, созданный на основе недавних статей с ArXiv, и две отдельные парные оценки в сравнении с отчетами, сгенерированными конвейером на базе Claude — сравнение с оценкой LLM на SQABench-CS2 и небольшое исследование с участием людей.
Отчет может звучать отточенно и полно, при этом отклоняясь от вопроса или привязывая цитаты к утверждениям, которые не подкреплены лежащими в их основе доказательствами. Для научного синтеза нам нужно было измерять эти аспекты отдельно. Но поддержка цитированием — это лишь часть научной достоверности: модель может процитировать нужное исследование и при этом сделать более сильное утверждение, чем то, которое поддерживает само исследование. Это может происходить тонкими способами, например, превращая вывод об определенной выборке в общее утверждение о всей популяции, переводя результат, сообщенный в прошедшем времени, в утверждение в настоящем времени, которое звучит более универсально, или превращая описательный вывод в рекомендацию о том, что должны делать клиницисты, политики или исследователи.
Такие обобщения особенно важны для генерации научных отчетов, поскольку каждый шаг может расширить кажущуюся область доказательств, не вводя при этом явно ложное утверждение. Таким образом, процитированное предложение может быть технически связано со своим источником, но при этом преувеличивать то, что на самом деле установили исследователи. Наши метрики разработки были сосредоточены в первую очередь на релевантности, охвате и обоснованности цитирования; более глубокая оценка авторов научных отчетов должна также проверять, сохраняют ли они масштаб и силу утверждений в своих источниках.
Наши первые прогоны SFT улучшили общее качество контента, но они все еще отставали от нашего конвейера генерации отчетов на базе Claude по точности ответов и качеству цитирования. Другими словами, модель стала лучше писать отчеты, но она все еще не была основана на доказательствах настолько последовательно, насколько нам требовалось для научного синтеза.
Это подтолкнуло нас уделить больше времени качеству данных. Мы протестировали четыре статистических фильтра для выявления более слабых синтетических примеров обучения:
- Отношение количества токенов вывода к вводу. Ответы с очень высокими показателями часто были зашумлены, так как генерировали много текста из слишком малого объема доказательств.
- Релевантность цитирования. Для каждого синтетического отчета в обучающем наборе мы усредняли показатели релевантности поиска цитируемых статей. Низкие средние значения указывали на то, что отчет слишком сильно полагается на менее релевантные доказательства.
- Плотность цитирования. Мы измеряли долю утверждений, имеющих хотя бы одну цитату. Отчеты с низкой плотностью часто содержали большие фрагменты текста без подтверждений.
- Разнообразие цитирования: мы измеряли долю статей, процитированных в ответе, относительно набора, возвращенного конвейером поиска отчетов на базе Claude. Низкие баллы указывали на то, что отчет чрезмерно полагался на несколько статей.
Наибольший прирост дала фильтрация синтетических отчетов с низкой плотностью цитирования; более агрессивная фильтрация, комбинации фильтров и перебор скорости обучения не дали значимых улучшений.
Это был один из самых ясных уроков проекта: более сложная фильтрация не обязательно была лучше. Относительно простой сигнал — последовательно ли синтетические отчеты цитируют свои утверждения — оказался полезнее, чем несколько более сложных комбинаций, которые мы пробовали. Другими словами, научная специализация — это не обязательно вопрос добавления большего количества научных текстов в предварительное обучение; состав и качество данных после обучения и то, демонстрируют ли они такие модели поведения, как обоснование и атрибуция, могут существенно изменить работу итоговой модели.
Такой фокус на обоснованных и полезных результатах также совпадает с тем, что мы услышали в ходе исследования пользователей Asta. Участники отмечают, что генерация большего объема текста не обязательно делает его более полезным; им нужен краткий синтез и достаточная прослеживаемость источников, чтобы проверять результаты, не пробираясь через ненужные выводы.
Как только у нас появилась более сильная контрольная точка SFT, мы провели на ее основе обучение DPO. Этот этап еще больше повысил производительность, приблизив AstaBrief к конвейеру отчетов на базе Claude в Asta и DR Tulu по генерации отчетов.
Валидация подхода
Поскольку эта модель предназначалась для работы в составе нашей агентной платформы генерации отчетов Asta (а не обязательно как самостоятельная модель), наш главный вопрос заключался в том, сможет ли AstaBrief сохранить важные для нас качества отчетов, обеспечив при этом значительно более быстрый и дешевый конвейер генерации. Другими словами, мы задавались вопросом не только о том, может ли модель сравниться с более мощными проприетарными моделями в отдельных бенчмарках; мы хотели понять, какую часть этого качества мы сможем сохранить при использовании гораздо более простой системы.
Каждая строка отсортирована от лучшего к худшему; чем выше показатель, тем лучше результат по каждой метрике. Модель Qwen3-8B оценивалась только на тесте SQABench-CS2. SQABench-CS2 представляет собой набор вопросов по компьютерным наукам, написанных пользователями; DeepScholarBench оценивает развернутые научные синтезы с помощью собственных метрик, которые нельзя сравнивать с метриками SQABench-CS2.
В ходе оценок, проводившихся во время разработки, AstaBrief показала конкурентоспособные результаты по сравнению с конвейером на базе Claude и DR Tulu по нескольким показателям качества ответов и цитирования. На графике ниже представлено сравнение, выполненное с помощью LLM; в отдельном исследовании с участием 14 вопросов три научных сотрудника подготовили по 4-5 вопросов каждый и оценили отчеты трех систем по общим предпочтениям, полноте, релевантности, структурированности и точности цитирования (допускались ничьи). По общим предпочтениям лидирует DR-Tulu, однако двое из трех исследователей предпочли AstaBrief другим системам по метрикам точности цитирования, что демонстрирует эффективность наших фильтров качества данных SFT.
Столбцы показывают долю сравнений отчетов, оцененных LLM, в которых каждая система одержала победу над режимом Thinking при ответе на одни и те же вопросы. Оценки людей рассматривались отдельно и не включены в график. Режим Thinking является эталоном для сравнения и не имеет столбца. В отличие от DR-Tulu, AstaBrief была оптимизирована для такого попарного ранжирования отчетов на этапе DPO.
Эти цифры лучше всего воспринимать как подтверждение инженерного подхода на момент разработки, а не как утверждение о позиции данной базовой модели относительно современных передовых решений. Экосистема моделей развивается быстро — мы ожидаем, что уроки, извлеченные из подготовки данных, фильтрации атрибуции и развертывания, будут применимы повсеместно.
Проверка полезности AstaBrief в Asta показала обнадеживающие результаты раннего использования режима Fast. Из 374 пользователей Asta, попробовавших его, 29,1% использовали его в течение двух и более дней, а пользователи в среднем генерируют с его помощью 3,67 потока отчетов. Двадцать три процента пользователей, попробовавших режим Fast, продолжили использовать его и больше не переключались на режим Thinking для будущих потоков. Еще 18% переключались между режимами Fast и Thinking в зависимости от своих целей, используя режим Fast примерно для 40% своих потоков.
Хотя обратной связи в целом недостаточно для того, чтобы делать серьезные выводы, мы видим, что режим Fast получает положительные отзывы с той же частотой, что и режим Thinking (84,2% против 85,2%).
Что дальше
Генерация отчетов в Asta — это первое промышленное применение AstaBrief, предоставляющее исследователям режим Fast с открытыми весами наряду с уже существующим режимом Thinking. Поскольку модель имеет открытые веса, организации могут развертывать ее на собственном оборудовании, в том числе за собственным брандмауэром, не полагаясь на API проприетарных моделей для генерации отчетов.
В Asta это также означает, что мы можем изучать и улучшать эту часть конвейера генерации отчетов напрямую, сохраняя при этом режим Thinking как опцию для более ресурсоемких задач.
Предстоит сделать еще больше. Мы изучаем более детальное обучение на основе предпочтений, более мощные подходы RAG-plus-RL, возможности многоходового взаимодействия и использования нескольких инструментов, дополнительные источники научных данных и декомпозицию запросов. Мы также заинтересованы в оценках, которые выходят за рамки проверки наличия подтверждающей цитаты, чтобы выяснить, сохраняет ли модель доказательную базу — как для лучшего отражения качества отчета как научного артефакта, так и для того, чтобы понять, сохраняет ли модель доказательный охват своих источников. Это включает в себя такие качества, как лаконичность и структурированность, а также то, превращает ли модель специфические выводы в широкие обобщения или описательные результаты в рекомендации.
AstaBrief — это один из экспериментов в длинной череде работ по языковым моделям для науки, от ScholarQA и DR Tulu до будущих версий Olmo, которые начинают обретать форму уже сейчас. Уроки, извлеченные здесь — особенно в отношении обучающих данных, фильтрации и оценки — помогут сформировать то, что мы будем создавать дальше.
Попробуйте модель Fast в Asta сегодня или скачайте AstaBrief с Hugging Face.










