Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Obuchenie vosproizvedeniyu ekspertnyh suzhdeniy v finansovyh zadachah
Dev48

© 2026 · All rights reserved.

Обучение воспроизведению экспертных суждений в финансовых задачах

Источник: Thinking Machines Lab

Обучение воспроизведению экспертных суждений в финансовых задачах

Источник: Thinking Machines Lab

Используя данные, размеченные экспертами, и дообучение на Tinker, специализированная модель превосходит передовые LLM в задачах фильтрации финансовой информации при значительно меньших затратах.

25 сентября 2026 г.

Оценка информации

Опередить рынок сложно. Когда каждый инвестор имеет доступ к одним и тем же источникам публичной информации, альфа должна проистекать из уникального понимания, основанного на вкусе и суждении. Суждение сильного инвестора трудно сформулировать и передать другим напрямую, будь то человек или ИИ. Оно приходит с опытом.

Даже когда мы разбиваем работу инвестора на простейшие составляющие задачи, они оказываются удивительно сложными для LLM. В этой статье мы рассматриваем простой частный случай: фильтрацию и обработку финансовых документов для выявления информации, актуальной для инвестиционных решений.

Инвесторы ежедневно завалены информацией: новостными статьями, аналитическими отчетами, корпоративными документами, электронными письмами, внутренними записками и многим другим. Чтение — это легкая часть. Настоящая работа заключается в мелких, повторяющихся суждениях, выполняемых в процессе: фильтрации, интерпретации, сегментации и определении того, где скрыт полезный сигнал. Эти суждения встроены в повседневный рабочий процесс инвестора и отнимают значительное время.

Мы хотели выяснить, сможем ли мы автоматизировать задачу сортировки информации: определение того, что является актуальным и интересным для чтения. Одно только это могло бы значительно повысить продуктивность инвесторов, позволяя им тратить высвободившееся внимание на синтез более высокого уровня и принятие решений.

Учитывая, что LLM плохо справляются с простыми финансовыми задачами, мы задались вопросом: можно ли научить LLM финансовому суждению? Мы обнаружили, что с помощью высококачественной человеческой разметки мы можем научить LLM интерпретировать текст с экспертным вкусом и суждением. Наша проприетарная модель превосходит все протестированные нами передовые модели по точности и полноте информации при значительно меньших затратах.

Мы описываем наш процесс обучения и результаты на подмножестве данных, разрешенных к публичному выпуску. Основываясь на наших результатах, мы далее описываем основы концепции дифференцированного интеллекта с моделями, настроенными под конкретные организационные потребности.

Производительность передовых моделей

Мы оценили модели на шести задачах фильтрации информации, взятых из повседневных рабочих процессов инвесторов. Помимо этих задач, у нас есть много других внутренних задач, которые демонстрируют схожие закономерности: протестированные нами передовые модели работают хуже, чем наши внутренне обученные модели.

Мы измеряли точность — процент документов, которые были правильно размечены в соответствии с мнением наших инвесторов. Для задач классификации мы также рассчитывали F1-меру. F-мера (Википедия).

Релевантность финансовой статьи

На основе финансовой статьи классифицируйте, является ли она актуальной для инвестиционного специалиста уровня C-suite.

МЕТРИКИ ОЦЕНКИ

F1-мера, Точность

Релевантность документа центрального банка

На основе документа центрального банка классифицируйте, сигнализирует ли он о направлении будущих изменений процентных ставок.

МЕТРИКИ ОЦЕНКИ

F1-мера, Точность

Релевантность общего документа

На основе вопроса инвестора и исследовательского документа классифицируйте, помогает ли документ ответить на него.

МЕТРИКИ ОЦЕНКИ

F1-мера, Точность

Специальная маркировка контента

Исследовательские документы бывают либо повторяющимися (шаблонными), либо смешанными (шаблон плюс уникальный анализ по конкретной проблеме). Классифицируйте тип и найдите последнюю страницу контента, специфичного для проблемы.

МЕТРИКИ ОЦЕНКИ

Точность

Усечение документа

Определите, где в документе начинается шаблонный контент.

МЕТРИКИ ОЦЕНКИ

Точность точного совпадения

Усечение электронной почты

Определите, где в электронном письме начинается шаблонный контент.

МЕТРИКИ ОЦЕНКИ

Точность точного совпадения

Эти задачи тривиальны для инвесторов, но они заходят в тупик, когда пытаются сформулировать свой процесс принятия решений. Рассмотрим следующий пример классификации новостной статьи как актуальной для инвестиционного профессионала ниже:

Не актуально

ft.com

Трамп настаивает, что Гренландия принадлежит ему

© Джереми Бэнкс

Актуально

ft.com

Акции США резко упали после того, как Трамп пригрозил новыми тарифами для Китая

Крупнейшее однодневное падение индекса S&P 500 с апреля положило конец многонедельному ралли © AFP/Getty Images

Пример с Гренландией вряд ли будет воспринят всерьез, учитывая контекст статьи, в то время как тарифы на Китай крайне актуальны. Тем не менее, оба примера затрагивают геополитику и финансы.

В отличие от наших инвесторов, протестированные нами передовые модели работают удивительно плохо. Варианты Gemini, Claude и GPT в среднем показали точность лишь около 50% при получении промпта, который просто описывает каждую из шести задач для выполнения.

Сначала мы попытались улучшить производительность LLM с помощью более сильных промптов. Наши эксперты написали инструкции, основанные на реальных описаниях задач, а также предложили переформулировать некоторые задачи. Например, хотя статья о небольшом IPO явно финансово актуальна, ей не хватает широкой значимости, которая сделала бы ее интересной для макроэкономического инвестора в Bridgewater. Производительность LLM в задаче классификации статей улучшилась, когда их попросили сортировать новости по трем меткам: актуально и интересно, актуально, но неинтересно, и неактуально.

Эти изменения повысили их точность с уровня подбрасывания монеты до середины 70-х процентов. Мы не увидели дальнейшего прироста точности от методов автоматической оптимизации промптов. С нашими лучшими промптами протестированные нами передовые модели все еще достигали точности менее 80% — порога, который инвесторы ожидают от системы, которой они могли бы доверять в своей повседневной работе.

47.2

77.2

50.1

74.3

47.2

75.8

48.5

78.2

45.6

78.0

Наши результаты также показывают, что новые модели не улучшаются быстро в этой задаче, особенно в расчете на потраченный доллар. GPT 5.4 стоит на 43% дороже, чем 5.2, но лишь незначительно точнее.

Явный промпт может передать только ту интуицию, которую эксперт способен выразить словами, в то время как суждения, которые имеют наибольшее значение, часто труднее всего сформулировать. Дообучение позволяет обойти это: вместо того чтобы втискивать интуицию эксперта в статический промпт, процесс обучения позволяет модели развивать собственное суждение. Можем ли мы обучить модели с открытыми весами превзойти передовые модели, которые мы тестировали в этих задачах?

Создание обучающего набора данных

Первой задачей при обучении специализированной модели было получение набора данных, который отражает высококачественный вкус инвестора. В частности, большая часть информации полезна только тогда, когда она отфильтрована через суждение профессионального инвестора.

Изначально мы получили набор данных от поставщиков, предоставляющих неэкспертную разметку. Модели, обученные на этом наборе данных, все равно работали плохо. Изучив следы рассуждений модели, мы поняли, что метки в наборе данных часто были неверными. Поскольку эксперты-разметчики стоят дорого, мы разработали схему проверки, которая направляет экспертам только спорные примеры.

Схема работала следующим образом: мы обучили модель на наборе данных от неэкспертных разметчиков, а затем оценили ее на тех же данных. Примеры, где ответ модели отличался от ответов разметчиков, отправлялись нашим экспертам для переоценки — если модель не могла сопоставить пример из своего собственного обучающего набора, то либо пример действительно сложен, либо исходная метка была неверной. Эта процедура использовалась для очистки данных обучающего набора; окончательная оценка проводилась на отложенном тестовом наборе.

Рецепт обучения

Мы обучили наши модели на Tinker от Thinking Machines Lab. Tinker позволил нам быстро итерировать, не беспокоясь о GPU-инфраструктуре.

Мы выбрали Qwen3-235B в качестве базовой модели, поскольку эффективность её дообучения широко изучена в академической литературе.

Мы начали со стандартного GRPO и функции потерь на основе importance-sampling в качестве простой отправной точки без использования критика. Этот базовый подход привел к значительному скачку производительности модели, но всё же не достиг желаемого нами порога в 80%.

Мы внесли следующие изменения в наш рецепт обучения, чтобы еще больше повысить производительность:

1. Чередующееся пакетирование (Interleaved batching)

Для нашего многозадачного рецепта обучения мы сравнили три стратегии пакетирования: последовательное обучение каждой задаче, полное смешивание задач внутри пакета и чередование по одному пакету на задачу в порядке циклического перебора. Мы обнаружили, что чередование работает лучше всего, повышая точность на 12,1% по сравнению с полностью смешанными пакетами.

2. Функция потерь CISPO с асимметричным отсечением

Мы использовали функцию потерь CISPO с асимметричным отсечением (arXiv) для замены стандартной функции потерь на основе importance-sampling. Среди всех опробованных нами функций потерь и схем отсечения этот вариант показал себя лучше всего, повысив точность на 10,1% по сравнению с базовым методом importance-sampling.

3. On-policy дистилляция с сильными учителями

Мы обучаем модель с помощью on-policy дистилляции (OPD), вычисляя преимущество следующим образом:

Награда штрафуется, когда студент отклоняется от распределения учителя, что регуляризирует политику в процессе обучения задаче.

Каждые 20 шагов мы повышаем текущую контрольную точку до уровня учителя — но только в том случае, если точность на валидации достигла нового максимума, поэтому мы никогда не проводим дистилляцию в сторону более слабой модели. Это дало дополнительный прирост в 3,1% по сравнению с учителем на базе замороженной базовой модели.

Результаты

Поиск оптимального рецепта обучения потребовал нескольких итераций различных подходов. Доступность Tinker позволила нам быстро проводить эксперименты и совершенствовать наш подход.

Наша обученная модель повышает среднюю точность с 78,2% до 84,7%, что означает, что обученная модель совершает на 29,8% меньше ошибок, чем лучшая из протестированных нами передовых моделей. Мы считаем, что такой уровень точности достаточен для нашей повседневной работы.

Наша обученная модель также значительно дешевле благодаря меньшему размеру: снижение затрат на инференс на одну задачу в 13,8 раза. Поскольку мы планируем полагаться на большее количество моделей, обученных для помощи в конкретных задачах, и масштабировать ИИ по всей организации, стоимость является важным фактором.

Мы провели абляционное исследование каждой части нашего рецепта обучения, чтобы показать, какой вклад вносит каждый компонент в производительность.

Заключение

Передовые модели, которые мы тестировали, с трудом справляются с относительно простыми финансовыми задачами, и развитие моделей не сильно улучшает их производительность. Напротив, мы показали, что высококачественные проприетарные наборы данных, размеченные экспертами-инвесторами и используемые для дообучения, позволяют создавать специализированные модели, которые превосходят передовые показатели в наших задачах. Мы обнаружили, что этот результат справедлив далеко за пределами шести задач, которые мы обсудили в этой статье.

Помимо более высокой точности, специализированные модели также существенно дешевле. Мы ожидаем увидеть больше преимуществ в производительности от обучения специализированных моделей в будущем, особенно с появлением такой инфраструктуры обучения, как Tinker, которая позволяет быстро проводить эксперименты.

Наши результаты показывают возможность будущего дифференцированного интеллекта, где специализированные модели, настроенные под конкретные организационные нужды, превосходят передовые модели.

Цитирование

Пожалуйста, цитируйте эту работу как:

Или используйте BibTeX-цитирование:

← Все статьи