Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Ispolzovanie ekspertnyh znaniy v rl pozvolyaet dostich peredovyh rezultatov v za
Dev48

© 2026 · All rights reserved.

Использование экспертных знаний в RL позволяет достичь передовых результатов в задачах Text-to-SQL

Источник: Thinking Machines Lab

Использование экспертных знаний в RL позволяет достичь передовых результатов в задачах Text-to-SQL

Источник: Thinking Machines Lab

Проверенный экспертами набор данных для обучения и измененная функция вознаграждения позволили методу RLVR на платформе Tinker обучить единую модель, превзойдя уровень точности человека в задачах Text-to-SQL при значительно меньших затратах по сравнению с передовыми моделями.

25 сентября 2026 г.

Многие отрасли полагаются на реляционные базы данных, запросы к которым выполняются с помощью SQL. Большая часть SQL-кода пишется машинами, однако люди ежемесячно пишут миллиарды пользовательских SQL-запросов, основываясь на наших внутренних оценках и общедоступных данных, таких как отчеты Snowflake, в ответ на бизнес-запросы. Люди справляются с этим довольно хорошо: их результат составляет 92,96% на BIRD, реалистичном бенчмарке для перевода вопросов с естественного языка на SQL.

Тем не менее, производительность ИИ в задачах Text-to-SQL отстает. Результаты LLM в таблице лидеров BIRD выросли с чуть менее 70% в 2024 году до 82% сегодня. Передовые модели, такие как GPT-5.6 Sol Ultra и Claude Fable 5, могут достигать показателей в районе 85%, однако стоимость их использования является запретительной для высоконагруженных приложений. Проблема не в нехватке данных для обучения: SQL широко представлен в интернет-контенте, используемом при предварительном обучении LLM. Сложность для ИИ заключается в интерпретации неоднозначных вопросов и высококонтекстных схем, которые характерны для реальных примеров.

Распространенным подходом к улучшению производительности ИИ в задачах, которые хорошо понимают люди, является создание агентных каркасов (scaffolding). Такие системы, как OpenHands, AI co-scientist и MetaGPT, разбивают задачу на этапы, каждый из которых требует отдельного промпта или вызова модели. Каркасы для Text-to-SQL следуют той же схеме. Этап связывания схем (schema-linking) сужает тысячи столбцов до набора кандидатов. Реальные корпоративные системы данных (включая базы данных, хранилища данных и озера данных) содержат до миллионов столбцов. Ответы на бизнес-вопросы часто требуют понимания того, какие именно столбцы использовать. Академические бенчмарки проще. Этап генерации создает выборку запросов. Этап самокоррекции исправляет ошибки выполнения. Этап выбора голосует среди выживших вариантов. Каждый компонент представляет собой отдельный вызов, а оркестрация обычно настраивается под конкретный бенчмарк.

Каркасы — это попытка преодолеть ограничения рассуждений модели, заставляя её следовать последовательности шагов, отражающей подход человека к задаче. И все же лучшие модели с каркасами по-прежнему отстают от людей в SQL на 11 процентных пунктов. Профессионалы приобретают навыки благодаря повторяющемуся опыту, а не получению списка инструкций — то же самое должно быть верно и для LLM. Опыт работы с задачей должен использоваться для обучения модели лучшему рассуждению о запросах и базах данных, вместо простого обновления промптов, которые она получает от каркаса.

В этой статье мы описываем дообучение модели, которая достигает точности уровня человека в задачах Text-to-SQL без использования каркасов, применяя обучение с подкреплением с проверяемыми вознаграждениями (RLVR) на платформе Tinker.

Извлечение правильного ответа с помощью SQL — это проверяемая задача, которую можно обучать прямым способом. Однако разрыв в производительности SQL-моделей показал, что стандартный рецепт можно улучшить. Наш подход содержит два ключевых улучшения: набор данных для обучения, проверенный экспертами и очищенный от ошибок разметки, которые могли бы «отравить» RLVR, и метод формирования вознаграждения, нацеленный на два распространенных режима сбоев RLVR в этой области.

Обученная модель, ReViSQL-K2.6, превосходит человеческий показатель в 92,96% при выборе из 16 образцов (SC-16). SC относится к выбору на основе самосогласованности, где мы группируем параллельно сгенерированные SQL-запросы по результатам их выполнения и случайным образом выбираем запрос из группы большинства. Ни один из этих компонентов не является частью традиционного агентного каркаса: генерация образцов просто создает несколько выводов из одного и того же промпта модели без отдельно заданных промежуточных шагов, в то время как голосование большинства не требует дополнительных вызовов модели. Стоимость составляет $0,56 за задачу. Это точнее, чем Fable 5 и GPT-5.6 Sol Ultra при 12–15% от их стоимости, и значительно точнее любой модели с каркасом из таблицы лидеров.

Код, данные и рецепты обучения доступны на github.com/uiuc-kang-lab/ReViSQL. Мы также подробно описываем наши методы в техническом отчете.

Курирование высококачественных данных для обучения

RLVR эффективен для улучшения рассуждений в конкретных доменах, но он чувствителен к данным с неверными метками. В RLVR скалярное вознаграждение является единственным сигналом обучения для шага обучения. Неверно размеченные экземпляры меняют сигнал на противоположный, значительно ухудшая процесс обучения. Наше исследование показало, что алгоритмические настройки не могут компенсировать эту потерю — очистка данных критически важна для эффективной работы RLVR.

Мы обнаружили, что существующие данные для Text-to-SQL крайне зашумлены. На зашумленность публичных SQL-датасетов указывали многие другие исследователи, такие как Pourreza и Rafiei (2023) и Wretblad и др. (2024). Наш анализ показал, что многие широко известные бенчмарки содержат большое количество шума. Мы отобрали 2,5 тыс. экземпляров из BIRD Train, обучающего датасета для Text-to-SQL. Наш аудит выявил ошибки в каждом компоненте датасета: в вопросах, предоставленных внешних знаниях и более чем в половине «золотых SQL-запросов», с которыми сравнивается ответ модели.

Таблица 1: Уровни ошибок аннотирования в 2,5 тыс. экземпляров, отобранных из BIRD Train. Категории перекрываются, поэтому итоговое значение не является суммой.

Мы очистили обучающий набор в ходе многоэтапного процесса. Сначала LLM (o3 от OpenAI) и эксперт-человек просмотрели каждый экземпляр и пометили ошибки. Экспертная проверка показала, что аудитор LLM был точен в выявлении ошибок аннотирования (точность 90,6%), но обнаружил лишь 24,5% ошибок, отмеченных людьми. Ошибки и предложенные исправления с этого первого этапа были отправлены другому эксперту для верификации. В случаях, когда верификатор не соглашался с первоначальным аудитором, образец отправлялся обратно для дополнительных циклов разрешения конфликтов.

Мы выпустили очищенный набор данных для сообщества под названием BIRD-Platinum.

Мы подозревали, что оценочный датасет BIRD Mini-Dev также содержит ошибки аннотирования. Первый этап очистки BIRD Mini-Dev был выполнен Arcwise и исправил ошибки в 32,3% экземпляров. Мы провели второй этап, который подтвердил подавляющее большинство пометок Arcwise и обнаружил еще больше ошибок, доведя общий уровень выявленных ошибок в BIRD Mini-Dev до 52,8%. Оценочный набор с исправленными ошибками золотых запросов был выпущен как Arcwise-Plat-SQL.

BIRD-Platinum поднимает RLVR выше предыдущих лучших моделей

Мы дообучили Kimi-K2.6 с помощью RLVR на BIRD-Platinum, чтобы получить ReViSQL-K2.6. Обучение только на проверенных данных подняло ReViSQL-K2.6 значительно выше как передовых универсальных LLM, так и ведущих дообученных моделей с открытыми весами для Text-to-SQL на Arcwise-Plat-SQL, с показателем точности 88,55%. Это доказывает, что ошибки аннотирования в стандартных данных для обучения были основным ограничением для RLVR в задачах Text-to-SQL.

Чтобы продемонстрировать, что этот подход обобщается на другие модели и оценочные наборы, которые мы не использовали, мы дообучили Qwen3-235B-A22B с помощью RLVR на BIRD-Platinum и оригинальном BIRD Train. Мы протестировали модель на двух новых бенчмарках Text-to-SQL, которые широко считаются более сложными, чем BIRD:

  • Spider2-SQLite: вариант бенчмарка Spider2, содержащий сложные запросы, в среднем в 5,2 раза длиннее по количеству токенов, чем Arcwise-Plat-SQL.
  • Spider2-Snow: вариант Spider2, использующий диалект Snowflake SQL.

Обучение на более тщательно отобранном наборе данных BIRD-Platinum повышает точность модели на 16% для Arcwise-Plat-SQL, на 12% для Spider2-SQLite и на 14% для Spider2-Snow по сравнению с BIRD Train. Это указывает на то, что наши верифицированные данные создают более переносимый обучающий сигнал между различными бенчмарками и диалектами SQL.

Точный сигнал вознаграждения для RLVR в задачах text-to-SQL

Обучение на «чистых» данных позволило дообученной модели приблизиться к уровню человеческих показателей, однако разрыв более чем в 4% сохранился. Мы проанализировали случаи, когда модель не могла выявить закономерности, что привело нас к изучению функции вознаграждения, используемой при обучении.

Стандартный метод RLVR для text-to-SQL присваивает вознаграждение 1, если сгенерированный запрос возвращает тот же результат, что и эталонный (gold) запрос к базе данных бенчмарка. Это отражает систему оценки, используемую при тестировании, но не полностью учитывает общее поведение, которому мы хотим обучить модель. Мы сосредоточились на двух способах, которыми вознаграждение на основе результата может отклоняться от желаемого поведения, и внесли изменения в функцию вознаграждения для их устранения.

Отклонение 1: совпадение результатов выполнения не означает семантическую эквивалентность

Стандартное вознаграждение на основе результата проверяет вывод сгенерированного запроса на одном экземпляре базы данных, но это не гарантирует, что результат будет верным для другого экземпляра. Ошибочный ключ соединения (join key) или пропущенный предикат могут остаться незамеченными, если конкретный экземпляр базы данных не выявляет эту ошибку. Только семантически эквивалентные запросы гарантированно дают одинаковый результат на любом экземпляре базы данных.

Мы проверяем семантическую эквивалентность SQL-запросов с помощью VeriEQL — решателя, который использует ограниченную верификацию и требует пренебрежимо малых затрат ресурсов процессора по сравнению с общими затратами на обучение (менее 0,1%). В ходе пилотного обучения мы обнаружили, что 32,8% положительных вознаграждений на основе результата были выданы запросам, которые не были полностью эквивалентны правильным. Это означает, что почти в каждом третьем случае вознаграждение подкрепляло неверный запрос.

Вопрос: Сколько денег в среднем тратит Лукас Уайлдбор на заказы книг?

Эталонный SQL-запрос

SELECT AVG(order_total) FROM ( SELECT o.order_id, SUM(i.price) AS order_total FROM orders o JOIN items i ON o.order_id = i.order_id WHERE o.customer = 'Lucas...' GROUP BY o.order_id );

Некорректный запрос, положительное вознаграждение

SELECT AVG(i.price) FROM orders o JOIN items i ON o.order_id = i.order_id WHERE o.customer = 'Lucas...'

Усредняет цены отдельных позиций, а не общую сумму заказа. Эти значения совпадают только потому, что каждый заказ содержит одну позицию.

Мы обновили сигнал вознаграждения, снизив его вес в случаях, когда запрос был принят по результатам выполнения, но не был эквивалентен согласно VeriEQL. Благодаря дополнительному источнику верификации вознаграждение направляет обучение к правильному запросу, который корректно работает на разных экземплярах баз данных.

Отклонение 2: вознаграждение за результат не учитывает предоставленные знания

Задачи в стиле BIRD предоставляют внешние знания вместе с вопросом в промпте. Вознаграждение на основе результата зависит только от финального ответа, что означает, что оно не может отличить модель, которая прочитала предоставленную информацию, от той, которая угадала ответ на основе своих априорных знаний, полученных при предварительном обучении. Например, поскольку «sodium = 0» и «sodium < 5» дают одинаковый набор результатов, вознаграждение на основе результата не может отличить модель, которая правильно использует внешние знания для выбора «sodium = 0», от той, которая запомнила или «галлюцинирует» «sodium < 5». При отсутствии градиента, подталкивающего модели к использованию внешних знаний, они склонны полагаться на свои априорные знания. В пилотном анализе на валидационном наборе 24,2% ошибок были связаны с тем, что модель игнорировала предоставленную необходимую информацию.

Вопрос: Среди рецептов от The California Tree Fruit Agreement рассчитайте процент рецептов без содержания натрия.

Внешние знания: «без содержания натрия» означает «sodium = 0».

Эталонный SQL-запрос

SELECT CAST(SUM( CASE WHEN sodium = 0 THEN 1 ELSE 0 END ) AS REAL) * 100 / COUNT(*) FROM recipes r WHERE r.source = 'California...'

Игнорирование внешних знаний

SELECT CAST(SUM( CASE WHEN sodium < 5 THEN 1 ELSE 0 END ) AS REAL) * 100 / COUNT(*) FROM recipes r WHERE r.source = 'California...'

Мы решаем эту проблему с помощью вознаграждений за процесс на основе правил. Модель должна выводить блок требований, который переводит каждую запись внешних знаний в явное ограничение запроса, и блок верификации, который проверяет сгенерированный запрос на соответствие этим ограничениям, с наложением штрафов за несоблюдение. Наше вознаграждение за процесс побуждает модель основывать свои рассуждения и генерацию на предоставленных знаниях, а не слепо полагаться на свои предварительно обученные знания. Вознаграждения основаны на правилах, а не на оценке другой моделью, что делает процесс оценки дешевым и свободным от влияния априорных знаний модели-судьи.

Рецепт обучения

Мы предоставляем наш рецепт обучения для ReViSQL-K2.6. Этот рецепт также можно воспроизвести, используя наш код, построенный на API Tinker.

Таблица 2: Конфигурация обучения.

Результаты

Мы представляем ReViSQL-K2.6 — модель, дообученную на Tinker с использованием верифицированных данных и обеих модификаций вознаграждения. При жадной декодировке (один образец, температура = 0) наша модель достигает точности 91,37% на Arcwise-Plat-SQL при стоимости $0,035 за задачу. Это улучшение на 8,4 процентных пункта по сравнению с OpenSearch, самым сильным из существующих open-source конвейеров, при стоимости на 37% ниже. Преимущество в стоимости является прямым следствием удаления вспомогательных структур (scaffolding) вокруг модели.

Если ReViSQL-K2.6 выбирает ответ среди 16 кандидатов, сгенерированных при температуре = 1, точность возрастает до 92,97% при стоимости $0,56 за задачу. Насколько нам известно, это первый случай, когда система ИИ для преобразования текста в SQL превзошла человеческий бенчмарк.

Заключение

Когда ИИ демонстрирует низкую производительность в узкоспециализированной задаче, обычная реакция — добавить вспомогательные структуры вокруг выполнения задачи. Этот подход несколько улучшил производительность моделей text-to-SQL, но в конечном итоге он упирается в потолок возможностей базовой модели. Это не означает, что вспомогательные структуры бесполезны. Скорее, это говорит о том, что знания о задаче, содержащиеся в этих структурах, должны быть частью обучающего сигнала — того самого обучения, которое повышает общую способность модели.

Общая черта с нашей предыдущей работой по обучению ИИ для принятия финансовых решений заключается в том, что специализированные модели могут превосходить передовые решения в широком спектре задач, требующих экспертного вкуса и суждения, часто за долю стоимости. Это требует, чтобы экспертное суждение было частью процесса обучения: в выявлении того, где ИИ ошибается, в разметке обучающих данных и в приведении обучения в соответствие с желаемым поведением.

В случае с text-to-SQL мы увидели значительные улучшения как от тщательной очистки данных, так и от формирования функции вознаграждения, чтобы обучить модель правильному навыку. Это потребовало больше усилий на начальном этапе, но полученная модель достигает лучшей производительности при меньших затратах, чем люди и модели со вспомогательными структурами. Внедрение экспертных знаний в специализированное обучение — это то, что в конечном итоге обеспечивает масштабируемость.

Цитирование

Пожалуйста, цитируйте эту работу как:

BibTeX:

← Все статьи