Язык рассуждений имеет значение
Одни из самых значительных недавних достижений в области языковых моделей основаны на простой идее: позволить модели «подумать» перед ответом. Результатом этой идеи стала разработка моделей рассуждений, которые прорабатывают задачу шаг за шагом, создавая письменный «ход рассуждений». Это привело к значительным улучшениям способностей языковых моделей справляться с такими задачами, как математика и программирование. Однако эти модели в основном сосредоточены на выдаче правильного ответа, в то время как мы задаем часто упускаемый из виду вопрос: могут ли пользователи на самом деле проследить за ходом рассуждений?
Для многих пользователей ответ сегодня — нет: когда вопрос задается на испанском, арабском или суахили, эти модели, как правило, рассуждают на английском. Итоговый ответ может быть на языке пользователя, но этапы рассуждений, стоящие за этим ответом, остаются недоступными для тех, кто не владеет английским. Это не неразрешимая проблема. Позволив многоязычным моделям рассуждать на языке пользователя — то, что мы называем рассуждением «на языке пользователя» или «L2-рассуждением», — пользователи могут прочитать ход рассуждений, проверить каждый шаг, найти, где возникла ошибка, если ответ неверен, и вмешаться при необходимости.
L2-рассуждение может помочь и самой модели. Многие знания, такие как культурный контекст и лингвистические нюансы, наиболее естественно выражаются на исходном языке. Рассуждение на языке пользователя может позволить моделям более эффективно использовать эти культурно обусловленные знания, особенно в лингвистических задачах и задачах с открытым ответом. Пример ниже показывает, как это выглядит на практике: при вопросе на хинди о том, какое событие предвещает удачу, наша модель Tiny Aya L2-Thinker рассуждает на хинди о том, что гласят индийские суеверия, и приходит к правильному ответу, в то время как мышление на английском выдает ответ с западным уклоном, не взвешивая варианты.
В этой статье мы описываем наше недавнее исследование, которое показывает, как лучшее смешивание данных приводит к эффективному L2-рассуждению без существенного ущерба для точности. Опираясь на Tiny Aya base model with 32K context length, мы применяем нашу стратегию смешивания данных для создания Tiny Aya L2-Thinker — массово многоязычной модели, достигающей более 93% уровня рассуждений на языке пользователя для 60 языков.
Чего не хватает в предыдущих работах
Заставить модели рассуждать на языке пользователя — идея не новая, но предыдущие попытки были ограничены по трем направлениям. Во-первых, это часто сопряжено с издержками: модели, которые принуждают рассуждать на другом языке, чаще дают неверные ответы, а подходы, позволяющие избежать этого снижения, опираются на сложное и дорогостоящее обучение. Во-вторых, большинство исследований оценивают модели только на математических и научных задачах. Математика — хороший тест для рассуждений, но это также задача, где язык имеет наименьшее значение, поэтому она мало что говорит нам о культурных знаниях, следовании инструкциям или написании текстов с открытым ответом. В-третьих, они охватывают лишь небольшое количество языков, обычно тех, которым уже уделяется много внимания со стороны исследователей и разработчиков ИИ.
Наша модель, Tiny Aya L2-Thinker, устраняет все три этих недостатка: она рассуждает на языке пользователя, оставаясь почти такой же точной, как при рассуждении на английском, в широком спектре задач, за исключением математики олимпиадного уровня. Мы тестируем ее на математических рассуждениях, понимании языка, культурных рассуждениях, написании текстов с открытым ответом и следовании инструкциям. Она также поддерживает 45 языков в обучении, и есть доказательства того, что она может переносить эту способность на языки, для которых ей никогда не показывали примеры рассуждений.
Мы также обнаружили, что подходы принудительного использования языка во время вывода не закрывают эти пробелы: просьба к Qwen3.5-4B думать на языке пользователя почти не меняет результат, а более жесткое принуждение путем предварительного заполнения начальных слов хода рассуждений работает, но снижает точность и недоступно для большинства пользователей. Надежное рассуждение на языке пользователя должно быть результатом обучения, что оставляет открытым вопрос о том, на чем именно обучать, — теме, на которой мы сосредоточимся далее.
Оптимизация данных для переноса навыков рассуждения за пределы английского языка
Наш подход сосредоточен на обучающих данных. Как мы можем спроектировать обучающие данные так, чтобы модель научилась рассуждать на языках, отличных от английского? Мы объединяем три типа данных, которые называем «столпами», каждый из которых обучает модель чему-то своему.
Первый столп — это данные рассуждений на английском (ER): около 1,7 миллиона примеров пошаговых решений, сгенерированных более крупной моделью, gpt-oss-120b. Именно здесь модель учится решать задачи, и это наиболее важно для математики. Однако сама по себе эта модель почти всегда думает на английском: она рассуждает на языке пользователя только в 12,8% случаев, даже при явном указании делать это.
Второй столп — это многоязычные данные рассуждений (MR): мы автоматически переводим примеры рассуждений на английском по математике, естественным наукам и общим темам на 44 языка. Перевод длинных цепочек рассуждений обходится дорого, поэтому у нас есть только около 5000 примеров на язык — крошечное количество по сравнению с английскими данными. Тем не менее, этого небольшого набора достаточно, чтобы научить модель рассуждать на языке пользователя: его добавление повышает этот показатель с 12,8% до 86,1%, при этом точность также улучшается.
Третий и важный столп — это многоязычные данные без рассуждений (NR): выборки с вопросами и ответами на целевом языке, но без цепочек рассуждений. Эти данные исторически гораздо более доступны, поскольку они использовались в предыдущих многоязычных моделях инструкций. Этот столп помогает модели переносить свою способность рассуждать на языке пользователя на новые языки, включая те, для которых она никогда не видела примеров рассуждений.
На графике ниже показано, как каждый столп данных дополняет предыдущий и постепенно улучшает как уровень L2-рассуждений, так и точность. Подробный анализ каждого столпа и того, как мы выбрали итоговый набор данных, см. в нашей статье.
Что мы измеряли и что обнаружили
Помимо показателей точности, которые обычно приводятся в бенчмарках для рассуждений, мы уделяем особое внимание трем аспектам, которые считаем ключевыми для обеспечения глобальной доступности моделей рассуждений:
- Достигаем ли мы L2-рассуждений без ущерба для качества?
- Сохраняется ли производительность для языков с меньшим объемом ресурсов?
- Насколько хороши сами рассуждения?
Мы проводим тестирование по шести бенчмаркам на 60 языках, охватывающим математику (MGSM и PolyMath), культурные и общелогические рассуждения (Macaron‑MCQ и GlobalPIQA), следование инструкциям (Marco‑Bench‑MIF) и написание текстов с открытым ответом (MIST‑OEG).
Достигаем ли мы L2-рассуждений без ущерба для качества?
Это тот компромисс, с которым столкнулись предыдущие работы, поэтому это первое, что нужно проверить. Мы сравниваем Tiny Aya L2-Thinker с ее «близнецом»: Tiny Aya En-Thinker, которая была обучена на той же базовой модели и аналогичных данных, но рассуждает на английском.
Наряду с точностью мы измеряем уровень L2-рассуждений: долю ответов, в которых модель действительно рассуждала на языке пользователя, что мы определяем путем запуска модели идентификации языка для каждой цепочки рассуждений. Модель может показать хорошие результаты по точности, полностью провалившись здесь, и именно этот разрыв мы стремились устранить.
Точность практически не меняется. На пяти из шести бенчмарков она падает максимум на два-три пункта, а на MIST-OEG, нашем бенчмарке для генерации текста с открытым концом, она даже немного возрастает. Производительность на английском языке также сохраняется: модель по-прежнему рассуждает на английском при англоязычных промптах и не уступает англоязычному рассуждателю на большинстве бенчмарков. Взамен доля цепочек рассуждений, написанных на языке пользователя, вырастает практически с нуля до более чем 93%.
Исключением является PolyMath — олимпиадный математический бенчмарк с задачами, выходящими далеко за рамки школьной арифметики. Здесь точность падает более заметно. Мы полагаем, что это связано с тем, что наша модель не проходила этап обучения с подкреплением, который наиболее полезен для сложной математики, а также сглаживает артефакты, возникающие при переводе наших обучающих цепочек; это направление для будущих исследований можно развить с упором на математику.
Сохраняется ли производительность на языках с меньшими ресурсами?
Рассуждения на родном языке обычно сложнее даются для языков с меньшим объемом доступных для обучения данных. Мы наблюдаем это при сравнении с существующими более крупными моделями, созданными для L2-рассуждений: M-Thinker-7B и Magistral-Small-24B. На рисунке ниже показано, как часто каждая модель рассуждает на языке пользователя, насколько она точна и сколько токенов тратит на рассуждения, в разрезе четырех категорий обеспеченности ресурсами. Языки оценки сгруппированы по категориям в зависимости от объема существующего для них веб-текста: 1-я категория — наиболее обеспеченные (например, английский, немецкий, французский), а 4-я — наименее обеспеченные (например, суахили, зулусский, валлийский).
Tiny Aya L2-Thinker — единственная модель, которая остается сильной по всем трем осям по мере сокращения доступности ресурсов. Ее показатель L2-рассуждений находится около верхнего предела на 1-й и 2-й категориях (99%) и лишь немного снижается на двух самых низких (94,3% и 94,5%). Напротив, Magistral падает с 72% до 5% по показателю L2-рассуждений, M-Thinker ухудшает показатели по каждой оси, а ее цепочки рассуждений примерно удваиваются в длину, в то время как принудительно использующая язык Qwen сохраняет относительно высокий показатель L2-рассуждений, но за счет точности и эффективности.
В целом наша модель также очень экономична: она тратит в среднем менее 5000 токенов мышления благодаря токенизатору, оптимизированному для многоязычности.
Избежание типичных сбоев в рассуждениях: действительно ли сами рассуждения хороши?
Модель, которая думает дольше, в принципе должна «думать усерднее» независимо от языка. Более сложные задачи заслуживают более глубокого анализа, а большее количество токенов может означать более тщательную работу. Но среди протестированных нами моделей длинные цепочки рассуждений обычно означали кое-что другое: модель ходила по кругу.
Мы измеряем это с помощью показателя повторения — того, как часто короткие последовательности текста повторяются внутри цепочки, — и сравниваем его с длительностью работы рассуждений, как показано на диаграмме рассеяния ниже. Эти два показателя растут одновременно: когда модели рассуждают дольше, у них обычно выше уровень повторения. Чтение цепочек делает эту закономерность наглядной: многие из них длинные не потому, что модель исследует альтернативы, а потому, что она циклически перебирает одни и те же несколько шагов снова и снова, пока не исчерпает свой лимит в 32 000 токенов и не остановится, так и не дав ответа. Обычно это называют «бесконечным циклом» (doomlooping).
Qwen3.5-4B — самый яркий пример: она регулярно тратит от 10 000 до 25 000 токенов на рассуждения, что не обязательно повышает производительность. Предварительное заполнение ее рассуждений на целевом языке не спасает положение: принудительно использующая язык Qwen остается в том же углу графика с высоким количеством токенов и высокой частотой повторений (см. рисунок ниже), и, как мы видели на графике языковых категорий выше, она становится гораздо менее эффективной на языках с низким уровнем ресурсов.
Tiny Aya L2-Thinker в основном избегает этого. На большинстве бенчмарков она рассуждает за несколько сотен — несколько тысяч токенов с минимальным количеством повторений, а также эффективна на всех языковых категориях, даже на малоресурсных.
Резюме и перспективы
Мы показали, что способность к рассуждениям и язык рассуждений можно разделить. Модель может научиться решать задачи в основном на основе англоязычных данных рассуждений, узнать, на каком языке рассуждать, из небольшого объема многоязычных данных рассуждений и обобщить это поведение на новые языки с помощью многоязычных данных, не связанных с рассуждениями.
Однако рассуждения на правильном языке — это лишь часть картины. Цепочка рассуждений может быть понятна пользователям, но при этом зацикливаться, уходить в дебри, никогда не приходить к решению или не оказывать значимого влияния на результат. Необходимо проделать дополнительную работу, чтобы сделать цепочки рассуждений более осмысленными, эффективными и интерпретируемыми для конечных пользователей.
Для поддержки дальнейших исследований в области доступных рассуждений на родном языке мы выкладываем нашу модель и многоязычные данные для рассуждений на Hugging Face.
Модели:
Tiny Aya L2-Thinker: https://huggingface.co/CohereLabs/tiny-aya-l2-thinker
Tiny Aya En-Thinker: https://huggingface.co/CohereLabs/tiny-aya-en-thinker
Tiny Aya Base 32K:
Попробуйте L2-Thinker в пространстве CohereLabs Space: https://huggingface.co/spaces/CohereLabs/tiny-aya-l2-thinker
Данные для многоязычных рассуждений: https://huggingface.co/datasets/CohereLabs/tiny-aya-l2-thinker-multilingual-reasoning
Если вы используете модель, данные или считаете эту работу полезной, пожалуйста, процитируйте статью:
Мы хотели бы поблагодарить всех, кто внес вклад в эту работу или поделился своими идеями: Ананья Саху, Алехандро Р. Саламанка, Дэниел Д'Суза, Александр Берар, Томас Ойанг, Дэвид Стап, Максимилиан Мозес, Келли Марчисио, Аммар Хаири, Никита Моге, Сара Раджаи, Саураб Даш, Дэвид Кайруз, Самми Бэ, Диана Абагян, Бьёрн Бебензее, Сильви Ши, Пьер Болье и Эйдан Пеппин.












