Морана Перич, директор по продукту — направления доверия и прозрачности в DeepL
Если вы спросите о качестве любого сервиса ИИ-перевода, вам, скорее всего, назовут какую-то цифру. Обычно это число из 100. Зачастую оно рассчитывается по одной из стандартных формул для оценки качества перевода. Такой подход кажется простым, объективным и окончательным взглядом на то, чей перевод «лучше». И почти наверняка на вершине окажется перевод того провайдера, с которым вы разговариваете. После десятилетий мантр о том, что «данные превыше всего», мы теперь также знаем: данные можно интерпретировать так, как это выгоднее тому, кто рассказывает историю.
Буду честен. Если вы спросите о качестве перевода DeepL, вы получите тот же ответ. Мы поделимся с вами подробным бенчмаркинговым анализом качества, который провели в марте на основе 48 000 слепых тестов с языковыми экспертами. Он показал, что DeepL побеждает в 94% тестовых групп по 16 языковым парам среди всех пяти основных конкурентов, включая самые мощные LLM. И мы не собираемся за это извиняться.
Однако есть то, в чем никто в сфере ИИ-перевода не любит признаваться. Это неудобная правда, которую заметают под ковер каждый раз, когда публикуются результаты тестов. Мы измеряем разницу в качестве, которая с каждым днем становится все меньше. Настолько меньше, что некоторые могут утверждать, будто она больше не имеет значения.
На данный момент весь ИИ-перевод письменного текста в целом хорош. Ошибок, которые непрофессионал заметил бы с первого взгляда, немного. Различия носят маргинальный, нюансированный и весьма субъективный характер. Отчасти именно поэтому существует так много разных рейтингов и ведущим моделям так легко найти тот из них, который окажется им на руку.
Поэтому, если вы выбираете провайдера ИИ-перевода, стоит ли вам по-прежнему рассматривать качество как фактор дифференциации? Я считаю, что да, но качество в том виде, в каком оно измеряется в тестовых баллах, — это на самом деле не то, на чем вам следует сосредоточиться.
Существует растущая разница между тем, как ИИ-перевод работает в стандартизированных тестах качества, и тем, как он работает на практике — для вашей организации и вашего контента. В тесте разница в качестве кажется незначительной. В реальном мире эти различия гораздо масштабнее, и они оказывают вполне реальное влияние на бизнес.
Что измеряют тесты качества ИИ-перевода
Чтобы объяснить, что я имею в виду, давайте подробнее рассмотрим, что именно измеряют стандартизированные тесты качества, как они это делают и, самое главное, что в них не включается.
Когда лингвисты-люди оценивают перевод, они обычно используют структуру MQM (Multidimensional Quality Metrics — многомерные метрики качества), которая включает восемь различных измерений качества перевода. Присваивая метрики этим различным измерениям и выбирая веса для них, можно создать формулу, которая математически выражает качество в виде единого числового балла.
Измерения MQM включают точность (насколько точно перевод на целевой язык соответствует содержанию оригинального текста на исходном языке), а также такие элементы, как плавность перевода (насколько естественно текст звучит на целевом языке), предметно-ориентированная терминология (корректность специализированных терминов), отражение стиля, соблюдение местных стандартов и многое другое.
Что означают различные формулы качества перевода
Привлечение лингвистов-экспертов для оценки переводов — дело сложное и дорогостоящее. На практике многие рейтинги качества переводов, прилагаемые к ИИ-провайдерам, вообще не используют оценку человеком. Вместо этого они применяют одну из следующих систем автоматического подсчета баллов. За прошедшие годы они стали значительно более сложными.
- В 2001 году компания IBM представила BLEU (Bilingual Evaluation Understudy). Эта система анализирует, насколько близко машинный перевод соответствует человеческому переводу того же исходного текста. В чем проблема? Она предполагает, что этот эталонный перевод является наилучшим из возможных, а любое отклонение от него считается ошибкой.
В 2001 году компания IBM представила BLEU (Bilingual Evaluation Understudy). Эта система анализирует, насколько близко машинный перевод соответствует человеческому переводу того же исходного текста. В чем проблема? Она предполагает, что этот эталонный перевод является наилучшим из возможных, а любое отклонение от него считается ошибкой.
- В 2006 году этот метод был адаптирован для оценки TER (Translation Edit Rate), которая подсчитывает количество правок, необходимых переводчику-человеку для превращения машинного перевода в человеческий. Метод похож на BLEU, но в этой системе меньшие значения считаются лучшими результатами.
В 2006 году этот метод был адаптирован для оценки TER (Translation Edit Rate), которая подсчитывает количество правок, необходимых переводчику-человеку для превращения машинного перевода в человеческий. Метод похож на BLEU, но в этой системе меньшие значения считаются лучшими результатами.
- Компания Unbabel запустила в 2020 году метрику COMET (Crosslingual Optimized Metric for Evaluation of Translation), используя модель нейронной сети для сравнения машинного перевода как с человеческим переводом, так и с исходным текстом. Она обращается к оригинальному тексту для определения смысла, чего не делают BLEU и TER.
Компания Unbabel запустила в 2020 году метрику COMET (Crosslingual Optimized Metric for Evaluation of Translation), используя модель нейронную сеть для сравнения машинного перевода как с человеческим переводом, так и с исходным текстом. Она обращается к оригинальному тексту для определения смысла, чего не делают BLEU и TER.
- Автоматизированная оценка вступила в эпоху LLM в 2023 году с запуском GEMBA (GPT Estimation Metric Based Assessment), которая дает большим языковым моделям задание применить различные измерения MQM к переводу и определить его качество.
Автоматизированная оценка вступила в эпоху LLM в 2023 году с запуском GEMBA (GPT Estimation Metric Based Assessment), которая дает большим языковым моделям задание применить различные измерения MQM к переводу и определить его качество.
Оценка автоматического перевода стала более совершенной и полезной, но все же пока не может полностью заменить суждение экспертов-людей. Когда LLM берут на себя основную тяжесть оценки качества, они сталкиваются с проблемой предвзятости, неизменно отдавая предпочтение переводам, созданным их собственной моделью, даже если в них не хватает определенной точности. Отчасти это объясняется субъективной природой качества перевода. По сути, модель ИИ проверяет собственную «домашнюю работу» по переводу и решает, что ее собственное решение было лучшим.
WMT25, десятая ежегодная конференция по автоматизированной оценке, пришла к очень четкому выводу по этому поводу: «Системы, занявшие первые места по автоматическим метрикам, не всегда побеждали при экспертной оценке людьми, что указывает на сохраняющуюся предвзятость метрик и подтверждает, что оценка человеком должна оставаться последней инстанцией в определении качества перевода».
Другими словами, если вы действительно хотите узнать о качестве перевода, спросите эксперта-человека (как это делает DeepL в нашем бенчмаркинг-тестировании). По мере того как различия в качестве ИИ-переводов стираются, человеческое суждение о том, как сбалансировать все различные элементы, становится все более ценным. Различия в качестве больше не очевидны. По крайней мере, в стандартных тестах качества.
Что упускают тесты качества перевода: контекст, детерминизм и согласованность
Как я уже упоминал, однако, качество перевода, измеряемое в тестах, не совпадает с качеством перевода, с которым вы сталкиваетесь на практике, особенно когда вы управляете переводом и локализацией в масштабах сложной организации. На самом деле, именно те аспекты качества перевода, которые тесты не измеряют, оказывают наибольшее влияние на бизнес.
Большинство фреймворков и систем оценки, о которых я упоминал в этом блоге, являются «аналитическими». Зачастую они работают путем сравнения «сегментов» исходного и переведенного текста, которые обычно представляют собой просто отдельные предложения. Они также оценивают качество перевода каждого предложения изолированно, как будто оно никак не связано с предложениями в других частях текста.
Наш реальный опыт восприятия переведенного контента совсем не таков. Он является «холистическим» (целостным). Он включает в себя не только то предложение, которое мы читаем в данный момент, но и весь текст, частью которого оно является. Он также включает в себя все остальные коммуникации, с которыми мы сталкиваемся со стороны организации. В этой целостной реальности качество отдельно переведенного предложения имеет, пожалуй, меньшее значение, чем качество согласованности и когерентности переведенного материала в целом.
У каждой организации есть свой собственный уникальный лексикон: терминология и фразы для продуктов и функций, областей бизнеса, аспектов обслуживания, стратегических концепций и многого другого. Последовательный перевод этих терминов — важнейший аспект качества перевода. Если перевод в Справочном центре не совпадает с терминами, используемыми в продуктах или на кнопках призыва к действию, то качество перевода является низким. Неважно, являются ли отдельные переводы технически правильными или нет.
Когда платформа машинного перевода определяет терминологию, стиль и тон в больших масштабах (как это делает DeepL с помощью глоссариев, стилевых правил и памяти переводов), она становится значительно более ценной. В то же время фундаментально вероятностная природа крупных универсальных LLM (Claude, Gemini, ChatGPT) приносит в жертву детерминизм, соответствие требованиям и последовательность. Они теряют то, что действительно важно для качества перевода на практике.
Что упускают тесты качества перевода: как достигается качество
Стандартные тесты качества перевода также не заботятся о том, как достигается уровень качества и насколько это масштабируемо.
Собственные слепые тесты DeepL с участием экспертов-людей показывают, что новейшие универсальные LLM при высоких настройках рассуждений могут обеспечивать конкурентоспособное качество перевода для конкретных языковых пар. Однако они делают это за счет использования более крупных моделей, более широких поверхностей задач и более широких контекстных окон.
Это означает, что они используют много токенов (с непредсказуемыми затратами) и работают намного дольше (как минимум в 4 раза и до 29 раз медленнее), что существенно влияет на ситуацию, если вы внедряете машинный перевод в продукты через API. Что наиболее важно для качества, они по своей сути менее предсказуемы в выборе переводов. Они по сути заново изобретают велосипед для каждой задачи, поэтому термины и фразы, используемые ими в одном контексте, гораздо реже повторяются в другом.
Если вы занимаетесь переводом в масштабах предприятия, это именно тот аспект качества, которому вам нужно уделить наиболее пристальное внимание. Оценки тестов качества не дают вам практически никакой полезной информации об этом.
Почему мы разрабатываем целостное видение качества, которое дает клиентам полный контроль
По этой причине автоматические оценки тестов являются весьма ограниченным ориентиром для оценки качества перевода. Однако это не значит, что они не являются крайне полезным инструментом, когда речь заходит о получении контроля над качеством ваших переводов. На самом деле они чрезвычайно ценны, если по-новому определить их роль.
В DeepL мы создали новую модель оценки качества перевода (TQE), которая использует специально созданную модель искусственного интеллекта для оценки качества переводов DeepL. Однако, что принципиально важно, она не просто выдает «оценку» перевода и переходит к следующему шагу. Ее роль заключается в том, чтобы выделять потенциальные ошибки и те области перевода, которые можно улучшить, привлекая ваших экспертов-людей. Она признает, что именно это человеческое суждение в конечном счете имеет наибольшее значение.
Когда наша модель TQE анализирует текст, она делает это с учетом всех функций настройки, с которыми вы работаете в DeepL. Она не анализирует качество перевода изолированно. Она проверяет, как терминология, стиль и тон вашей организации применяются в контексте. Она обеспечивает целостное представление о качестве, которое действительно имеет значение на практике.
Если вы заботитесь о качестве перевода, и я считаю, что вы все еще должны это делать, это именно тот взгляд на него, о котором вам действительно стоит беспокоиться. Дело не в тестах. Дело в том, чтобы найти ту точку зрения на качество перевода, которая подходит именно вам и работает с вашим контентом в реальных условиях.
