Когда на этой неделе OpenAI released сотни заявленных решений некоторых из самых сложных математических проблем в мире, передовая лаборатория заявила, что проконсультировалась с совещательной группой элитных математиков, чтобы избежать споров, возникших в прошлый раз, когда одна из ее моделей решила давнюю проблему в этой области.
Но OpenAI не дотянула до этих стандартов, особенно в тех аспектах, где математики подчеркивали необходимость человеческого понимания математического результата. Это вызывает особую тревогу после того, как в новой научной работе были отмечены расхождения между естественным языком и формально выраженным решением проблемы на миллион долларов, которую якобы решили модели OpenAI.
Консультативная группа по математике и искусственному интеллекту (AGMAI) при Институте перспективных исследований Принстонского университета состоит из девяти видных исследователей из институтов по всему миру.
Организация опубликовала guidelines для передовых лабораторий, решающих математические задачи, в конце сентября. В заявлении по поводу последнего набора доказательств AGMAI отметила, что «в конечном итоге именно математическое сообщество должно оценить, в какой степени наши рекомендации были успешно выполнены».
Тем не менее, первым требованием организации было «прекратить тестирование сложных математических задач на проприетарных моделях». В релизе OpenAI прямо говорится, что она оценивает свои проприетарные модели с использованием открытых исследовательских задач в области математики.
Консультативная группа не ответила на запрос TechCrunch с просьбой дать более тщательную оценку последней публикации доказательств от OpenAI. Лаборатория явно последовала некоторым из ее принципов, включая публикацию результатов как можно скорее и предоставление информации о том, как модели пришли к своим выводам. Но не всем: лишь 13 из 719 рукописей содержали материалы о цепочке рассуждений модели.
Для статей, которые люди не понимают, математики предложили формализовать доказательства, однако лишь 42% доказательств, выпущенных OpenAI, не прошли этот процесс.
В конечном счете все еще неясно, берет ли OpenAI на себя «ответственность за обеспечение того, чтобы за публикацией доказательств последовало их понимание человеком», в соответствии с принципами AGMAI. AGMAI предложила OpenAI помочь профинансировать работу математиков-людей, которые будут необходимы для того, чтобы решения лаборатории обрели реальный смысл.
«Проблемы автономно решаются создателями промптов для ИИ, которые не проявляют интереса к самой более широкой области после того, как их первоначальная цель “решена”, и недостаточно хорошо понимают вывод ИИ, чтобы отвечать на вопросы о результате, выступать с докладами или иным образом взаимодействовать с остальным сообществом», — wrote в социальных сетях после релиза Теренс Тао (Terence Tao), видный математик, критиковавший подход OpenAI.
Эту проблему иллюстрирует статья, опубликованная на этой неделе математиками из Кембриджского университета и Королевского колледжа Лондона, в которой ставится под сомнение то, как передовые лаборатории подходят к этим задачам.
Когда модели ИИ решают математические задачи, они сначала создают объяснение на «естественном языке», а затем пытаются выразить этот результат на языке программирования Lean, который теоретически подтверждает точность доказательства, компилируя его в виде кода.
Однако могут возникнуть проблемы с тем, как модели переводят свои доказательства с естественного языка в код; в этой статье зафиксировано по меньшей мере два несоответствия между доказательством на естественном языке и кодом на Lean, лежащим в основе решения, предложенного OpenAI для задачи, выведенной из уравнений Навье — Стокса, описывающих сложное поведение жидкостей.
Эти несоответствия не обязательно опровергают ни то, ни другое решение, но они ставят под сомнение вопрос о том, можем ли мы просто полагаться на модели, которые формализуют собственные решения без участия человека. Это одна из причин, по которой AGMAI попросила OpenAI «включить машиночитаемые метаданные, сопоставляющие естественный язык и формальные артефакты», — то, чего передовая лаборатория не сделала в этих релизах.
«Из-за феномена неправильного перевода, как подчеркивается в этой статье, доказательство на естественном языке от OpenAI и другие автоматически формализованные доказательства на Lean не должны приниматься на веру без такого же процесса экспертной оценки и тщательного анализа, которым подвергаются другие доказательства», — заключают авторы статьи «потерянные в переводе».
Математики подчеркивают, что когда новые результаты открываются людьми, они берут на себя ответственность за них и взаимодействуют с более широким сообществом посредством статей, докладов и семинаров. Этот процесс повышает понимание решений, позволяет найти стратегии, которые можно использовать для решения других проблем, и дает возможность применять новые знания в практических областях.
Когда модели дают подсказку для решения сложной задачи и она выдает результат, «в момент публикации отсутствует понимание этого результата человеком, и вот тут-то работа только начинается», — рассказала TechCrunch профессор математики Гарвардского университета Мелани Вуд (Melanie Wood).
Покупая товары по ссылкам в наших статьях, вы можете получить небольшую комиссию. Это не влияет на нашу редакционную независимость.
Тим Фернхольц (Tim Fernholz) — журналист, пишущий о технологиях, финансах и государственной политике. Он пристально освещал подъем частной космической индустрии и является автором книги «Ракетные миллиардеры: Илон Маск, Джефф Безос и новая космическая гонка». Ранее он более десяти лет был старшим корреспондентом глобального делового новостного сайта Quartz, а свою карьеру начал в качестве политического корреспондента в Вашингтоне, округ Колумбия. Вы можете связаться с Тимом или проверить подлинность сообщения, отправив письмо по адресу [email protected] или зашифрованное сообщение на аккаунт tim_fernholz.21 в Signal.
Посмотреть биографию







