Международная олимпиада по информатике (IOI) и Международная математическая олимпиада (IMO) проверяют разные навыки. IOI требует алгоритмов и кода, которые проходят скрытые тесты в условиях жестких ограничений по времени и количеству попыток. IMO требует строгих доказательств на естественном языке. Успех на любом из этих соревнований дается с трудом. Успех в обоих говорит о чем-то гораздо большем.
Наши недавние результаты показывают, что Nemotron является мощной и адаптируемой базовой основой для создания специализированных моделей мирового уровня. Начиная с Nemotron 3, наши команды использовали контролируемое дообучение (SFT), обучение с подкреплением (RL) и инференс на основе обратной связи для создания систем, достигших уровня золотой медали как на IOI, так и на IMO.
Результат IOI был получен в ходе живого проспективного тестирования в тех же условиях по времени, доступу в интернет и ограничениям на отправку решений, что и у людей-участников. Это был неофициальный бенчмарк без прокторинга, и он не был включен в официальный рейтинг IOI. Доказательства, представленные системой для IMO, оценивались официальными жюри IMO.
Воспроизводимый рецепт специализации
Фраза «простая доработка» должна означать нечто большее, чем просто возможность сделать контрольную точку обучаемой. Она должна означать, что способную базовую модель можно адаптировать к сложной предметной области с помощью четкого, воспроизводимого рецепта.
В обоих проектах этот рецепт состоял из четырех частей:
- Начните с мощной базовой модели Nemotron.
- Соберите задачи для конкретной предметной области и высококачественные цепочки рассуждений.
- Примените стандартные методы постобучения, такие как SFT и, где это полезно, RL.
- Свяжите специализированную модель с циклом инференса, который генерирует, оценивает и улучшает варианты ответов.
Процессы обучения и инференса были масштабными, но сам подход является привычным и воспроизводимым. Нам не нужно было создавать новую базовую модель для каждой задачи. Мы специализировали Nemotron под конкретную задачу.
От общих навыков программирования до золота IOI
Для соревновательного программирования мы отобрали 22 000 задач и сгенерировали синтетические цепочки рассуждений для обучения двух специалистов. Nemotron-3-Nano-CC с 30 миллиардами общих параметров и 3 миллиардами активных параметров прошла как SFT, так и RL. Nemotron-3-Ultra-CC с 550 миллиардами общих параметров и 55 миллиардами активных параметров прошла SFT.
Прогресс на IOI 2025 позволяет легко оценить ценность специализации. Модель Nano улучшила результат со 130 баллов до постобучения до 280 после SFT и 291 после RL. С помощью GenCorrect, нашей итеративной стратегии генерации, оценки и доработки, она набрала 468 баллов и преодолела золотой порог в 438,3 балла. Ultra-CC достигла 502 баллов с той же стратегией во время инференса.
Эти эксперименты также показали, что адаптация не обязательно должна выглядеть одинаково в любом масштабе. SFT обеспечила большую часть прироста Nano, в то время как RL добавила меньшее, но стабильное улучшение. Для более мощной модели Ultra одной эпохи SFT оказалось достаточно, чтобы превзойти полностью постобученную модель Nano в IOI, ICPC и LiveCodeBench Pro. Этот вывод определил выбор специализированной системы Ultra-CC для IOI 2026, которая набрала 535,4 балла из 600.
Обучаем Nemotron доказывать, проверять и исправлять
В проекте IMO та же идея была применена к олимпиадной математике. Начиная с Nemotron 3 Ultra, мы обучили одного специалиста с помощью SFT, а другого с помощью RL.
Корпус SFT содержал 414 890 прошедших фильтрацию качества примеров по 15 818 уникальным задачам на доказательство. Он делал больше, чем просто обучал финальным ответам. Данные охватывали генерацию доказательств, доработку, верификацию и метаверификацию, поэтому модель научилась строить аргументы, выявлять пробелы, реагировать на критику и оценивать полноту доказательства. Модель RL обучалась на 9 597 задачах на доказательство, выбранных вблизи границы возможностей модели.
Обе постобученные контрольные точки превзошли общедоступную модель в экспериментах по разработке. Контрольная точка SFT оказалась сильнее в первом раунде поиска, в то время как контрольная точка RL показала лучший общий результат среди одиночных контрольных точек. Их сильные стороны дополняли друг друга, поэтому в финальной системе использовались оба специалиста наряду с базовой моделью.
Для каждой задачи IMO модели генерировали кандидаты доказательств, оценивали их, создавали критические замечания и дорабатывали наиболее перспективные попытки. Отдельный этап с высокими вычислениями выбирал финальную заявку. Вся система работала на естественном языке, без использования формальных средств доказательства, внешних инструментов или доступа в интернет. Она набрала 30 баллов из 42, включая максимальный балл по четырем задачам из шести, и превысила официальный порог золотой медали.
Дообучение и вычисления во время инференса работают в тандеме
Наша предыдущая публикация об IOI 2025 на Hugging Face показала, как вычисления во время инференса могут поднять открытые модели до уровня золотой медали. Новые результаты добавляют важный элемент: лучшая специализация дает системе инференса лучших кандидатов, лучших критиков и лучшие улучшения.
На IOI стратегия GenCorrect превратила прирост от дообучения в более значительные улучшения за несколько раундов обратной связи. В IMO использование взаимодополняющих контрольных точек SFT и RL оказалось ценнее, чем просто создание большего числа выборок из одной контрольной точки. В обоих случаях наилучший результат был достигнут за счет объединения способного специалиста с системой, способной осуществлять поиск, верификацию и улучшение.
Это различие имеет принципиальное значение. Медали были получены не только за счет дообучения и не только за счет слепой выборки методом грубой силы. Они стали результатом совместного проектирования модели, данных и цикла инференса.
Открытые модели, данные и рецепты на Hugging Face
Мы хотим, чтобы эти результаты были полезны и за пределами соревнований. Коллекция Nemotron Labs IMO 2026 объединяет контрольные точки SFT и RL, оба набора обучающих данных и Nemotron-IMO-Bench, новый бенчмарк из 200 задач олимпиадного уровня. В статье IMO описан подход к обучению и система генерации-верификации-доработки, в то время как репозиторий NeMo-Skills включает конвейер инференса IMO, промпты, отправленные доказательства и воспроизводимый быстрый старт. Что касается соревновательного программирования, модель Nemotron-3-Ultra-CC доступна на Hugging Face, а статья IOI содержит рецепт обучения и методологию GenCorrect. Конвейер оценки и инференса IOI также доступен в NeMo-Skills.
В совокупности IMO и IOI предоставляют необычайно веские доказательства простой идеи: Nemotron можно дообучить до состояния специализированных моделей мирового уровня в конкретных областях, а затем объединить с прозрачными рабочими процессами инференса для решения задач на переднем крае человеческих соревнований.
Мы с нетерпением ждем возможности увидеть, что сообщество Hugging Face создаст дальше.










