Одно семейство моделей, два результата золотого уровня: дообучение Nemotron для IOI и IMO
Наши недавние результаты показывают, что Nemotron — это мощная и адаптируемая основа для создания специализированных моделей мирового класса. Взяв за основу Nemotron 3, наши команды использовали дообучение с учителем (SFT), обучение с подкреплением (RL) и вывод с учётом обратной связи, чтобы создать системы, достигшие уровня золотой медали как на IMO 2026, так и на IOI 2026.
| Соревнование | Специализация Nemotron | Результат |
|---|---|---|
| IOI 2026 | Nemotron-3-Ultra-CC с SFT и GenCorrect | 535,4/600 — выше порога золотой медали 361,12 и лучшего результата человека 498,27 |
| IMO 2026 | Общая модель Nemotron 3 Ultra, контрольные точки SFT и RL в системе генерации, проверки и доработки | 30/42 — выше официального порога золотой медали 29 |
Результат IOI был получен в ходе очного проспективного запуска при тех же ограничениях по времени, доступу к интернету и отправке решений, что и для участников-людей. Это был неофициальный неконтролируемый бенчмарк, и его результаты не вошли в официальный рейтинг IOI. Отправленные системой IMO доказательства оценивали официальные проверяющие IMO.
Воспроизводимый рецепт специализации
«Легко дообучаемая» модель должна означать нечто большее, чем просто возможность обучать контрольную точку. Это должно означать, что способную базовую модель можно адаптировать к сложной предметной области по понятному и воспроизводимому рецепту.
В обоих проектах этот рецепт состоял из четырёх частей:
- Начать с мощной базовой модели Nemotron.
- Подобрать задачи, специфичные для предметной области, и высококачественные цепочки рассуждений.
- Применить стандартные методы постобучения, такие как SFT и, где это полезно, RL.
- Объединить специализированную модель с циклом вывода, который генерирует, оценивает и улучшает варианты ответов.
Запуски обучения и вывода были масштабными, но сам подход хорошо известен и воспроизводим. Нам не пришлось создавать новую базовую модель для каждой задачи. Мы специализировали Nemotron под конкретную задачу.
От общих навыков программирования к золоту IOI
Для соревновательного программирования мы отобрали 22 000 задач и сгенерировали синтетические цепочки рассуждений для обучения двух специализированных моделей. Nemotron-3-Nano-CC с 30 миллиардами общих параметров и 3 миллиардами активных параметров прошла SFT и RL. Nemotron-3-Ultra-CC с 550 миллиардами общих параметров и 55 миллиардами активных параметров прошла SFT.
Прогресс на IOI 2025 наглядно показывает ценность специализации. Результат Nano вырос со 130 баллов до постобучения до 280 после SFT и 291 после RL. С GenCorrect — нашей итеративной стратегией генерации, оценки и доработки — модель набрала 468 баллов и преодолела порог золотой медали 438,3. Ultra-CC набрала 502 балла с использованием той же стратегии на этапе тестирования.
Эти эксперименты также показали, что адаптация не обязана выглядеть одинаково на каждом масштабе. SFT обеспечила большую часть прироста Nano, а RL добавило меньший, но стабильный прирост. Для более мощной модели Ultra одного цикла SFT оказалось достаточно, чтобы превзойти полностью постобученную модель Nano на IOI, ICPC и LiveCodeBench Pro. Этот вывод определил систему Ultra-CC для IOI 2026, специализированную под соревнование; она набрала 535,4 из 600 баллов.
Обучение Nemotron доказательству, проверке и доработке
В проекте IMO та же идея была применена к олимпиадной математике. Взяв за основу Nemotron 3 Ultra, мы обучили одну специализированную модель с помощью SFT, а другую — с помощью RL.
Корпус SFT содержал 414 890 отфильтрованных по качеству примеров по 15 818 уникальным задачам на доказательства. Он обучал не только финальным ответам. Данные охватывали генерацию, доработку, проверку и метапроверку доказательств, поэтому модель училась строить аргументы, выявлять пробелы, реагировать на критику и определять, является ли доказательство полным. Модель RL обучалась на 9597 задачах на доказательства, выбранных вблизи границы возможностей модели.
Обе постобученные контрольные точки превзошли модель общего назначения в экспериментах на этапе разработки. Контрольная точка SFT была сильнее всего в первом раунде поиска, а контрольная точка RL показала лучший общий результат среди отдельных контрольных точек. Их сильные стороны дополняли друг друга, поэтому в финальной системе обе специализированные модели использовались вместе с общей моделью.
Для каждой задачи IMO модели генерировали варианты доказательств, оценивали их, формулировали критические замечания и дорабатывали наиболее перспективные попытки. На отдельном этапе с большими вычислительными затратами выбиралось финальное решение. Вся система работала на естественном языке, без формального доказателя, внешних инструментов и доступа к интернету. Она набрала 30 из 42 баллов, включая полный результат по четырём из шести задач, и превысила официальный порог золотой медали.
Дообучение и вычисления на этапе тестирования работают вместе
Наша предыдущая публикация о золотой медали IOI 2025 на Hugging Face показала, как вычисления на этапе тестирования могут вывести модели с открытыми весами на уровень золотой медали. Новые результаты добавляют важную деталь: более качественная специализация даёт системе вывода лучшие варианты ответов, более сильных критиков и более качественные доработки.
На IOI GenCorrect превратила прирост от дообучения в более значительные улучшения за несколько раундов обратной связи. На IMO использование взаимодополняющих контрольных точек SFT и RL оказалось ценнее, чем простая генерация большего числа образцов из одной контрольной точки. В обоих случаях лучший результат был получен благодаря сочетанию способной специализированной модели с системой, умеющей искать, проверять и улучшать решения.
Это различие важно. Медали были получены не только за счёт дообучения и не только за счёт перебора большого числа образцов. Они стали результатом совместного проектирования модели, данных и цикла вывода.
Открытые модели, данные и рецепты на Hugging Face
Мы хотим, чтобы эти результаты были полезны не только на соревнованиях. В коллекции Nemotron Labs IMO 2026 собраны контрольные точки SFT и RL, оба обучающих набора данных и Nemotron-IMO-Bench — новый бенчмарк из 200 задач олимпиадного уровня. В статье об IMO описаны подход к обучению и система генерации, проверки и доработки, а репозиторий NeMo-Skills содержит конвейер вывода IMO, подсказки, отправленные доказательства и воспроизводимое краткое руководство. Для соревновательного программирования модель Nemotron-3-Ultra-CC доступна на Hugging Face, а в статье об IOI представлены рецепт обучения и методология GenCorrect. Конвейер оценки и вывода IOI также доступен в NeMo-Skills.
Вместе IMO и IOI дают необычайно убедительные подтверждения простой идеи: Nemotron можно дообучить до уровня специализированных моделей мирового класса, а затем объединить с прозрачными процессами вывода для решения задач на переднем крае человеческих соревнований.
Мы с нетерпением ждём, что следующим создаст сообщество Hugging Face.
Модели, упомянутые в этой статье 1
Коллекции, упомянутые в этой статье 1
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Модели, упомянутые в этой статье 1
Коллекции, упомянутые в этой статье 1
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.




