Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← До новин

Одна родина моделей, два результати золотого рівня: донавчання Nemotron для IOI та IMO

Одне сімейство моделей, два результати золотого рівня: донавчання Nemotron для IOI та IMO
Для підприємств + Стаття
Опубліковано 7 жовтня 2026 року
Міжнародна олімпіада з інформатики (IOI) та Міжнародна математична олімпіада (IMO) перевіряють різні навички. IOI вимагає алгоритмів і коду, які проходять приховані тести за суворих обмежень часу та кількості подань. IMO вимагає строгих доказів природною мовою. Успіх у будь-якому з цих змагань є складним завданням. Успіх в обох вказує на дещо ширше.

Наші нещодавні результати показують, що Nemotron є потужною, адаптивною основою для створення спеціалізованих моделей світового рівня. Почавши з Nemotron 3, наші команди використали навчання з учителем (SFT), навчання з підкріпленням (RL) та інференс на основі зворотного зв’язку, щоб створити системи, які досягли рівня золотих медалей і на IMO 2026, і на IOI 2026.

fig_ioi_imo_gold_results_headline

Змагання Спеціалізація Nemotron Результат
IOI 2026 Nemotron-3-Ultra-CC із SFT та GenCorrect 535,4/600, вище за поріг золотої медалі 361,12 і найкращий результат людини 498,27
IMO 2026 Загальна модель Nemotron 3 Ultra, контрольні точки SFT і RL у системі генерування-перевірки-уточнення 30/42, вище за офіційний поріг золотої медалі 29

Результат IOI було отримано під час живого перспективного запуску за тих самих обмежень щодо часу, доступу до інтернету та подань, що й для учасників-людей. Це був неофіційний неконтрольований бенчмарк, і його не було включено до офіційного рейтингу IOI. Подані системою IMO докази оцінювали офіційні перевіряльники IMO.

Повторно використовуваний рецепт спеціалізації

«Легко донавчати» має означати більше, ніж просто можливість навчати контрольну точку. Це має означати, що потужну базову модель можна адаптувати до складної галузі за допомогою чіткого, повторно використовуваного рецепта.

В обох проєктах цей рецепт складався з чотирьох частин:

  1. Почати з потужної базової моделі Nemotron.
  2. Підібрати спеціалізовані галузеві задачі та високоякісні ланцюжки міркувань.
  3. Застосувати стандартні методи подальшого навчання, як-от SFT і, де це доречно, RL.
  4. Поєднати спеціалізовану модель із циклом інференсу, який генерує, оцінює та вдосконалює варіанти відповідей.

Запуски навчання та інференсу були масштабними, але базовий підхід є знайомим і відтворюваним. Нам не потрібно було створювати нову базову модель для кожного виклику. Ми спеціалізували Nemotron під завдання.

Від загальних навичок програмування до золота IOI

Для змагального програмування ми відібрали 22 000 задач і згенерували синтетичні ланцюжки міркувань для навчання двох спеціалізованих моделей. Nemotron-3-Nano-CC, що має загалом 30 мільярдів параметрів і 3 мільярди активних параметрів, пройшла SFT і RL. Nemotron-3-Ultra-CC, що має загалом 550 мільярдів параметрів і 55 мільярдів активних параметрів, пройшла SFT.

Прогрес на IOI 2025 дає змогу легко побачити цінність спеціалізації. Nano покращила результат зі 130 балів до постнавчання до 280 після SFT і 291 після RL. За допомогою GenCorrect — нашої ітеративної стратегії генерування-оцінювання-уточнення — вона набрала 468 балів і перевищила поріг золотої медалі 438,3. Ultra-CC набрала 502 бали за тієї самої стратегії під час тестування.

fig_main_capability_progression_previous_style

Ці експерименти також показали, що адаптація не обов’язково має виглядати однаково на кожному масштабі. SFT забезпечило більшу частину приросту Nano, а RL додало менше, але стабільне покращення. Для потужнішої моделі Ultra одного епохи SFT було достатньо, щоб перевершити повністю постнавчену модель Nano на IOI, ICPC і LiveCodeBench Pro. Це відкриття визначило спеціалізовану для змагань систему Ultra-CC, використану для IOI 2026, яка набрала 535,4 із 600 балів.

Навчання Nemotron доводити, перевіряти та виправляти

У проєкті IMO ту саму ідею застосували до олімпіадної математики. Почавши з Nemotron 3 Ultra, ми навчили одну спеціалізовану модель за допомогою SFT, а іншу — за допомогою RL.

Корпус SFT містив 414 890 прикладів, відібраних за якістю, і охоплював 15 818 унікальних задач на доведення. Він навчав не лише фінальних відповідей. Дані охоплювали генерування, уточнення, перевірку та метаперевірку доказів, тому модель навчилася будувати аргументи, знаходити прогалини, реагувати на критику та оцінювати повноту доказу. Модель RL навчали на 9 597 задачах на доведення, відібраних поблизу межі можливостей моделі.

Обидві постнавчені контрольні точки перевершили загальнодоступну модель у експериментах із розробки. Контрольна точка SFT була найсильнішою в першому раунді пошуку, тоді як контрольна точка RL досягла найкращого загального результату для однієї контрольної точки. Їхні сильні сторони доповнювали одна одну, тому фінальна система використовувала обох спеціалістів разом із загальною моделлю.

Для кожної задачі IMO моделі генерували варіанти доказів, оцінювали їх, формулювали критичні зауваження та уточнювали найперспективніші спроби. Окремий етап із високими обчислювальними ресурсами обирав фінальне подання. Уся система працювала природною мовою, без формального доводчика, зовнішніх інструментів чи доступу до інтернету. Вона набрала 30 із 42 балів, зокрема отримала повний бал за чотири з шести задач, і перевищила офіційний поріг золотої медалі.

image

Донавчання та обчислення під час тестування працюють разом

У нашій попередній публікації Hugging Face про IOI 2025 ми показали, як обчислення під час тестування можуть підштовхнути моделі з відкритими вагами до результатів золотого рівня. Нові результати додають важливий елемент: краща спеціалізація дає системі інференсу кращі варіанти, критиків і уточнення.

На IOI GenCorrect перетворила здобутки від донавчання на більші покращення протягом кількох раундів зворотного зв’язку. На IMO використання взаємодоповнювальних контрольних точок SFT і RL виявилося ціннішим, ніж просте генерування більшої кількості зразків з однієї контрольної точки. В обох випадках найкращого результату було досягнуто завдяки поєднанню потужного спеціаліста із системою, здатною шукати, перевіряти та вдосконалювати.

Ця відмінність має значення. Медалі були здобуті не самим лише донавчанням і не самим лише вибірковим семплюванням грубою силою. Вони стали результатом спільного проєктування моделі, даних і циклу інференсу.

Відкриті моделі, дані та рецепти на Hugging Face

Ми хочемо, щоб ці результати були корисними й поза межами змагань. Колекція Nemotron Labs IMO 2026 об’єднує контрольні точки SFT і RL, обидва навчальні набори даних та Nemotron-IMO-Bench — новий бенчмарк із 200 задач олімпіадного рівня. У статті про IMO описано підхід до навчання та систему генерування-перевірки-уточнення, тоді як репозиторій NeMo-Skills містить пайплайн інференсу IMO, промпти, подані докази та відтворюваний короткий посібник зі старту. Для змагального програмування модель Nemotron-3-Ultra-CC доступна на Hugging Face, а стаття про IOI містить рецепт навчання та методологію GenCorrect. Пайплайн оцінювання та інференсу IOI також доступний у NeMo-Skills.

Разом IMO та IOI дають надзвичайно переконливі докази простої ідеї: Nemotron можна донавчити до спеціалізованих моделей світового рівня, а потім поєднати їх із прозорими робочими процесами інференсу для розв’язання задач на передньому краї людських змагань.

Ми з нетерпінням чекаємо, що наступним створить спільнота Hugging Face.

Моделі, згадані в цій статті 1

Колекції, згадані в цій статті 1

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у поле введення тексту, вставляючи або натискаючи тут.
Натисніть або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб залишити коментар

Моделі, згадані в цій статті 1

Колекції, згадані в цій статті 1

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини