Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Едно семейство модели, два резултата на златно ниво: дообучаване на Nemotron за IOI и IMO

Едно семейство модели, два резултата на златно ниво: фино настройване на Nemotron за IOI и IMO
За предприятия + Статия
Публикувано на 7 октомври 2026 г.
Международната олимпиада по информатика (IOI) и Международната математическа олимпиада (IMO) проверяват различни умения. IOI изисква алгоритми и код, които преминават скрити тестове при строги ограничения за време и брой предавания. IMO изисква строги доказателства на естествен език. Успехът в което и да е от двете състезания е труден. Успехът и в двете показва нещо по-широко.

Последните ни резултати показват, че Nemotron е силна и адаптивна основа за изграждане на специализирани модели от световна класа. Започвайки с Nemotron 3, екипите ни използваха контролирано фино настройване (SFT), обучение с подсилване (RL) и извеждане, управлявано от обратна връзка, за да създадат системи, достигнали ниво на златен медал както на IMO 2026, така и на IOI 2026.

заглавие на фигурата с резултатите за златни медали на IOI и IMO

Състезание Специализация на Nemotron Резултат
IOI 2026 Nemotron-3-Ultra-CC със SFT и GenCorrect 535,4/600, над прага за златен медал от 361,12 и най-високия човешки резултат от 498,27
IMO 2026 Общият Nemotron 3 Ultra, контролирано фино настройване и RL контролни точки в система за генериране-проверка-усъвършенстване 30/42, над официалния праг за златен медал от 29

Резултатът от IOI беше постигнат в реално, предварително планирано участие при същите ограничения за време, достъп до интернет и предаване като тези за човешките състезатели. Това беше неофициален, неконтролиран бенчмарк и не беше включен в официалното класиране на IOI. Предадените от системата доказателства на IMO бяха оценени от официални проверяващи на IMO.

Повторно използваема рецепта за специализация

„Лесен за фино настройване“ трябва да означава повече от това една контролна точка да може да бъде обучавана. Това трябва да означава, че способен базов модел може да бъде адаптиран към взискателна област с ясна, повторно използваема рецепта.

В двата проекта тази рецепта се състоеше от четири части:

  1. Започнете със силен базов модел Nemotron.
  2. Подберете специфични за областта задачи и висококачествени следи от разсъждения.
  3. Приложете стандартни методи за дообучаване, като SFT и, когато е полезно, RL.
  4. Свържете специализирания модел с цикъл на извеждане, който генерира, оценява и подобрява кандидат-отговорите.

Обучението и извеждането бяха значителни по мащаб, но основният подход е познат и възпроизводим. Не беше необходимо да изграждаме нов базов модел за всяко предизвикателство. Специализирахме Nemotron за конкретната задача.

От общи умения за програмиране до златен медал на IOI

За състезателното програмиране подбрахме 22 000 задачи и генерирахме синтетични следи от разсъждения, за да обучим два специализирани модела. Nemotron-3-Nano-CC, с общо 30 милиарда параметъра и 3 милиарда активни параметъра, премина през SFT и RL. Nemotron-3-Ultra-CC, с общо 550 милиарда параметъра и 55 милиарда активни параметъра, премина през SFT.

Развитието на IOI 2025 ясно показва стойността на специализацията. Nano се подобри от 130 точки преди дообучаването до 280 след SFT и 291 след RL. С GenCorrect, нашата итеративна стратегия за генериране-оценяване-усъвършенстване, той достигна 468 точки и премина прага за златен медал от 438,3. Ultra-CC достигна 502 точки със същата стратегия по време на теста.

фигура за развитието на основните способности в предишен стил

Тези експерименти показаха също, че адаптацията не трябва да изглежда еднакво при всеки мащаб. SFT осигури по-голямата част от подобрението на Nano, като RL добави по-малко, но последователно подобрение. При по-силния модел Ultra един цикъл на SFT беше достатъчен, за да надмине напълно дообучения модел Nano в IOI, ICPC и LiveCodeBench Pro. Това откритие насочи създаването на системата Ultra-CC, специфична за състезанието, използвана за IOI 2026, която постигна 535,4 от 600 точки.

Обучаване на Nemotron да доказва, проверява и преработва

Проектът IMO приложи същата идея към олимпиадната математика. Започвайки с Nemotron 3 Ultra, обучихме един специализиран модел със SFT, а друг — с RL.

Корпусът за SFT съдържаше 414 890 филтрирани по качество примера, обхващащи 15 818 уникални задачи за доказване. Той не просто обучаваше на крайни отговори. Данните обхващаха генериране, усъвършенстване, проверка и метапроверка на доказателства, така че моделът се научи да изгражда аргументи, да открива пропуски, да отговаря на критики и да преценява дали дадено доказателство е пълно. RL моделът беше обучен върху 9 597 задачи за доказване, избрани близо до границата на възможностите на модела.

И двете дообучени контролни точки надминаха общодостъпния модел в експериментите за разработка. Контролната точка със SFT беше най-силна в първия кръг на търсене, докато RL контролната точка постигна най-добрия общ резултат от единична контролна точка. Силните им страни бяха допълващи се, затова крайната система използваше и двата специализирани модела заедно с общия модел.

За всяка задача от IMO моделите генерираха кандидат-доказателства, оценяваха ги, създаваха критики и усъвършенстваха най-обещаващите опити. Отделен етап с високи изчислителни ресурси избираше крайното предаване. Цялата система работеше на естествен език, без формален доказател, външни инструменти или достъп до интернет. Тя постигна 30 от 42 точки, включително пълен резултат на четири от шестте задачи, и надмина официалния праг за златен медал.

изображение

Финото настройване и изчисленията по време на теста работят заедно

Предишната ни публикация на Hugging Face за IOI 2025 показа как изчисленията по време на теста могат да изведат моделите с отворени тегла до резултати на ниво златен медал. Новите резултати добавят важен елемент: по-добрата специализация осигурява на системата за извеждане по-добри кандидати, по-добри критици и по-добри усъвършенствания.

При IOI GenCorrect превърна подобренията от финото настройване в по-големи подобрения чрез множество кръгове на обратна връзка. При IMO използването на допълващи се контролни точки със SFT и RL беше по-ценно от простото генериране на повече образци от една контролна точка. И в двата случая най-добрият резултат дойде от съчетаването на способен специализиран модел със система, която може да търси, проверява и подобрява.

Това разграничение е важно. Медалите не бяха постигнати само чрез фино настройване, нито само чрез грубо генериране на образци. Те бяха резултат от съвместното проектиране на модела, данните и цикъла на извеждане.

Отворени модели, данни и рецепти в Hugging Face

Искаме тези резултати да бъдат полезни и извън състезанията. Колекцията Nemotron Labs IMO 2026 обединява контролните точки със SFT и RL, двата набора от данни за обучение и Nemotron-IMO-Bench — нов бенчмарк от 200 задачи на олимпиадно ниво. Статията за IMO описва подхода за обучение и системата за генериране-проверка-усъвършенстване, докато хранилището NeMo-Skills включва конвейера за извеждане на IMO, подсказванията, предадените доказателства и възпроизводимото кратко ръководство. За състезателно програмиране моделът Nemotron-3-Ultra-CC е достъпен в Hugging Face, а статията за IOI предоставя рецептата за обучение и методологията GenCorrect. Конвейерът за оценяване и извеждане на IOI също е достъпен в NeMo-Skills.

Заедно IMO и IOI предоставят необичайно строго доказателство за една проста идея: Nemotron може да бъде фино настроен в специализирани модели от световна класа за конкретни области, а след това да бъде комбиниран с прозрачни работни процеси за извеждане, за да решава задачи на границата на човешките състезателни възможности.

С нетърпение очакваме да видим какво ще създаде общността на Hugging Face занапред.

Модели, споменати в тази статия 1

Колекции, споменати в тази статия 1

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или кликнете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте в профила си, за да коментирате

Модели, споменати в тази статия 1

Колекции, споменати в тази статия 1

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини