Модель Nvidia Nemotron 3.5 Lightning із відкритими вагами надає перевагу швидкості над максимальним інтелектом
Нова модель Nvidia Nemotron 3.5 Lightning із компактними відкритими вагами відповідає OpenAI gpt-oss-120b за показниками інтелекту, маючи вчетверо менше параметрів, і забезпечує найвищу у своєму класі швидкість інференсу.
Nvidia випустила Nemotron 3.5 Lightning — першу модель у своїй новій лінійці Nemotron 3.5. Модель безпосередньо прийшла на зміну Nemotron 3 Nano 30B A3B і зберігає її гібридну архітектуру Mamba-Transformer: загалом вона має 31,6 мільярда параметрів, з яких у кожен момент активні лише 3,6 мільярда.
Згідно з даними незалежної платформи бенчмаркінгу Artificial Analysis, модель набирає 24 бали в Intelligence Index — на дев’ять балів більше, ніж її попередниця (15). Це ставить Lightning на один рівень з OpenAI gpt-oss-120b (24) і трохи позаду власної моделі Nvidia Nemotron 3 Super (26), яка приблизно вчетверо більша. Найрозумніші малі моделі в тому ж класі розмірів, як-от Qwen3.6 35B A3B (32) і нова Muse Glimmer від Meta (35), усе ще мають помітну перевагу.

Nvidia орієнтує Lightning на іншу ділянку межі ефективності. У попередніх тестах із використанням фінальних ваг NVFP4 модель досягає майже 670 токенів за секунду — це найвища виміряна пропускна здатність серед усіх порівнюваних моделей і майже вдвічі більше, ніж у Gemini 3.5 Flash-Lite від Google (386 токенів/с). Виконання одного завдання з Intelligence Index займає близько 0,5 хвилини, тоді як Qwen3.6 35B A3B потребує приблизно 3,5 хвилини, а Gemma 4 31B — близько 5,8 хвилини.

Пропрієтарні моделі все ще домінують на загальній межі ефективності. Gemini 3.5 Flash-Lite набирає 37 балів у Intelligence Index за приблизно такий самий час на завдання, а GPT-5.6 Luna (max) досягає 52 балів менш ніж за дві хвилини.
Найбільші здобутки — у бенчмарках агентних систем
За даними Artificial Analysis, найбільші покращення спостерігаються в бенчмарках агентних систем. У GDPval-AA v2 Lightning отримує рейтинг Elo 824 — на 334 бали більше, ніж Nemotron 3 Nano. Це перевищує показники як gpt-oss-120b (800), так і більшої Nemotron 3 Super (698). У Terminal-Bench v2.1 показник зростає з 7 до 24,3 відсотка, майже зрівнявшись із gpt-oss-120b (26,2 відсотка).

Nvidia випускає модель за ліберальною ліцензією OpenMDW-1.1, позиціонуючи її як високопродуктивну робочу модель для конвеєрів на основі агентів. Artificial Analysis повідомляє, що Nvidia співпрацювала з такими партнерами, як CodeRabbit і Harvey, над посттренуванням для підвищення продуктивності в окремих сферах.
Доступність
Nvidia надає модель із вагами BF16 і NVFP4. За даними Artificial Analysis, варіант NVFP4 також набирає 24 бали в Intelligence Index, демонструючи мінімальну втрату якості порівняно з версією з вищою точністю. Модель міркування працює лише з текстом і підтримує контекстне вікно на один мільйон токенів. Ваги вже доступні, а безсерверний інференс пропонують DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius і Crusoe та інші.
Прагнення Nvidia до ефективності, а не розміру, не є новим. У широко обговорюваній статті минулого року її дослідники стверджували, що моделі з менш ніж 10 мільярдами параметрів можуть виконувати більшість агентних завдань так само добре, як моделі зі 70–175 мільярдами параметрів, але коштують у 10–30 разів дешевше. Nemotron 3.5 Lightning має 31,6 мільярда параметрів, але на кожному кроці активує лише 3,6 мільярда, що відносить її до того самого легкого класу. Із показником майже 670 токенів за секунду вона також перевершує gpt-oss-120b і більшу Nemotron 3 Super у бенчмарках агентних систем, ставши найпереконливішим на рівні продукту підтвердженням цієї тези.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний шість разів на рік звіт про передові розробки «AI Radar», повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.