Модель Nvidia Nemotron 3.5 Lightning с открытыми весами ставит скорость выше максимального интеллекта
Новая Nemotron 3.5 Lightning от Nvidia — компактная модель с открытыми весами, которая на тестах интеллекта соответствует OpenAI gpt-oss-120b, имея в четыре раза меньше параметров, и при этом обеспечивает самые высокие в своем классе скорости инференса.
Nvidia выпустила Nemotron 3.5 Lightning — первую модель новой линейки Nemotron 3.5. Модель напрямую приходит на смену Nemotron 3 Nano 30B A3B и сохраняет гибридную архитектуру Mamba-Transformer, имея в общей сложности 31,6 млрд параметров, из которых в каждый момент активны лишь 3,6 млрд.
Согласно независимой платформе для тестирования Artificial Analysis, модель набирает 24 балла по индексу интеллекта — на девять баллов больше предшественницы (15). Это ставит Lightning на один уровень с OpenAI gpt-oss-120b (24) и немного ниже собственной Nemotron 3 Super от Nvidia (26), которая примерно в четыре раза больше. Самые интеллектуальные малые модели того же размерного класса, такие как Qwen3.6 35B A3B (32) и новая Muse Glimmer от Meta (35), по-прежнему заметно опережают ее.

Nvidia нацеливает Lightning на другую точку фронтира эффективности. В предварительных тестах с использованием финальных весов NVFP4 модель достигает почти 670 токенов в секунду — это самый высокий измеренный показатель среди всех сравниваемых моделей и почти вдвое больше, чем у Gemini 3.5 Flash-Lite от Google (386 токенов/с). Выполнение одной задачи из индекса интеллекта занимает около 0,5 минуты, тогда как Qwen3.6 35B A3B требуется примерно 3,5 минуты, а Gemma 4 31B — около 5,8 минуты.

Проприетарные модели по-прежнему доминируют на общем фронтире эффективности. Gemini 3.5 Flash-Lite набирает 37 баллов по индексу интеллекта при аналогичном времени на задачу, а GPT-5.6 Luna (max) достигает 52 баллов менее чем за две минуты.
На агентных тестах заметен наибольший прогресс
Согласно Artificial Analysis, самые значительные улучшения проявляются на агентных тестах. В GDPval-AA v2 Lightning достигает рейтинга Elo 824 — на 334 балла больше, чем Nemotron 3 Nano. Это выше показателей как gpt-oss-120b (800), так и более крупной Nemotron 3 Super (698). В Terminal-Bench v2.1 результат вырос с 7 до 24,3 процента, почти сравнявшись с gpt-oss-120b (26,2 процента).

Nvidia выпускает модель под разрешительной лицензией OpenMDW-1.1, позиционируя ее как высокопроизводительный рабочий инструмент для агентных конвейеров. Artificial Analysis сообщает, что Nvidia сотрудничала с такими партнерами, как CodeRabbit и Harvey, над дообучением модели для повышения производительности в конкретных областях.
Доступность
Nvidia предоставляет модель с весами BF16 и NVFP4. Согласно Artificial Analysis, вариант NVFP4 также набирает 24 балла по индексу интеллекта при минимальной потере качества по сравнению с версией с более высокой точностью. Модель рассуждений работает только с текстом и поддерживает контекстное окно размером в один миллион токенов. Веса уже доступны, а бессерверный инференс предлагают DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius и Crusoe, а также другие компании.
Стремление Nvidia к эффективности, а не к размеру, не ново. В широко обсуждавшейся статье в прошлом году ее исследователи утверждали, что модели с менее чем 10 млрд параметров могут справляться с большинством агентных задач не хуже моделей со 70–175 млрд параметров, но при этом обходиться в 10–30 раз дешевле. Nemotron 3.5 Lightning имеет 31,6 млрд параметров, но активирует лишь 3,6 млрд на каждом шаге, что относит ее к тому же легковесному классу. Со скоростью почти 670 токенов в секунду она также превосходит gpt-oss-120b и более крупную Nemotron 3 Super на агентных тестах, становясь самым наглядным на уровне продукта подтверждением этой концепции.
Новости ИИ без хайпа — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный годовой отчет о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и возможность оставлять комментарии.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.