Sakhanda Wire
NVDA $218.94 +0.64% MSFT $503.00 -0.60% GOOGL $351.56 -1.67% META $609.52 +2.45% AMZN $273.23 -1.75%
← К новостям

Модель Nvidia Nemotron 3.5 Lightning с открытыми весами ставит скорость выше максимального интеллекта

Nvidia's открытая по весам Nemotron 3.5 Lightning делает ставку на скорость, а не на максимальный интеллект
Маттиас Бастиан
11 авг. 2026
Nano Banana Pro по запросу THE DECODER

Новая Nemotron 3.5 Lightning от Nvidia — компактная модель с открытыми весами, которая на тестах интеллекта соответствует OpenAI gpt-oss-120b, имея в четыре раза меньше параметров, и при этом обеспечивает самые высокие в своем классе скорости инференса.

Nvidia выпустила Nemotron 3.5 Lightning — первую модель новой линейки Nemotron 3.5. Модель напрямую приходит на смену Nemotron 3 Nano 30B A3B и сохраняет гибридную архитектуру Mamba-Transformer, имея в общей сложности 31,6 млрд параметров, из которых в каждый момент активны лишь 3,6 млрд.

Согласно независимой платформе для тестирования Artificial Analysis, модель набирает 24 балла по индексу интеллекта — на девять баллов больше предшественницы (15). Это ставит Lightning на один уровень с OpenAI gpt-oss-120b (24) и немного ниже собственной Nemotron 3 Super от Nvidia (26), которая примерно в четыре раза больше. Самые интеллектуальные малые модели того же размерного класса, такие как Qwen3.6 35B A3B (32) и новая Muse Glimmer от Meta (35), по-прежнему заметно опережают ее.

Nemotron 3.5 Lightning набирает 24 балла по индексу интеллекта Artificial Analysis, сравниваясь с gpt-oss-120b. | Изображение: Artificial Analysis

Nvidia нацеливает Lightning на другую точку фронтира эффективности. В предварительных тестах с использованием финальных весов NVFP4 модель достигает почти 670 токенов в секунду — это самый высокий измеренный показатель среди всех сравниваемых моделей и почти вдвое больше, чем у Gemini 3.5 Flash-Lite от Google (386 токенов/с). Выполнение одной задачи из индекса интеллекта занимает около 0,5 минуты, тогда как Qwen3.6 35B A3B требуется примерно 3,5 минуты, а Gemma 4 31B — около 5,8 минуты.

Со скоростью 669 токенов в секунду Lightning — самая быстрая модель в сравнении. Несмотря на генерацию примерно такого же количества токенов на задачу, как у предшественницы Nemotron 3 Nano, она обеспечивает значительно лучшие результаты. | Изображение: Artificial Analysis

Проприетарные модели по-прежнему доминируют на общем фронтире эффективности. Gemini 3.5 Flash-Lite набирает 37 баллов по индексу интеллекта при аналогичном времени на задачу, а GPT-5.6 Luna (max) достигает 52 баллов менее чем за две минуты.

На агентных тестах заметен наибольший прогресс

Согласно Artificial Analysis, самые значительные улучшения проявляются на агентных тестах. В GDPval-AA v2 Lightning достигает рейтинга Elo 824 — на 334 балла больше, чем Nemotron 3 Nano. Это выше показателей как gpt-oss-120b (800), так и более крупной Nemotron 3 Super (698). В Terminal-Bench v2.1 результат вырос с 7 до 24,3 процента, почти сравнявшись с gpt-oss-120b (26,2 процента).

На агентных тестах Lightning превосходит и gpt-oss-120b, и более крупную Nemotron 3 Super, достигая рейтинга Elo 824. | Изображение: Artificial Analysis

Nvidia выпускает модель под разрешительной лицензией OpenMDW-1.1, позиционируя ее как высокопроизводительный рабочий инструмент для агентных конвейеров. Artificial Analysis сообщает, что Nvidia сотрудничала с такими партнерами, как CodeRabbit и Harvey, над дообучением модели для повышения производительности в конкретных областях.

Доступность

Nvidia предоставляет модель с весами BF16 и NVFP4. Согласно Artificial Analysis, вариант NVFP4 также набирает 24 балла по индексу интеллекта при минимальной потере качества по сравнению с версией с более высокой точностью. Модель рассуждений работает только с текстом и поддерживает контекстное окно размером в один миллион токенов. Веса уже доступны, а бессерверный инференс предлагают DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius и Crusoe, а также другие компании.

Стремление Nvidia к эффективности, а не к размеру, не ново. В широко обсуждавшейся статье в прошлом году ее исследователи утверждали, что модели с менее чем 10 млрд параметров могут справляться с большинством агентных задач не хуже моделей со 70–175 млрд параметров, но при этом обходиться в 10–30 раз дешевле. Nemotron 3.5 Lightning имеет 31,6 млрд параметров, но активирует лишь 3,6 млрд на каждом шаге, что относит ее к тому же легковесному классу. Со скоростью почти 670 токенов в секунду она также превосходит gpt-oss-120b и более крупную Nemotron 3 Super на агентных тестах, становясь самым наглядным на уровне продукта подтверждением этой концепции.

Новости ИИ без хайпа — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный годовой отчет о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и возможность оставлять комментарии.

Источник: Nvidia | Artificial Analysis | Hugging Face

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости