Моделът Nemotron 3.5 Lightning с отворени тегла на Nvidia дава приоритет на скоростта пред максималната интелигентност
Новият Nemotron 3.5 Lightning на Nvidia е компактен модел с отворени тегла, който постига резултати, сравними с тези на gpt-oss-120b на OpenAI в тестовете за интелигентност, но с една четвърт от параметрите, като същевременно осигурява най-високата скорост на инференция в своя клас.
Nvidia пусна Nemotron 3.5 Lightning — първия модел от новата си серия Nemotron 3.5. Моделът е пряк наследник на Nemotron 3 Nano 30B A3B и запазва хибридната архитектура Mamba-Transformer, с общо 31,6 милиарда параметъра, от които във всеки момент се активират само 3,6 милиарда.
Според независимата платформа за сравнителен анализ Artificial Analysis моделът получава 24 точки в Intelligence Index — с девет точки повече от предшественика си (15). Това поставя Lightning наравно с gpt-oss-120b на OpenAI (24) и малко зад собствения Nemotron 3 Super на Nvidia (26), който е около четири пъти по-голям. Най-интелигентните малки модели в същия размерен клас, като Qwen3.6 35B A3B (32) и новия Muse Glimmer на Meta (35), все още имат ясна преднина.

Nvidia цели различна позиция на фронтира на ефективността с Lightning. В предварителни тестове с финалните тегла NVFP4 моделът достига почти 670 токена в секунда — най-високата измерена пропускателна способност сред всички сравнявани модели и почти два пъти по-висока от тази на Gemini 3.5 Flash-Lite на Google (386 токена/сек.). Изпълнението на една задача от Intelligence Index отнема около 0,5 минути, докато на Qwen3.6 35B A3B са му нужни около 3,5 минути, а на Gemma 4 31B — приблизително 5,8 минути.

Собствените модели все още доминират общия фронтир на ефективността. Gemini 3.5 Flash-Lite получава 37 точки в Intelligence Index при сходно време за задача, а GPT-5.6 Luna (max) достига 52 точки за по-малко от две минути.
Тестовете за агентни системи показват най-големи подобрения
Най-големите подобрения се наблюдават в тестовете за агентни системи, според Artificial Analysis. В GDPval-AA v2 Lightning достига Elo рейтинг от 824 — с 334 точки повече от Nemotron 3 Nano. Това е по-добър резултат както от gpt-oss-120b (800), така и от по-големия Nemotron 3 Super (698). В Terminal-Bench v2.1 резултатът се повишава от 7 на 24,3 процента, почти изравнявайки се с gpt-oss-120b при 26,2 процента.

Nvidia предоставя модела под либералния лиценз OpenMDW-1.1, позиционирайки го като високопроизводителен работен кон за базирани на агенти конвейери. Artificial Analysis съобщава, че Nvidia е работила с партньори като CodeRabbit и Harvey върху дообучаването, за да повиши производителността в конкретни области.
Наличност
Nvidia предоставя модела с тегла BF16 и NVFP4. Според Artificial Analysis вариантът NVFP4 също получава 24 точки в Intelligence Index, като загубата на качество спрямо версията с по-висока прецизност е минимална. Моделът за разсъждение работи само с текст и поддържа контекстен прозорец от един милион токена. Теглата вече са налични, а безсървърният инференс се предлага от DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius и Crusoe, наред с други.
Стремежът на Nvidia към ефективност за сметка на размера не е нов. В широко обсъждан научен труд от миналата година нейни изследователи твърдят, че модели с под 10 милиарда параметъра могат да се справят с повечето агентни работни натоварвания също толкова добре, колкото модели със 70 до 175 милиарда параметъра, но на цена от една десета до една тридесета. Nemotron 3.5 Lightning има 31,6 милиарда параметъра, но активира само 3,6 милиарда на стъпка, което го поставя в същия лек клас. Със скорост от почти 670 токена в секунда той също така надминава gpt-oss-120b и по-големия Nemotron 3 Super в тестовете за агентни системи, превръщайки се в най-ясното доказателство на ниво продукт за тази теза досега.
Новини за AI без преувеличения – подбрани от хора
Абонирайте се за THE DECODER, за да получавате четене без реклами, седмичен бюлетин за AI, нашия ексклузивен шест пъти годишно доклад за фронтира „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.