NVIDIA AI пуска Nemotron 3.5 Lightning: отворен MoE модел с 30 млрд. параметъра, 3 млрд. активни параметъра и NeMo Switchyard Model Router
NVIDIA представи отворени технологии за изграждане на постоянно активни AI агенти от системи със специализирани модели. Два артефакта бяха пуснати заедно. Nemotron 3.5 Lightning е лек, персонализируем отворен модел, създаден за агентни задачи с голям обем, а NeMo Switchyard е библиотека с отворен код за маршрутизиране, която насочва всяка стъпка от работния процес на агента към най-способния и ефективен наличен модел. Проблемът, който и двата адресират, е структурен: дълго работещите агенти прекарват по-голямата част от времето си в извиквания на инструменти, валидиране на резултати и делегиране към подагенти, а изпращането на всяка от тези стъпки към пограничен модел за разсъждение увеличава разходите и латентността. Lightning е модел със смес от експерти с 30 млрд. параметъра и 3 млрд. активни параметъра, изграден върху хибридна архитектура Mamba-2 + MoE + Attention с контекстен прозорец от 1 млн. токена. NVIDIA отчита до 4 пъти по-висока скорост на генериране от модели със сходен размер и 30% по-бързо изпълнение на 10 000 задачи от PinchBench в сравнение с Qwen3.6 35B при съпоставима точност. Много компании от индустрията, като CrowdStrike, Harvey, CodeRabbit, Fastino Labs и Lila Sciences, вече го персонализират за работни натоварвания в областта на киберсигурността, правото, програмирането, финансите и здравеопазването.
Може ли да бъде внедрен?
Да. Nemotron 3.5 Lightning е общодостъпен съгласно либералния лиценз OpenMDW-1.1, с отворени тегла, тренировъчни данни и рецепти. NVIDIA посочва, че моделът е готов за търговска употреба.
- Кои компании: Всеки, който разполага с един съвременен GPU. NVIDIA посочва внедряване на един GPU чрез 1x DGX Spark (GB10) или 1x H100. Това поставя независимите разработчици и стартъпите в ранен етап на едно и също равнище с предприятията. Екипите от средния пазар могат да го обслужват чрез Baseten, Together AI или Nebius; регулираните предприятия могат да го поддържат изцяло локално.
- Индустрии: Киберсигурността, правните услуги, софтуерното инженерство, финансовите услуги, здравеопазването и науките за живота са сред посочените от NVIDIA сфери на клиентите.
- Приложения: Извикване на инструменти, валидиране на резултати, делегиране към подагенти, маршрутизиране на прегледа на код, сортиране на логове, анализиране на договори и извличане на информация в дълъг контекст с прозорец от 1 млн. токена.
Слоят за изпълнение, а не слоят за планиране
Дълго работещите агенти прекарват по-голямата част от времето си в изпълнение на задачи с голям обем. Извикванията на инструменти, валидирането на резултати и делегирането към подагенти доминират в бюджета от токени. Маршрутизирането на всяка от тези стъпки към пограничен модел за разсъждение увеличава разходите и латентността.
Nemotron 3.5 Lightning е насочен към този слой за изпълнение. Това е модел със смес от експерти с 30 млрд. параметъра и 3 млрд. активни параметъра, изграден върху хибридна архитектура Mamba-2 + MoE + Attention. Дължината на контекста достига 1 млн. токена. Предварителното обучение обхваща над 20 трилиона токена, използвайки NVFP4 рецепта.
Моделът е най-малкият представител на семейството Nemotron 3. Погранични модели като Nemotron 3 Ultra се справят с оркестрацията и планирането, докато Lightning обработва рутинните извиквания под тях.
Откъде идва скоростта
Два механизма:
- Първо, спекулативно декодиране: Предсказването на множество токени е заложено по време на специален етап на предварителното обучение, след което е подобрено с фаза за увеличаване на MTP. NVIDIA предлага и два външни модела за генериране на чернови: DSpark, полурегресивен модел, препоръчан за DGX Spark и работни натоварвания в центрове за данни с ниска конкурентност, и DFlash, който използва лек модел на блокова дифузия.
- Второ, квантизация: Контролна точка NVFP4 се предлага заедно с BF16. Една и съща контролна точка обслужва нативно Blackwell и Hopper, а чрез W4A16 ядра се разширява и до Ampere.
NVIDIA отчита до 4 пъти по-висока скорост на генериране в сравнение с модели със сходен размер. При PinchBench компанията отчита 86% точност, като 10 000 задачи са изпълнени с 30% по-бързо от Qwen3.6 35B при съпоставима точност.
Публикувани резултати от картата на модела (BF16 / NVFP4): MMLU Pro 81.94 / 81.62, GPQA Diamond 75.44 / 75.57, SWE-bench Verified 51.56 / 52.80, Terminal-Bench 2.1 24.58 / 23.46, AA-LCR 52.00 / 49.19. Препоръчителните настройки за семплиране са temperature 1.0 и top_p 0.95.
NeMo Switchyard
NeMo Switchyard е библиотека с отворен код, която насочва всяка стъпка от работния процес на агента към най-способния и ефективен наличен модел.
Тя предлага маршрутизатори без нужда от настройване, включително LLM класификатор със сесийна зависимост, маршрутизатор на етапи, който анализира скорошната активност на инструментите, и маршрутизатор за ескалация, който започва с евтин модел и преминава към по-способен при продължителна трудност. Настройваем маршрутизатор за предварително попълване се учи от остатъчния поток на модела, за да предскаже кой кандидат ще успее. Референтният сървър приема заявки към OpenAI, Anthropic и Responses API.
Публикувани са два резултата: LangChain тества 145 многостъпкови агентни задачи. Маршрутизирането между Lightning и Claude Opus 4.8 с маршрутизатора за ескалация намалява разходите със 74% спрямо базова линия само с пограничен модел, като изпраща 7% от извикванията към пограничния модел, при компромис в точността от приблизително 6 процентни пункта. Cognition реализира поетапно маршрутизиране в Devin Desktop. При FrontierCode Main маршрутизирането между Opus 5 и Kimi K2.7 достига 50.6% при средна цена от $3.11, в рамките на 2.8 пункта от точността на Opus 5 и при приблизително 28% по-ниска средна цена.
Интерактивно обяснение
Основни изводи
- Отворен MoE модел с 30 млрд. параметъра и 3 млрд. активни параметъра, контекст от 1 млн. токена, лиценз OpenMDW-1.1 и разрешена търговска употреба.
- До 4 пъти по-висока скорост на генериране; 10 000 задачи от PinchBench са изпълнени с 30% по-бързо от Qwen3.6 35B.
- Скоростта идва от предсказването на множество токени, както и от моделите за генериране на чернови DSpark и DFlash и контролна точка NVFP4.
- Работи на 1x DGX Spark или 1x H100, както и локално чрез Ollama, LM Studio, llama.cpp и Unsloth.
- NeMo Switchyard намали разходите със 74% в 145-задачния тест на LangChain при компромис в точността от около 6 процентни пункта.
Изпробвайте го в build.nvidia.com или OpenRouter, а изтеглете теглата от Hugging Face или ModelScope. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия информационен бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово представяне ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.