NVIDIA AI випустила Nemotron 3.5 Lightning: відкриту MoE-модель на 30 млрд параметрів із 3 млрд активних параметрів і NeMo Switchyard Model Router
NVIDIA представила відкриті технології для створення постійно активних ШІ-агентів із систем спеціалізованих моделей. Обидва артефакти постачаються разом. Nemotron 3.5 Lightning — це легка, налаштовувана відкрита модель для високопродуктивних агентних завдань, а NeMo Switchyard — бібліотека з відкритим кодом, яка спрямовує кожен крок робочого процесу агента до найбільш спроможної та ефективної доступної моделі. Проблема, яку вирішують обидві технології, має структурний характер: довготривалі агенти більшість часу витрачають на виклики інструментів, перевірку результатів і делегування підзавдань, а надсилання кожного з цих кроків до передової моделі міркування збільшує вартість і затримку. Lightning — це модель із сумішшю експертів на 30 млрд параметрів, із 3 млрд активних параметрів, побудована на гібридній архітектурі Mamba-2 + MoE + Attention із контекстним вікном на 1 млн токенів. NVIDIA повідомляє про швидкість генерації до 4 разів вищу, ніж у моделей подібного розміру, а також про виконання 10 000 завдань PinchBench на 30% швидше, ніж Qwen3.6 35B, за зіставної точності. Багато гравців індустрії, зокрема CrowdStrike, Harvey, CodeRabbit, Fastino Labs і Lila Sciences, уже налаштовують її для завдань у сфері кібербезпеки, права, програмування, фінансів та охорони здоров’я.
Чи можна її розгорнути?
Так. Nemotron 3.5 Lightning загальнодоступна за дозволеною ліцензією OpenMDW-1.1, із відкритими вагами, даними для навчання та рецептами. NVIDIA заявляє, що модель готова до комерційного використання.
- Які компанії: Будь-хто, хто має сучасний графічний процесор. NVIDIA вказує на можливість розгортання на одному GPU — 1x DGX Spark (GB10) або 1x H100. Це ставить індивідуальних розробників і стартапи на ранніх етапах розвитку на один рівень із великими підприємствами. Команди середнього бізнесу можуть обслуговувати модель через Baseten, Together AI або Nebius; регульовані підприємства можуть повністю зберігати її локально.
- Галузі: Кібербезпека, юридичні послуги, програмна інженерія, фінансові послуги, охорона здоров’я та науки про життя — усі вони представлені в переліку названих клієнтів NVIDIA.
- Застосування: Виклики інструментів, перевірка результатів, делегування підзавдань, маршрутизація перевірки коду, сортування журналів, аналіз контрактів і пошук у довгому контексті у вікні на 1 млн токенів.
Рівень виконання, а не планування
Довготривалі агенти більшість часу витрачають на високопродуктивне виконання. Виклики інструментів, перевірка результатів і делегування підзавдань домінують у бюджеті токенів. Маршрутизація кожного з цих кроків до передової моделі міркування збільшує вартість і затримку.
Nemotron 3.5 Lightning орієнтована на цей рівень виконання. Це модель із сумішшю експертів на 30 млрд параметрів, із 3 млрд активних параметрів, побудована на гібридній архітектурі Mamba-2 + MoE + Attention. Довжина контексту сягає 1 млн токенів. Попереднє навчання охопило понад 20 трлн токенів із використанням рецепта NVFP4.
Модель є найменшим представником сімейства Nemotron 3. Передові моделі, такі як Nemotron 3 Ultra, відповідають за оркестрацію та планування, тоді як Lightning виконує стандартні виклики під ними.
Звідки береться швидкість
Два механізми:
- По-перше, спекулятивне декодування: Багатотокенне передбачення було закладене ще на окремому етапі попереднього навчання, а потім удосконалене на етапі MTP-boosting. NVIDIA також постачає дві зовнішні моделі-чернетки: DSpark — напівавторегресивну модель-чернетку, рекомендовану для DGX Spark і центрів обробки даних із низькою паралельністю, та DFlash, яка використовує легку блочно-дифузійну модель.
- По-друге, квантизація: Контрольна точка NVFP4 постачається разом із BF16. Та сама контрольна точка нативно працює на Blackwell і Hopper, а також підтримує Ampere через ядра W4A16.
NVIDIA повідомляє про швидкість генерації до 4 разів вищу, ніж у моделей подібного розміру. На PinchBench компанія заявляє про точність 86% і виконання 10 000 завдань на 30% швидше, ніж у Qwen3.6 35B, за зіставної точності.
Опубліковані результати з картки моделі (BF16 / NVFP4): MMLU Pro 81.94 / 81.62, GPQA Diamond 75.44 / 75.57, SWE-bench Verified 51.56 / 52.80, Terminal-Bench 2.1 24.58 / 23.46, AA-LCR 52.00 / 49.19. Рекомендовані параметри семплювання: temperature 1.0 і top_p 0.95.
NeMo Switchyard
NeMo Switchyard — це бібліотека з відкритим кодом, яка спрямовує кожен крок робочого процесу агента до найбільш спроможної та ефективної доступної моделі.
Вона пропонує маршрутизатори без потреби в налаштуванні, зокрема класифікатор LLM із прив’язкою до сесії, маршрутизатор етапів, який аналізує нещодавню активність інструментів, і маршрутизатор ескалації, що починає з дешевої моделі та підвищує рівень моделі за стабільної складності. Налаштовуваний маршрутизатор попереднього заповнення навчається на залишковому потоці моделі, щоб передбачити, який кандидат досягне успіху. Еталонний сервер приймає запити OpenAI, Anthropic і Responses API.
Опубліковано два результати: LangChain протестувала 145 багатоетапних агентних завдань. Маршрутизація між Lightning і Claude Opus 4.8 за допомогою маршрутизатора ескалації скоротила витрати на 74% порівняно з базовим сценарієм, що використовує лише передову модель, спрямовуючи до передової моделі 7% викликів, за приблизно 6-відсоткової втрати точності. Cognition реалізувала поетапну маршрутизацію в Devin Desktop. На FrontierCode Main маршрутизація між Opus 5 і Kimi K2.7 досягла результату 50.6% за середньої вартості $3.11, відставши від точності Opus 5 на 2.8 пункту за приблизно на 28% нижчої середньої вартості.
Інтерактивне пояснення
Основні висновки
- Відкрита MoE-модель на 30 млрд параметрів із 3 млрд активних параметрів, контекстом на 1 млн токенів, ліцензією OpenMDW-1.1 і дозволеним комерційним використанням.
- Швидкість генерації до 4 разів вища; 10 000 завдань PinchBench виконуються на 30% швидше, ніж у Qwen3.6 35B.
- Швидкість забезпечують багатотокенне передбачення разом із моделями-чернетками DSpark і DFlash, а також контрольна точка NVFP4.
- Працює на 1x DGX Spark або 1x H100, а також локально через Ollama, LM Studio, llama.cpp і Unsloth.
- NeMo Switchyard скоротив витрати на 74% у тестуванні LangChain зі 145 завдань за приблизно 6-відсоткової втрати точності.
Спробуйте її на build.nvidia.com або OpenRouter, а ваги завантажте з Hugging Face або ModelScope. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про ML із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.