NVIDIA AI выпустила Nemotron 3.5 Lightning: открытую MoE-модель на 30 млрд параметров с 3 млрд активных параметров и NeMo Switchyard Model Router
NVIDIA представила открытые технологии для создания постоянно работающих ИИ-агентов на основе систем специализированных моделей. Одновременно были выпущены два артефакта. Nemotron 3.5 Lightning — это легковесная настраиваемая открытая модель, созданная для высокообъёмных агентных задач, а NeMo Switchyard — библиотека маршрутизации с открытым исходным кодом, которая направляет каждый шаг рабочего процесса агента к наиболее мощной и эффективной доступной модели. Обе технологии решают структурную проблему: долго работающие агенты проводят большую часть времени за вызовами инструментов, проверкой результатов и делегированием подагентам, а отправка каждого из этих шагов фронтирной модели рассуждений увеличивает стоимость и задержку. Lightning — это модель со смесью экспертов на 30 млрд параметров, из которых активно используются 3 млрд, построенная на гибридной архитектуре Mamba-2 + MoE + Attention с контекстным окном в 1 млн токенов. NVIDIA сообщает о скорости генерации до 4 раз выше, чем у моделей аналогичного размера, а также о завершении 10 000 задач PinchBench на 30% быстрее, чем Qwen3.6 35B, при сопоставимой точности. Многие игроки отрасли, такие как CrowdStrike, Harvey, CodeRabbit, Fastino Labs и Lila Sciences, уже адаптируют её для задач в сфере кибербезопасности, права, программирования, финансов и здравоохранения.
Можно ли её развернуть?
Да. Nemotron 3.5 Lightning общедоступна по разрешительной лицензии OpenMDW-1.1, с открытыми весами, данными для обучения и рецептами. NVIDIA заявляет, что модель готова к коммерческому использованию.
- Какие компании: Любая компания, располагающая одним современным GPU. NVIDIA указывает возможность развертывания на одном GPU — 1x DGX Spark (GB10) или 1x H100. Это ставит индивидуальных разработчиков и стартапы на посевной стадии в равное положение с крупными предприятиями. Команды среднего бизнеса могут предоставлять к ней доступ через Baseten, Together AI или Nebius; регулируемые предприятия могут полностью разместить модель локально.
- Отрасли: Кибербезопасность, юридические услуги, разработка программного обеспечения, финансовые услуги, здравоохранение и науки о жизни — все они представлены среди названных NVIDIA клиентов.
- Приложения: Вызов инструментов, проверка результатов, делегирование подагентам, маршрутизация проверки кода, сортировка журналов, анализ контрактов и извлечение данных в длинном контексте размером до 1 млн токенов.
Слой исполнения, а не планирования
Долго работающие агенты проводят большую часть времени за высокообъёмными операциями. Вызовы инструментов, проверка результатов и делегирование подагентам занимают основную долю бюджета токенов. Маршрутизация каждого из этих шагов к фронтирной модели рассуждений увеличивает стоимость и задержку.
Nemotron 3.5 Lightning ориентирована на этот слой исполнения. Это модель со смесью экспертов на 30 млрд параметров, из которых активно используются 3 млрд, построенная на гибридной архитектуре Mamba-2 + MoE + Attention. Длина контекста достигает 1 млн токенов. Предварительное обучение охватывало более 20 трлн токенов с использованием рецепта NVFP4.
Модель является младшим представителем семейства Nemotron 3. Фронтирные модели, такие как Nemotron 3 Ultra, занимаются оркестрацией и планированием, а Lightning обрабатывает выполняемые под ними рутинные вызовы.
Откуда берётся скорость
Два механизма:
- Во-первых, спекулятивное декодирование: Предсказание нескольких токенов было заложено на этапе специальной предварительной подготовки, а затем улучшено в ходе фазы усиления MTP. NVIDIA также поставляет две внешние черновые модели: DSpark — полуавторегрессионную модель-черновик, рекомендованную для DGX Spark и центров обработки данных с низким уровнем параллелизма, и DFlash, использующую легковесную модель блочной диффузии.
- Во-вторых, квантизация: Контрольная точка NVFP4 поставляется вместе с BF16. Одна и та же контрольная точка нативно работает на Blackwell и Hopper, а для Ampere поддержка обеспечивается через ядра W4A16.
NVIDIA сообщает о скорости генерации до 4 раз выше, чем у моделей аналогичного размера. В PinchBench заявлена точность 86%, при этом 10 000 задач выполняются на 30% быстрее, чем у Qwen3.6 35B, при сопоставимой точности.
Опубликованные результаты в карточке модели (BF16 / NVFP4): MMLU Pro 81.94 / 81.62, GPQA Diamond 75.44 / 75.57, SWE-bench Verified 51.56 / 52.80, Terminal-Bench 2.1 24.58 / 23.46, AA-LCR 52.00 / 49.19. Рекомендуемые параметры сэмплирования: temperature 1.0 и top_p 0.95.
NeMo Switchyard
NeMo Switchyard — это библиотека с открытым исходным кодом, которая направляет каждый шаг рабочего процесса агента к наиболее мощной и эффективной доступной модели.
Она предлагает маршрутизаторы, не требующие настройки, включая классификатор на базе LLM с привязкой к сессии, маршрутизатор этапов, анализирующий недавнюю активность инструментов, и маршрутизатор эскалации, который начинает с дешёвой модели и переключается на более мощную при устойчивом усложнении задачи. Настраиваемый маршрутизатор префилла обучается на остаточном потоке модели, чтобы предсказывать, какой кандидат успешно справится с задачей. Эталонный сервер принимает запросы OpenAI, Anthropic и Responses API.
Опубликованы два результата: LangChain протестировала 145 многошаговых агентных задач. Маршрутизация между Lightning и Claude Opus 4.8 с помощью маршрутизатора эскалации снизила стоимость на 74% по сравнению с базовым вариантом, использующим только фронтирную модель: 7% вызовов направлялись к фронтирной модели, при этом компромисс по точности составил примерно 6 процентных пунктов. Cognition реализовала поэтапную маршрутизацию в Devin Desktop. В FrontierCode Main маршрутизация между Opus 5 и Kimi K2.7 достигла результата 50,6% при средней стоимости $3.11 — в пределах 2,8 пункта от точности Opus 5 и при примерно на 28% меньшей средней стоимости.
Интерактивное объяснение
Основные выводы
- Открытая MoE-модель на 30 млрд параметров с 3 млрд активных параметров, контекстом в 1 млн токенов и лицензией OpenMDW-1.1, допускающей коммерческое использование.
- Скорость генерации до 4 раз выше; 10 000 задач PinchBench выполняются на 30% быстрее, чем у Qwen3.6 35B.
- Скорость обеспечивается предсказанием нескольких токенов, моделями-черновиками DSpark и DFlash, а также контрольной точкой NVFP4.
- Работает на 1x DGX Spark или 1x H100, а также локально через Ollama, LM Studio, llama.cpp и Unsloth.
- NeMo Switchyard снизила стоимость на 74% в бенчмарке LangChain из 145 задач при компромиссе по точности примерно в 6 процентных пунктов.
Попробуйте её на build.nvidia.com или OpenRouter, а веса скачайте с Hugging Face или ModelScope. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тысяч участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.