NVIDIA запускает Nemotron 3.5 Lightning с четырехкратной пропускной способностью

Компания NVIDIA представила открытую модель Nemotron 3.5 Lightning, предназначенную для выполнения рутинных вычислительных задач в системах автономных агентов. Новое решение направлено на снижение операционных расходов и уменьшение задержек при обработке длительных цепочек действий.

NVIDIA запускает Nemotron 3.5 Lightning с четырехкратной пропускной способностью

Модель построена на архитектуре смеси экспертов (Mixture-of-Experts): при общем объеме в 30 миллиардов параметров для обработки каждого токена активируется только 3 миллиарда. По заявлению разработчиков, это позволяет сохранить вычислительную мощность, сопоставимую с меньшими моделями, при сохранении возможностей более крупных систем.

Nemotron 3.5 Lightning ориентирована на исполнительный уровень работы агентов — этап, на котором системы многократно обращаются к инструментам, проверяют результаты, выполняют команды и распределяют подзадачи. Разработчики могут использовать данную модель для стандартных операций, оставляя более ресурсоемкие модели для стратегического планирования и сложных решений.

Модель поддерживает локальное развертывание, в том числе на системах NVIDIA DGX Spark, Jetson и видеокартах GeForce RTX 5090, а также может быть установлена в дата-центрах, что позволяет выполнять интенсивные вычисления ближе к источникам данных.

Выпуск Nemotron 3.5 Lightning соответствует тренду на создание многомодельных систем, где функции разделены между специализированными решениями. В процессе обучения использовались популярные агентные фреймворки, включая OpenClaw и Hermes Agent, что, по данным NVIDIA, повышает точность выбора инструментов и сокращает задержки при повторяющихся операциях.

Модель распространяется с открытым доступом: опубликованы весовые коэффициенты, обучающие наборы данных и рецепты под лицензией OpenMDW-1.1. Разработчики могут дообучать модель с помощью инструментов NVIDIA NeMo или проводить оценку через обучение с подкреплением.

Nemotron 3.5 Lightning способна генерировать в четыре раза больше токенов по сравнению с аналогами аналогичного размера. На бенчмарке PinchBench она показала точность 86% при выполнении 10 000 задач, при этом скорость обработки была на 30% выше, чем у Qwen3.6 35B при сопоставимом уровне точности.

Модель поддерживает спекулятивное декодирование и многотокеновое прогнозирование. Для различных сценариев вывода предоставлены две дополнительные черновые модели — DSpark и DFlash.

В рамках анонса также представлена библиотека маршрутизации NVIDIA NeMo Switchyard, предназначенная для распределения запросов между моделями в зависимости от сложности. Сложные задачи могут направляться на мощные модели логического вывода, тогда как стандартные операции обрабатываются Nemotron 3.5 Lightning. Такой подход, по мнению разработчиков, позволяет сократить использование дорогостоящих вычислительных ресурсов в системах, выполняющих тысячи мелких действий в течение длительного времени.

Новая модель интегрируется с рядом платформ и сервисов, включая Ollama, LM Studio, Amazon SageMaker JumpStart, Google Cloud, Microsoft Foundry и Oracle Cloud Infrastructure. Загрузить Nemotron 3.5 Lightning можно через Hugging Face и ModelScope, а также получить доступ через платформы NVIDIA и OpenRouter.

Читайте также: Grok Bot Илона Маска получает доступ к виртуальному ПК для выполнения задач без участия человека

Что будем искать? Например,ChatGPT

Мы в социальных сетях