Nvidia выпустила открытую модель Nemotron 3.5 Lightning для работы ИИ-агентов на одном GPU
Nvidia представила Nemotron 3.5 Lightning — открытую модель с 30 миллиардами параметров, созданную для ускорения работы ИИ-агентов и способную работать на вычислительных ресурсах единственного GPU, установленного в ноутбуке или настольном ПК. Компания позиционирует новинку как экономичное решение для рутинных задач, программирования и вызова инструментов в связке с более мощными моделями и системой маршрутизации. Корпоративные клиенты могут свободно скачивать модель, использовать её и модифицировать без согласования с Nvidia.
Архитектура и технические особенности
Nemotron 3.5 Lightning относится к архитектуре Mixture of Experts (MoE). Общий объём модели составляет 30 млрд параметров, однако для обработки каждого токена активируется лишь 3 млрд. Такой подход позволяет существенно снизить вычислительные затраты по сравнению с полноразмерными моделями. Файлы модели занимают около 20 ГБ, что делает возможным запуск на потребительских и профессиональных видеокартах, включая GeForce RTX 5090, а также на платформах DGX Spark и Jetson.
Ускорение инференса достигается за счёт спекулятивного декодирования и низкоточных форматов данных. При спекулятивном декодировании вспомогательная модель быстро предсказывает несколько следующих токенов, а основная модель проверяет и подтверждает или исправляет их. Nvidia предлагает DFlash и DSpark в качестве черновиков для разных сценариев. Формат NVFP4 позволяет обрабатывать данные с меньшей точностью, экономя ресурсы и память, а BF16 обеспечивает компромисс между скоростью и качеством.
Производительность в тестах
В внутреннем тесте PinchBench на массовое выполнение агентских задач Nemotron 3.5 Lightning достигла точности около 86% и выполнила очередь из 10 тысяч заданий на 30% быстрее, чем Qwen3.6 35B, при сопоставимом качестве. Nvidia заявляет, что модель обрабатывает задачи до четырёх раз быстрее аналогичных по размеру решений, однако эти показатели получены в собственных тестах компании и требуют независимой проверки.
В более сложных задачах по программированию новинка уступила конкурентам. В тестах Nvidia на исправление ошибок в реальных проектах Nemotron решила около 52% заданий. Для сравнения: Qwen3.6 справилась примерно с 70%, а Gemma 4 — с 57%.
Позиционирование в много-модельных системах
Nvidia предлагает использовать Lightning не как замену наиболее мощным моделям, а как часть системы из нескольких моделей. В такой архитектуре сложные модели отвечают за планирование и принятие решений, а компактная Lightning — за выполнение большого количества простых операций: вызов инструментов, написание кода, обработку рутинных задач.
Для автоматического распределения запросов компания представила маршрутизатор NVIDIA NeMo Switchyard. Эта система определяет в реальном времени, какую модель лучше использовать для конкретного запроса, направляя сложные задачи более мощным моделям, а рутинные — Lightning.
Открытость и дообучение
Nvidia опубликовала не только веса модели, но и описание использованных данных, рецепты обучения и инструкции по запуску. Модель можно дополнительно обучать на данных компании, её инструментах и внутренних правилах. В комплект поставки входит открытый набор данных Nemotron-RL Agentic Terminal Pivot, предназначенный для обучения агентским сценариям, включая программирование.
Nemotron 3.5 Lightning доступна для загрузки через Hugging Face и ModelScope, а также для тестирования через сервисы Nvidia и OpenRouter. Уже протестировали и адаптировали модель для своих нужд компании CrowdStrike, CodeRabbit и Harvey.
Стратегия Nvidia и планы на будущее
Релиз вписывается в более широкую стратегию Nvidia по развитию открытых ИИ-моделей. Основатель и генеральный директор Дженсен Хуанг в конце июля выступил в поддержку моделей с открытым исходным кодом, заявив, что «бесплатный ИИ пойдёт на пользу аппаратному обеспечению и чипам». По его мнению, такие модели позволяют компаниям лучше контролировать своё будущее, стимулируют конкуренцию, снижают цены и усиливают кибербезопасность и суверенитет стран. Nvidia присоединилась к консорциуму вместе с Microsoft для продвижения открытых моделей в сфере кибербезопасности.
Компания стремится конкурировать не только с закрытыми системами вроде OpenAI и Anthropic, но и с открытыми китайскими моделями Qwen, DeepSeek и Kimi. Следующим крупным релизом должна стать Nemotron 4: по данным Reuters, Nvidia разрабатывает модель с более чем триллионом параметров и рассчитывает выпустить её до конца осени.