Skip to content
Nvidia представила открытую модель Nemotron 3.5 Lightning для локальных ИИ-агентов
13 августа 09:01 48 Просмотров Новости

Nvidia представила открытую модель Nemotron 3.5 Lightning для локальных ИИ-агентов

Компания Nvidia анонсировала выпуск открытой языковой модели Nemotron 3.5 Lightning, оптимизированной для работы автономных ИИ-агентов на локальном оборудовании. Главная особенность новинки — способность функционировать на единственном GPU, установленном в ноутбуке, настольном ПК или рабочей станции, что делает её доступной для широкого круга разработчиков и корпоративных клиентов. модель Nemotron 3.5 Lightning

Архитектура и технические характеристики

Nemotron 3.5 Lightning построена на гибридной архитектуре, сочетающей схему смеси экспертов (Mixture of Experts, MoE) с механизмами Mamba-2 и Attention. Общий объём модели составляет 30 миллиардов параметров, однако для обработки каждого токена активируется лишь 3 миллиарда (формат 30B-A3B). Такой подход обеспечивает производительность большой модели при вычислительных затратах компактной.

Контекстное окно модели поддерживает до 1 миллиона токенов. Файлы весов занимают около 20 ГБ и оптимизированы для работы в низкоточных форматах NVFP4 и BF16, что экономит видеопамять и ускоряет инференс. Модель способна запускаться на локальных системах уровня GeForce RTX 5090, а также на платформах DGX Spark и Jetson. архитектура Mixture of Experts Nemotron 3.5 Lightning

Производительность и бенчмарки

Ключевым приоритетом разработчиков стала скорость генерации. По внутренним тестам Nvidia, Nemotron 3.5 Lightning выдаёт до четырёхкратное превосходство в скорости вывода по сравнению с аналогичного размера решениями. В бенчмарке PinchBench, ориентированном на массовое выполнение агентских задач, модель достигла точности 86% и обработала очередь из 10 тысяч заданий на 30% быстрее конкурента Qwen3.6 35B при сопоставимом качестве.

Однако в сложных сценариях программирования результаты более скромны. В тестах на исправление ошибок в реальных проектах Nemotron 3.5 Lightning решила около 52% задач, тогда как Qwen3.6 справилась примерно с 70%, а Gemma 4 — с 57%. Nvidia честно указывает, что показатели получены в собственных тестах и требуют независимой верификации. тест производительности Nemotron 3.5 Lightning против Qwen3.6

Технологии ускорения: спекулятивное декодирование

Для достижения высокой скорости Nvidia заложила в обучение механизм многотокенового предсказания (Multi-Token Prediction) и предлагает использовать специализированные вспомогательные модели для спекулятивного декодирования. В роли «черновиков» выступают две модели-помощника: DSpark и DFlash. Они быстро генерируют несколько следующих токенов, а основная модель затем верифицирует и корректирует предсказания. Этот подход существенно сокращает латентность при сохранении качества генерации.

Экосистема: маршрутизатор NeMo Switchyard

Параллельно с моделью Nvidia представила библиотеку NeMo Switchyard — систему интеллектуальной маршрутизации запросов. Она позволяет строить композитные конвейеры, где Nemotron 3.5 Lightning выполняет рутинные, высоковольные операции (вызов инструментов, написание шаблонного кода, валидация), а более мощные и медленные модели подключаются только для сложного логического планирования и принятия решений. Такой подход оптимизирует затраты вычислительных ресурсов в продакшн-среде. система маршрутизации NeMo Switchyard

Открытость, дообучение и доступность

Nvidia публикует не только веса модели, но и полное описание обучающих данных, рецепты тренировки и инструкции по развёртыванию. Корпоративные клиенты могут свободно скачивать, использовать и модифицировать Nemotron 3.5 Lightning без согласования с вендором. Модель поддерживает дополнительное дообучение (fine-tuning) на проприетарных данных компании, внутренних инструментах и регламентах. В комплект поставки входит открытый датасет Nemotron-RL Agentic Terminal Pivot для обучения агентским сценариям, включая программирование.

Скачать модель можно на Hugging Face и ModelScope, протестировать — через сервисы Nvidia, OpenRouter, а также локально через Ollama и LM Studio. Интеграция доступна в Amazon SageMaker JumpStart и Google Cloud.

Стратегический контекст и планы

Релиз Nemotron 3.5 Lightning вписывается в широкую стратегию Nvidia по продвижению открытых ИИ-моделей. В конце июля основатель и CEO Дженсен Хуанг публично поддержал концепцию открытых весов, заявив, что «бесплатный ИИ пойдёт на пользу аппаратному обеспечению и чипам». Компания вступила в консорциум вместе с Microsoft для продвижения открытых решений в сфере кибербезопасности. Позиция Nvidia находит отклик у других крупных игроков: за день до анонса Meta выпустила сопоставимую по размеру локальную модель Muse Glimmer 30B (17 ГБ, запускачится на 24 ГБ памяти).

Следующим крупным этапом станет Nemotron 4: по данным Reuters, Nvidia разрабатывает модель масштабом более триллиона параметров и планирует представить её до конца осени 2026 года. Таким образом, Nvidia формирует полноценную экосистему, где собственные модели, инструменты оркестрации и программное обеспечение стимулируют спрос на видеокарты и ускорители собственного производства.

Поделиться

Похожие публикации