NVIDIA представила процессор Vera с 88 собственными ядрами Olympus для ИИ-агентов
NVIDIA раскрыла подробности архитектуры серверного процессора Vera, который станет центральным элементом платформы Vera Rubin для дата-центров и ИИ-инфраструктуры. Чип получил 88 кастомных Arm-ядер Olympus, поддержку до 1,5 ТБ памяти, интерфейсы NVLink-C2C, PCIe 6.4 и CXL 3.1, а также специализированные оптимизации для agentic AI, научных расчётов и reinforcement learning. 
Архитектура ядер Olympus: разработка с нуля
Ключевым элементом Vera являются ядра Olympus — собственная разработка NVIDIA на базе ISA ARMv9.2, а не лицензированные Arm Neoverse, как в предыдущем процессоре Grace. Каждый чип Vera включает 88 ядер с поддержкой пространственной многопоточности (по 2 потока на ядро), что даёт 176 физических потоков. Объединённый L3-кэш составляет 164 МБ, L2-кэш — 2 МБ на ядро, L1 instruction cache — 64 КБ, L1 data cache — 96 КБ.
Конвейер выборки способен передавать до 16 инструкций за такт (128 байт) из L1-кэша в очередь декодирования длиной 48 инструкций. 10-канальный декодер обрабатывает до 10 fuse-инструкций за цикл. На исполнении работают 18 конвейеров: 8 целочисленных, 6 векторных с поддержкой FP8 и 4 конвейера загрузки-выгрузки. Ядро способно переименовывать до 10 микроопераций за цикл, не отставая от декодера. NVIDIA не раскрывает размер буфера переупорядочивания и регистровых файлов. 
Оптимизация под агентные ИИ-нагрузки
Ядро Olympus ориентировано на максимизацию IPC (инструкций за такт) для высококонкурентных рабочих нагрузок ИИ. В него интегрирован нейросетевой предсказатель ветвлений, оценивающий две ветки за такт, и аппаратный graph prefetcher — механизм предварительной загрузки данных для графовых и аналитических структур. Такие задачи характерны для агентных ИИ-систем, где память читается не последовательно, а скачками по указателям (деревья, графы).
Реализовано переименование памяти (по аналогии с переименованием регистров, как в последних AMD), позволяющее выполнять зависимые инструкции store-to-load ещё до завершения загрузки, если взаимосвязь данных предсказуема. Olympus выявляет стабильно повторяющиеся последовательности инструкций и данных, расширяя спекулятивное исполнение. Динамический планировщик управляет широким набором исполнительных блоков для целочисленных и векторных операций, ветвлений, криптографии, загрузки и выгрузки данных. 
Подсистема памяти и межсоединения
Vera поддерживает масштабную подсистему памяти: до 1,5 ТБ LPDDR5X-9600 через модули SOCAMM2 с совокупной пропускной способностью до 1,2 ТБ/с на кристалл. Внутренняя шина Scalable Coherency Fabric обеспечивает 3,4 ТБ/с core-to-core. Для связи с ускорителями используется NVLink-C2C со скоростью 1,8 ТБ/с. Периферия представлена PCIe 6.4 и CXL 3.1.
Процессор поддерживает двухсокетное масштабирование: каждый сокет предоставляет до 176 линий PCIe Gen 6. Для снижения задержек в двухсокетных конфигурациях применяется программный подход к NUMA-топологии — каждый сокет представляется как один NUMA-домен, формируя понятную двухузловую структуру. 
Сравнение с Grace и перспективы поставок
Формально Vera наследует место Grace, но разница в характеристиках существенна. Grace имел 72 ядра на архитектуре Arm Neoverse V2 и до 512 ГБ/с пропускной способности памяти. Vera предлагает 88 собственных ядер и до 1,2 ТБ/с — более чем двукратный рост. Первые публикации SPEC CPU 2026 подтверждают преимущество в однопоточных сценариях, хотя не по всем тестам оно очевидно.
NVIDIA впервые показала Vera на CES в январе 2026 года, а подробную архитектуру и тесты раскрыла в июле. Дата начала серийных поставок серверов на Vera не названа — процессор выйдет вместе с платформой Vera Rubin, массовое производство которой ориентировочно начнётся не раньше конца 2026 или 2027 года. Верхняя граница теплового пакета составляет 450 Вт на процессор, что требует усиленного питания и жидкостного охлаждения, а не типового воздушного шкафа.