Nvidia раскрыла детали процессора Vera с 88 ядрами Olympus и памятью LPDDR5X на скорости 1,2 Тбайт/с
Новый серверный процессор Nvidia Vera
Nvidia опубликовала подробные архитектурные особенности своего серверного процессора Vera, который станет основой платформы следующего поколения Vera Rubin. Чип объединяет 88 специально разработанных ARM-ядер Olympus, 176 потоков и унифицированный кеш L3 объёмом 164 Мбайт на монолитном вычислительном кристалле. 
Архитектура ядра Olympus
Каждое ядро Olympus построено на основе спецификаций Arm v9.2 и включает широкий конвейер с нейронным предсказателем ветвлений, 64-килобайтный четырёхканальный кеш инструкций L1 и очередь декодирования на 48 инструкций. Ядро способно считывать до 16 инструкций за такт и обрабатывать десять объединённых инструкций за такт с помощью 10-канального декодера.
Исполнительный блок поддерживает целочисленные операции, операции ветвления, векторные операции, операции с плавающей запятой, криптографические операции, а также выделенные ресурсы для загрузки и сохранения данных. Каждое ядро может переименовывать, выделять и фиксировать до десяти микроопераций за такт. Для снижения задержек используются технологии переименования памяти, предсказания значений и исключения перемещений.
Память и кеш
Каждое ядро располагает 96-килобайтным шестиканальным кешем данных L1 и 2-мегабайтным восьмиканальным кешем L2. Помимо траадиционной предварительной выборки, реализована предварительная выборка графов для структур данных с большим количеством указателей и рабочих нагрузок, связанных с обработкой графов. 
Технология пространственной многопоточности
Процессор Vera использует фирменную технологию пространственной многопоточности, обеспечивающую два аппаратных потока на каждое ядро Olympus. Это позволяет распределять ресурсы ядра между потоками, уменьшая конкуренцию по сравнению с традиционной одновременной многопоточностью. Один поток может получать приоритет для высокой производительности, в то время как второй обрабатывает системные и управляющие задачи.
Инфраструктура соединений
Ядра процессора, кеш, контроллеры памяти и ввода-вывода соединены через масштабируable когерентную структуру Nvidia второго поколения. Пропускная способность между ядрами достигает до 3,4 Тбайт/с, а подсистема памяти SOCAMM2 LPDDR5X обеспечивает пропускную способность до 1,2 Тбайт/с с поддержкой до 1,5 Тбайт памяти на процессор. Vera поддерживает интерфейс NVLink-C2C со скоростью до 1,8 Тбайт/с, PCIe 6.0 и CXL 3.1. 
Производительность в ИИ-задачах
Компания заявляет, что процессор Vera обеспечивает до 1,8 раза более высокую производительность, чем неназванные системы x86, в рабочих нагрузках, связанных с работой ИИ-агентов. Ядра Olympus демонстрируют до 1,5-кратный прирост производительности на одно ядро по сравнению с традиционными x86-решениями при максимальной загрузке сокета. Каждому ядру доступна полоса до 14 Гбит/с, что примерно в 3 раза выше, чем у традиционных серверных CPU.
Системы с двумя сокетами обеспечивают 176 линий PCIe и используют двухузловую конфигурацию NUMA — по одному домену NUMA на каждый сокет. Процессоры спроектированы для максимальной энергоэффективности, что позволит центрам обработки данных работать с меньшим тепловыделением и расходом электроэнергии.