AMD EPYC 9006 Venice SP7 — обзор серии процессоров

AMD EPYC 9006 Venice — шестое поколение серверных процессоров EPYC и первая серверная серия AMD на архитектурах Zen 6 и Zen 6c. Главная платформа поколения получила сокет SP7, до 256 физических ядер и 512 потоков на один процессор, 16 каналов памяти, поддержку DDR5-8000 и MRDIMM-12800, интерфейс PCI Express 6.0 и максимальную расчётную мощность 600 Вт.

AMD EPYC 9006 Venice SP7: серверные процессоры Zen 6 и Zen 6c для AI, облаков, HPC и виртуализации

Это не обновление отдельных моделей внутри прежней платформы SP5, а полноценная смена серверной архитектуры. Для EPYC 9006 требуются новые материнские платы SP7, новый прижимной механизм, обновлённая подсистема питания и серверное шасси, рассчитанное на процессоры с тепловым пакетом до 600 Вт. Установить Venice в сервер с EPYC 9004 Genoa или EPYC 9005 Turin нельзя.

Серия разделена на несколько направлений:

  • EPYC 9006 SP7 для самых производительных одно- и двухсокетных серверов;

  • EPYC 9006 SP8 для более компактных и экономичных платформ;

  • EPYC 9006X SP7 с увеличенным объёмом 3D V-Cache;

  • EPYC 9006 LP для специализированных узлов, обслуживающих крупные GPU-кластеры.

В этом обзоре рассматривается именно семейство AMD EPYC 9006 SP7. В него входят девять опубликованных моделей с 64–256 ядрами. Высокоплотные процессоры используют компактные ядра Zen 6c, а высокочастотные варианты построены на полноразмерных Zen 6. Максимальная частота достигает 5 ГГц, кэш L3 — 1024 МБ, а паспортная пропускная способность памяти при установке MRDIMM-12800 составляет 1638 ГБ/с на сокет.

Выход Venice также меняет само позиционирование серверного CPU. EPYC 9006 предназначен не только для традиционных баз данных, виртуальных машин, веб-сервисов и HPC. AMD продвигает семейство как основу инфраструктуры для агентных систем искусственного интеллекта. Процессор обслуживает подготовку данных, планирование задач, сетевые операции, векторный поиск, базы данных, исполнение вспомогательного кода и передачу данных к ускорителям.

На 28 июля 2026 года линейка официально представлена, серийное производство начато, но массовая доступность SP7-систем назначена на четвёртый квартал 2026 года. Полноценные независимые тесты серийных серверов ещё не опубликованы. Доступные результаты получены AMD на предварительных платформах, поэтому их нельзя смешивать с независимыми измерениями Phoronix, ServeTheHome или других лабораторий. Phoronix уже подтвердил подготовку самостоятельного тестирования без ограничений на выбор нагрузок, фиксацию частот и измерение энергопотребления.

Где купить AMD EPYC 9006 Venice SP7

AMD EPYC 9006 относится к корпоративным серверным комплектующим и не рассчитан на обычный розничный канал. На момент проверки отдельные процессоры Venice SP7 отсутствуют в продаже на AliExpress, в Ситилинке и на Яндекс Маркете. Магазины не опубликовали карточки EPYC 9996, 9966, 9846, 9756, 9G76, 9656, 9686F, 9556 и 9586F.

В таблице приведены прямые страницы поиска по каждой модели. После начала массовых поставок они будут показывать появившиеся предложения без изменения адреса. В колонке с ценой указана официальная стоимость AMD при заказе партии из 1000 процессоров. Это не розничная цена одного экземпляра: конечная стоимость у интегратора включает логистику, налоги, наценку дистрибьютора, поддержку и условия гарантии.

Ситилинк продаёт отдельные серверные процессоры AMD EPYC прежних поколений, но раздел AMD пока не содержит Venice. Поэтому отсутствие карточки относится именно к EPYC 9006, а не ко всей серверной продукции AMD.

На AliExpress сразу после появления нового поколения обычно встречаются инженерные образцы, процессоры с удалённой маркировкой и экземпляры, привязанные к OEM-платформе через AMD Secure Boot. Для SP7 риск особенно высок: серийный процессор стоит дорого, а проверить его без соответствующей материнской платы невозможно.

Перед покупкой требуется проверить:

  • полное название модели;

  • артикул Tray;

  • серийный статус процессора;

  • отсутствие обозначений ES и QS;

  • совместимость с конкретной ревизией BIOS;

  • поддержку 600-ваттных моделей подсистемой питания;

  • привязку AMD Secure Boot к производителю сервера;

  • гарантию продавца;

  • условия возврата;

  • наличие подходящей рамки и системы охлаждения.

EPYC 9006 SP7 не устанавливается в ноутбуки. Готовые системы на Venice выпускаются только в серверном исполнении: 1U, 2U, 4U, многосерверные шасси, GPU-узлы и стоечные комплексы. AMD называет среди партнёров Dell, Supermicro, HPE, Lenovo и Cisco. Gigabyte и ASRock Rack уже открыли страницы платформ EPYC 9006, но полноценный каталог серийных конфигураций формируется к началу массовых поставок.

Полный модельный ряд AMD EPYC 9006 Venice SP7

В состав SP7-линейки входят девять моделей. Все они поддерживают один или два процессорных сокета, 16 каналов DDR5, RDIMM-8000, MRDIMM-12800, AMD Infinity Guard и PCI Express 6.0. Различия сосредоточены в типе ядер, их количестве, частотах, объёме кэша, мощности и цене.

Модель Архитектура Ядра / потоки Базовая частота Boost L3 Мощность Цена 1kU Tray ID
AMD EPYC 9996 Zen 6c 256 / 512 2,55 ГГц 4,1 ГГц 1024 МБ 600 Вт 14 904 доллара 100-000001041
AMD EPYC 9966 Zen 6c 192 / 384 2,9 ГГц 4,0 ГГц 768 МБ 600 Вт 14 079 долларов 100-000002189
AMD EPYC 9846 Zen 6c 168 / 336 2,85 ГГц 3,7 ГГц 768 МБ 500 Вт 13 114 долларов 100-000001044
AMD EPYC 9756 Zen 6c 128 / 256 3,15 ГГц 4,0 ГГц 512 МБ 500 Вт 12 498 долларов 100-000001046
AMD EPYC 9G76 Zen 6 96 / 192 3,4 ГГц 4,8 ГГц 384 МБ 500 Вт 11 622 доллара 100-000002120
AMD EPYC 9656 Zen 6c 96 / 192 3,05 ГГц 3,7 ГГц 512 МБ 400 Вт 9713 долларов 100-000001048
AMD EPYC 9686F Zen 6 96 / 192 3,4 ГГц 5,0 ГГц 384 МБ 500 Вт 11 434 доллара 100-000001644
AMD EPYC 9556 Zen 6 64 / 128 2,75 ГГц 4,3 ГГц 384 МБ 300 Вт 8008 долларов 100-000001647
AMD EPYC 9586F Zen 6 64 / 128 3,75 ГГц 5,0 ГГц 384 МБ 500 Вт 9701 доллар 100-000001645

AMD EPYC 9996

EPYC 9996 — флагман Venice SP7 и самый плотный одночиповый серверный процессор AMD на момент анонса. Он содержит 256 ядер Zen 6c, обрабатывает 512 потоков, работает на базовой частоте 2,55 ГГц и разгоняется до 4,1 ГГц. Объём L3 составляет 1024 МБ.

Модель предназначена для максимальной консолидации виртуальных машин, контейнерных платформ, фронтендов, микросервисов, параллельной компиляции, CPU-инференса, векторного поиска и массового исполнения независимых задач. В двухсокетной системе доступно 512 физических ядер и 1024 аппаратных потока.

AMD EPYC 9966

EPYC 9966 сохраняет 600-ваттный лимит, но содержит 192 ядра Zen 6c. Его базовая частота выше, чем у 9996: 2,9 ГГц против 2,55 ГГц. Кэш L3 уменьшен до 768 МБ.

Эта модель занимает промежуточное положение между абсолютной плотностью и производительностью одного ядра. Для приложений, которые не масштабируются до 256 ядер на сокет, 9966 обеспечивает более высокий частотный запас при сохранении 384 потоков.

AMD EPYC 9846

EPYC 9846 получил 168 ядер, 336 потоков, 768 МБ L3 и мощность 500 Вт. Он дешевле 9966 и снижает требования к питанию и охлаждению. Модель подходит для высокоплотной виртуализации, облачных платформ и пакетных вычислений, где 192–256 ядер не используются полностью.

AMD EPYC 9756

EPYC 9756 содержит 128 ядер Zen 6c, 512 МБ L3 и работает на базовой частоте 3,15 ГГц. Это самая высокая базовая частота среди плотных SP7-моделей. Процессор ориентирован на универсальные двухсокетные серверы, аналитические системы и HPC-нагрузки, которым важен баланс числа ядер, частоты и пропускной способности памяти.

AMD EPYC 9G76

EPYC 9G76 — 96-ядерный Zen 6 с базовой частотой 3,4 ГГц, Boost до 4,8 ГГц и кэшем L3 объёмом 384 МБ. Он находится рядом с 9686F, но имеет более низкий максимальный Boost. Название выделяет модель из стандартной цифровой схемы и подчёркивает её роль в высокопроизводительных узлах общего назначения и AI-инфраструктуре.

AMD EPYC 9656

EPYC 9656 — 96-ядерный вариант Zen 6c с 512 МБ L3 и мощностью 400 Вт. Он уступает высокочастотным 9G76 и 9686F в пиковой частоте, но потребляет на 100 Вт меньше и содержит больше кэша. Модель интересна для виртуализации, контейнеров, веб-нагрузок и вычислений с хорошим масштабированием по потокам.

AMD EPYC 9686F

EPYC 9686F содержит 96 ядер Zen 6 и достигает 5 ГГц. Буква F обозначает высокочастотную специализацию. Процессор рассчитан на лицензируемые по ядрам базы данных, EDA, финансовые вычисления, игровые серверы, инженерные приложения и AI-хосты, в которых время выполнения одного потока важнее максимального числа ядер.

AMD EPYC 9556

EPYC 9556 — младшая по числу ядер и мощности SP7-модель. Она содержит 64 ядра, 128 потоков, 384 МБ L3 и потребляет 300 Вт. При этом процессор сохраняет все 16 каналов памяти и интерфейс PCIe 6.0. В результате он подходит для систем, где требуются максимальная память и ввод-вывод, но отсутствует потребность в 96–256 ядрах.

AMD EPYC 9586F

EPYC 9586F сочетает 64 ядра, базовую частоту 3,75 ГГц и Boost до 5 ГГц. Это самая высокая базовая частота в SP7-линейке. Модель ориентирована на приложения с дорогим лицензированием на ядро, низколатентные базы данных, высокочастотный трейдинг, серверы симуляции, компиляцию крупных проектов и обслуживание GPU-ускорителей.

Как расшифровываются названия моделей

Система обозначений EPYC 9006 продолжает схему предыдущих поколений, но AMD расширяет её дополнительными буквенными индексами.

Последняя цифра 6 обозначает шестое поколение EPYC. В EPYC 9005 последняя цифра 5 указывала на пятое поколение, а в EPYC 9004 — на четвёртое.

Первые цифры отражают положение модели в линейке. EPYC 9996 располагается на вершине семейства, а EPYC 9556 — в нижней части SP7-каталога. Сравнивать модели только по первой паре цифр недостаточно: 9686F и 9656 имеют одинаковые 96 ядер, но используют разные варианты архитектуры, частоты и объёмы кэша.

Индекс F обозначает высокочастотную модель. Такие процессоры работают на повышенных базовых и максимальных частотах при меньшем числе активных ядер относительно максимально плотных продуктов. EPYC 9586F и 9686F достигают 5 ГГц.

Индекс P в семействе EPYC традиционно относится к моделям для односокетных систем. В первой опубликованной SP7-линейке P-вариантов нет: все девять процессоров поддерживают 1P и 2P. Односокетные P-модели присутствуют в ассортименте EPYC 9006 SP8.

Буква G в EPYC 9G76 используется для отдельного высокопроизводительного варианта. AMD не расшифровывает её как универсальный индекс, применимый ко всей линейке, поэтому трактовать G как фиксированное обозначение конкретной технологии нельзя.

Архитектура Zen 6 и Zen 6c

AMD использует две физические реализации одной архитектурной основы. Zen 6 рассчитан на высокую производительность одного ядра и повышенные частоты. Zen 6c оптимизирован по площади кристалла и позволяет разместить больше ядер в пределах одного CCD и всего корпуса процессора.

Zen 6c не является урезанным набором инструкций. Он сохраняет совместимость x86-64, SMT и серверные функции семейства. Разница связана с плотностью физической реализации, частотным диапазоном, числом ядер на кристалле и тепловой оптимизацией.

Один полноразмерный CCD Zen 6 содержит до 12 ядер и 48 МБ L3. В процессоре устанавливается до восьми таких CCD, поэтому максимальная опубликованная конфигурация Zen 6 SP7 включает 96 ядер.

Один плотный CCD Zen 6c содержит до 32 ядер и 128 МБ L3. В EPYC 9996 используются восемь CCD, что даёт 256 ядер и 1024 МБ L3. На одно ядро приходится 4 МБ разделяемого кэша третьего уровня. Для сравнения, у плотного EPYC 9965 Turin Dense отношение L3 к числу ядер было ниже.

Zen 6 построена с расчётом на более широкий поток инструкций, высокую многопоточную загрузку и интенсивные векторные операции. Архитектура сохраняет SMT: каждое физическое ядро одновременно исполняет два программных потока. На 256-ядерном EPYC 9996 операционная система видит 512 логических процессоров, а на двухсокетной машине — 1024.

Высокая плотность особенно полезна при большом числе независимых работ:

  • виртуальных машин;

  • контейнеров;

  • процессов веб-сервера;

  • заданий компиляции;

  • пользователей терминальных сервисов;

  • потоков обработки данных;

  • агентов автоматизации;

  • независимых задач рендеринга;

  • CPU-инференса небольших моделей.

Zen 6 предпочтительнее в приложениях, где производительность ограничивается одним или несколькими тяжёлыми потоками. К ним относятся часть коммерческих СУБД, EDA, расчёты с последовательными участками, симуляторы, серверная логика игр и управляющие процессы GPU-кластера.

Чиплетная компоновка Venice

Venice сохраняет модульную философию EPYC, но существенно меняет масштаб кристаллов. Вычислительные CCD выпускаются по технологическому процессу TSMC N2. В топовой конфигурации используются восемь 32-ядерных CCD Zen 6c и два кристалла ввода-вывода.

Переход к двум I/O-кристаллам связан с увеличением числа каналов памяти, пропускной способности Infinity Fabric и возможностей ввода-вывода. Один центральный I/O-кристалл прежних EPYC должен был обслуживать все вычислительные чиплеты, память и PCIe. В SP7 нагрузка распределяется между двумя крупными блоками ввода-вывода.

Физическая компоновка влияет на программную оптимизацию. Ядро обращается к локальному L2 быстрее, чем к L3 на своём CCD, а доступ к данным в другом домене памяти занимает больше времени. Поэтому EPYC 9006 требует правильной NUMA-настройки.

Для серверной нагрузки важны четыре уровня локальности:

  1. поток и его частный кэш L1/L2;

  2. ядра одного CCD и общий сегмент L3;

  3. память, непосредственно связанная с локальным I/O-доменом;

  4. память другого процессорного сокета.

Неправильная привязка потоков создаёт ситуацию, когда процесс активно использует память и кэш удалённого домена. При этом возрастает нагрузка на межкристальные соединения, увеличивается задержка и снижается полезная пропускная способность.

При развёртывании баз данных, JVM, NUMA-чувствительных HPC-кодов и виртуальных машин требуется согласованно настраивать:

  • CPU affinity;

  • привязку памяти;

  • количество NUMA-узлов;

  • размер виртуальной машины;

  • распределение сетевых очередей;

  • размещение NVMe-контроллеров;

  • связь GPU с локальным CPU;

  • параметры Huge Pages.

Кэш-память

Объём L3 стал одним из главных изменений Venice. Даже без 3D V-Cache флагман EPYC 9996 содержит 1024 МБ кэша третьего уровня. Это в 2,67 раза больше 384 МБ у EPYC 9965.

Модель Ядра L3 L3 на одно физическое ядро
EPYC 9996 256 1024 МБ 4 МБ
EPYC 9966 192 768 МБ 4 МБ
EPYC 9846 168 768 МБ около 4,57 МБ
EPYC 9756 128 512 МБ 4 МБ
EPYC 9G76 96 384 МБ 4 МБ
EPYC 9656 96 512 МБ около 5,33 МБ
EPYC 9686F 96 384 МБ 4 МБ
EPYC 9556 64 384 МБ 6 МБ
EPYC 9586F 64 384 МБ 6 МБ

Большой L3 снижает число обращений к оперативной памяти, но не заменяет её пропускную способность. Веб-сервер с большим числом независимых соединений, компилятор и виртуализация получают пользу от большого числа ядер и разделяемого кэша. CFD, потоковая аналитика и обход огромных массивов данных чаще ограничиваются памятью.

EPYC 9556 и 9586F особенно интересны по объёму L3 на ядро. При 64 ядрах они сохраняют 384 МБ, поэтому на одно физическое ядро приходится больше кэша, чем у 256-ядерного флагмана. Это полезно для лицензируемых по ядрам приложений и нагрузок с крупным рабочим набором на поток.

EPYC 9006X расширит объём кэша за счёт 3D V-Cache. Для Venice-X опубликована конфигурация до 96 ядер и 1152 МБ L3, но эти модели относятся к отдельной ветви и выходят позже стандартных SP7-процессоров.

Новый сокет SP7 и серверная платформа

SP7 заменяет SP5 в верхнем сегменте серверов AMD. Новый разъём требуется из-за 16-канального контроллера памяти, PCIe 6.0, увеличенной мощности и переработанной внутренней топологии.

Совместимость между сокетами отсутствует:

Поколение Платформа Память Максимум ядер
EPYC 9004 Genoa/Bergamo SP5 12-канальная DDR5 128
EPYC 9005 Turin/Turin Dense SP5 12-канальная DDR5 192
EPYC 9006 Venice SP7 16-канальная DDR5/MRDIMM 256

Замена EPYC 9005 на EPYC 9006 требует новой материнской платы. Также меняются расположение модулей памяти, конструкция радиатора, трассировка PCIe и требования к VRM. Серверный интегратор обязан сертифицировать конкретный процессор для конкретного шасси.

SP7 поддерживает односокетные и двухсокетные системы. Односокетная конфигурация рациональна при максимальной плотности одного EPYC 9996, поскольку уже один CPU предоставляет 256 ядер, 16 каналов памяти и большое число линий ввода-вывода. Двухсокетная машина нужна для 512 ядер, увеличенного объёма памяти и дополнительных устройств.

Односокетная система упрощает NUMA и снижает межпроцессорные задержки. Двухсокетная обеспечивает максимум совокупной производительности, но требует внимательного размещения памяти, сетевых интерфейсов, накопителей и ускорителей относительно каждого CPU.

Подсистема оперативной памяти

Каждый EPYC 9006 SP7 содержит 16 каналов DDR5. Поддерживаются два класса модулей:

  • DDR5 RDIMM со скоростью до 8000 MT/s;

  • MRDIMM со скоростью до 12 800 MT/s.

Паспортная пропускная способность одного сокета составляет:

Тип памяти Скорость Каналы Теоретическая пропускная способность
DDR5 RDIMM 8000 MT/s 16 1024 ГБ/с
MRDIMM 12 800 MT/s 16 1638 ГБ/с

Расчёт основан на передаче 8 байт за такт на канал. Для DDR5-8000 один канал даёт 64 ГБ/с, а шестнадцать каналов — 1024 ГБ/с. MRDIMM-12800 повышает показатель одного канала до 102,4 ГБ/с и всего сокета до 1638,4 ГБ/с. Паспортные значения округляются до 1024 и 1638 ГБ/с.

У Turin было 12 каналов DDR5-6400. Теоретическая пропускная способность такой конфигурации составляла 614,4 ГБ/с. Таким образом, переход на обычную DDR5-8000 увеличивает пиковый показатель примерно на 67%, а MRDIMM-12800 — примерно в 2,67 раза.

MRDIMM объединяет несколько рангов через буфер и позволяет контроллеру параллельно обращаться к ним. Для процессора модуль выглядит как более быстрый канал. Технология особенно полезна в приложениях, которые стабильно читают и записывают большие массивы данных.

К таким нагрузкам относятся:

  • векторные базы данных;

  • аналитические СУБД;

  • CFD;

  • расчёты методом конечных элементов;

  • молекулярная динамика;

  • подготовка данных для GPU;

  • CPU-инференс;

  • обработка медиаконтента;

  • большие кэши приложений;

  • системы in-memory.

Максимальная скорость достигается при симметричном заполнении всех шестнадцати каналов. Установка восьми модулей оставляет половину каналов пустыми и резко снижает доступную полосу. Для двухсокетного сервера минимальная сбалансированная конфигурация включает по 16 модулей на процессор.

Практические схемы:

Сервер Модули Общий объём Назначение
1P, 16 × 64 ГБ 16 1 ТБ универсальные задачи
1P, 16 × 128 ГБ 16 2 ТБ виртуализация и базы данных
1P, 16 × 256 ГБ 16 4 ТБ in-memory и аналитика
2P, 32 × 128 ГБ 32 4 ТБ двухсокетная виртуализация
2P, 32 × 256 ГБ 32 8 ТБ крупные СУБД и HPC

Фактическая поддержка конкретной ёмкости определяется материнской платой, BIOS и квалификационным списком производителя. Нельзя смешивать RDIMM и MRDIMM в одной системе. Также не следует покупать память до публикации списка сертифицированных модулей для выбранного сервера.

После сборки необходимо провести длительный тест всех каналов и проверить журнал ECC.

PCI Express 6.0, CXL и подключение ускорителей

Venice стал первым EPYC с PCI Express 6.0. Удвоение скорости относительно PCIe 5.0 особенно важно для GPU, сетевых адаптеров, DPU, коммутаторов и NVMe следующего поколения.

Спецификации отдельных моделей указывают PCIe 6.0 x96. Архитектурные материалы описывают до 128 линий в односокетной конфигурации и до 160 доступных линий в двухсокетном сервере. Разница связана с распределением высокоскоростных портов между обычным PCIe, межпроцессорным соединением и функциями платформы. Конкретная материнская плата выводит только предусмотренную разработчиком конфигурацию.

PCIe 6.0 передаёт вдвое больше данных на линию, чем PCIe 5.0. Слот x16 получает теоретическую двунаправленную полосу, достаточную для ускорителей следующего поколения без необходимости расширять физический интерфейс.

Типичная AI-платформа распределяет линии между:

  • восемью GPU;

  • двумя или четырьмя сетевыми адаптерами 400/800 Гбит/с;

  • DPU;

  • NVMe-корзинами;

  • PCIe-коммутаторами;

  • служебными контроллерами.

Для обычного сервера виртуализации приоритет другой:

  • несколько NVMe-накопителей;

  • два независимых сетевых адаптера;

  • контроллер хранения;

  • резервный сетевой интерфейс;

  • платы ускорения шифрования или обработки трафика.

Платформа также поддерживает CXL 3.1. CXL использует физический уровень PCIe и добавляет когерентный доступ к памяти и устройствам. Это позволяет подключать расширители памяти, специализированные ускорители и будущие пулы ресурсов.

Наборы инструкций и вычислительные функции

EPYC 9006 сохраняет полную x86-64-совместимость и запускает существующее серверное программное обеспечение без перехода на другую архитектуру. Это одно из главных отличий Venice от Nvidia Vera и Arm AGI.

Zen 6 поддерживает современные векторные и криптографические инструкции. Для серверных вычислений особенно важны:

  • AVX;

  • AVX2;

  • AVX-512;

  • операции FP64 и FP32;

  • FP16 и BF16;

  • VNNI;

  • инструкции AES;

  • SHA;

  • векторные перестановки;

  • операции над масками;

  • ускорение целочисленных вычислений.

AVX-512 используется в HPC, машинном обучении, базах данных, компрессии, криптографии, обработке изображений и видео. Реальная прибавка зависит от компилятора и качества векторизации. Приложение без оптимизированного кода не получает автоматического ускорения только из-за наличия AVX-512.

Intel Xeon 6 сохраняет важное преимущество в виде AMX — матричных блоков для AI-операций. EPYC отвечает большим числом ядер, высокой пропускной способностью памяти и сильной универсальной векторной производительностью. Поэтому итог зависит от конкретной библиотеки: код, оптимизированный под AMX и oneDNN, способен лучше работать на Xeon, а массово-параллельная x86-нагрузка без привязки к AMX часто выгоднее масштабируется на EPYC.

Для получения максимальной производительности применяются:

  • актуальный GCC;

  • LLVM Clang;

  • AMD Optimizing C/C++ Compiler;

  • оптимизированные BLAS-библиотеки;

  • ZenDNN;

  • профилирование AMD uProf;

  • настройка флагов -march;

  • Profile-Guided Optimization;

  • Link-Time Optimization.

Default CPU Power, энергопотребление и охлаждение

Начиная с шестого поколения AMD использует термин Default CPU Power вместо исторического TDP. Он описывает мощность вычислительных и I/O-кристаллов при установленной целевой производительности.

Модель Default CPU Power
EPYC 9996 600 Вт
EPYC 9966 600 Вт
EPYC 9846 500 Вт
EPYC 9756 500 Вт
EPYC 9G76 500 Вт
EPYC 9656 400 Вт
EPYC 9686F 500 Вт
EPYC 9556 300 Вт
EPYC 9586F 500 Вт

600 Вт относится только к процессору. Полная система включает память, VRM, накопители, вентиляторы, сеть и ускорители. Односокетный сервер EPYC 9996 с 16–32 модулями памяти и NVMe способен потреблять значительно больше 1 кВт. Двухсокетная система получает 1200 Вт только на CPU.

Воздушное охлаждение 600-ваттного процессора требует:

  • серверного радиатора большой площади;

  • мощного фронтального потока;

  • высокой статической производительности вентиляторов;

  • точного воздушного кожуха;

  • контролируемой температуры на входе;

  • чистых фильтров и радиаторов;

  • отсутствия нештатных препятствий внутри корпуса.

В 1U такая мощность создаёт высокий уровень шума и жёсткие ограничения по температуре. Для постоянной полной загрузки более рациональны 2U, 4U и жидкостные системы прямого охлаждения.

В двухсокетной конфигурации с несколькими GPU жидкостное охлаждение становится частью проектирования стойки, а не дополнительной опцией. Необходимо учитывать температуру теплоносителя, расход, резервирование насосов, распределительный коллектор и возможность замены узла без остановки всего ряда.

EPYC 9556 выделяется 300-ваттным лимитом. Он сохраняет 16 каналов памяти и возможности SP7, но значительно снижает требования к охлаждению. Для универсального корпоративного сервера это одна из самых практичных моделей семейства.

Управление частотой и питанием

Максимальный Boost не означает, что все ядра постоянно работают на указанной частоте. Частота зависит от:

  • числа активных ядер;

  • типа инструкций;

  • температуры;

  • лимита мощности;

  • качества охлаждения;

  • параметров BIOS;

  • состояния памяти и ввода-вывода.

EPYC 9586F достигает 5 ГГц при ограниченной нагрузке, но его базовая частота 3,75 ГГц лучше описывает гарантированный класс производительности под длительной работой. EPYC 9996 имеет Boost 4,1 ГГц, однако при одновременной загрузке 256 ядер рабочая частота определяется 600-ваттным бюджетом.

Для Venice заявлены новые механизмы управления питанием FAST, UBPS и UPP. Их практическое влияние ещё предстоит измерить на серийных серверах. Phoronix отдельно отметил эти функции среди направлений будущего тестирования.

В BIOS серверов обычно доступны профили:

  • максимальной производительности;

  • сбалансированной работы;

  • экономии энергии;

  • минимальной задержки;

  • фиксированной NUMA-конфигурации;

  • оптимизации виртуализации;

  • HPC;

  • AI и GPU host.

Для базы данных профиль минимальной задержки часто полезнее максимальной экономии энергии. Для массовых контейнеров рационален сбалансированный режим. HPC требует тестирования нескольких вариантов, поскольку агрессивный Boost одного ядра не всегда увеличивает производительность всей задачи.

Безопасность и доверенная виртуализация

AMD EPYC 9006 входит в экосистему Infinity Guard. Для шестого поколения указаны:

  • AMD Secure Boot;

  • Transparent Secure Memory Encryption;

  • Shadow Stack;

  • Secure Encrypted Virtualization;

  • Encrypted State;

  • Secure Nested Paging;

  • Reverse Map Table Optimizations;

  • усиленный корень доверия AMD Secure Processor;

  • интегрированный Caliptra;

  • поддержка LMS для постквантовой защиты;

  • дополнительные меры против физических и побочных атак.

Secure Boot формирует аппаратный корень доверия для прошивки. TSME шифрует оперативную память всей системы. SEV использует отдельные криптографические секреты для виртуальных машин. SEV-ES защищает состояние регистров, а SEV-SNP добавляет контроль целостности памяти гостевой системы и защиту от атак со стороны скомпрометированного гипервизора.

Trusted I/O расширяет доверенную среду на совместимые PCIe-устройства через TDISP. Это важно для конфиденциальной виртуальной машины, которая работает не только с CPU и памятью, но и с GPU, сетевым адаптером или накопителем.

Функции безопасности активируются на нескольких уровнях:

  1. процессор;

  2. BIOS и прошивка платформы;

  3. BMC;

  4. гипервизор;

  5. гостевая операционная система;

  6. облачная система аттестации.

Наличие функции в процессоре не означает её автоматическую доступность в любом сервере. Производитель платформы должен включить и сертифицировать соответствующий режим. Для промышленного внедрения требуется проверять документацию OEM, версию BIOS и список поддерживаемых гипервизоров.

RAS и отказоустойчивость

Серверный процессор оценивается не только по скорости. Для постоянной эксплуатации важны обнаружение, локализация и обработка аппаратных ошибок.

Подсистема RAS охватывает:

  • ECC оперативной памяти;

  • журналирование исправляемых ошибок;

  • обработку неисправимых ошибок;

  • контроль кэша;

  • ошибки Infinity Fabric;

  • ошибки PCIe;

  • восстановление линий;

  • изоляцию неисправных ресурсов;

  • Machine Check Architecture;

  • взаимодействие с BMC;

  • прогнозирование отказов модулей памяти.

В сервере с несколькими терабайтами RAM единичные исправляемые ошибки неизбежно становятся статистически заметнее. Поэтому администратор отслеживает не только факт ECC-коррекции, но и скорость накопления ошибок на конкретном DIMM.

Для критических систем применяются:

  • резервные блоки питания;

  • RAID или программное распределённое хранение;

  • дублирование сетевых адаптеров;

  • кластер высокой доступности;

  • live migration;

  • резервные узлы;

  • автоматическое исключение проблемного сервера.

Двухсокетная конструкция сама по себе не обеспечивает отказоустойчивость. Отказ материнской платы, BMC или общей подсистемы питания останавливает оба процессора. Для настоящей высокой доступности нужны несколько физических серверов.

Поддерживаемое программное окружение

EPYC 9006 использует стандартную архитектуру x86-64, поэтому основная серверная экосистема сохраняется:

  • Linux;

  • Windows Server;

  • KVM;

  • QEMU;

  • VMware ESXi;

  • Microsoft Hyper-V;

  • Proxmox VE;

  • OpenStack;

  • Kubernetes;

  • Docker;

  • Podman;

  • PostgreSQL;

  • MySQL;

  • MariaDB;

  • Microsoft SQL Server;

  • Oracle Database;

  • Redis;

  • NGINX;

  • Apache;

  • Java;

  • .NET;

  • современные HPC-компиляторы и MPI.

До массового развёртывания требуется проверить, что операционная система корректно распознаёт топологию SP7, все NUMA-домены, счётчики производительности, PCIe 6.0 и функции безопасности.

Для Linux важны актуальные версии:

  • ядра;

  • linux-firmware;

  • amd-pstate и серверных механизмов управления частотой;

  • numactl;

  • hwloc;

  • perf;

  • AMD uProf;

  • QEMU;

  • libvirt.

Старое ядро способно загрузиться благодаря совместимости x86, но оно не использует все функции нового процессора и содержит неоптимальные таблицы планировщика.

Методика анализа производительности

На момент подготовки обзора доступны результаты AMD и моделирование стоечного уровня. Полноценные независимые измерения ещё не опубликованы.

Результаты производителя полезны для понимания направления развития, поскольку AMD раскрыла абсолютные показатели в нескольких тестах. Однако они не заменяют независимый обзор по четырём причинам:

  1. производитель выбирает наиболее выгодные нагрузки;

  2. конфигурации платформ отличаются;

  3. часть стоечных сравнений основана на моделировании;

  4. энергопотребление всей системы не всегда измерено одинаковым способом.

Корректный независимый тест должен фиксировать:

  • точную модель процессора;

  • число сокетов;

  • BIOS и микрокод;

  • объём и тип памяти;

  • фактическую скорость DIMM;

  • число модулей на канал;

  • операционную систему;

  • версию ядра;

  • компилятор;

  • флаги оптимизации;

  • SMT;

  • профиль питания;

  • частоту под нагрузкой;

  • температуру;

  • потребление CPU;

  • потребление всей системы;

  • NUMA-настройку;

  • продолжительность прогрева;

  • разброс повторных запусков.

Особенно важно сравнивать не только результат на сервер, но и:

  • производительность на ядро;

  • производительность на поток;

  • производительность на ватт;

  • производительность на доллар;

  • производительность на стойку;

  • стоимость лицензий;

  • стоимость памяти.

Первые тесты AMD EPYC 9996

AMD продемонстрировала EPYC 9996 в веб-нагрузках, TPCx-AI, FAISS, корпоративных приложениях и сценариях исполнения AI-агентов. Числа относятся к тестированию производителя и предварительным системам.

NGINX и WRK

Тест измеряет максимальное число HTTP-обращений в секунду.

Процессор Максимум HTTP-обращений в секунду Относительно EPYC 9996
Intel Xeon 6980P 10 162 179 35,3%
AWS Graviton5 15 331 108 53,3%
AMD EPYC 9755 17 906 196 62,2%
AMD EPYC 9965 24 320 476 84,5%
AMD EPYC 9996 28 789 170 100%

EPYC 9996 опережает EPYC 9965 примерно на 18,4%, EPYC 9755 — примерно на 60,8%, а Xeon 6980P — примерно в 2,83 раза. Результат показывает преимущество в массово-параллельной обработке соединений, но не описывает задержку отдельного обращения и 99-й перцентиль.

TPCx-AI

Основной показатель — число AI use cases в минуту.

Процессор AIUCpm Относительно EPYC 9996
Intel Xeon 6980P 1750,36 29,3%
AWS Graviton5 2444,80 40,9%
AMD EPYC 9755 2704,19 45,2%
AMD EPYC 9965 3458,79 57,8%
AMD EPYC 9996 5982,91 100%

Здесь EPYC 9996 превосходит EPYC 9965 примерно на 73%, а Xeon 6980P — примерно в 3,42 раза. Тест чувствителен к числу ядер, памяти, векторным блокам и эффективности программного стека.

FAISS

FAISS используется для поиска ближайших векторов и широко применяется в системах семантического поиска и Retrieval-Augmented Generation.

Процессор Операций поиска в секунду Относительно EPYC 9996
Intel Xeon 6980P 316 069 42,1%
AWS Graviton5 119 179 15,9%
AMD EPYC 9755 369 252 49,1%
AMD EPYC 9965 472 079 62,8%
AMD EPYC 9996 751 453 100%

Преимущество EPYC 9996 над EPYC 9965 составляет около 59%, а над Xeon 6980P — около 2,38 раза. Высокий результат связан с сочетанием большого числа ядер, векторных инструкций, крупного L3 и быстрой памяти.

Корпоративные инструменты

AMD объединила показатели TPC-H, транзакционной нагрузки и Redis в геометрическое среднее.

Процессор Геометрическое среднее
Intel Xeon 6980P 2 284 701
AWS Graviton5 2 982 203
AMD EPYC 9755 2 546 290
AMD EPYC 9965 3 867 149
AMD EPYC 9996 6 054 748

EPYC 9996 опережает EPYC 9965 примерно на 56,6%, а Xeon 6980P — примерно в 2,65 раза. Показатель нельзя трактовать как результат одной конкретной базы данных: это объединённый индекс нескольких разных нагрузок.

Исполнение AI-агентов

AMD воспроизвела пять профилей агентов и вывела геометрическое среднее пропускной способности.

Процессор Геометрическое среднее
Intel Xeon 6980P 1,779
AWS Graviton5 2,505
AMD EPYC 9755 2,317
AMD EPYC 9965 2,970
AMD EPYC 9996 4,451

EPYC 9996 показывает примерно в 1,5 раза более высокий результат, чем EPYC 9965, и в 2,5 раза более высокий, чем Xeon 6980P. Подробная единица измерения для этого объединённого индекса не раскрыта, поэтому он подходит для относительного сравнения внутри диаграммы, но не для расчёта производительности реальной системы.

SPEC CPU

AMD заявляет для 256-ядерного Venice до 2,2 раза более высокую пропускную способность SPECrate integer относительно Nvidia Vera. В сравнении на ядро использовался 96-ядерный высокочастотный Venice, который показал преимущество около 20%.

В SPEC CPU 2017 AMD также заявляет примерно двукратное преимущество по совокупной пропускной способности над Xeon 6980P и около 30% на ядро. Эти показатели требуют независимой проверки, поскольку конфигурации Venice ещё не опубликованы в базе SPEC как обычные серийные результаты.

Производительность на ядро

Число ядер не заменяет производительность одного потока. В EPYC 9006 эту задачу решают модели Zen 6 с высокой частотой.

EPYC 9586F имеет 64 ядра и Boost 5 ГГц. EPYC 9996 содержит в четыре раза больше ядер, но его максимальная частота равна 4,1 ГГц, а базовая — 2,55 ГГц. При последовательной нагрузке 9586F работает быстрее.

Высокая производительность одного ядра важна для:

  • ядра базы данных;

  • критического потока игрового сервера;

  • очереди транзакций;

  • планировщика AI-кластера;

  • компиляции отдельных крупных файлов;

  • части EDA-процессов;

  • финансовых моделей;

  • Java-приложений с ограниченным параллелизмом.

EPYC 9996 выигрывает при сотнях независимых задач. EPYC 9586F выигрывает при небольшом числе тяжёлых потоков. EPYC 9756 располагается между этими крайностями: 128 ядер и базовая частота 3,15 ГГц обеспечивают универсальный баланс.

Пиковая частота не гарантирует одинаковую производительность в AVX-512. Векторная нагрузка повышает энергопотребление исполнительных блоков, поэтому процессор снижает частоту для соблюдения 500–600-ваттного лимита. Независимые тесты должны фиксировать среднюю частоту отдельно для scalar, AVX2 и AVX-512.

Масштабирование на 128, 168, 192 и 256 ядер

Масштабирование зависит от параллельной доли программы. NGINX, контейнеры и рендеринг обычно хорошо распределяются на сотни потоков. Лицензируемая СУБД, плохо настроенная JVM или последовательный препроцессор не используют 256 ядер эффективно.

Основные ограничения:

  • пропускная способность памяти;

  • общий кэш;

  • блокировки;

  • синхронизация;

  • межпоточная коммуникация;

  • NUMA;

  • скорость хранения;

  • сеть;

  • лицензирование.

EPYC 9996 имеет 4 МБ L3 на ядро и 6,4 ГБ/с теоретической полосы MRDIMM на ядро. EPYC 9756 при той же памяти получает 12,8 ГБ/с на ядро. Поэтому для memory-bound-нагрузки 128-ядерная модель способна обеспечивать более высокую полосу на поток.

Модель Ядра Полоса MRDIMM на ядро
EPYC 9996 256 около 6,4 ГБ/с
EPYC 9966 192 около 8,5 ГБ/с
EPYC 9846 168 около 9,8 ГБ/с
EPYC 9756 128 около 12,8 ГБ/с
EPYC 9656 96 около 17,1 ГБ/с
EPYC 9556 64 около 25,6 ГБ/с

Эта таблица не показывает фактическую скорость приложения, но объясняет, почему максимальное число ядер не всегда является лучшим вариантом для HPC и аналитики.

Сравнение AMD EPYC 9006 с EPYC 9005 Turin

Параметр EPYC 9006 Venice SP7 EPYC 9005 Turin SP5
Архитектура Zen 6 / Zen 6c Zen 5 / Zen 5c
Максимум ядер 256 192
Максимум потоков 512 384
Максимум L3 1024 МБ 512 МБ у отдельных моделей, 384 МБ у 9965
Каналы памяти 16 12
RDIMM до 8000 MT/s до 6400 MT/s
MRDIMM до 12 800 MT/s нет штатной поддержки такого класса
Максимальная полоса памяти 1638 ГБ/с около 614 ГБ/с
PCIe 6.0 5.0
Сокет SP7 SP5
Максимальная мощность 600 Вт 500 Вт
Максимальная частота 5 ГГц ниже у серверной линейки

EPYC 9006 даёт наиболее заметное преимущество в плотности, памяти и вводе-выводе. Переход с 12 на 16 каналов важнее обычного повышения частоты памяти: одновременно увеличивается и количество независимых каналов.

Turin сохраняет практические преимущества:

  • зрелые материнские платы;

  • доступные готовые серверы;

  • отлаженные BIOS;

  • независимые тесты;

  • более широкий рынок памяти;

  • совместимость с частью инфраструктуры Genoa;

  • более низкая стоимость внедрения.

Миграция на Venice оправдана при нехватке ядер, памяти, PCIe-полосы или производительности на стойку. Сервер EPYC 9005 остаётся рациональным для обычной виртуализации, файловых сервисов, корпоративных приложений и нагрузок, которые не используют MRDIMM и PCIe 6.0.

EPYC 9965 содержит 192 ядра, 384 потока, 384 МБ L3, 12 каналов DDR5-6400, обеспечивает до 614 ГБ/с пропускной способности памяти, поддерживает PCIe 5.0 x128 и работает с мощностью до 500 Вт.

Сравнение с Intel Xeon 6

Главный прямой соперник первых Venice — Intel Xeon 6980P Granite Rapids.

Параметр AMD EPYC 9996 Intel Xeon 6980P
Ядра 256 128
Потоки 512 256
Базовая частота 2,55 ГГц 2,0 ГГц
Максимальная частота 4,1 ГГц 3,9 ГГц
L3 1024 МБ 504 МБ
Мощность 600 Вт 500 Вт
Официальная цена 14 904 доллара 13 955 долларов
Архитектура Zen 6c P-core
Векторные функции AVX-512 AVX-512, AMX
Память 16 каналов, до MRDIMM-12800 MRDIMM, конфигурация зависит от платформы
PCIe Gen 6 Gen 5

Xeon 6980P содержит вдвое меньше ядер, но оснащён AMX, Intel DSA, IAA, QAT и DLB. Эти встроенные ускорители дают преимущество в оптимизированных задачах AI, компрессии, шифрования, перемещения данных и аналитики.

EPYC 9996 предлагает больше потоков, L3, память следующего поколения и PCIe 6.0. В тестах AMD он значительно опережает Xeon по общей пропускной способности. Для честного выбора нужны независимые тесты приложений и расчёт лицензий.

Intel Xeon 6980P содержит 128 ядер, 256 потоков, разгоняется до 3,9 ГГц, оснащён 504 МБ кэша, имеет TDP 500 Вт и официальную цену 13 955 долларов.

Intel также развивает Xeon с E-ядрами. Clearwater Forest достигает более высокого числа ядер, чем Granite Rapids, и ориентирован на облачную плотность. Поэтому EPYC 9996 необходимо сравнивать не только с 6980P, но и с плотными Xeon 6+, когда серийные серверы обоих семейств станут доступны.

Сравнение с Nvidia Vera и Arm AGI

Nvidia Vera и Arm AGI используют Arm-совместимую архитектуру, поэтому сравнение выходит за рамки числа ядер.

Nvidia Vera

Vera содержит 88 высокопроизводительных ядер и использует LPDDR5X с большой пропускной способностью. Процессор предназначен прежде всего для AI-систем Nvidia и тесной интеграции с GPU.

Преимущества Vera:

  • интеграция с экосистемой Nvidia;

  • высокая производительность одного ядра;

  • LPDDR5X;

  • оптимизация под AI host;

  • единая архитектура стоечных систем.

Преимущества EPYC 9006:

  • x86-64;

  • до 256 ядер;

  • до 512 потоков;

  • обычные заменяемые серверные DIMM;

  • широкий выбор OEM;

  • PCIe 6.0;

  • независимость от одного производителя GPU.

AMD заявляет 2,2-кратное преимущество EPYC 9996 в SPECrate throughput и около 20% на ядро для высокочастотного 96-ядерного Venice. Эти показатели получены AMD на основе опубликованных данных Vera и требуют независимой проверки.

Arm AGI

Arm AGI содержит 136 ядер Neoverse V3, работает в пределах 300 Вт, поддерживает 12 каналов DDR5-8800, полосу около 800 ГБ/с, 96 линий PCIe 6.0 и CXL 3.0.

AGI предлагает высокую плотность при сравнительно низкой мощности. EPYC отвечает SMT, большей максимальной плотностью потоков, 16 каналами памяти и полной совместимостью с существующим x86-кодом.

Для нового Linux-сервиса, уже собранного под Arm64, AGI становится прямым конкурентом. Для крупного парка Windows, коммерческих x86-приложений и контейнеров с закрытыми бинарными компонентами EPYC снижает расходы на перенос.

Виртуализация и частные облака

Виртуализация — один из главных сценариев для EPYC 9006. Один EPYC 9996 предоставляет 512 логических процессоров, а двухсокетная система — 1024.

Такой сервер способен заменить большое число старых двухсокетных узлов, но плотность нельзя рассчитывать простым делением потоков. Требуется учитывать:

  • объём RAM на VM;

  • резерв CPU;

  • пиковую нагрузку;

  • сетевой трафик;

  • IOPS;

  • NUMA;

  • лицензирование;

  • отказоустойчивость.

Для небольших виртуальных машин по 2–8 vCPU флагман обеспечивает высокую плотность. Для крупных VM на 64–128 vCPU важно держать виртуальную машину внутри одного NUMA-домена или настроить виртуальную NUMA-топологию.

Переподписка vCPU подходит для переменных офисных и веб-нагрузок. Для баз данных, real-time-сервисов и компиляционных ферм требуется более консервативный коэффициент.

Пример расчётной конфигурации на EPYC 9996:

Компонент Конфигурация
CPU 1 × EPYC 9996
Потоки 512
RAM 2–4 ТБ
Сеть 2 × 200/400 Гбит/с
Системные диски зеркальная пара NVMe
Хранилище VM 8–16 NVMe
Гипервизор KVM, VMware ESXi, Hyper-V или Proxmox
Назначение плотная консолидация VM и контейнеров

Главный риск сверхплотной консолидации — большой объём сервисов, потерянных при отказе одного узла. Чем больше VM находится на сервере, тем важнее кластер, резервирование и быстрая миграция.

Облачные и контейнерные нагрузки

Контейнерные платформы хорошо масштабируются на Zen 6c, поскольку множество небольших сервисов создаёт большое число независимых потоков. EPYC 9996 особенно подходит для:

  • Kubernetes worker nodes;

  • serverless;

  • CI/CD;

  • микросервисов;

  • NGINX;

  • API-шлюзов;

  • кэшей;

  • очередей;

  • обработчиков событий;

  • изолированных сред исполнения.

512 потоков позволяют размещать много контейнеров, но планировщик Kubernetes должен учитывать NUMA и локальность устройств. GPU, NVMe и сетевой интерфейс принадлежат конкретному I/O-домену. Контейнер с интенсивным обменом данными размещается рядом с соответствующим устройством.

Для CPU limits и requests лучше использовать гарантированные классы QoS для чувствительных сервисов. Массовая переподписка приводит к непредсказуемой задержке в периоды пиковой нагрузки.

В CI/CD EPYC 9996 ускоряет параллельную сборку множества проектов. EPYC 9586F лучше выполняет небольшое число крупных компиляций, где критичен один поток. EPYC 9756 обеспечивает наиболее универсальный баланс.

Базы данных и аналитика

Для СУБД выбор между 64, 96, 128 и 256 ядрами определяется не только производительностью, но и лицензированием.

Oracle, Microsoft SQL Server и другие коммерческие продукты используют схемы оплаты по ядрам или процессорным лицензиям. В таком случае 256-ядерный CPU способен резко увеличить стоимость программного обеспечения. EPYC 9586F или 9686F даёт более высокую производительность на лицензируемое ядро.

OLTP

Транзакционные нагрузки чувствительны к:

  • задержке памяти;

  • блокировкам;

  • производительности одного потока;

  • скорости журнала;

  • сетевой задержке;

  • частоте ядер.

Для OLTP предпочтительны EPYC 9586F, 9686F и 9G76.

OLAP

Аналитические операции активнее используют:

  • многопоточность;

  • пропускную способность памяти;

  • векторные инструкции;

  • большой L3;

  • быстрые NVMe.

Для OLAP подходят EPYC 9756, 9846, 9966 и 9996.

In-memory

Система in-memory требует симметричного заполнения всех 16 каналов и большого объёма RAM. EPYC 9556 интересен тем, что предоставляет полную подсистему памяти SP7 при 64 ядрах и 300 Вт. Он подходит для систем, где объём памяти важнее числа потоков.

AI-инфраструктура и хост-узлы GPU

GPU выполняет матричные вычисления, но CPU остаётся центральным элементом узла. Он обслуживает:

  • загрузку данных;

  • распаковку;

  • токенизацию;

  • сетевой стек;

  • хранение метаданных;

  • RAG;

  • векторную базу;

  • планирование;

  • контейнеры;

  • мониторинг;

  • контроль GPU;

  • предварительную и последующую обработку.

Плохо подобранный хост-процессор оставляет дорогие ускорители без данных. Поэтому для GPU-сервера важны высокая частота, память и PCIe.

EPYC 9686F и 9G76 подходят для AI-host благодаря 96 ядрам, частоте до 5 или 4,8 ГГц, 16 каналам памяти и PCIe 6.0. EPYC 9996 больше ориентирован на CPU-часть инфраструктуры: исполнение множества агентов, векторный поиск, базы данных и сервисы вокруг моделей.

Пример GPU-узла:

Компонент Рекомендуемая конфигурация
CPU 2 × EPYC 9686F или 9G76
RAM 2–4 ТБ MRDIMM
GPU 8 ускорителей
Локальное хранение 8–16 NVMe
Сеть несколько портов 400/800 Гбит/с
Охлаждение прямое жидкостное
Блоки питания резервированные, с запасом под пик GPU
Назначение обучение, инференс, RAG и агентные системы

AMD использует высокочастотный 96-ядерный Venice в собственной стоечной платформе Helios вместе с Instinct MI455X и Pensando. Заявлены PCIe 6.0 между CPU и GPU и до 1,6 ТБ/с памяти на сокет.

HPC и научные вычисления

HPC-нагрузки делятся на три группы:

  1. вычислительные;

  2. ограниченные памятью;

  3. ограниченные обменом между узлами.

EPYC 9586F и 9686F подходят для кода с высокой производительностью на ядро. EPYC 9756 и 9846 дают больше потоков. EPYC 9996 рационален для идеально параллельных задач и throughput computing.

Для CFD, молекулярной динамики и конечных элементов важны не только ядра, но и память. MRDIMM-12800 способен резко улучшить задачи, которые упирались в 12-канальную DDR5 предыдущего поколения.

При выборе HPC-процессора необходимо провести тест на реальном размере сетки. Большой L3 ускоряет задачу только тогда, когда рабочий набор или его критическая часть помещается в кэш. Влияние L3 на CFD зависит от размера модели и характера доступа к памяти.

Для распределённого расчёта важна сеть. Сервер с 256 ядрами генерирует большой поток MPI-сообщений. Недостаточно установить быстрый CPU: требуется подходящий InfiniBand или Ethernet, корректная привязка сетевого адаптера к NUMA и оптимизация MPI.

Серверные конфигурации на AMD EPYC 9006 SP7

Односокетный сервер максимальной плотности

Компонент Конфигурация
Процессор AMD EPYC 9996
Ядра / потоки 256 / 512
Память 16 × 128 ГБ MRDIMM, всего 2 ТБ
Хранилище 8–16 NVMe
Сеть 2 × 200 или 400 Гбит/с
Форм-фактор 2U
Охлаждение усиленное воздушное или жидкостное
Назначение виртуализация, контейнеры, веб-сервисы, CPU-инференс

Односокетная схема снижает NUMA-сложность и оставляет большой запас PCIe для накопителей и сети. Она подходит для консолидации без необходимости второго CPU.

Двухсокетный сервер на 512 ядер

Компонент Конфигурация
Процессоры 2 × EPYC 9996
Ядра / потоки 512 / 1024
Память 32 × 128 или 256 ГБ
Общий объём RAM 4 или 8 ТБ
Хранилище 16–24 NVMe
Сеть 2–4 адаптера 400/800 Гбит/с
Форм-фактор 2U или 4U
Охлаждение жидкостное предпочтительно
Назначение максимальная виртуализация и массовый throughput

Такой сервер концентрирует огромную вычислительную мощность. Его использование оправдано при высокой загрузке и наличии кластера резервирования.

Сервер баз данных

Компонент Конфигурация
Процессор EPYC 9586F, 9686F или 9G76
Память 1–4 ТБ
Системные диски 2 NVMe в зеркале
Данные массив корпоративных NVMe
Журнал отдельные NVMe с защитой от потери питания
Сеть резервированные 100/200 Гбит/с
Назначение PostgreSQL, Oracle, SQL Server, аналитика

Высокочастотные модели уменьшают задержку транзакций и повышают производительность на лицензируемое ядро.

HPC-узел

Компонент Конфигурация
Процессор EPYC 9756 или 9846
Память 16 каналов MRDIMM
Сеть InfiniBand или Ethernet 400/800 Гбит/с
Scratch 2–8 локальных NVMe
Форм-фактор 1U/2U
Назначение CFD, рендеринг, моделирование

Узел хранения и аналитики

Компонент Конфигурация
Процессор EPYC 9556
Мощность CPU 300 Вт
Память 1–4 ТБ
Накопители большое число NVMe или дисковых полок
Сеть 200/400 Гбит/с
Назначение Ceph, объектное хранение, аналитика, кэш

EPYC 9556 даёт полноценные возможности SP7 при самой низкой мощности в линейке.

Готовые серверы с EPYC 9006

AMD перечисляет Dell, Supermicro, HPE, Lenovo и Cisco среди партнёров EPYC 9006. Также платформы готовят Gigabyte, ASRock Rack и другие производители серверных плат.

Ожидаемые категории систем:

  • 1U двухсокетные серверы;

  • 2U универсальные платформы;

  • 2U и 4U GPU-серверы;

  • многосерверные шасси;

  • системы жидкостного охлаждения;

  • узлы хранения;

  • HPC-кластеры;

  • стоечные AI-комплексы.

Преимущества готового OEM-сервера:

  • проверенная совместимость;

  • сертифицированная память;

  • поддержка BIOS;

  • BMC;

  • гарантия;

  • запасные части;

  • документация;

  • предсказуемое охлаждение;

  • квалифицированные сетевые и NVMe-карты.

Недостатки готового OEM-сервера:

  • более высокая цена;

  • привязка к фирменным комплектующим;

  • ограничения BIOS;

  • дорогая память и накопители;

  • платные контракты поддержки;

  • возможная привязка CPU через Secure Boot.

Самостоятельная сборка SP7 подходит опытным интеграторам. Обычная покупка платы, процессора и случайного радиатора создаёт высокий риск несовместимости.

Подходит ли AMD EPYC 9006 для игр

EPYC 9006 не предназначен для обычного игрового компьютера. Платформа SP7 требует серверной платы, RDIMM или MRDIMM, мощного охлаждения и специализированного корпуса. Стоимость одного процессора начинается с 8008 долларов без учёта платы и памяти.

Современные игры не используют 64–256 ядер. Игровой FPS определяется производительностью нескольких потоков, задержкой памяти и видеокартой. Даже EPYC 9586F с частотой 5 ГГц остаётся серверным CPU с чиплетной топологией и дорогой платформой.

Недостатки игровой сборки SP7:

  • крайне высокая цена;

  • отсутствие обычных ATX-плат;

  • сложный запуск потребительских устройств;

  • серверный BIOS;

  • отсутствие встроенной графики;

  • дорогая ECC-память;

  • шумное охлаждение;

  • неоптимальная задержка;

  • отсутствие смысла в сотнях потоков.

Реальное игровое применение связано с серверной стороной:

  • хостинг игровых серверов;

  • облачный гейминг;

  • виртуальные игровые рабочие места;

  • массовые серверы Minecraft;

  • игровые backend-сервисы;

  • симуляция больших миров;

  • сборка игровых проектов;

  • автоматизированное тестирование.

Для одного высоконагруженного игрового сервера лучше EPYC 9586F или 9686F. Для размещения сотен независимых игровых инстансов лучше EPYC 9996 или 9966.

Игровые тесты Venice пока отсутствуют. Публиковать расчётный FPS по частоте или числу ядер некорректно.

Разгон и практическая настройка

Классический пользовательский разгон EPYC 9006 не предусмотрен. Ryzen Master для SP7 не применяется, множитель не является инструментом обычного администратора, а стабильность важнее кратковременного прироста.

Практическая настройка выполняется через BIOS, BMC и операционную систему:

  • профиль мощности;

  • SMT;

  • NUMA;

  • частотную политику;

  • режим памяти;

  • чередование каналов;

  • Huge Pages;

  • CPU affinity;

  • IRQ affinity;

  • распределение сетевых очередей;

  • локальность NVMe и GPU.

Для виртуализации SMT обычно включён. Для отдельных HPC-задач сравниваются режимы SMT On и Off. Отключение SMT уменьшает число логических потоков, но освобождает ресурсы ядра для одного процесса.

Huge Pages снижают нагрузку на TLB в базах данных, виртуализации и больших in-memory-приложениях. Размер страниц выбирается по результатам тестирования.

Размещение сетевых IRQ на ядрах другого NUMA-домена увеличивает задержку. Поэтому высокоскоростной адаптер привязывается к ядрам того процессора, к которому он физически подключён.

Инженерные образцы нельзя использовать в промышленной эксплуатации. Они имеют ранний микрокод, неизвестные лимиты, нестабильную совместимость BIOS и отсутствие гарантии.

Экономика, TCO и консолидация

Цена CPU — только часть стоимости SP7-системы. Полный бюджет включает:

  • процессоры;

  • материнскую плату;

  • память;

  • охлаждение;

  • шасси;

  • питание;

  • NVMe;

  • сеть;

  • лицензии;

  • поддержку;

  • электричество;

  • место в стойке.

EPYC 9996 стоит 14 904 доллара в партии 1kU. Двухсокетный сервер содержит процессоров почти на 30 000 долларов ещё до добавления памяти. Несколько терабайт MRDIMM, высокоскоростная сеть и корпоративные NVMe способны стоить дороже CPU.

TCO улучшается не из-за низкой абсолютной цены, а за счёт консолидации. Один сервер на 256 или 512 ядрах заменяет несколько старых систем, сокращая:

  • количество блоков питания;

  • число сетевых портов;

  • объём кабельной инфраструктуры;

  • число лицензий на сервер;

  • обслуживание;

  • занимаемое место;

  • потребление вспомогательных компонентов.

Однако лицензирование по ядрам способно полностью изменить расчёт. При дорогой лицензии СУБД 64-ядерный EPYC 9586F экономически выгоднее 256-ядерного 9996, даже при меньшей общей производительности.

Для корректного TCO требуется считать:

Показатель Формула оценки
Стоимость одного потока цена платформы / число используемых потоков
Производительность на ватт результат теста / потребление всей системы
Стоимость VM TCO узла / число гарантированных VM
Стоимость лицензирования цена лицензии × учитываемые ядра
Плотность стойки полезная производительность / мощность стойки
Срок окупаемости затраты миграции / ежемесячная экономия

AMD показывает до 3,3 раза более высокую расчётную производительность стойки EPYC 9996 относительно Vera в пределах 100 кВт. Этот показатель основан на моделировании и геометрическом среднем нескольких нагрузок, а не на физическом тесте полностью заполненной стойки.

Сильные и слабые стороны

Плюсы

  • до 256 ядер и 512 потоков на один сокет;

  • до 512 ядер и 1024 потоков в двухсокетном сервере;

  • архитектуры Zen 6 и Zen 6c внутри одной платформы;

  • частоты до 5 ГГц;

  • 16 каналов оперативной памяти;

  • поддержка DDR5-8000;

  • поддержка MRDIMM-12800;

  • пропускная способность памяти до 1638 ГБ/с;

  • кэш L3 до 1024 МБ;

  • PCI Express 6.0;

  • CXL 3.1 на серверных платформах;

  • одно- и двухсокетные конфигурации;

  • широкий выбор моделей на 64–256 ядер;

  • полная x86-64-совместимость;

  • развитая конфиденциальная виртуализация;

  • высокая плотность виртуальных машин;

  • сильная производительность в тестах AMD;

  • подходящие модели для GPU-host;

  • поддержка крупных OEM;

  • большой потенциал консолидации.

Минусы

  • новый сокет SP7 без совместимости с SP5;

  • необходимость полной замены платформы;

  • мощность до 600 Вт на процессор;

  • сложное воздушное охлаждение;

  • высокая цена CPU;

  • дорогая 16-канальная память;

  • особенно высокая стоимость MRDIMM;

  • сложная NUMA-топология;

  • рост стоимости лицензий при оплате по ядрам;

  • ограниченная розничная доступность на старте;

  • отсутствие независимых тестов серийных серверов;

  • отсутствие смысла в обычной игровой сборке;

  • риск OEM-привязки процессора;

  • необходимость актуального BIOS и операционной системы;

  • повышенные требования к питанию стойки;

  • большой ущерб от отказа сверхплотного узла без кластера резервирования.

Мнения технических изданий

Phoronix назвал Venice потенциальным крупным успехом AMD, но одновременно охарактеризовал запуск как предварительный: массовая доступность ожидается в четвёртом квартале, а независимые тесты ещё готовятся. Издание подчёркивает, что будущая проверка будет включать свободный выбор Linux-нагрузок, измерение частот и энергопотребления.

Tom’s Hardware выделяет пять главных характеристик: 256 ядер, 512 потоков, 1024 МБ L3, 16-канальную память и частоту до 5 ГГц у высокочастотных моделей. Издание подробно разобрало тесты AMD, но указывает, что часть стоечных сравнений построена на масштабировании и моделировании.

ComputerBase отмечает, что анонс охватывает сразу четыре направления EPYC 9006, а обычные SP7 и SP8 выходят раньше Venice-X и EPYC 9006 LP. Издание также подчёркивает разницу между 32-ядерными CCD Zen 6c и 12-ядерными CCD Zen 6.

Tweakers рассматривает EPYC 9996 как главный пример перехода AMD к приоритету дата-центров. В предварительном материале отдельно отмечены 256 ядер Zen 6c, 1024 МБ L3 и цена 14 904 доллара.

Общий вердикт прессы положительный, но осторожный. Характеристики выглядят сильными, а первые показатели превосходят Turin и Xeon. Окончательная оценка зависит от фактического потребления, частот под полной нагрузкой, задержки памяти, зрелости BIOS и стоимости MRDIMM.

Какую модель AMD EPYC 9006 SP7 выбрать

Сценарий Оптимальная модель Причина
Максимум VM и контейнеров EPYC 9996 256 ядер и 512 потоков
Высокая плотность с повышенной частотой EPYC 9966 192 ядра и база 2,9 ГГц
Баланс плотности и 500 Вт EPYC 9846 168 ядер и 768 МБ L3
Универсальный HPC и облако EPYC 9756 128 ядер и база 3,15 ГГц
Высокочастотный универсальный сервер EPYC 9G76 96 Zen 6 и Boost 4,8 ГГц
Экономичный 96-ядерный узел EPYC 9656 400 Вт и 512 МБ L3
Максимальная скорость на 96 ядрах EPYC 9686F Boost 5 ГГц
Память и I/O при умеренной мощности EPYC 9556 64 ядра и 300 Вт
Максимум производительности на 64 ядрах EPYC 9586F база 3,75 ГГц и Boost 5 ГГц
Игровые серверы EPYC 9586F высокая частота одного ядра
GPU host EPYC 9686F или 9G76 частота, 96 ядер, PCIe 6.0
In-memory EPYC 9556 или 9586F 16 каналов и больше памяти на ядро
CPU-инференс и FAISS EPYC 9996 максимальная совокупная пропускная способность
Коммерческая СУБД с оплатой по ядрам EPYC 9586F высокая производительность на лицензируемое ядро

EPYC 9996 нельзя автоматически считать лучшей моделью для любого сервера. Он является лучшим вариантом для максимальной плотности. EPYC 9586F лучше подходит для дорого лицензируемых и низколатентных приложений. EPYC 9556 даёт наиболее спокойный тепловой режим. EPYC 9756 выглядит самым универсальным среди высокоплотных моделей.

Итоговый вердикт

AMD EPYC 9006 Venice SP7 — самое масштабное обновление верхней серверной платформы AMD после перехода на чиплетную архитектуру. Рост числа ядер с 192 до 256 заметен, но ещё важнее изменения вокруг вычислительных блоков: 16 каналов памяти, MRDIMM-12800, PCIe 6.0, переработанная I/O-компоновка и кэш L3 до 1024 МБ.

Флагман EPYC 9996 предназначен для максимальной консолидации, облачных сервисов, контейнеров, CPU-инференса и массового исполнения параллельных задач. Он предоставляет 512 потоков на сокет и 1024 в двухсокетном сервере.

EPYC 9686F и 9586F закрывают противоположную задачу. Частота до 5 ГГц делает их подходящими для баз данных, инженерного программного обеспечения, игровых серверов, финансовых расчётов и GPU-хостов.

EPYC 9556 выглядит одной из наиболее практичных моделей. При 300 Вт он сохраняет 16 каналов памяти, 384 МБ L3 и возможности SP7. Для сервера хранения, аналитики или in-memory-системы 64 ядра часто достаточны.

Первые показатели AMD показывают крупный прирост относительно EPYC 9005 и Intel Xeon 6980P. В NGINX EPYC 9996 достиг 28,79 млн HTTP-обращений в секунду, в FAISS — 751 тыс. операций поиска в секунду, а в TPCx-AI — 5982,91 AIUCpm. Эти числа подтверждают потенциал архитектуры, но пока остаются результатами производителя.

Главные ограничения Venice — цена перехода на SP7, мощность до 600 Вт, стоимость 16-канальной памяти и отсутствие независимых тестов серийных платформ. Для владельца свежего EPYC 9005 немедленная миграция оправдана при реальной нехватке ядер, памяти или PCIe-полосы. Для старых серверов консолидация на EPYC 9006 способна дать значительно больший экономический эффект.

AMD EPYC 9006 SP7 не является процессором для домашнего ПК и не конкурирует с Ryzen в играх. Это специализированная основа серверов нового поколения: от высокоплотной виртуализации и HPC до стоечных AI-комплексов. По опубликованным характеристикам Venice задаёт новый уровень плотности для x86-систем, а окончательное положение серии определят независимые тесты и фактическая стоимость готовых серверов в четвёртом квартале 2026 года.