AMD EPYC 9384X: подробный обзор 32-ядерного Genoa-X с 768 МБ L3 для HPC, CFD и EDA

AMD EPYC 9384X — серверный процессор четвертого поколения EPYC 9004 с кодовым именем Genoa-X. Это не обычный Genoa с увеличенным числом ядер, а специализированная 32-ядерная модель с трехмерно наращенным кэшем AMD 3D V-Cache. У процессора 32 ядра Zen 4, 64 потока SMT, базовая частота 3,1 ГГц, максимальный boost до 3,9 ГГц и заявленная частота all-core boost 3,5 ГГц. Главное отличие модели — 768 МБ L3, то есть в несколько раз больше кэша последнего уровня, чем у стандартных 32-ядерных EPYC 9004. Такая конфигурация ориентирована прежде всего на CAE, CFD, FEA, EDA и HPC, где рабочий набор данных способен заметно выигрывать от большой емкости кэша и сокращения обращений к оперативной памяти.

AMD EPYC 9384X: точная идентификация и назначение модели

Точная дата выхода EPYC 9384X — 13 июня 2023 года. Более ранняя дата 10 ноября 2022 года относится к запуску базового поколения EPYC 9004 Genoa и не должна использоваться как дата выпуска этой X-модели. Рекомендованная цена для партии 1000 штук на старте составляла 5529 долларов. Процессор рассчитан на платформу SP5 и допускает как односокетную, так и двухсокетную конфигурацию. Это важное отличие от моделей EPYC с суффиксом P, предназначенных только для 1P. Суффикс X здесь означает наличие 3D V-Cache; он не обозначает разблокированный настольный множитель и не превращает серверный EPYC в процессор для привычного ручного разгона.

AMD EPYC 9384X с маркировкой 9384X и OPN 100-000001256
Фотография AMD EPYC 9384X: на теплораспределителе видны обозначение 9384X и OPN 100-000001256. Это именно 32-ядерный Genoa-X для сокета SP5.

Для проверки конкретного экземпляра важнее всего сопоставить название, OPN и аппаратные характеристики. Текущая карточка AMD указывает Product ID Tray 100-000001256. В актуальном документе AMD по экспортной классификации с моделью 9384X также официально сопоставлен OPN 100-000000791. Оба номера относятся к EPYC 9384X, однако публичная карточка продукта в настоящее время выводит именно 100-000001256 как идентификатор tray. AMD не публикует для них объяснение различий по ревизии или каналу поставки, поэтому при покупке нельзя самостоятельно приписывать одному номеру статус нового степпинга, а другому — старого. Для точного выбора достаточно подтвержденного соответствия модели, спецификаций и списка поддержки конкретной системной платы.

Где купить AMD EPYC 9384X в 2026 году

EPYC 9384X продается главным образом как OEM/tray-компонент, через поставщиков серверных комплектующих и как опция в готовых системах. Перед оплатой следует сверять не только название в карточке, но и OPN, число ядер, объем L3 и сокет. На торговых площадках встречаются карточки с ошибочно подставленными характеристиками соседних EPYC, поэтому надежная комбинация для проверки выглядит так: AMD EPYC 9384X, 32 ядра и 64 потока, 3,1/3,9 ГГц, 768 МБ L3, SP5, TDP 320 Вт, OPN 100-000001256 либо официально сопоставленный 100-000000791.

МагазинЦена или статус на 17.08.2026
Яндекс Маркетоколо 365 410 ₽ с условиями площадки

Цена на вторичном рынке заметно ниже стартовой 1kU-цены, однако для серверного процессора важна история экземпляра. У EPYC для SP5 нет типичного для настольных CPU коробочного набора с кулером. При покупке CPU отдельно охлаждение, совместимый радиатор, плата, память и серверное шасси приобретаются отдельно. Готовые серверы с 9384X иногда оказываются практичнее голого процессора: производитель уже валидировал BIOS, VRM, воздушный канал, крепление SP5 и допустимую мощность. Для корпоративного применения стоимость всей платформы и поддержки обычно важнее разницы в несколько сотен долларов между двумя tray-предложениями.

Сводная мегатаблица характеристик AMD EPYC 9384X

ГруппаПараметрAMD EPYC 9384XКомментарий
ИдентичностьТочное имяAMD EPYC 9384X32-ядерная модель Genoa-X
ИдентичностьЛинейкаEPYC 9004 Series, 4-е поколение EPYCСерверный сегмент
ИдентичностьКодовое имяGenoa-XВариант Genoa с AMD 3D V-Cache
ИдентичностьProduct ID Tray100-000001256Номер в текущей публичной карточке AMD
ИдентичностьДополнительный официальный OPN100-000000791Сопоставлен с 9384X в документе AMD по экспортной классификации
ИдентичностьСтеппингДля OPN 100-000000791 в QVL ряда серверных плат указан B1; для 100-000001256 публичная карточка AMD степпинг не выводитЗначение B1 не переносится автоматически между OPN без отдельной таблицы платформы
ИдентичностьS-SpecНе применяетсяS-Spec — система идентификаторов Intel
ИдентичностьARK IDНе применяетсяARK относится к каталогу Intel
ПоставкаRetail boxed IDНе заявленПублично указан tray/OEM Product ID
ПоставкаПример OEM-комплектаHPE P63492-B21; сервисный spare P63502-001Это номера HPE для систем/обслуживания, а не OPN процессора AMD
ПоставкаКулер в комплектеНет подтвержденного комплектного кулераДля tray/OEM требуется серверная система охлаждения SP5
СтатусДата запуска точной модели13.06.2023Не путать с запуском обычного Genoa 10.11.2022
СтатусСтартовая 1kU-цена5529 $Цена для партии 1000 единиц, не розничный MSRP в бытовом смысле
СегментНазначениеСерверы, HPC, CAE, CFD, FEA, EDAКэш-чувствительные технические вычисления
АрхитектураМикроархитектураZen 4Однородные высокопроизводительные ядра
АрхитектураP/E-ядраНетГибридной схемы P-core/E-core нет
АрхитектураSMTДа, 2 потока на ядро32 ядра / 64 потока
ТехпроцессВычислительные CCDTSMC 5 нмZen 4 chiplets
ТопологияCCD8 вычислительных CCD Genoa-X32 активных ядра распределены по 8 CCD
ТопологияАктивных ядер на CCD4Именно такая конфигурация дает 32 ядра при восьми CCD
ТопологияI/O dieОтдельный центральный I/O-кристаллОбслуживает память, PCIe/CXL и межкристальные связи
ЯдраЯдра32Zen 4
ЯдраПотоки64SMT2
ЧастотыБазовая частота3,1 ГГцОфициальная спецификация
ЧастотыAll-core boost3,5 ГГцЗаявленная AMD величина для all-core boost
ЧастотыМаксимальный boostдо 3,9 ГГцМаксимум отдельного ядра при подходящих условиях
ЧастотыГарантированная постоянная частота всех ядер 3,9 ГГцНет3,9 ГГц не является all-core значением
РазгонПользовательский множительНе заявлен как инструмент разгонаСерверная платформа не рассчитана на настольный OC-сценарий
РазгонcTDP320–400 ВтНастройка силового конверта через валидированную платформу
КэшL1 instruction32 КБ на ядроХарактеристика ядра Zen 4
КэшL1 data32 КБ на ядроХарактеристика ядра Zen 4
КэшL21 МБ на ядро, 32 МБ суммарноЧастный L2 для каждого активного ядра
КэшL3768 МБГлавная особенность 9384X
КэшL3 на активное ядро, условное отношение24 МБ/ядро768 МБ / 32 ядра; это не означает приватный L3
Кэш3D V-CacheДаДополнительный кэш уложен поверх CCD
ПитаниеDefault TDP320 ВтБазовый силовой класс
ПитаниеКонфигурируемый TDP320–400 ВтТребует поддержки BIOS, VRM и охлаждения системы
ПитаниеОтдельный официальный Turbo/Maximum PowerНе заявленНе подменяется значением cTDP
ТемператураПубличный Tjmax для этого OPNНе подтвержденЕдиного значения в публичной карточке продукта нет
ПамятьТипDDR5 server memoryПлатформы EPYC 9004 используют ECC Registered DIMM
ПамятьМаксимальная скоростьдо DDR5-48004800 MT/s
ПамятьКаналы12 на сокетДля полной полосы желательно симметричное заполнение
ПамятьТеоретическая полоса на сокет460,8 ГБ/сОфициальное значение для DDR5-4800
ПамятьМаксимальная емкостьдо 6 ТБ на сокет для платформы EPYC 9004Фактический предел зависит от платы, DIMM и QVL
ПамятьECCДаСерверная ECC-память
ПамятьRDIMMДаОсновной подтвержденный класс модулей SP5
ПамятьUDIMMНе используется как штатный тип для EPYC 9004Следует брать модули из QVL серверной платы
Память2 DIMM на каналПоддерживается платформойРежим и частота зависят от схемы заполнения и DIMM
I/OPCI ExpressPCIe 5.0Современный серверный I/O
I/OЛинии PCIeдо 128 линий на сокетЧасть физического ресурса в 2P занята межсокетной связью
I/OCXLCXL 1.1+ на части линийДо 64 линий платформенного ресурса CXL
I/OSATA из процессорных линийПлатформа допускает до 32 линий в SATA-режимеКонкретная разводка зависит от платы
I/OМежсокетная связьInfinity Fabric / xGMIВ 2P использует часть высокоскоростных линий
ГрафикаВстроенное графическое ядроНетBMC VGA на серверной плате не является iGPU процессора
ГрафикаМедиакодер/декодерНе заявленПроцессор не ориентирован на мультимедийную графику
ИнструкцииAVX / AVX2 / FMAДаZen 4
ИнструкцииAVX-512ДаИсполнение Zen 4 через 256-битный datapath
ИнструкцииAVX-512 BF16ДаПолезно для части HPC/AI-кода
ИнструкцииAVX-512 VNNIДаУскоряет некоторые целочисленные матричные операции
AIОтдельный NPU/тензорный блокНетAI на CPU опирается на SIMD и библиотеки
ВиртуализацияAMD-V / SVMДаАппаратная виртуализация x86
БезопасностьAMD Infinity GuardДаНабор серверных механизмов защиты
БезопасностьSEV / SEV-ES / SEV-SNPПоддерживаются поколением EPYC 9004Фактическая активация зависит от BIOS и гипервизора
RASECC и серверные RAS-механизмыДаКонкретные функции и телеметрия зависят от платформы
СокетПлатформаSP5Большой серверный LGA-сокет
СокетСокетность1P / 2PОдин или два процессора в системе
ЧипсетОбязательный настольный PCHНетEPYC — SoC-платформа; совместимость задает конкретная серверная плата
BIOSУниверсальная минимальная версияНе существуетНужна версия из CPU support list конкретной платы
ПлатыПроверенный примерSupermicro H13DSH и другие SP5-платы с явной поддержкой 9384XТребуется соответствующий BIOS и силовой класс
ОхлаждениеТребованиеРадиатор/СЖО SP5, рассчитанные минимум на 320 Вт и на выбранный cTDPВоздушный канал шасси является частью теплового расчета

Что означает Genoa-X и чем 9384X отличается от обычного Genoa

Genoa-X сохраняет базовую микроархитектуру Zen 4 и общую платформенную основу EPYC 9004, но добавляет крупный вертикально уложенный слой L3. В обычном Zen 4 серверный CCD несет 32 МБ L3; в X-варианте к нему добавляется еще 64 МБ, поэтому на одном кэшированном CCD получается 96 МБ L3. У EPYC 9384X таких CCD восемь, что и дает 768 МБ суммарного L3. Большой кэш не повышает число исполнительных блоков и не заменяет оперативную память. Его задача — удерживать существенно больший рабочий набор ближе к ядрам, снижать число дорогостоящих обращений к DRAM и уменьшать давление на 12-канальный контроллер памяти.

Эффект зависит от структуры программы. Если расчет многократно обращается к массивам, сеткам, матрицам, таблицам или состояниям, которые помещаются в кэш или значительной частью остаются в нем между итерациями, 9384X способен значительно сократить задержки доступа. Если же набор данных намного больше 768 МБ, поток доступа почти линейный и повторное использование данных мало, главным ресурсом становится пропускная способность DDR5. В чисто вычислительных задачах, которые почти не упираются в память, более высокая частота EPYC 9374F способна быть полезнее. Поэтому обозначение X надо воспринимать как специализацию под locality-sensitive workloads, а не как универсальную гарантию преимущества над всеми 32-ядерными моделями.

3D V-Cache в серверном контексте особенно интересен при лицензировании программ на ядро. 9384X сохраняет всего 32 активных ядра, но дает им 768 МБ L3. Для дорогих CAE/EDA-пакетов, где стоимость лицензии может расти вместе с числом задействованных ядер, это позволяет строить узлы не вокруг максимального количества вычислительных потоков, а вокруг более высокой производительности на лицензированное ядро и более короткого времени решения. Именно поэтому модель находится в необычной точке линейки: она заметно дороже стандартного 32-ядерного Genoa, но ее экономику нельзя оценивать только по цене процессора.

Чиплетная компоновка: восемь CCD и отдельный I/O-кристалл

EPYC 9384X построен как многочиповый модуль. В центре находится I/O-кристалл, а вокруг него расположены вычислительные CCD. Для 9384X используется восемь CCD Genoa-X, при этом суммарно активно 32 ядра — по четыре ядра на CCD. Такая схема выглядит менее плотной по ядрам, чем у многих стандартных EPYC, но именно она дает большой объем L3 при ограниченном числе лицензируемых ядер. Восемь участков по 96 МБ образуют суммарные 768 МБ L3. Кэш физически распределен, поэтому выражение 24 МБ L3 на ядро является лишь удобным отношением общей емкости к числу активных ядер, а не описанием приватного 24-мегабайтного блока возле каждого ядра.

Распределенная топология означает, что NUMA и привязка потоков остаются важными. Доступ к локальным данным внутри своего CCD дешевле, чем путешествие через межкристальную фабрику к удаленному участку памяти или к данным, принадлежащим другому домену. Linux, гипервизоры и HPC-runtime умеют учитывать топологию, но для высокой и воспроизводимой производительности администратор обычно настраивает NUMA policy, pinning потоков, huge pages и размещение памяти вместе. Большой L3 уменьшает частоту выходов в DRAM, однако не отменяет физику распределенной системы и не превращает 768 МБ в единый монолитный кэш с одинаковой задержкой для всех 32 ядер.

Отдельный I/O-кристалл объединяет 12 каналов DDR5, PCIe 5.0, CXL и межпроцессорные интерфейсы. Это одно из преимуществ серверной SoC-архитектуры EPYC: процессору не нужен настольный набор системной логики для базовых функций памяти и высокоскоростного ввода-вывода. На практике серверная плата все равно содержит BMC, сетевые контроллеры, накопители загрузки, генераторы тактовых сигналов и другую инфраструктуру, но понятие совместимого чипсета здесь не работает так, как в десктопе. Для 9384X совместимость определяется сокетом SP5, разводкой платы, ее ревизией, BIOS, VRM, поддержкой 320–400 Вт и механикой охлаждения.

32 ядра Zen 4, 64 потока и характер однопоточной производительности

Все 32 ядра EPYC 9384X относятся к одному классу Zen 4. Гибридной архитектуры с производительными и энергоэффективными ядрами нет. Каждое ядро поддерживает SMT и может выполнять два аппаратных потока, поэтому операционная система видит 64 логических процессора на сокет. Для двухсокетного сервера это 64 физических ядра и 128 потоков. С точки зрения лицензирования важно читать условия конкретного ПО: одни продукты считают физические ядра, другие сокеты, третьи хосты или одновременные задачи, поэтому наличие SMT не всегда меняет стоимость лицензии.

Базовые 3,1 ГГц для серверного CPU с TDP 320 Вт выглядят высоко, но 9384X не является самым высокочастотным 32-ядерным EPYC 9004. Модель 9374F имеет заметно более высокий частотный профиль и предназначена именно для задач, где скорость отдельного ядра важнее дополнительного кэша. У 9384X ставка другая: приемлемая частота сочетается с огромным L3. Это видно и по общему классу производительности. В агрегате PassMark однопоточный показатель составляет около 3006 баллов, а многопоточный CPU Mark — около 72 121 балла. Эти цифры полезны как ориентир, но не описывают главное преимущество X-модели, потому что синтетический общий CPU Mark не моделирует конкретные CFD/FEA-наборы, для которых создавался процессор.

Для компиляции, скриптов управления, препроцессинга и других смешанных задач 3,9 ГГц максимум дают нормальную отзывчивость серверного узла, но это не рабочая станция с потребительским CPU на частоте свыше 5 ГГц. Если проект состоит из множества коротких последовательных этапов и почти не использует огромный L3, 9384X не раскрывает основную причину своей высокой цены. Он рационален тогда, когда критический этап действительно распараллеливается на десятки потоков или хорошо реагирует на большой кэш.

Частоты, boost и cTDP: как читать 3,1, 3,5 и 3,9 ГГц

В спецификации 9384X присутствуют три разные частотные величины. Базовая частота — 3,1 ГГц. All-core boost — 3,5 ГГц. Максимальный boost — до 3,9 ГГц. Последнее значение относится к предельной частоте отдельного ядра при нормальных серверных условиях и достаточном запасе по мощности и температуре. Оно не означает, что 32 ядра должны работать на 3,9 ГГц одновременно. All-core boost также не следует воспринимать как жестко зафиксированную частоту при любой тяжелой AVX-512-нагрузке: фактический режим зависит от характера инструкций, активности ядер, настроек системы, температуры и силового лимита.

Диапазон cTDP 320–400 Вт дает интегратору возможность настроить силовой конверт в пределах, поддержанных CPU и платформой. Установка более высокого cTDP может помочь дольше удерживать высокий темп в длительной многопоточной нагрузке, но требует платы, VRM, радиатора и воздушного канала, валидированных именно для такого режима. Это не настольный разгон. Для серверов первична повторяемость результатов, предсказуемая температура, отсутствие ошибок и соответствие профилю производителя системы. Любая смена параметров мощности после развертывания должна сопровождаться повторной проверкой производительности, потребления и стабильности на реальном рабочем наборе.

Пользовательского сценария с ручным множителем и подъемом напряжения, характерного для Ryzen, у 9384X нет. Отдельные BIOS дают тонкие настройки power profile, deterministic behavior, NUMA-per-socket, cTDP и управления памятью. Их надо рассматривать как серверные инструменты настройки платформы. Снижение напряжения как универсальная официальная процедура для 9384X не документировано; производственный узел лучше оптимизировать через поддержанные профили мощности и управление нагрузкой, а не через невалидированные значения напряжения.

Кэш-подсистема: почему 768 МБ L3 меняют поведение прикладного ПО

Каждое ядро Zen 4 имеет 32 КБ кэша инструкций L1 и 32 КБ кэша данных L1, а также 1 МБ приватного L2. Для 32 активных ядер суммарная емкость L2 составляет 32 МБ. Главный уровень — 768 МБ распределенного L3. В Genoa-X дополнительный слой 3D V-Cache увеличивает емкость L3 на CCD с 32 до 96 МБ. Такой объем особенно заметен в задачах с интенсивным повторным чтением сеток, разреженных структур, индексов и промежуточных данных. Когда данные остаются на уровне L3, ядрам реже приходится ждать DDR5, а память обслуживает меньше повторных транзакций.

Нельзя оценивать пользу 3D V-Cache только отношением «кэш больше в три раза — программа быстрее в три раза». Ускорение нелинейно. Все зависит от размера working set, шаблона доступа, числа параллельных потоков и того, насколько хорошо код локализует данные. У одной модели CFD дополнительный L3 способен заметно сократить время итерации, у другой после определенного размера сетки эффект падает, потому что рабочий набор все равно многократно превосходит кэш. Наоборот, иногда рост кэша предотвращает переход через критическую границу, после которой программа резко начинает упираться в DRAM; тогда преимущество X-модели выглядит непропорционально большим.

Есть и программная сторона. Компилятор, структура данных и привязка потоков способны определить, попадет ли рабочий набор в локальный кэш конкретного CCD. При плохой локальности большой общий объем не используется оптимально. Для HPC-узла имеет смысл профилировать cache misses, memory bandwidth, NUMA traffic и stalled cycles на типичном расчете, а не только смотреть на загрузку CPU. 9384X особенно хорошо показывает, почему метрика «процент загрузки процессора» недостаточна: 100-процентная занятость потоков может скрывать длинные ожидания памяти, которые как раз и пытается уменьшить 3D V-Cache.

DDR5: 12 каналов, 4800 MT/s и до 460,8 ГБ/с на сокет

Контроллер памяти EPYC 9384X поддерживает DDR5 и 12 каналов на сокет. Максимальная заявленная скорость для поколения EPYC 9004 — 4800 MT/s, а теоретическая полоса на один процессор составляет 460,8 ГБ/с. Это в полтора раза больше каналов, чем у восьмиканального EPYC предыдущих поколений, и заметный шаг по пропускной способности. Для 2P-системы локальная суммарная теоретическая полоса двух контроллеров еще выше, но удаленный доступ через межсокетную фабрику имеет дополнительную цену по задержке, поэтому размещение памяти по NUMA-узлам остается принципиально важным.

Платформа EPYC 9004 рассчитана на серверную ECC-память, прежде всего DDR5 RDIMM. Максимальная емкость поколения достигает 6 ТБ на сокет при поддерживаемой конфигурации DIMM; конкретная плата может иметь 12 или 24 слота на процессор и собственные ограничения по емкости модулей. Нельзя переносить предел из общей спецификации CPU прямо на любую материнскую плату. Перед закупкой больших объемов памяти требуется проверить QVL, таблицу population rules и версию BIOS конкретной системы. Особенно это важно для 3DS RDIMM большой емкости, где поддержка зависит от платы и прошивки.

Для пропускной способности следует заполнять каналы симметрично. У 12-канального контроллера конфигурация из четырех или шести модулей может быть экономичной, но она оставляет часть каналов пустой и ограничивает полосу, что плохо сочетается с дорогим HPC-процессором. В расчетных узлах обычно стремятся использовать все 12 каналов на сокет, подбирая емкость модулей под нужный общий объем. Два DIMM на канал платформа допускает, однако электрическая нагрузка и правила ранжирования могут влиять на режим памяти; окончательная скорость определяется конкретными модулями и таблицей производителя сервера.

Большой L3 не делает широкую память лишней. Как только набор данных перестает помещаться в 768 МБ или приложение выполняет потоковую обработку без повторного использования, DDR5 снова становится основным ресурсом. Поэтому конфигурация 9384X с малым числом каналов — экономия не в том месте. Для CFD, EDA и научных пакетов желательно рассматривать процессор, кэш и подсистему памяти как единую систему, а не как независимые спецификации.

PCIe 5.0, CXL и двухсокетная связность

На один EPYC 9384X приходится до 128 линий PCIe 5.0. Это позволяет соединять с быстрыми NVMe-накопители, сетевые адаптеры 100/200/400GbE или InfiniBand, GPU и другие ускорители без внешнего настольного PCH. Часть линий платформы способна работать с CXL 1.1+; для EPYC 9004 предусмотрено до 64 линий CXL. Еще часть физического ресурса может быть переназначена под SATA. Конкретный сервер редко выводит все возможности наружу одновременно: разводка определяется числом слотов, backplane, riser-картами и двухсокетной топологией.

В 2P-системе процессоры соединяются xGMI поверх физического ресурса высокоскоростных линий. Поэтому простое умножение 128 PCIe на два и ожидание 256 пользовательских линий некорректно. Межсокетная связность требует части линий, а OEM выбирает схему, которая балансирует I/O и пропускную способность между CPU. На практике некоторые 2P-платформы способны дать очень большой суммарный PCIe-бюджет, но точное число доступных слотов и линий надо брать из block diagram конкретного сервера.

Для HPC это особенно важно при установке нескольких GPU и сетевых карт. Нужно знать, к какому сокету физически связан каждый слот, и размещать процесс, память и устройство в одном NUMA-домене. Иначе трафик к GPU или NIC может ходить через второй процессор и получать дополнительную задержку. 9384X дает достаточную платформенную связность для сложных узлов, но максимальная производительность достигается только при грамотном размещении устройств.

Встроенная графика и медиавозможности

У AMD EPYC 9384X нет встроенного Radeon GPU и нет ориентированного на пользовательское видео аппаратного медиаблока. Это серверный CPU. Изображение на консоли многих плат обеспечивает BMC — отдельный контроллер управления с простым VGA-выходом. Такой BMC нужен для удаленной администрации и сервисной консоли, а не для 3D-рендеринга или видеомонтажа. Наличие VGA на задней панели сервера нельзя трактовать как встроенную графику 9384X.

Инструкции Zen 4, AVX-512 и применение в AI

Zen 4 принес серверным EPYC поддержку AVX-512. В 9384X доступны современные векторные инструкции, в том числе AVX-512 VNNI и BF16, а также привычные AVX2, FMA, AES и другие расширения x86-64. Реализация Zen 4 выполняет 512-битные операции через 256-битный datapath, что отличает ее от архитектур с физически 512-битным исполнением за один проход. Для прикладного пользователя важнее итоговая производительность библиотеки, а не только ширина инструкции: хорошо оптимизированный код способен заметно выиграть от VNNI, BF16 и новых путей обработки данных.

У 9384X нет отдельного NPU или тензорного ускорителя. CPU-инференс и часть AI-подготовки выполняются на обычных ядрах с SIMD. В задачах, где модель и часто используемые веса помещаются в кэш, 768 МБ L3 могут уменьшить обращения к DDR5. Однако крупные современные модели обычно ограничены объемом памяти и матричной производительностью, поэтому для обучения и массового инференса специализированные GPU остаются основным выбором. EPYC 9384X в таких системах логично рассматривать как сильный host CPU с большой I/O-полосой, а не как замену дискретному AI-ускорителю.

Виртуализация, безопасность и RAS

EPYC 9384X поддерживает аппаратную виртуализацию AMD-V/SVM и типичный для поколения EPYC 9004 набор функций защищенной виртуализации. AMD Infinity Guard объединяет механизмы, связанные с защищенным запуском и шифрованием памяти, а семейство SEV содержит SEV, SEV-ES и SEV-SNP. В практической инфраструктуре наличие CPU-функции — только одна часть цепочки: требуются поддержка конкретного BIOS, BMC, гипервизора и иногда прошивок платформы. Для защищенных виртуальных машин конфигурацию следует строить по матрице совместимости выбранного стека.

Серверная платформа рассчитана на ECC DDR5 и корпоративные RAS-сценарии: диагностику ошибок, машинные события, журналирование и восстановление там, где это допускает система. Точный набор RAS-параметров отличается по OEM, поэтому его нельзя сводить к одной строке процессорной спецификации. Для production-сервера значение имеют также резервирование питания, BMC-телеметрия, корректное распределение вентиляторов, прошивки накопителей, сетевых адаптеров и процедура обслуживания.

Сокет SP5, платы, BIOS и практическая совместимость

EPYC 9384X устанавливается в сокет SP5. Физическая совместимость сокета недостаточна: плата должна явно поддерживать Genoa-X и конкретный CPU в своей CPU support list. Нужны подходящая ревизия PCB, BIOS с нужным микрокодом, VRM для 320 Вт и, при использовании верхнего cTDP, для 400 Вт. Универсального номера минимального BIOS для всех плат не существует. Один и тот же 9384X на Supermicro, GIGABYTE, HPE или другой платформе может требовать разные версии прошивки.

Проверенный пример — двухсокетные платы и системы Supermicro семейства H13DSH, рассчитанные на EPYC 9004 и высокие силовые классы. У GIGABYTE в QVL также встречается 9384X с OPN 100-000000791, что дополнительно подтверждает этот официальный номер. Однако даже присутствие CPU в QVL одной ревизии не распространяется автоматически на другую ревизию платы. Перед закупкой CPU для уже установленного сервера надо сверить точную маркировку платы, текущий BIOS и таблицу поддержки именно этого варианта.

SP5 также используется более новыми серверными поколениями на части платформ, но это не гарантирует автоматический апгрейд любой платы на любой последующий EPYC. Плата должна получить поддержку нового поколения в BIOS, выдерживать его силовые требования и иметь подходящую ревизию. Для владельца 9384X потенциал платформы хорош, однако план апгрейда следует составлять по конкретной модели сервера, а не по одному совпадению сокета.

Питание, охлаждение и требования к корпусу

Default TDP EPYC 9384X составляет 320 Вт, а cTDP допускает 320–400 Вт. Это высокий тепловой поток для одного сокета. Охлаждение должно быть спроектировано под SP5 и конкретное шасси. Серверный радиатор работает вместе с направленным воздушным каналом: высокооборотные вентиляторы создают статическое давление, воздух последовательно проходит через накопители, память, VRM и CPU. Большой пассивный радиатор без соответствующего потока в обычном корпусе не эквивалентен валидированному серверному охлаждению.

В 2P-конфигурации только два процессора имеют суммарный default TDP 640 Вт, а верхняя граница cTDP дает до 800 Вт расчетного класса для пары CPU. К этому добавляются DDR5, BMC, NIC, NVMe и ускорители. Поэтому выбор блока питания нельзя делать по TDP одного процессора. OEM обычно рассчитывает систему целиком и задает разрешенные сочетания CPU, GPU, riser и вентиляторов. При самостоятельной сборке такой тепловой расчет становится обязанностью интегратора.

AMD не публикует в карточке 9384X отдельное универсальное значение Tjmax, которое можно было бы безопасно использовать как настольный предел температуры. Корректнее следить за телеметрией BMC и порогами конкретной платформы. Серверная система сама знает предупреждающие и критические уровни для своей комбинации CPU, платы и прошивки. Если под длительной нагрузкой вентиляторы уходят в максимум, а частоты снижаются, проблему надо решать воздушным каналом, радиатором, ambient temperature или силовым профилем, а не ориентироваться на случайное температурное число из карточки другого EPYC.

Методика чтения тестов: почему один рейтинг не описывает 9384X

Для 9384X особенно опасно делать вывод по одному универсальному бенчмарку. Общие синтетические рейтинги преимущественно показывают вычислительную пропускную способность и масштабирование потоков, но главный аппаратный ресурс модели — 768 МБ L3 — раскрывается только при подходящем working set. Поэтому ниже результаты разделены по методикам. PassMark используется как агрегированный индикатор общей и однопоточной скорости, а технические расчеты AMD — как пример поведения в CAE/CFD/HPC относительно Intel Xeon CPU Max 9462 в одинаковом 32-ядерном классе.

Результаты производителя надо читать как vendor benchmark. Они полезны, поскольку раскрывают точные приложения, число сокетов и режим конкурента, но не являются независимой лабораторией. Сравнение нормализовано относительно системы Intel, а не дано абсолютным временем для каждого теста. Поэтому коэффициент 1,72x в LS-DYNA означает результат конкретного набора и стенда, а не обещание, что любой проект пользователя ускорится на 72 процентов. Для закупки большого кластера правильная практика — пилотный прогон собственного кейса.

PassMark PerformanceTest: агрегированные результаты

Бенчмарк / версияНагрузкаAMD EPYC 9384XКонфигурацияЭпоха данныхПримечание
PassMark PerformanceTest V10, CPU MarkСводная многопоточная72 121 балл1× EPYC 9384X, публичные отправленные результаты17.08.2026Агрегат, 5 образцов в рейтинге; погрешность отмечена как высокая
PassMark PerformanceTest V10, Single ThreadОдин поток3006 баллов1× EPYC 9384X17.08.2026Сводный рейтинг одного потока; 3D V-Cache отражает слабо
PassMark V10Integer Math301 066 MOps/s1× EPYC 9384X15.08.2026Публичный агрегат PerformanceTest V10
PassMark V10Floating Point Math181 016 MOps/s1× EPYC 9384X15.08.2026Публичный агрегат PerformanceTest V10
PassMark V10Prime Numbers719 млн простых/с1× EPYC 9384X15.08.2026Синтетическая нагрузка PerformanceTest V10
PassMark V10Random String Sorting124 741 тыс. строк/с1× EPYC 9384X15.08.2026Синтетическая сортировка PerformanceTest V10
PassMark V10Data Encryption71 179 МБ/с1× EPYC 9384X15.08.2026Синтетическое шифрование PerformanceTest V10
PassMark V10Data Compression1 118 057 КБ/с1× EPYC 9384X15.08.2026Синтетическое сжатие PerformanceTest V10
PassMark V10Physics10 398 кадров/с1× EPYC 9384X15.08.2026CPU physics PerformanceTest V10, не игровой FPS
PassMark V10Extended Instructions76 143 млн матриц/с1× EPYC 9384X15.08.2026PerformanceTest V10, расширенные инструкции

PassMark показывает важный контраст: 9384X не выглядит рекордсменом общего многопоточного рейтинга среди серверных CPU, потому что в нем всего 32 ядра. У стандартных EPYC с 48, 64 или 96 ядрами общий CPU Mark закономерно выше. Однако 9384X создавался не ради максимального количества универсальных потоков на сокет. Его задача — дать 32 ядрам очень большой кэш и хорошую память, что может быть экономически выгодно в лицензируемых технических приложениях.

AMD technical computing: 2P EPYC 9384X против 2P Xeon CPU Max 9462

Приложение / тестТип нагрузкиРезультат 2P EPYC 9384XСтенд сравненияДата / эпохаОсобенность методики
Ansys LS-DYNA; версия в опубликованной сводке не указанаЯвная динамика, CAEоколо 1,72×2× 32C EPYC 9384X vs 2× 32C Xeon CPU Max 9462, Intel Cache modeноябрь 2023Нормировано к системе Intel
Altair Radioss; версия в опубликованной сводке не указанаСтруктурный анализ / crashоколо 1,42×тот же класс 2P 32Cноябрь 2023AMD internal testing
Altair AcuSolve; версия в опубликованной сводке не указанаCFDоколо 1,27×2P 9384X vs 2P 9462 Cacheноябрь 2023Нормированный коэффициент
Ansys CFX; версия в опубликованной сводке не указанаCFD / multiphysicsоколо 1,59×2P 9384X vs 2P 9462 Cacheноябрь 2023Система AMD и Cache mode завершили пять тестов
Ansys Fluent, набор 15 тестов; версия в опубликованной сводке не указанаCFDоколо 1,33×2P 9384X vs 2P 9462 Cacheноябрь 2023Для HBM mode часть моделей не помещалась, сравнение здесь с Cache mode
OpenFOAM; версия в опубликованной сводке не указанаCFDоколо 1,14×2P 9384X vs 2P 9462 Cacheноябрь 2023Vendor benchmark
GROMACS; версия в опубликованной сводке не указанаМолекулярная динамикаоколо 1,31×2P 9384X vs 2P 9462 Cacheноябрь 2023Vendor benchmark
NAMD; версия в опубликованной сводке не указанаМолекулярная динамикаоколо 1,02×2P 9384X vs 2P 9462 Cacheноябрь 2023Практически паритет
CP2K; версия в опубликованной сводке не указанаКвантовая химияоколо 1,79×2P 9384X vs 2P 9462 Cacheноябрь 2023HBM-only вариант Intel не вмещал рабочий набор
WRF; версия в опубликованной сводке не указанаПрогноз погодыоколо 1,25×2P 9384X vs 2P 9462 Cacheноябрь 2023HBM-only вариант Intel не вмещал рабочий набор
Shearwater Reveal; версия в опубликованной сводке не указанаСейсмическая обработкапримерно 1,00×2P 9384X vs 2P 9462 Cacheноябрь 2023Пример нагрузки без заметного преимущества
SLB INTERSECT; версия в опубликованной сводке не указанаМоделирование резервуаровоколо 1,29×2P 9384X vs 2P 9462 Cacheноябрь 2023Vendor benchmark
SLB ECLIPSE; версия в опубликованной сводке не указанаМоделирование резервуаровоколо 1,90×2P 9384X vs 2P 9462 Cacheноябрь 2023Один из крупнейших выигрышей набора

Эта таблица лучше раскрывает характер 9384X, чем общий CPU Mark. Разброс от почти паритета в NAMD и Shearwater Reveal до приблизительно 1,79–1,90x в CP2K и ECLIPSE показывает, что дополнительный L3 не дает одинакового результата повсюду. В одних кодах кэш резко снижает память-зависимые задержки, в других узкое место находится в вычислительной части или структура доступа хуже использует локальность. Это нормальное поведение специализированного CPU.

Ansys Fluent pump2 и расчет плотности узлов

Показатель2P AMD EPYC 9384X2P Intel Xeon Platinum 8462Y+УсловияЭпоха
Ansys Fluent pump2, производительность на сервероколо 14 482 jobs/dayоколо 8 006 jobs/day32-ядерные процессоры, vendor/TCO modelизмерения 2023, опубликованный расчет 2024
Серверы для около 165 000 jobs/day1221Расчет на основе измеренной производительности2024
Сокращение числа серверовоколо 43%база сравненияОценка AMD2024
Снижение потребления инфраструктурыдо примерно 38%база сравненияМодель для данного сценария2024
Оценка трехлетнего TCOдо примерно 39% нижебаза сравненияЗависит от цен, лицензий и инфраструктуры2024

Эти цифры не следует переносить на любой CFD-проект. Они показывают другой важный аспект: процессор с меньшим числом ядер может быть выгоден не только временем решения, но и плотностью работы на сервер при ограничениях лицензии. Если более быстрый 32-ядерный узел заменяет несколько менее производительных узлов, уменьшаются количество серверов, сетевых портов, лицензий управления, PDU-розеток и объем администрирования. Но модель TCO чувствительна к стоимости электричества, лицензий, оборудования и степени загрузки, поэтому ее надо пересчитывать для конкретного центра обработки данных.

CFD, FEA и CAE: основной сценарий для 9384X

CFD и FEA часто работают с большими разреженными структурами и итерационными решателями. Производительность здесь ограничивается не только FLOPS, но и движением данных. Обычный CPU может иметь свободные исполнительные блоки, пока ядро ждет очередную порцию из DRAM. 768 МБ L3 способны удержать больше сеточных данных, коэффициентов и промежуточных массивов рядом с ядрами. Именно поэтому 9384X особенно силен в части Ansys, Altair и OpenFOAM-нагрузок.

Практический выбор между 9384X и 9374F сводится к профилю конкретного solver. Если cache miss rate высок, а рабочий набор имеет повторное использование, 9384X получает шанс компенсировать более низкие частоты. Если расчет почти не использует повторно данные и хорошо масштабируется по чистой арифметике, частотный 9374F может быть конкурентнее. Лучший способ выбрать — запустить типичный production case на обоих профилях или хотя бы на облачных/тестовых узлах с близкой архитектурой и измерить не только elapsed time, но и стоимость лицензии на завершенный job.

EDA и лицензирование на ядро

Electronic Design Automation — еще один естественный рынок 9384X. Задачи размещения, трассировки, верификации и симуляции способны потреблять большие структуры данных и одновременно иметь дорогое лицензирование. Дополнительный L3 полезен не во всех стадиях EDA, но сама комбинация 32 ядер и 768 МБ создает привлекательный баланс: сервер не раздувает количество лицензируемых ядер до 64 или 96, сохраняя высокий кэш-ресурс на ядро.

Молекулярная динамика, квантовая химия и научный код

В GROMACS vendor-тест показал заметное преимущество 2P 9384X над 2P Xeon CPU Max 9462 в Cache mode, а в NAMD результат оказался близок к паритету. Это хороший пример зависимости от реализации. Два научных пакета из одной широкой области могут иметь разную векторизацию, шаблоны доступа и сетевое масштабирование. Нельзя делать вывод о всей молекулярной динамике по одному приложению.

CP2K в том же наборе показал один из крупнейших коэффициентов в пользу 9384X. Большая память Intel HBM-only имела ограничение по емкости, и конкретный рабочий набор туда не помещался, тогда как Genoa-X использовал обычную DDR5 вместе с большим кэшем. Для пользователя это напоминает, что емкость, пропускная способность и кэш — разные ресурсы. Очень быстрая память малой емкости не всегда лучше более емкой системной памяти, особенно если задача не помещается в ограниченный локальный пул.

Компиляция, рендеринг и универсальные серверные нагрузки

При компиляции крупных проектов 32 ядра и 64 потока дают высокий параллелизм, однако 9384X не является экономически очевидным компиляционным CPU. Большой L3 способен помочь при некоторых графах сборки и линковке, но цена X-модели оправдана прежде всего специализированными техническими нагрузками. Для CI, где сотни независимых файлов компилируются параллельно и данные хорошо кэшируются файловой системой, более многоядерный стандартный EPYC часто дает выше jobs/hour на доллар.

CPU-рендеринг похож. Blender, V-Ray и другие path tracing engine хорошо масштабируются по ядрам, и в них максимальное число ядер обычно важнее гигантского L3. 32-ядерный 9384X будет быстрым серверным процессором, но 64- или 96-ядерный EPYC способен выдавать гораздо больше кадров в час при подходящем энергобюджете. Поэтому покупать 9384X специально для рендер-фермы имеет смысл только тогда, когда тот же узел решает cache-sensitive задачи или лицензирование/ПО накладывает ограничения.

AI и data science: где большой L3 помогает, а где нужен GPU

CPU-инференс небольших моделей, предобработка данных, feature engineering и некоторые численные библиотеки способны использовать AVX-512 VNNI/BF16 и большой L3. Если набор параметров или таблиц повторно читается и помещается в кэш, 9384X сокращает обращения к DDR5. На низколатентных сервисах это иногда важнее абсолютной матричной производительности.

Для обучения больших нейросетей 9384X не заменяет GPU. У него нет специализированных тензорных блоков и высокоскоростной памяти ускорителя. Оптимальная роль в AI-сервере — host processor для подготовки батчей, сетевого стека, storage, orchestration и обслуживания GPU. 128 линий PCIe 5.0 дают хорошую основу для нескольких ускорителей и быстрых NIC, однако реальное число GPU зависит от платы и riser. Если AI — единственная нагрузка, надо сравнивать 9384X с более дешевыми SP5-моделями по тому, насколько CPU-side этап действительно ограничивает систему.

Игры: почему для EPYC 9384X нет смысла гоняться за FPS

EPYC 9384X технически способен запускать обычное x86-приложение при наличии совместимой ОС и дискретной видеокарты, но игровая сборка противоречит его назначению. У процессора нет iGPU, платы SP5 огромны и дороги, RDIMM имеет серверную организацию, а однопоточная частота 3,9 ГГц заметно ниже современных игровых настольных CPU. Огромные 768 МБ L3 похожи по идее на преимущества настольных X3D-моделей, но серверная топология с восемью CCD и 32 активными ядрами совершенно другая.

Надежных контролируемых игровых тестов именно 9384X с указанием разрешения, видеокарты, среднего FPS и 1% low нет в достаточном объеме, поэтому придумывать таблицу игровых кадров нельзя. Для оценки этой модели игровые результаты не нужны: сервер покупают под расчетные пакеты, виртуализацию или специализированный backend. Если задача — игры, настольная платформа будет быстрее в чувствительных к latency сценариях, дешевле и проще по памяти, охлаждению и периферии.

Энергопотребление и эффективность

320 Вт TDP выглядит высоким, но серверную эффективность оценивают не только ваттами на сокет. Если 9384X завершает расчет заметно быстрее и освобождает узел для следующей работы, энергия на один завершенный job способна быть ниже. В кластере важен показатель jobs/kWh или simulations/day/rack, а не минимальный TDP отдельного CPU. Vendor-примеры CFD демонстрируют именно такую логику: более производительный узел способен уменьшить число серверов для заданной суточной производительности.

Верхний cTDP 400 Вт надо использовать осмысленно. Повышение power limit имеет смысл только там, где приложение реально получает дополнительную частоту и сокращает время решения сильнее, чем растет энергопотребление. Для memory-bound кода, который уже упирается в DRAM или latency, увеличение мощности может дать небольшую прибавку. Для compute-bound workload эффект обычно выше. Измерять следует на конкретном профиле с одинаковой памятью, BIOS и температурой.

Стабильность, настройка и разумный тюнинг

Для производственного 9384X полезнее оптимизировать системные параметры, чем пытаться разгонять ядра. Наибольшую отдачу часто дают корректное заполнение 12 каналов памяти, актуальный BIOS, NUMA-aware scheduler, локальное размещение памяти, huge pages, подходящий governor и affinity. Для MPI важны rank placement и сетевой affinity; для многопоточного solver — pinning и число потоков на домен.

В BIOS EPYC-систем встречаются профили deterministic performance/power, настройки NPS и лимита мощности. Их влияние надо измерять на своем приложении. Один профиль способен улучшить воспроизводимость частоты, другой — максимальную эффективность. После изменений следует проверить не только средний runtime, но и разброс между повторными запусками. Для лицензируемого HPC стабильная длительность задания иногда ценнее пикового результата одного удачного прогона.

Диагностическая деактивация 3D V-Cache на некоторых платформах позволяет оценить чувствительность программы к дополнительному кэшу, однако это не штатный способ повысить производительность. При деактивированном дополнительном слое преимущество X-модели теряется, и покупка дорогого 9384X перестает иметь смысл. Для production лучше оставить валидированную конфигурацию и использовать сравнение с обычным Genoa на отдельном тестовом узле.

Сравнение с ближайшими AMD EPYC 9004

МодельЯдра / потокиБаза / max boostL3Default TDPСокетыОсновная специализация
EPYC 9384X32 / 643,1 / 3,9 ГГц768 МБ320 Вт1P / 2PКэш-чувствительные HPC, CAE, CFD, EDA
EPYC 935432 / 643,25 / 3,8 ГГц256 МБ280 Вт1P / 2PУниверсальная 32-ядерная серверная нагрузка
EPYC 9374F32 / 643,85 / 4,3 ГГц256 МБ320 Вт1P / 2PВысокая производительность на ядро
EPYC 9184X16 / 323,55 / 4,2 ГГц768 МБ320 Вт1P / 2PМаксимум кэша на лицензируемое ядро
EPYC 9684X96 / 1922,55 / 3,7 ГГц1152 МБ400 Вт1P / 2PМаксимальная throughput-производительность Genoa-X

EPYC 9354 — рациональная контрольная точка. Он имеет те же 32 ядра и ту же платформу, но намного меньший L3 и более низкий TDP. Если приложение почти не реагирует на объем кэша, переплата за 9384X не оправдывается. 9354 также проще охлаждать. Но в расчетах, где дополнительные сотни мегабайт L3 резко уменьшают трафик к памяти, 9384X может окупить разницу сокращением runtime.

EPYC 9374F — другой полюс 32-ядерного выбора. Его базовая и максимальная частоты существенно выше, а L3 составляет 256 МБ. Для последовательных и compute-bound этапов он часто логичнее. Для cache-sensitive CFD/FEA 9384X способен обойти частотное преимущество благодаря данным, остающимся ближе к ядрам. Сравнивать эти модели по одной частоте нельзя — они оптимизированы под разные ограничения.

EPYC 9184X имеет те же 768 МБ L3 при всего 16 ядрах, поэтому условно дает 48 МБ L3 на активное ядро. Это чрезвычайно специализированный вариант для дорогого лицензирования и задач, где 16 быстрых ядер достаточно. 9384X вдвое увеличивает ядра при той же общей емкости кэша и обычно является более универсальным X-вариантом.

EPYC 9684X — 96-ядерный флагман Genoa-X с 1152 МБ L3. Он гораздо сильнее по общей throughput-производительности и подходит для задач, хорошо масштабирующихся на десятки ядер, но стоит значительно дороже и имеет TDP 400 Вт. При лицензировании на ядро 96C может оказаться экономически бессмысленным, тогда как 32C 9384X попадает в более удобную лицензионную ступень.

Сравнение с Intel Xeon CPU Max: кэш против HBM

В 2023 году AMD позиционировала 9384X против 32-ядерного Intel Xeon CPU Max 9462. Это содержательное сравнение, потому что обе платформы пытаются решить память-зависимую проблему разными способами. Genoa-X увеличивает L3 возле ядер и использует 12-канальную DDR5, а Xeon CPU Max добавляет высокоскоростную HBM-память. В HBM-only режиме у Xeon CPU Max емкость памяти ограничена 64 ГБ на сокет, поэтому некоторые большие тесты не помещались; Cache mode использует HBM как дополнительный быстрый уровень перед обычной DRAM.

Результаты AMD показывают, что 9384X особенно хорошо выступал в LS-DYNA, CFX, CP2K и ECLIPSE, но не выигрывал радикально в NAMD и Reveal. Это подчеркивает, что архитектурный выбор нельзя свести к слогану «больше кэша лучше HBM» или наоборот. HBM дает огромную полосу, а 3D V-Cache — очень низколатентное хранение часто используемых данных. Реальный победитель определяется приложением и размером рабочего набора.

Сегодня сравнение с CPU Max уже историческое: рынок серверов ушел вперед, появились новые поколения AMD EPYC и Intel Xeon. Однако оно остается полезным для понимания характера 9384X и для закупки систем с вторичного рынка. При одинаково выгодной цене старый специализированный CPU может быть быстрее нового универсального именно в нужном solver, поэтому поколение само по себе не заменяет application benchmark.

Односокетная или двухсокетная система

9384X поддерживает 1P и 2P. Односокетный узел дает 32 ядра, 64 потока, 12 каналов DDR5 и до 128 линий PCIe 5.0 без межсокетной NUMA-сложности. Для многих инженерных лицензий это очень привлекательная конфигурация: одна большая память, одна топологическая группа CPU и меньшая стоимость платы. 1P также проще охлаждать и плотнее размещать в стойке при заданном power budget.

Два 9384X дают 64 ядра, 128 потоков и два независимых контроллера памяти. Пиковая вычислительная мощность возрастает, но приложение должно хорошо работать с NUMA. Поток на сокете 0, читающий память сокета 1, платит дополнительную задержку. Неправильное first-touch размещение может заметно ухудшить результат. В серьезном 2P HPC-узле процесс запускают с явной привязкой rank/thread и проверяют, что память распределена в соответствии с вычислениями.

2P также меняет I/O. Межпроцессорная фабрика использует часть физического lane budget, а устройства привязаны к конкретному CPU. Перед покупкой нескольких GPU или сетевых карт надо изучить block diagram платы. На некоторых задачах два независимых 1P-узла, соединенных быстрой сетью, дают лучшую отказоустойчивость и удобнее для scheduler, чем один 2P. На других лицензия на узел или большой объем общей памяти делает 2P более выгодным.

Узкие места реальной системы с EPYC 9384X

Первое типичное узкое место — неполное заполнение каналов памяти. Приобретать 9384X и ставить четыре RDIMM на сокет означает терять большую часть потенциальной полосы DDR5. Второе — недостаточный объем RAM. Если solver начинает активно использовать swap, преимущество 3D V-Cache исчезает на фоне задержек накопителя. Третье — неверная NUMA-привязка в 2P, когда трафик постоянно пересекает межсокетную связь.

Четвертое ограничение — storage. В EDA, компиляции и некоторых научных workflow промежуточные файлы могут быть огромными. Один медленный SATA SSD способен сделать дорогой CPU почти безразличным к времени этапа. PCIe 5.0 позволяет строить очень быстрые NVMe-массивы, но RAID, файловая система и endurance должны соответствовать записи. Пятое — сеть в кластере: слабая fabric ограничит MPI scaling еще до того, как 9384X исчерпает собственные вычислительные ресурсы.

Шестое — охлаждение. При 320–400 Вт частота зависит от того, насколько уверенно система отводит тепло. Сервер, рассчитанный на 225–280 Вт, нельзя считать подходящим только потому, что физический сокет совпадает. Седьмое — лицензии. Неправильно выбранный тип лицензирования способен сделать дополнительный сокет самым дорогим компонентом системы, превосходящим стоимость железа.

Примеры сбалансированных конфигураций

1P HPC/CAE-узел

Для одного 9384X разумна плата SP5 с явной поддержкой Genoa-X и силового класса 400 Вт, 12 одинаковых RDIMM для заполнения всех каналов, один-два enterprise NVMe под систему и scratch, высокоскоростной сетевой адаптер и шасси с валидированным воздушным каналом. Объем памяти выбирается по модели: 384 ГБ при 12×32 ГБ, 768 ГБ при 12×64 ГБ или выше. Для CFD лучше иметь небольшой запас RAM, чтобы крупные кейсы не переходили к swap.

2P расчетный узел

Два 9384X требуют 24-канальной конфигурации памяти для максимального использования контроллеров, мощного охлаждения и NUMA-aware настройки. Такой узел подходит, когда программа хорошо масштабируется на 64 физические ядра, а лицензия и инфраструктура оправдывают два сокета. Для длительных производственных расчетов особенно важны резервные БП, BMC-мониторинг и проверка airflow при полностью установленной памяти.

GPU/HPC host

При установке нескольких GPU CPU следует подбирать не только по ядрам, но и по роли host. 9384X оправдан, если CPU-side часть расчетов кэш-чувствительна или на том же узле выполняются тяжелые CPU-солверы. Если GPU почти полностью берет вычисления на себя, более дешевый EPYC 9004 может обеспечить те же PCIe-линии и достаточный host throughput. Экономию тогда лучше вложить в память, NIC или GPU.

Апгрейд с Milan-X и обычных Genoa

Переход с EPYC 7003 Milan-X на 9384X требует новой платформы SP5 и DDR5, потому что Milan-X использует SP3 и DDR4. Это не drop-in upgrade. Выгода приходит сразу в нескольких местах: Zen 4, 12 каналов DDR5, PCIe 5.0 и новая I/O-платформа. Но стоимость миграции охватывает плату, память и часто новое шасси/охлаждение, поэтому сравнивать только цену CPU неправильно.

Переход с обычного Genoa на 9384X физически проще, если существующая SP5-плата поддерживает Genoa-X, нужный BIOS и 320–400 Вт. Однако замена стандартного 32-ядерного CPU оправдана только после измерения cache sensitivity. Если production-код уже ограничен арифметикой или storage, дополнительные 512 МБ L3 относительно 256-мегабайтной 32-ядерной модели не дадут пропорционального эффекта. Хороший пилот — прогонить один и тот же кейс, сравнить elapsed time, DRAM bandwidth и LLC misses.

Актуальность AMD EPYC 9384X в 2026 году

К 2026 году 9384X уже не новое поколение и не абсолютный лидер серверного рынка. Появились более свежие EPYC с новой микроархитектурой и более высокой производительностью. Тем не менее Genoa-X остается необычно специализированным. 32 ядра с 768 МБ L3 — конфигурация, которая может быть привлекательна для уже сертифицированного ПО, существующих SP5-систем и закупок на вторичном рынке. Цена отдельных tray/open-box экземпляров снизилась значительно относительно 5529 долларов 1kU на старте.

Для нового кластера стоит сравнивать 9384X не только с соседними EPYC 9004, но и с актуальными платформами по performance per licensed core, энергии на job и общей стоимости владения. Новое поколение способно быть быстрее даже без столь огромного L3 за счет IPC, частоты и памяти. С другой стороны, если измеренный solver получает сильный выигрыш от 3D V-Cache, скидка на 9384X и уже имеющаяся SP5-инфраструктура могут перевесить преимущество нового CPU.

Как не перепутать EPYC 9384X с соседними SKU и сомнительными образцами

На крышке должен присутствовать индекс 9384X. Для текущего tray-исполнения основной Product ID — 100-000001256; второй официальный OPN, встречающийся в документации AMD и QVL плат, — 100-000000791. Соседний 9184X имеет 16 ядер, а 9684X — 96 ядер и 1152 МБ L3. EPYC 9374F также 32-ядерный, но имеет 256 МБ L3 и более высокую частоту. Уже одно сочетание 32C/64T и 768 МБ L3 хорошо отделяет 9384X от большинства соседей.

Нельзя ориентироваться только на текст продавца. Некоторые агрегаторы автоматически подставляют неправильный объем кэша или частоту. Лучше требовать фотографию маркировки CPU, сверять OPN и затем проверять CPU support list платы. Инженерные образцы ES/QS имеют отдельный риск совместимости и микрокода; для production-сервера нужен серийный процессор с нормальной прослеживаемостью. Если продавец не показывает маркировку и не дает понятных условий возврата, низкая цена не компенсирует риск.

Не следует искать для 9384X Intel S-Spec или ARK ID. Эти системы идентификации принадлежат Intel и к AMD не применяются. У AMD главными идентификаторами здесь являются модель и OPN/Product ID. OEM-номера HPE или другого производителя могут обозначать комплект апгрейда с этим CPU, но они не заменяют OPN самого процессора.

Сильные стороны AMD EPYC 9384X

  • 768 МБ L3. Огромный объем кэша для 32 ядер — основная причина выбирать эту модель.
  • 32 ядра и 64 потока Zen 4. Достаточный параллелизм без перехода в дорогие лицензионные ступени 64–96 ядер.
  • Хорошие результаты в cache-sensitive CAE/CFD/HPC. Vendor-тесты демонстрируют крупные выигрыши в LS-DYNA, CFX, CP2K и ECLIPSE.
  • 12 каналов DDR5-4800. До 460,8 ГБ/с теоретической полосы памяти на сокет.
  • PCIe 5.0 x128 и CXL. Сильная база для NVMe, быстрых NIC и ускорителей.
  • Поддержка 1P и 2P. Процессор подходит и для простого односокетного узла, и для крупного двухсокетного сервера.
  • AVX-512, BF16 и VNNI. Современный набор SIMD для научного и части AI-кода.
  • Серверные функции безопасности и виртуализации. AMD-V и семейство Infinity Guard/SEV соответствуют классу дата-центра.
  • Сниженная цена на вторичном рынке. В 2026 году отдельные предложения заметно дешевле стартовой 1kU-цены.

Слабые стороны AMD EPYC 9384X

  • Высокая цена относительно обычных 32-ядерных EPYC. Без реальной пользы от 3D V-Cache переплата бессмысленна.
  • 320 Вт default TDP и до 400 Вт cTDP. Нужны мощный VRM, радиатор и серверный airflow.
  • Максимальный boost лишь 3,9 ГГц. Для чисто последовательных задач высокочастотные F-модели и современные workstation CPU быстрее.
  • Специализация. В NAMD и некоторых других нагрузках огромный L3 не превращается в большой выигрыш.
  • Нет встроенной графики и медиаблока. Консоль обычно дает BMC, а вычислительную графику — дискретный GPU.
  • Дорогая SP5-инфраструктура. Плата, RDIMM, охлаждение и шасси стоят значительно дороже потребительской платформы.
  • NUMA-сложность в 2P. Для двух сокетов необходимо внимательно размещать потоки, память и PCIe-устройства.
  • Поколение уже не самое новое. Для нового проекта нужно сравнивать с актуальными EPYC и Xeon на реальном ПО.

Кому подходит EPYC 9384X

Лучший покупатель 9384X — организация, которая уже знает, что ее solver или EDA-пакет выигрывает от крупного L3. Это может быть инженерная компания с Ansys/Altair, исследовательская группа с CP2K или другим cache-sensitive кодом, команда semiconductor design, либо HPC-центр, где лицензия и время решения важнее максимального числа ядер на сокет. В таких сценариях 9384X способен дать экономическую выгоду, которую не видно в обычном рейтинге CPU.

Также процессор интересен владельцам совместимых SP5-серверов как специализированный апгрейд. Если инфраструктура уже есть, а цена tray-экземпляра в 2026 году существенно ниже стартовой, переход может быть выгодным. Но апгрейд надо предварять тестом приложения: 768 МБ L3 должны решать реальную проблему, а не просто выглядеть впечатляюще в спецификации.

Для облачной виртуализации общего назначения, рендер-фермы, массовой компиляции или простого хостинга обычно выгоднее EPYC с большим числом ядер или меньшей ценой. Для игровой и домашней workstation-системы 9384X также нерационален. Его сильные стороны относятся к серверной инженерной эксплуатации, а не к универсальному desktop.

Итоговый вердикт

AMD EPYC 9384X — редкий процессор, у которого главное число в спецификации не 32 ядра и не 3,9 ГГц, а 768 МБ L3. AMD взяла 32-ядерный класс Genoa, распределила ядра по восьми CCD и добавила 3D V-Cache, создав CPU для задач, где движение данных ограничивает расчет сильнее, чем количество арифметических блоков. В сочетании с 12-канальной DDR5-4800, PCIe 5.0 x128, AVX-512 и полноценной 1P/2P-платформой это мощный инструмент для HPC, CAE, CFD, FEA и EDA.

Модель не универсальна. Там, где рабочий набор плохо использует кэш, преимущество X-серии снижается; высокочастотный 9374F или более многоядерный EPYC может дать лучший результат. Высокие 320–400 Вт требуют серьезного охлаждения, а SP5-платформа и RDIMM увеличивают стоимость узла. Поэтому 9384X нельзя выбирать по принципу «больше L3 всегда лучше».

В 2026 году сильнейший аргумент в пользу EPYC 9384X — сочетание специализированной архитектуры и более доступного рынка tray/б/у систем. При подтвержденном выигрыше в вашем solver процессор способен оставаться экономически эффективным даже рядом с более новыми поколениями. Правильный критерий покупки — измеренное время решения, стоимость лицензии, энергия на завершенную работу и общая цена узла. По этим метрикам 9384X до сих пор способен быть очень сильным 32-ядерным серверным CPU.