AMD EPYC 9654: архитектура Zen 4, 96 ядер, DDR5, PCIe 5.0 и реальная серверная производительность

AMD EPYC 9654 — серверный процессор четвертого поколения EPYC с кодовым именем Genoa, рассчитанный на платформу SP5 и одно- или двухсокетные системы. В этой конкретной модели активны 96 полноценных ядер Zen 4 и 192 потока SMT, базовая частота составляет 2,4 ГГц, максимальная частота одного или нескольких наиболее удачно нагруженных ядер достигает 3,7 ГГц, а заявленная частота all-core boost равна 3,55 ГГц. Процессор располагает 384 МБ кэша L3, двенадцатиканальным контроллером DDR5 и 128 линиями PCI Express 5.0 в односокетной конфигурации. Штатный TDP равен 360 Вт, диапазон cTDP — 320–400 Вт. Это не настольный флагман в серверном корпусе, а SoC для центров обработки данных, где важны плотность вычислений, пропускная способность памяти, число виртуальных машин, скорость HPC-кода и высокая насыщенность периферией.

Модель вышла 10 ноября 2022 года и на старте занимала верхнюю позицию среди обычных Genoa без 3D V-Cache и без компактных ядер Zen 4c. Стартовая цена, зафиксированная в материалах запуска и независимых обзорах того периода, составляла 11 805 долларов США. Текущая карточка AMD указывает 1kU Pricing 8 452 доллара, то есть цену для партий по тысяче единиц; это современное значение нельзя переносить назад и выдавать за стартовую цену 2022 года. Уже одно это различие показывает, почему для EPYC важно отделять исторические параметры запуска, текущие прайс-листы производителя и розничные предложения посредников.

AMD EPYC 9654 96-Core Processor 100-000000789
Реальная фотография AMD EPYC 9654: на теплораспределителе видны обозначение модели 9654 и OPN 100-000000789.

Точная идентичность AMD EPYC 9654 и проверка маркировки

Для этой статьи точная модель определяется связкой AMD EPYC 9654 + OPN 100-000000789. В текущей спецификации AMD этот номер указан как Product ID Tray, то есть подтвержденный идентификатор поставки процессора в tray/OEM-канале. Отдельный публичный Box Product ID для 9654 не заявлен, а штатный кулер в поставку серверного tray-процессора не входит. В серверной торговле встречаются полные системы, процессорные комплекты и OEM spare parts с собственными артикулами производителя сервера; такие номера относятся к сборке или сервисному комплекту и не заменяют базовый OPN самого CPU.

На теплораспределителе серийного AMD EPYC 9654 нанесены имя семейства, номер модели и маркировка, по которой можно сопоставить изделие с OPN. Для закупки отдельного процессора наиболее надежная проверка состоит из трех совпадений: продавец прямо называет 9654 без дополнительного суффикса, на фотографии виден серийный процессор, а в характеристиках или на крышке присутствует 100-000000789. Для дорогого серверного CPU этого недостаточно делать только по строке «96 cores»: соседние модели и инженерные образцы тоже встречаются с 96 ядрами, но имеют другой статус, частоты, ограничения и маркировки.

Обозначение S-Spec к AMD EPYC 9654 не относится: это система маркировки Intel. ARK ID также отсутствует, потому что ARK — каталог Intel. У AMD для этой модели используется собственный Product ID/OPN. В открытой карточке подтвержден один tray-идентификатор 100-000000789; отдельного второго серийного OPN для boxed-версии там нет. Поэтому попытка заполнить S-Spec, ARK ID или «box OPN» случайными строками из объявлений создала бы ложную идентичность.

Особенно важно не подменять 9654 моделями EPYC 9654P, EPYC 9684X и образцами с нестандартной маркировкой. 9654P похож по числу ядер, частотам и объему L3, но предназначен только для 1P. 9684X — другой SKU Genoa-X с существенно увеличенным L3 благодаря 3D V-Cache и иным энергетическим настройкам. В объявлениях также встречаются QS/ES-процессоры с собственными OPN и частотами; они не являются подтвержденным серийным 100-000000789 и не используются в характеристиках или тестах ниже. OEM-названия вида 9B14/9J14, встречающиеся в отдельных системных отчетах, тоже нельзя автоматически приравнивать к розничному tray OPN без документального сопоставления.

Где купить AMD EPYC 9654: актуальные предложения и проверка OPN

AMD EPYC 9654 продается как отдельный серверный процессор и внутри готовых SP5-систем. На момент проверки российские площадки показывали заметно различающиеся цены, что нормально для корпоративного CPU с малым розничным оборотом. Ситилинк индексирует точную карточку 100-000000789, а Яндекс Маркет показывает отдельный товар AMD EPYC 9654 и одновременно соседние 9654P, поэтому название и суффикс нужно сверять до оплаты. Для AliExpress надежно подтвержденной индексируемой цены на точный серийный 100-000000789 получить не удалось; вместо выдуманной суммы в таблице дана точная поисковая страница.

МагазинЦена при проверке
Ситилинк317 990 ₽; клубная цена отображалась 317 000 ₽
Яндекс Маркет271 186 ₽ с Яндекс Пэй отображалось в выдаче на момент проверки

Для нового инфраструктурного проекта цена одного CPU — только часть бюджета. У EPYC 9654 нет практического смысла без платы SP5, достаточного числа RDIMM, серверного блока питания, квалифицированного радиатора и корпуса с рассчитанным воздушным трактом. В двухсокетном сервере добавляются второй CPU, полный набор памяти для обоих сокетов и требования к межсокетной топологии. При покупке готовой системы полезнее сравнивать не только цену процессора, а итоговую стоимость на ядро, на гигабайт памяти, на линию PCIe и на единицу производительности в целевой нагрузке.

Позиционирование, поколение Genoa и место модели в линейке EPYC 9004

EPYC 9654 относится к 4-му поколению AMD EPYC и к серии EPYC 9004. Кодовое имя обычных моделей с ядрами Zen 4 — Genoa. В линейке конца 2022 года 9654 был флагманом общего назначения: 96 ядер давали максимум для стандартного Genoa, тогда как ниже располагались модели на 84, 64, 48, 32 и меньше ядер, а F-варианты делали акцент на высокой частоте при меньшем числе ядер. Позднее семейство SP5 расширилось Genoa-X с 3D V-Cache и Bergamo с 128 компактными Zen 4c, поэтому «верхний EPYC 9004» без уточнения периода перестал быть синонимом 9654. Точный смысл 9654 — максимум ядер исходного Genoa при сохранении полного кэша 32 МБ на каждый восьмиядерный CCD.

Серверный сегмент определяет почти все компромиссы. 2,4 ГГц базовой частоты выглядит невысоко рядом с настольными процессорами, однако при 96 ядрах одновременно удержать высокий частотный потолок в 360–400-ваттном бюджете невозможно без резкого падения эффективности. Поэтому 9654 оптимизирован не под минимальную задержку одного пользовательского потока, а под throughput: сотни параллельных процессов, контейнеров, виртуальных CPU, компиляционных задач, шардов баз данных, MPI/OpenMP-потоков и сервисов. При хорошо распараллеливаемой работе такая конструкция дает гораздо больше полезных вычислений на один сокет, чем высокочастотная модель с существенно меньшим числом ядер.

Техническое руководство AMD по EPYC 9004 содержит общий дисклеймер, что дорожные карты, сроки и будущие характеристики могут изменяться без уведомления. Для EPYC 9654 это не означает предварительный статус: модель серийно вышла 10 ноября 2022 года, а ядра, частоты, кэш, TDP, память и PCIe в этой статье берутся из производственной спецификации. Дисклеймер относится к перспективным планам и не используется для заполнения отсутствующих полей.

Чиплетная архитектура: 12 CCD, 12 CCX и центральный I/O Die

AMD EPYC 9654 построен по чиплетной схеме. Вычислительная часть состоит из 12 CCD, и в каждом CCD у Genoa находится один CCX с восемью ядрами Zen 4. У 9654 все восемь ядер каждого CCD активны: 12 × 8 дает ровно 96 физических ядер. Каждый CCD соединен с центральным I/O Die выделенным каналом GMI семейства Infinity Fabric. Такая топология хорошо масштабируется по числу ядер: вычислительные кристаллы можно производить отдельно по более тонкому техпроцессу, а крупный I/O-кристалл объединяет память, PCIe/CXL, межсокетные связи и служебную логику.

CCD для Genoa выпускаются по 5-нм техпроцессу TSMC N5. Центральный I/O Die выполнен по 6-нм техпроцессу. Сводить всю модель к фразе «5 нм» недостаточно: она описывает вычислительные кристаллы, но не весь многокристальный корпус. Именно I/O Die содержит двенадцать контроллеров памяти UMC и четыре внешних P-link-блока, которые распределяются между PCIe/CXL и Infinity Fabric. В результате масштабирование памяти и периферии слабо зависит от того, какой конкретно CCD обращается наружу, но программное обеспечение все равно должно учитывать NUMA и локальность данных.

У 9654 нет гибридного деления на P- и E-ядра. Все 96 ядер принадлежат одной микроархитектуре Zen 4, имеют одинаковый набор инструкций и поддерживают SMT с двумя аппаратными потоками на ядро. Это упрощает планирование в классическом серверном ПО: ОС не нужно решать, какой поток отправить на «большое» или «малое» ядро. При этом одинаковые ядра не означают одинаковую задержку доступа ко всем ресурсам: локальный L3 находится внутри CCD, память подключена через I/O Die, а в 2P добавляется удаленный сокет. Поэтому NUMA-aware размещение данных и потоков остается существенным фактором.

CCX, SMT и последствия для планировщика

Один восьмиядерный CCX делит 32 МБ L3. На уровне ОС при включенном SMT один сокет виден как 192 логических CPU. Для задач с высоким IPC, большими векторными блоками или жестким ограничением по памяти отключение SMT иногда освобождает часть общих ресурсов ядра и упрощает привязку потоков; для облачных сервисов, компиляции и смешанной загрузки SMT чаще повышает общий throughput. Универсального правила «SMT всегда быстрее» нет: в AMD HPC Tuning Guide многие численные примеры для 9654 приводятся с SMT Off, потому что конкретные HPC-коды обычно сильнее зависят от памяти, векторных блоков и предсказуемой привязки, чем от количества логических контекстов.

Частоты, boost, cTDP и отсутствие настольного разгона

Базовая частота AMD EPYC 9654 равна 2,4 ГГц. Максимальный boost заявлен до 3,7 ГГц, а all-core boost — 3,55 ГГц. Эти цифры описывают разные режимы. Максимальный boost — верхняя частота, которую при нормальных серверных условиях способен достигать хотя бы один подходящий по температуре и электрическим ограничениям core. All-core boost в документации определен как средняя частота всех ядер в performance mode при низкой активности; это не гарантия, что 96 ядер будут бесконечно выполнять AVX-512-код на 3,55 ГГц. Под тяжелой полностью параллельной работой частота зависит от мощности, температуры, типа инструкций и платформенной политики.

Штатный TDP составляет 360 Вт, а разрешенный диапазон configurable TDP — от 320 до 400 Вт. Это дает системному интегратору легальный способ смещать баланс между производительностью, плотностью стойки и энергопотреблением. В HPC-референсе AMD для 9654 использован cTDP/PPL 400 Вт, то есть процессору выделен верхний край разрешенного бюджета. Снижение до 320 Вт ближе по смыслу к power capping, чем к потребительскому undervolt: платформа ограничивает мощность и частотное поведение, сохраняя серверную модель управления и валидации.

Множитель у EPYC 9654 не предназначен для пользовательского разгона, как у разблокированных Ryzen. Типичные серверные BIOS дают не ручную установку произвольного множителя, а параметры Boost, Determinism, cTDP/PPT/PPL, SMT, NPS, настройки памяти и энергосбережения. Публично поддерживаемого аналога настольного Curve Optimizer для эксплуатации 9654 нет. Практический тюнинг поэтому состоит в выборе профиля мощности, NUMA, количества активных потоков, huge pages, привязки задач и оптимизированного компилятора, а не в «разгоне до 4 ГГц».

Кэш-память: 6 МБ L1, 96 МБ L2 и 384 МБ L3

Каждое ядро Zen 4 имеет 32 КБ L1 для инструкций и 32 КБ L1 для данных. На 96 ядрах это суммарно 3 МБ L1I и 3 МБ L1D, то есть 6 МБ L1, однако эти объемы распределены по отдельным ядрам и не образуют единый общий кэш. На ядро также приходится 1 МБ приватного L2; суммарный физический объем L2 достигает 96 МБ. В серверной аналитике полезнее мыслить не общими мегабайтами, а локальными уровнями: конкретный поток получает быстрый L1/L2 своего core и общий 32-мегабайтный L3 своего восьмиядерного CCD.

L3 организован как 12 блоков по 32 МБ, что дает заявленные 384 МБ. Это одна из причин, почему 9654 нельзя путать с Bergamo: у плотных Zen 4c топология и объем L3 другие. В 9654 большой общий кэш помогает компиляторам, базам данных, рендерерам, web-сервисам и многим HPC-задачам, но не устраняет NUMA. Доступ к L3 другого CCD проходит через фабрику и имеет большую задержку. Для очень чувствительных к объему кэша научных и EDA-нагрузок AMD позднее выпустила Genoa-X, где 3D V-Cache радикально увеличивает L3; это отдельная специализация, а не скрытая возможность 9654.

Двенадцатиканальная DDR5: пропускная способность, емкость и размещение DIMM

Контроллер памяти — одна из центральных характеристик EPYC 9654. Процессор поддерживает 12 каналов DDR5 со скоростью до 4800 MT/s. Теоретическая суммарная пропускная способность на сокет заявлена как 460,8 ГБ/с. Для двухсокетной машины суммарный локальный ресурс двух контроллеров удваивается, однако удаленный доступ через межсокетное соединение не превращает систему в один монолитный 921,6-гигабайтный канал: правильное NUMA-размещение памяти остается обязательным.

Архитектура I/O Die содержит 12 UMC, каждый способен обслуживать до двух DIMM на канал, то есть технический максимум — 24 модуля на сокет. Документация платформы указывает максимальную емкость до 6 ТБ памяти на сокет. Конкретная плата реализует 12 или 24 слота и имеет собственный список квалифицированных модулей. Серверы с 12 DIMM на сокет позволяют заполнить все каналы при 1DPC, что важно для максимальной полосы; 24-слотовые конструкции ориентируются на повышенную емкость, но электрическая нагрузка 2DPC и правила OEM влияют на доступную частоту и тайминги.

В сертифицированных результатах SPEC для 9654 использовались DDR5 Registered DIMM: например, 1P Supermicro работал с 12 × 128 ГБ PC5-4800B-R, а 2P ASUS — с 24 × 64 ГБ PC5-4800B-R. Именно RDIMM/ECC — штатный класс памяти платформы SP5. Обычные потребительские DDR5 UDIMM из настольных ПК для таких серверов не рассматриваются как совместимая замена. Для закупки памяти важно сверять QVL конкретной платы, ранги, емкость и число DIMM на канал, а не только надпись DDR5-4800.

Контроллер допускает interleaving по 2, 4, 6, 8, 10 или 12 каналам. В идеально симметричной конфигурации все 12 каналов заполнены одинаковыми по организации модулями. Неполное заполнение экономит бюджет, но уменьшает физическую полосу памяти и способно сильнее ударить по STREAM, CFD, FEA, научным расчетам и большим in-memory базам, чем по задачам, помещающимся в кэш. Поэтому собирать 96-ядерный 9654 с двумя-четырьмя DIMM ради экономии означает сознательно оставлять значительную часть платформенного потенциала неиспользованной.

NUMA Per Socket: NPS1, NPS2 и NPS4

EPYC 9654 поддерживает режимы NPS, при которых один физический сокет делится для ОС на один, два или четыре NUMA-домена. NPS1 проще для универсальной виртуализации и приложений, плохо знакомых с NUMA. NPS4 часто выгоден HPC и throughput-нагрузкам, где процессы можно привязать к локальным ядрам и памяти. AMD использовала NPS4 в референсной HPC-конфигурации Quartz для HPL, DGEMM, HPCG и STREAM. Выбор NPS должен соответствовать структуре приложения: слишком грубое или слишком дробное деление способно изменить задержки, локальность и число доступных потоков в домене.

PCI Express 5.0, CXL и межсокетные линии

В односокетной конфигурации EPYC 9654 предоставляет 128 линий PCI Express 5.0. Это фундаментальное преимущество серверной платформы перед настольными системами: один сокет способен напрямую подключать несколько GPU/accelerator-карт, NVMe-бэкплейны, высокоскоростные сетевые адаптеры и DPU без необходимости прятать почти все устройства за узким PCH. Часть линий платформа способна использовать в режиме CXL 1.1+; в архитектурной документации для EPYC 9004 указан максимум до 64 CXL-линий.

В 2P часть физических линков используется для Infinity Fabric между сокетами. Архитектура допускает до четырех G-link/xGMI-соединений со скоростью до 32 Гбит/с на линию связи, а доступное внешнее I/O распределяется иначе, чем в 1P. Документация платформы указывает до 160 PCIe-линий для двухсокетной системы благодаря тому, что не все P-link ресурсы требуются межсокетной связи. Это системная величина, а не «160 линий у одного процессора». Точная разводка определяется материнской платой и форм-фактором сервера.

До 32 из 128 PCIe-линий в 1P архитектура позволяет конфигурировать под SATA, а до 64 — под CXL 1.1+. Реальный сервер может вывести меньший набор разъемов из-за размеров корпуса, количества слотов, дисковой корзины и сетевых портов. Для выбора платформы важна блок-схема конкретной платы: два сервера с одинаковым EPYC 9654 способны резко различаться по числу x16-слотов, OCP NIC, NVMe-портов и распределению линий между ними. Сам CPU создает высокий потолок, но не гарантирует, что каждый производитель выведет все 128 линий в удобной форме.

Встроенная графика, медиаблок и назначение серверного видеовывода

AMD EPYC 9654 не содержит пользовательского интегрированного GPU класса Radeon и не ориентирован на аппаратное кодирование/декодирование видео как настольный APU. Серверный консольный вывод обычно обеспечивает BMC на материнской плате, например контроллер управления с простым framebuffer. Поэтому наличие VGA на задней панели сервера не означает наличие графики внутри EPYC. Для GPU-рендеринга, CUDA/ROCm, транскодирования или AI-ускорения устанавливаются дискретные ускорители по PCIe 5.0.

Набор инструкций, AVX-512, VNNI, BF16 и вычисления AI на CPU

Zen 4 вернул в серверный AMD полный набор AVX-512-инструкций, причем внутренние векторные тракты реализованы через 256-битные datapath. Для программ это AVX-512 ISA, а микроархитектура выполняет 512-битные операции через соответствующую внутреннюю организацию. EPYC 9654 поддерживает VNNI и BF16, что полезно для целочисленного и пониженно-точного машинного обучения, а также широкий стандартный набор AMD64, AVX2 и FMA, на котором построены современные численные библиотеки.

У 9654 нет отдельного NPU и нет специализированных матричных блоков уровня Intel AMX. Его сильная сторона в AI — большое число универсальных ядер, широкая память и возможность держать много независимых CPU-инстансов либо обслуживать GPU-ускорители. Для XGBoost, препроцессинга, feature engineering, классического ML, CPU inference умеренных моделей и оркестрации GPU такой профиль остается практичным. Для крупных трансформеров основная математика обычно переносится на дискретные ускорители, а EPYC обеспечивает ввод-вывод, память, сетевые потоки и подготовку данных.

Современные измерения AMD для XGBoost показывают, что 2P Genoa 9654 в конфигурации с 1,5 ТБ DDR5-4800 остается валидной точкой сравнения даже на фоне поколений Zen 5. В конкретном тесте XGBoost 2.2.1 на Higgs Dataset, FP32, с 32-ядерными инстансами медианное значение для 2P 9654 составило 644,776 условных единицы throughput; 2P EPYC 9755 был заметно быстрее, а 2P Xeon Platinum 8592+ в той же опубликованной методике — медленнее. Это не превращает 9654 в специализированный AI-чип, но демонстрирует сильный throughput универсального CPU.

Виртуализация, шифрование памяти, Infinity Guard и RAS

EPYC 9654 поддерживает аппаратную виртуализацию AMD-V/SVM и IOMMU, поэтому подходит для KVM, VMware, Hyper-V и облачных гипервизоров, где важны 192 логических потока на сокет и большой объем RAM. В двухсокетной системе физические ресурсы удваиваются до 192 ядер и 384 потоков, но планирование VM должно учитывать NUMA. Большую виртуальную машину, бесконтрольно растянутую через оба сокета, легче заставить обращаться к удаленной памяти; меньшие VM рациональнее привязывать к локальным NUMA-доменам, когда профиль нагрузки это позволяет.

Платформа EPYC 9004 включает технологии AMD Infinity Guard, Secure Encrypted Virtualization, SEV-ES и SEV-SNP. SEV-SNP добавляет механизмы проверки целостности и изоляции гостевых машин, что важно для confidential computing. В поколении также усилено шифрование памяти и защита секретного материала внутри аппаратной цепочки доверия. Текущая карточка 9654 помечает FIPS Certification как In Review; это именно текущий статус записи, а не подтверждение завершенной сертификации конкретной серверной конфигурации.

RAS-функции распределены между процессором, памятью, I/O и прошивкой платформы. ECC Registered memory, машинные проверки, телеметрия ошибок и серверные механизмы восстановления являются частью класса системы, однако конкретные функции вроде memory sparing, mirroring, patrol scrub и политики реакции на ошибки настраиваются и квалифицируются OEM. Поэтому в спецификации CPU нельзя честно обещать одинаковый набор RAS-режимов на любой плате SP5. Для эксплуатации важны совместимость DIMM, версия BIOS/AGESA/PSP, журнал BMC и регламент обновлений.

Сокет SP5, системные платы, BIOS и прошивки

EPYC 9654 устанавливается в сокет SP5 и поддерживает как 1P, так и 2P. Переход с SP3 физически несовместим: старые платы EPYC 7002/7003 не подходят. В экосистеме 9654 есть односокетные платы Supermicro H13SSL-NT и H13SST-G, двухсокетные серверные платформы ASUS RS700A-E12, Lenovo ThinkSystem, Dell PowerEdge, Gigabyte/Giga Computing и другие системы поколения SP5. Конкретный список поддерживаемых CPU определяется производителем платы, а не одним названием сокета.

У платформы нет привычного потребительского «чипсета», который определял бы основные PCIe-линии: EPYC — полноценный server SoC, и критические контроллеры находятся в I/O Die. На плате присутствуют BMC, сетевые и дисковые контроллеры, тактовая/силовая обвязка и дополнительные коммутаторы, но память и основное PCIe идут непосредственно от CPU. Из-за этого качество разводки, VRM и firmware у SP5-платы особенно важно: на ней лежит задача стабильно кормить 360–400-ваттный процессор и десятки DIMM/PCIe-устройств.

Единой «минимальной версии BIOS для EPYC 9654», одинаковой для всех производителей, не существует. Каждый OEM выпускает собственную нумерацию BIOS и включает нужную AGESA, PSP и микрокод. В референсной HPC-системе AMD использовалась AGESA 1.0.0.7, но это пример конкретной тестовой эпохи, а не универсальный минимум. Для производственного сервера следует использовать текущую поддерживаемую прошивку OEM, потому что с момента выхода Genoa обновлялись исправления errata, совместимость памяти, безопасность и управление питанием.

Охлаждение, питание, корпус и температурные ограничения

360 Вт штатного TDP и допустимый cTDP до 400 Вт требуют серверного радиатора SP5 и направленного воздушного потока. Процессор не комплектуется бытовым кулером. В 1U-системах применяются низкопрофильные радиаторы и мощные вентиляторные модули с высоким статическим давлением; в 2U и более крупных корпусах проще получить запас площади радиатора и снизить обороты, но общий тепловой бюджет остается высоким. AMD в HPC-референсе Quartz использовала водяное охлаждение, тогда как серийные серверы с 9654 широко работают и на квалифицированном воздушном охлаждении.

Публичная карточка AMD для EPYC 9654 не приводит отдельное числовое Tjmax/Tcase, пригодное для заполнения как универсальный «максимум температуры». Поэтому точное значение в мегатаблице ниже помечено как не заявленное, а не заменено цифрой из чужого EPYC или Ryzen. Серверный OEM проектирует собственную систему датчиков, fan curve и пределы эксплуатации. Практически важен не бытовой вопрос «какая температура нормальная», а отсутствие thermal throttling при заданном cTDP, соблюдение inlet-temperature диапазона сервера и температурных требований DIMM/VRM/NVMe.

Мегатаблица характеристик AMD EPYC 9654

ПолеAMD EPYC 9654
Точное имяAMD EPYC 9654
Семейство / серияAMD EPYC, EPYC 9004 Series
КатегорияСерверный процессор для центров обработки данных
Кодовое имяGenoa
Поколение4-е поколение AMD EPYC
МикроархитектураZen 4
Техпроцесс вычислительных CCDTSMC N5, 5 нм
Техпроцесс I/O Die6 нм
Дата запуска10 ноября 2022 года
Стартовая цена11 805 USD по материалам запуска и обзорам ноября 2022 года
Текущая 1kU Pricing AMD8 452 USD
СтатусСерийный выпущенный продукт; глобальная доступность в карточке AMD
OPN / Product ID Tray100-000000789
Box Product IDНе заявлен / нет подтвержденного отдельного boxed OPN
S-SpecНе применимо: идентификатор Intel
ARK IDНе применимо: каталог Intel
Форм-фактор поставкиTray/OEM CPU; серверный LGA-процессор для SP5
СокетSP5
Сокетность1P / 2P
Число ядер96
Число потоков192
SMTДа, 2 потока на ядро
P/E-ядраНет, все ядра одинаковые Zen 4
CCD12 вычислительных CCD
CCX12 CCX, по одному CCX на CCD
Ядер на CCD/CCX8 активных ядер
I/O DieЦентральный IOD с памятью, PCIe/CXL и Infinity Fabric
Базовая частота2,4 ГГц
Max BoostДо 3,7 ГГц
All-Core Boost3,55 ГГц по спецификации; не является гарантией постоянных 3,55 ГГц в тяжелой нагрузке
МножительПользовательский разблокированный множитель не заявлен
РазгонОбычный multiplier overclock не поддерживается как штатный режим; доступен платформенный power/performance tuning
L1 на ядро32 КБ инструкций + 32 КБ данных
L1 суммарно6 МБ физически: 3 МБ L1I + 3 МБ L1D, распределены по ядрам
L2 на ядро1 МБ
L2 суммарно96 МБ
L3384 МБ
Организация L312 × 32 МБ; один 32-МБ блок общий для 8 ядер CCD
Default TDP360 Вт
cTDP320–400 Вт
Отдельный Turbo/Maximum PowerНе заявлен в формате Intel MTP; верхняя штатная настройка cTDP/PPL — 400 Вт
Максимальная температураТочное универсальное Tjmax/Tcase в публичной карточке 9654 не заявлено
Тип памятиDDR5 server memory
Каналы памяти12
Скорость памятиДо DDR5-4800 MT/s
Полоса памяти460,8 ГБ/с на сокет
Максимум DIMMДо 24 DIMM на сокет архитектурно, 2 DIMM на канал
Максимальный объем RAMДо 6 ТБ на сокет
ECCДа, серверная ECC Registered memory
RDIMMДа; именно RDIMM PC5-4800B-R используются в сертифицированных конфигурациях
UDIMMНе является штатным типом памяти SP5/EPYC 9004; применять QVL серверной платы
NUMA / NPSNPS1, NPS2, NPS4
PCIePCI Express 5.0
PCIe в 1P128 линий
PCIe в 2PДо 160 внешних линий на систему в архитектурной конфигурации; разводка зависит от OEM
CXLCXL 1.1+; до 64 линий архитектурно
SATA через P-linkДо 32 линий могут быть сконфигурированы как SATA на уровне платформы
Infinity Fabric / xGMIМежчиплетные GMI и до четырех межсокетных G-link/xGMI; до 32 Гбит/с для межсокетных линков в документации платформы
Встроенная графикаНет пользовательского iGPU
ВидеовыводОбычно через BMC материнской платы; не является функцией GPU внутри 9654
МедиаблокНе заявлен; аппаратный видео encode/decode как у APU отсутствует
AVX-512Да, Zen 4; 256-битные внутренние datapath
VNNIДа
BF16Да
AVX2 / FMAДа, стандартная часть Zen 4/AMD64
Специализированный NPUНет
AMD-V / SVMДа
IOMMUДа
SEV / SEV-ES / SEV-SNPДа, платформа AMD Infinity Guard
FIPS statusIn Review в текущей карточке продукта
RASСерверные RAS-механизмы CPU/памяти/I/O; конкретные режимы зависят от OEM BIOS и платформы
Традиционный внешний чипсетНе требуется для основных контроллеров: EPYC 9004 — server SoC с I/O Die
Примеры плат/системSupermicro H13SSL-NT, H13SST-G; ASUS RS700A-E12 и другие SP5-системы, где 9654 есть в CPU support list
BIOSВерсия зависит от производителя; универсального номера нет
AGESA в референсном HPC-тесте AMD1.0.0.7 — пример тестовой платформы, не универсальный минимум
ОСLinux, Windows Server и гипервизоры с поддержкой EPYC 9004; конкретная сертификация зависит от OEM
Комплект поставкиTray/OEM; штатный радиатор/вентилятор не заявлен в комплекте
ОхлаждениеКвалифицированное SP5 server cooling для 360–400 Вт; воздушное или жидкостное в зависимости от шасси

Как читать результаты тестов: почему один балл не описывает 96-ядерный сервер

У серверного CPU результаты особенно чувствительны к числу сокетов, объему и ранговости RAM, SMT, NPS, cTDP, BIOS, версии компилятора и способу привязки потоков. Поэтому ниже каждый числовой результат сопровождается конфигурацией. Нельзя напрямую делить балл 2P на два и объявлять производительность одного процессора: межсокетные задержки, удвоенная память, иной number of copies и общая настройка системы меняют масштабирование. Точно так же Geekbench на одной ОС не заменяет SPEC Rate или HPL, потому что измеряет другую смесь алгоритмов и имеет иной характер параллелизма.

Geekbench 6: ориентир для одного потока и общего CPU-профиля

ТестРезультатТип нагрузкиСтендПО и дата
Geekbench 6.0.3 CPU2010 single-coreКороткие разнородные CPU-задачи: сжатие, браузерный код, компиляция, обработка изображений1× AMD EPYC 9654, 96C/192T; Supermicro H13SSL-NT; 755,23 ГБ RAMUbuntu 22.04.2 LTS; AVX2 build; 23.04.2023
Geekbench 6.0.3 CPU22 860 multi-coreПараллельная смесь тех же подзадачТот же 1P Supermicro H13SSL-NTUbuntu 22.04.2 LTS; 23.04.2023
Geekbench 6.0.3 Clang2132 / 10,5 Klines/s singleКомпиляционная подзадачаТот же 1P стендGeekbench 6.0.3; 23.04.2023
Geekbench 6.0.3 Clang72 966 / 359,4 Klines/s multiПараллельная компиляционная подзадачаТот же 1P стендGeekbench 6.0.3; 23.04.2023
Geekbench 6.0.3 File Compression2037 / 292,6 МБ/с singleСжатие файловТот же 1P стендGeekbench 6.0.3; 23.04.2023
Geekbench 6.0.3 File Compression13 450 / 1,89 ГБ/с multiПараллельное сжатиеТот же 1P стендGeekbench 6.0.3; 23.04.2023

Single-core 2010 в Geekbench 6 показывает, что одно ядро Zen 4 не является слабым в абсолютном смысле, однако максимум 3,7 ГГц ставит 9654 ниже современных высокочастотных настольных CPU в интерактивных задачах. Multi-core score при этом растет не в 96 раз: внутри Geekbench есть подзадачи, которые плохо масштабируются на сотни потоков, а память и межъядерные зависимости становятся ограничением. Для серверного sizing это хороший пример того, почему число ядер нельзя умножать на single-core score и принимать результат за реальную производительность.

SPEC CPU2017: целочисленный throughput

Benchmark и версияИтогСокеты / CPUПамятьСистема и ПОЭпоха
SPEC CPU2017 SPECrate2017_int_base8291× EPYC 9654, 96C/192T1536 ГБ, 12×128 ГБ 2S2Rx4 PC5-4800B-RSupermicro A+ 2115GT-HNTR, H13SST-G; Ubuntu 22.04, kernel 5.15.0-47; AOCC 4.0; BIOS Sep-2022; performance profileOct-2022
SPEC CPU2017 SPECrate2017_int_base17902× EPYC 9654, 192 физических ядра / 384 потока1536 ГБ, 24×64 ГБ 2Rx4 PC5-4800B-RASUS RS700A-E12 K14PP-D24; SLES 15 SP4, kernel 5.14.21; AOCC 4.0; BIOS 0402 Sep-2022; xfs; performance profileOct-2022
SPEC CPU2017 SPECrate2017_int_peak19302× EPYC 96541536 ГБ, 24×64 ГБ DDR5-4800 RDIMMТот же ASUS RS700A-E12, peak tuningOct-2022

Односокетный base score 829 — особенно полезная цифра для оценки чистого 1P throughput, потому что в нем нет межсокетного взаимодействия. Двухсокетный base 1790 выше простого удвоения 829 примерно на восемь процентов; сравнивать эти два результата как идеальный scaling experiment нельзя, потому что серверы, BIOS, DIMM, файловая система и конфигурация отличаются. Они доказывают другое: 9654 способен насыщать очень большой число независимых integer rate copies, а полные 12 каналов памяти и оптимизированный AOCC имеют реальное значение.

SPEC CPU2017: плавающая точка и научные коды

Benchmark и версияРезультатКонфигурацияПО / настройкиДата
SPEC CPU2017 SPECrate2017_fp_base1480xFusion FusionServer 2258 V7; 2× EPYC 9654; 192 физ. ядра; 768 ГБ, 24×32 ГБ PC5-4800B-RRHEL 9.0, kernel 5.14.0-70.13.1; AOCC 4.0; BIOS 1.06.29; TDP 400, PPT 400, NPS4Jan-2024
SPEC CPU2017 SPECrate2017_fp_peak1570Тот же 2P xFusionPeak config, numactl и оптимизации среды SPECJan-2024
503.bwaves_r, base ratio1770192 copies на 2P xFusionBase configJan-2024
538.imagick_r, base ratio6640192 copies на 2P xFusionBase configJan-2024
544.nab_r, base ratio2710192 copies на 2P xFusionBase configJan-2024
549.fotonik3d_r, base ratio582192 copies на 2P xFusionBase configJan-2024

HPL, DGEMM, HPCG и STREAM из HPC Tuning Guide

ТестРезультат для AMD EPYC 9654СтендНастройки / версияЭпоха
HPL 2.3 AMD optimized8856,2 GFLOP/s; время 578,83 с2× EPYC 9654, 192 физ. ядра; 768 ГБ DDR5-4800; AMD QuartzSMT Off, cTDP/PPL 400 W, NPS4; AOCC 4.0/AOCL 4.0; AVX-512; Rocky Linux 8.708.02.2023
DGEMM / AOCL8595 GFLOP/s в подробном примере; 8658 GFLOP/s в сводной таблице2× EPYC 9654, AMD QuartzSMT Off, boost on, cTDP 400 W; AOCL 4.02023 guide
HPCG129,2 при single-rank; 135,0 при dual-rank2× EPYC 9654, AMD QuartzNPS4, SMT Off, DDR5-4800; одинаковый класс теста2023 guide
STREAM Triad766 863 МБ/с2× EPYC 9654; 192 physical cores activeNPS4, SMT Off, Boost On, 8 cores per L3 active2023 guide
STREAM Triad750 525 МБ/сТот же 2P серверNPS4, SMT Off, Boost Off, 8 cores per L3 active2023 guide

В DGEMM одна и та же документация содержит 8595 GFLOP/s в подробном примере и 8658 GFLOP/s в сводной таблице. Это расхождение сохранено, а не «исправлено» усреднением: тестовые запуски, параметры или выбранный результат могли различаться. Для HPL опубликован конкретный run 8856,2 GFLOP/s. В обоих случаях важен контекст: два CPU, полный 400-ваттный режим, оптимизированные библиотеки AMD, отключенный SMT и корректная NUMA-конфигурация. Это характеристики системы, а не лабораторная «частота процессора в TFLOPS».

STREAM показывает почти 767 ГБ/с на двух сокетах при NPS4, SMT Off и включенном Boost, что составляет значительную долю от суммарной теоретической полосы двух 12-канальных контроллеров. Разница с Boost Off относительно невелика, потому что STREAM ограничивается прежде всего памятью. Эта картина типична: добавление частоты ядрам не помогает пропорционально, когда узким местом становятся DDR5 и движение данных. Поэтому для 9654 заполнение всех каналов часто выгоднее, чем погоня за небольшим повышением core frequency.

STREAM: масштабирование по числу активных ядер на L3

Активных ядер на 32-МБ L3Всего активных физ. ядер в 2PSMTBoost Off, МБ/сBoost On, МБ/с
124Off723 532739 500
248Off764 642770 343
496Off760 919771 153
6144Off760 613774 746
8192Off750 525766 863

Полоса выходит на плато уже задолго до использования всех 192 физических ядер двухсокетной машины. Это важный практический вывод для memory-bound сервисов: 96-ядерный CPU не означает, что memory bandwidth продолжит линейно расти до последнего core. Для части задач выгоднее ограничить количество рабочих потоков, уменьшить конкуренцию за память и использовать оставшиеся ядра под другие процессы. В контейнерном кластере это можно превратить в преимущество, разделив независимые сервисы; в монолитном HPC-коде потребуется тщательный thread placement.

Производительность в компиляции, рендеринге и инженерных задачах

Компиляция — сильный сценарий EPYC 9654, когда проект можно разбить на большое число независимых translation units. Geekbench показывает 359,4 Klines/s в своей multi-core Clang-подзадаче на 1P системе, а серверные сборочные фермы выигрывают от 96 физических ядер и большого файлового/страничного кэша. Реальные монорепозитории масштабируются хуже синтетического теста из-за линковки, генераторов кода, дискового I/O и этапов с ограниченным параллелизмом, поэтому быстрые NVMe и правильно настроенная файловая система остаются необходимой частью сборочного узла.

CPU-рендеринг хорошо использует многочисленные ядра, особенно в офлайн-задачах, где каждый tile или sample независим. SPEC fp содержит компоненты POV-Ray и Blender, но их rate ratios нельзя преобразовывать в «секунды Blender Classroom» без исходного отдельного теста. Для 9654 правильная оценка — высокая throughput-производительность при массовом параллелизме и заметно меньшая выгода в интерактивном viewport, где важнее один-два быстрых потока и GPU. Если рендерер поддерживает GPU, современный ускоритель часто окажется быстрее CPU, а EPYC станет управляющим и подготовительным процессором.

В CFD, FEA, молекулярной динамике, погодном моделировании и линейной алгебре результат зависит от arithmetic intensity. HPL и DGEMM способны загружать AVX-512 и показывают 8,6–8,9 TFLOP/s на опубликованном 2P 9654. HPCG и STREAM гораздо сильнее чувствительны к памяти и коммуникациям. Поэтому инженерное ПО нельзя ранжировать одним числом «научная производительность»: код с плотными матричными операциями любит compute, разреженные матрицы и сетки чаще требуют bandwidth/latency, а распределенная задача добавляет MPI и сеть.

Для EDA и части коммерческих инженерных пакетов дополнительно важна лицензия. Некоторые продукты лицензируются по ядрам или имеют нелинейную стоимость при росте параллелизма. AMD в рекомендациях по EDA отмечала, что 2P способен терять около пяти процентов из-за межсокетного доступа, когда задания не закреплены на одном сокете, и рекомендовала 1P как удобную конфигурацию для такого класса работ. Для 9654 это особенно интересно: один сокет уже дает 96 ядер, 12 каналов RAM и 128 PCIe 5.0, поэтому 1P часто снимает часть NUMA-сложности без малого количества вычислителей.

Базы данных, web-сервисы, контейнеры и виртуальные машины

Для OLTP 9654 дает огромный пул ядер, но высокая производительность базы зависит от блокировок, буферного пула, NUMA и задержки хранилища. PostgreSQL, MySQL, SQL Server и коммерческие СУБД способны обслуживать множество соединений и параллельных обращений, однако одна горячая таблица или глобальный mutex не ускоряются от 96 ядер. Практически мощный 1P сервер позволяет консолидировать несколько инстансов и держать их память локально, а 384 МБ L3 снижает часть давления на DDR5. Для in-memory систем особенно важно заполнить каналы и планировать память по NUMA-доменам.

Виртуализация — один из самых естественных сценариев. 96 cores позволяют выделять десятки VM без сильного overcommit или сотни vCPU при контролируемом коэффициенте переподписки. До 6 ТБ RAM на сокет дает пространство для больших memory-heavy VM, а 128 PCIe 5.0 удобны для NVMe, SR-IOV NIC и passthrough-ускорителей. SEV-SNP добавляет аппаратную изоляцию confidential VM. Главный риск — забыть, что крупная VM, охватывающая несколько CCD или второй сокет, имеет неоднородную память; гостевая ОС и гипервизор должны получить корректную NUMA-топологию.

AI, ML и сервер с GPU: роль EPYC 9654 в ускоренной системе

EPYC 9654 не заменяет GPU в обучении крупных нейросетей, но его I/O делает его подходящим host CPU для ускорителей. 128 линий PCIe 5.0 позволяют строить плотные узлы с несколькими GPU и высокоскоростной сетью, а 12 каналов DDR5 обеспечивают подготовку данных, декомпрессию, tokenization и feeding accelerator. При таком использовании важен баланс: слишком слабый host CPU способен оставить GPU без данных, а слишком дорогой 96-ядерный CPU не окупится, когда весь input pipeline занимает несколько ядер. 9654 оправдан в узлах, где CPU-подготовка, сеть и параллельные сервисы действительно велики.

Игры: почему FPS для EPYC 9654 не является полезным критерием

Точный AMD EPYC 9654 практически не представлен в стандартизированных игровых обзорах с контролируемыми 1080p/1440p, одинаковой видеокартой и опубликованным 1% low. Подставлять FPS от 9654P, Threadripper, Ryzen или инженерных образцов нельзя. Поэтому здесь нет выдуманной игровой таблицы. Архитектурно процессор способен запускать игры при наличии дискретной видеокарты и совместимой ОС, но платформа SP5 имеет 96 ядер, много NUMA-доменов, сравнительно низкий 3,7-ГГц boost и серверные приоритеты; это противоположность оптимизированной игровой системе.

Большинство игр не масштабируются на 96 ядер. Им важны высокая частота нескольких потоков, низкая задержка памяти и кэша, быстрый межъядерный обмен и потребительская платформа. У 9654 каждый CCD имеет локальный 32-МБ L3, а данные между CCD идут через I/O Die/Infinity Fabric. Даже при огромном суммарном L3 игровой поток не получает монолитные 384 МБ с одинаковой задержкой. Для GPU-bound 4K разница CPU может скрываться, но это не делает серверный EPYC рациональной игровой покупкой: цена платы, RDIMM и охлаждения несопоставима с целевой задачей.

Энергопотребление, эффективность и поведение под длительной нагрузкой

При 96 ядрах 360 Вт означает около 3,75 Вт TDP на физическое ядро до учета I/O Die, поэтому энергоэффективность достигается прежде всего количеством умеренно частотных ядер. В 400-ваттном режиме бюджет возрастает примерно на 11%, но производительность растет не линейно: memory-bound задачи почти не используют дополнительную мощность, а compute-bound код получает больше частотного запаса. Именно поэтому cTDP следует выбирать по собственному профилю, а не автоматически ставить 400 Вт во всех серверах.

На старте AMD публиковала для 2P EPYC 9654 результат SPECpower_ssj2008 overall efficiency 27 501 ssj_ops/W против 13 670 у 2P Xeon Platinum 8380 в указанном сравнении ноября 2022 года. Это поколенческий и платформенный тест, где сопоставляются не только CPU, но и целые серверы, однако он хорошо объясняет мотивацию Genoa: больше полезной работы на ватт при высокой консолидации. В реальном ЦОД экономия зависит от загрузки, idle power, эффективности БП, вентиляции и того, сколько старых узлов действительно заменяет один новый.

Тюнинг без разгона: NPS, SMT, huge pages, NUMA и power profiles

Первый практический параметр — NPS. Для HPL/STREAM референс AMD использует NPS4, что создает более мелкие локальные домены. Для универсальной VM-консолидации NPS1 часто проще. Второй — SMT: HPC-код с насыщенными векторными блоками нередко быстрее или стабильнее масштабируется с SMT Off, а web/компиляция/многосервисная нагрузка может получить плюс от второго аппаратного потока. Третий — power determinism и cTDP: 400 Вт дают максимум compute headroom, 320–360 Вт позволяют снизить мощность стойки.

На Linux большое значение имеют numactl, cpuset/cgroups, irq affinity и huge pages. Сетевые IRQ стоит размещать рядом с NUMA-узлом NIC, NVMe queues — рядом с соответствующими CPU, а рабочую память — там же, где исполняются потоки. Для SPEC fp опубликованные системы использовали numactl, Transparent Huge Pages и настройки VM-подсистемы, уменьшающие вариативность. Такие оптимизации нельзя слепо копировать в production: отключение ASLR или агрессивный zone reclaim из benchmark-профиля имеет другие эксплуатационные последствия. Нужна настройка под сервис, а не ритуальное повторение лабораторного файла конфигурации.

Сравнение с соседними AMD EPYC 9004

МодельЯдра / потокиBase / Max BoostL3TDP / cTDPСокетностьГлавное отличие от 9654
EPYC 963484 / 1682,25 / 3,7 ГГц384 МБ290 Вт1P/2PМеньше ядер и ниже мощность при том же суммарном L3
EPYC 965496 / 1922,4 / 3,7 ГГц384 МБ360 Вт, 320–400 Вт1P/2PБазовая модель этой статьи
EPYC 9654P96 / 1922,4 / 3,7 ГГц384 МБ360 Вт, 320–400 ВтТолько 1PПохожая спецификация, но нельзя использовать во втором сокете
EPYC 9684X96 / 1922,55 / до 3,7 ГГц1152 МБ400 Вт1P/2PGenoa-X с 3D V-Cache для cache-sensitive workloads
EPYC 9754128 / 2562,25 / до 3,1 ГГц256 МБ360 Вт1P/2PBergamo, Zen 4c: больше ядер, меньше L3 и ниже частоты
EPYC 955464 / 1283,1 / до 3,75 ГГц256 МБ360 Вт1P/2PМеньше ядер, выше base; полезен при лицензиях на core и более частотных задачах

EPYC 9634 интересен там, где 84 ядра достаточно, а power envelope важнее максимального throughput. 9654P имеет смысл в строго 1P-системах, потому что не оплачивается двухсокетная возможность; подменять его 9654 в закупочной спецификации нельзя. 9684X — гораздо более специализированный вариант: 1,125 ГБ L3 способны серьезно изменить CFD/EDA/FSI и другие cache-bound задачи, но больший кэш не гарантирует пропорциональный выигрыш в web или виртуализации. 9754 увеличивает число ядер до 128 через Zen 4c и ориентирован на cloud density, при этом его 256 МБ L3 меньше, а boost ниже.

Сравнение с Intel Xeon Platinum 8490H и контекстом поколения

ПараметрAMD EPYC 9654Intel Xeon Platinum 8490H
Поколение4th Gen EPYC Genoa4th Gen Xeon Scalable Sapphire Rapids
Ядра / потоки96 / 19260 / 120
Base / max turbo2,4 / 3,7 ГГц1,9 / 3,5 ГГц
Кэш последнего уровня384 МБ L3112,5 МБ cache
TDP360 Вт, cTDP 320–400 Вт350 Вт
Память12 каналов DDR5-48008 каналов DDR5-4800
PCIe 5.0128 линий в 1Pдо 80 линий на сокет
Сокетность1P/2Pдо 8S в зависимости от платформы SKU/UPI-конфигурации; 8490H — многосокетный Xeon
Публичная цена производителяТекущая 1kU 8 452 USD; launch 11 805 USDРекомендованная цена 19 040 USD в текущей карточке Intel
Специализированные ускорителиAVX-512, VNNI, BF16; без NPU/AMXAVX-512, AMX и встроенные accelerator blocks семейства Sapphire Rapids

Соперничество поколения нельзя сводить к числу ядер. EPYC 9654 предлагает значительно больше cores, каналов памяти и PCIe-линий на сокет; 8490H отвечает AMX и аппаратными accelerators семейства Xeon для отдельных типов задач. В обычном integer throughput 96-ядерный Genoa часто выигрывает за счет плотности, а в коде, который действительно использует AMX или специализированное offload-железо Intel, картина может меняться. Для enterprise-софта также важны сертификация, vendor support и цена лицензии на core.

В ноябре 2022 года AMD сравнивала 2P EPYC 9654 с предыдущим Xeon Platinum 8380 и приводила SPECrate2017_fp_base 1480 против 587, то есть 2,52× в конкретной опубликованной конфигурации. Это корректная историческая иллюстрация скачка Genoa относительно Ice Lake, но не прямой тест против 8490H, который вышел позже. В современной закупке следует сравнивать реальные серверы и актуальные поколения, а не использовать launch-слайды как универсальное доказательство превосходства над любым Xeon.

1P или 2P: какая конфигурация раскрывает EPYC 9654

Односокетный 9654 уже предоставляет 96 ядер, 12 каналов DDR5 и 128 PCIe 5.0, поэтому 1P — не компромиссный «половинный сервер». Для многих web, DB, EDA, CI/CD, storage и GPU-host задач он дает лучшую простоту NUMA и меньшее энергопотребление. Двухсокетная система нужна, когда 192 физических ядра, удвоенная память и общая вычислительная плотность в одном шасси действительно уменьшают число узлов или соответствуют лицензированию/топологии приложения.

Практические конфигурации серверов и узкие места

Виртуализационный 1P-узел

Рациональная 1P конфигурация включает EPYC 9654, 12 одинаковых RDIMM для полного 12-канального режима, несколько enterprise NVMe, два высокоскоростных сетевых порта и достаточный запас RAM под overcommit. При 12 × 64 ГБ получается 768 ГБ, при 12 × 128 ГБ — 1,5 ТБ. Для VM с большим memory footprint доступны и более емкие модули при поддержке платы. Главным ограничением после CPU часто становится память на VM или storage latency, а не количество ядер.

HPC 2P-узел

Для HPL/DGEMM 2P 9654 логично заполнять все 24 канала памяти, включать NPS4, выбирать 400-ваттный профиль при допустимом тепловом бюджете и использовать tuned numerical libraries. Нужна сеть уровня HDR/NDR InfiniBand или современный Ethernet/RDMA, когда задача масштабируется между узлами. AMD Quartz с ConnectX-6 HDR200 демонстрирует именно такой подход. Узким местом становится не только CPU, но и memory bandwidth, MPI fabric и эффективность векторизации.

GPU-сервер

В GPU-сервере 128 PCIe 5.0 линий позволяют подключить несколько x16-ускорителей и сетевые адаптеры без чрезмерной oversubscription. Здесь нужно проверить физическую разводку конкретной платы: часть слотов может идти к разным NUMA-доменам, а в 2P — к разным сокетам. CPU стоит выбирать под data pipeline. Если четыре-восемь GPU постоянно ждут декодирование, сетевую обработку и preprocessing, 96 Zen 4 cores полезны; если workload почти полностью находится в GPU memory, более дешевый EPYC способен дать тот же итог.

Storage и software-defined infrastructure

Большое число PCIe-линий делает 9654 удобным для NVMe storage, Ceph, ZFS, object storage и network appliances. Однако 96 ядер не компенсируют плохо настроенную сеть или неудачную NUMA-разводку HBA/NIC. Для ZFS важны RAM и настройка ARC, для Ceph — отдельные сети и latency, для NVMe-oF — IRQ affinity и PCIe locality. В этом классе серверов достоинство EPYC — возможность соединить много устройств напрямую, сохраняя CPU headroom для checksum, compression и сетевого стека.

Обновление и жизненный цикл платформы SP5

SP5 используется не только EPYC 9004, но и последующим EPYC 9005. Это создает аппаратную основу для апгрейда внутри одной механической платформы, однако совместимость конкретного сервера всегда определяется CPU support list и BIOS OEM. Плата, выпущенная под Genoa, не получает автоматического права на любой новый SP5 SKU только из-за совпадения сокета. Перед апгрейдом проверяют мощность VRM, охлаждение, память, firmware и список поддерживаемых процессоров.

С точки зрения 2026 года 9654 уже не является верхним серверным процессором AMD: 5-е поколение EPYC 9005 на Zen 5/Zen 5c подняло максимум до 192 ядер и увеличило скорость памяти, а более новые семейства продолжают развитие. Тем не менее 96 Zen 4 cores, 384 МБ L3, DDR5-4800 и 128 PCIe 5.0 не стали медленнее. На вторичном рынке и в уцененных новых системах 9654 может давать сильную стоимость на ядро, особенно когда организация уже стандартизирована на SP5 и не нуждается в максимальной производительности нового поколения.

Что изменилось относительно EPYC 7003 Milan

Главный переход — с Zen 3 на Zen 4 и с SP3 на SP5. Genoa увеличил максимум обычных ядер с 64 до 96, перешел с DDR4 на 12-канальную DDR5, с PCIe 4.0 на PCIe 5.0 и добавил CXL. L2 на ядро вырос до 1 МБ, появился AVX-512. Платформа стала заметно мощнее электрически: 360 Вт у 9654 и разрешенные 400 Вт выше типичных топовых Milan. Это не «бесплатное» ускорение — серверу нужны новый сокет, новая память и более серьезное охлаждение.

AMD оценивала поколенческий рост IPC Zen 4 примерно в 14% в своем фиксированно-частотном сравнении 9554 и 7763. Этот процент нельзя автоматически присвоить конкретно 9654 в любой программе: он описывает геометрическое среднее выбранных нагрузок и сравнение архитектур при фиксированных условиях. Для 9654 реальное преимущество над Milan часто сильнее приходит от 50% большего числа максимум-ядер на сокет, DDR5 bandwidth и новых I/O, чем от одного IPC.

Стартовая оценка в 2022 году и сильные стороны на момент выхода

На старте 9654 был одним из самых впечатляющих процессоров для x86-серверов общего назначения. 96 cores в одном сокете резко повышали консолидацию против предыдущего 64-ядерного потолка AMD, а 12 DDR5-каналов и 128 PCIe 5.0 давали платформе достаточно данных и устройств, чтобы эти ядра не выглядели изолированным рекордом. Цена 11 805 долларов была высокой, но в корпоративной среде ее сравнивают с ценой сервера, лицензий, стойки и электроэнергии; один мощный 1P узел способен заменить несколько старых систем.

Актуальность AMD EPYC 9654 сейчас

В 2026 году смысл 9654 сместился с «новейшего флагмана» к зрелому высокоплотному серверному CPU. Его сильные стороны сохраняются: 96 быстрых Zen 4 cores, SMT, 384 МБ L3, двенадцать DDR5-каналов, 128 PCIe 5.0, CXL, SEV-SNP и двухсокетность. Для существующей SP5-инфраструктуры это понятный, хорошо измеренный SKU с большим количеством опубликованных результатов SPEC и зрелыми BIOS. Для greenfield-проекта он конкурирует уже не только с Intel своего поколения, но и с более новыми EPYC, поэтому решающей становится цена полного узла.

Текущая 1kU Pricing AMD 8 452 доллара значительно ниже стартовой 11 805 долларов, а розничные российские предложения демонстрируют еще более широкий разброс. Это повышает привлекательность для лабораторий, рендер-ферм и частных облаков, которые могут купить прошлое поколение дешевле. Одновременно появляются риски вторичного рынка: ES/QS, снятые с серверов экземпляры без понятной истории, OEM lock в отдельных экосистемах и продавцы, путающие 9654 с 9654P. OPN 100-000000789 и проверка платформы важнее красивой низкой цены.

Плюсы AMD EPYC 9654

  • 96 полноценных ядер Zen 4 и 192 потока в одном сокете дают высокий throughput для виртуализации, компиляции, рендеринга, HPC и серверной консолидации.
  • 12 каналов DDR5-4800 с заявленной полосой 460,8 ГБ/с на сокет заметно снижают давление памяти по сравнению с прежними восьмиканальными платформами.
  • 384 МБ L3 распределены по 12 CCD и хорошо поддерживают множество параллельных рабочих наборов.
  • 128 линий PCIe 5.0 в 1P дают очень богатую I/O-конфигурацию для GPU, NVMe, NIC и DPU.
  • CXL 1.1+ и современная SP5-платформа расширяют возможности памяти и ускорителей.
  • AVX-512, VNNI и BF16 усиливают численные, HPC и часть ML-нагрузок.
  • SEV-SNP и Infinity Guard делают процессор актуальным для confidential computing и облачной изоляции.
  • 1P и 2P позволяют выбирать между простой NUMA-топологией одного сокета и максимальной плотностью двух.
  • cTDP 320–400 Вт дает официальный диапазон настройки плотности и производительности без бытового разгона.
  • Зрелая экосистема: для 9654 накоплены результаты SPEC, OEM-конфигурации, tuning guides и обновленные BIOS.

Минусы AMD EPYC 9654

  • Высокая платформа-стоимость: кроме самого CPU нужны SP5-плата, ECC RDIMM, серверное охлаждение и мощное шасси.
  • 360–400 Вт на CPU требуют серьезного VRM, радиатора и воздушного тракта; в 2P тепловой бюджет еще выше.
  • NUMA-сложность: 12 CCD в одном сокете и тем более два сокета требуют грамотной привязки потоков, памяти и I/O.
  • Максимум 3,7 ГГц делает процессор слабее высокочастотных настольных CPU в latency-sensitive однопоточной работе.
  • Нет пользовательского iGPU и медиаблока; для графики и транскодирования нужен BMC или дискретный accelerator.
  • Нет обычного пользовательского разгона/Curve Optimizer; тюнинг выполняется через server power, NUMA и software policies.
  • Не новейшее поколение в 2026 году: EPYC 9005 и последующие решения предлагают выше плотность и новую архитектуру.
  • Риск путаницы на вторичном рынке: 9654P, QS/ES и OEM-обозначения требуют проверки OPN и статуса процессора.
  • Полный потенциал памяти требует 12 каналов, поэтому экономия на числе DIMM заметно ухудшает memory-bound сценарии.

Кому подходит AMD EPYC 9654

Процессор подходит организациям, которым нужен высокий throughput одного сокета: private cloud, KVM/VMware-кластеры, CI/CD и компиляционные фермы, CPU-render nodes, scientific/HPC, большие web-пулы, базы данных с множеством параллельных обращений, software-defined storage и GPU-host серверы. Особенно логичен 9654 в 1P, когда 96 ядер позволяют избежать второго сокета и его NUMA-сложности. В 2P он оправдан, когда приложение действительно масштабируется до 192 физических ядер или плотность шасси важнее простоты.

Он плохо подходит для игровой системы, обычного домашнего ПК, недорогой рабочей станции и софта, который лицензируется настолько дорого за каждое ядро, что 96-core SKU повышает TCO. Для задачи, ограниченной одним-двумя потоками, разумнее high-frequency CPU; для cache-bound HPC — рассмотреть Genoa-X; для максимальной cloud-density внутри семейства 9004 — Bergamo; для нового проекта с достаточным бюджетом — сравнить более новое поколение EPYC на том же направлении SP5. Это не недостатки 9654 как такового, а результат его четкой специализации.

Итоговый вердикт

AMD EPYC 9654 остается очень мощным 96-ядерным серверным процессором и одним из наиболее показательных представителей Genoa. Его ценность складывается не из одного рекорда: 96 Zen 4 cores сочетаются с 384 МБ L3, двенадцатью DDR5-каналами, 128 линиями PCIe 5.0, CXL, AVX-512 и зрелым набором средств виртуализации и безопасности. Опубликованные SPEC, HPL, DGEMM, HPCG и STREAM подтверждают, что модель способна обеспечивать высокий integer/floating-point throughput и почти насыщать огромную полосу памяти при правильной конфигурации.

Главное условие эффективности — рассматривать 9654 как часть платформы, а не отдельный «96-ядерный камень». Для него критичны полное заполнение каналов DDR5, NUMA-aware software, подходящий NPS/SMT, актуальный BIOS и охлаждение, способное удерживать 360–400 Вт. В неправильно собранной системе часть вычислительного потенциала теряется на памяти, межсокетных обращениях и power limits. В грамотно настроенном 1P или 2P сервере 9654 дает именно тот профиль, ради которого создавался: много предсказуемого x86 throughput на ограниченное число сокетов.

При покупке точная проверка завершается OPN 100-000000789. Это отделяет серийный tray AMD EPYC 9654 от 9654P, Genoa-X, QS/ES и OEM-вариантов с другой идентичностью. Стартовая цена 11 805 долларов относится к 2022 году; текущая 1kU цена AMD 8 452 доллара и розничные предложения отражают зрелый жизненный цикл. Для уже развернутой SP5-инфраструктуры это сильный апгрейд или расширение, а для новой закупки — производительный вариант, который стоит оценивать рядом с более свежими EPYC по цене полного сервера и стоимости полезной работы, а не по возрасту поколения.