- AMD EPYC 9575F 실측은 Zen 5 코어 반복 설명보다 서버용 메모리 서브시스템 변화에 초점을 맞춰 Turin의 실제 차이를 보여줌
- 단일 스레드 대역폭은 읽기 약 52GB/s, 쓰기 약 48GB/s, add 약 95GB/s 수준이며, 전체 소켓 읽기는 이론상 576GB/s의 거의 99%에 도달함
- 서버용 Turin은 CCD와 I/O 다이 사이에 GMI3-W로 2개 GMI 링크를 쓰고, 쓰기 링크 폭도 링크당 32B로 늘어 데스크톱 Zen 5보다 CCD 대역폭이 큼
- 메모리 지연시간은 비부하 상태에서 Genoa와 비슷하지만, 코어 간 지연시간은 Intra-CCD 약 45ns, Inter-CCD 약 150ns, 소켓 간 약 260ns로 Genoa보다 높아짐
- 9575F는 64코어가 단일 스레드에서 최대 5GHz에 도달하고 128스레드 Cinebench 2024에서 약 4.3GHz를 유지해, 고주파수·상대적 저코어 수 엔터프라이즈 SKU의 성격이 뚜렷함
EPYC 9575F로 본 Turin의 변화
- Turin 분석은 AMD EPYC 9575F 실측 데이터를 중심으로 진행됨
- StorageReview의 Jordan을 통해 해당 CPU를 테스트할 수 있었음
- Zen 5 코어는 모바일, 데스크톱, 변형 비교에서 이미 다뤄졌기 때문에 이번 초점은 메모리 서브시스템에 맞춰짐
- AMD의 Turin 출시 슬라이드는 Serve the Home에서 확인할 수 있으며, 여기서는 자체 측정 데이터가 더 큰 비중을 차지함
CCD 대역폭을 키운 GMI 구성
- 1T 결과에서 EPYC 9575F의 단일 스레드 메모리 대역폭은 다음 수준임
- 읽기: 약 52GB/s
- 쓰기: 약 48GB/s
- add, 즉 Read-Modify-Write: 약 95GB/s
- 단일 코어도 CCD 전체 메모리 대역폭의 상당 부분을 사용할 수 있음
- 읽기는 전체 CCD 읽기 대역폭의 절반에 조금 못 미침
- 쓰기는 전체 CCD 쓰기 대역폭의 약 55%
- add는 전체 CCD add 대역폭의 3분의 2 이상
- 이 차이는 서버용 Turin의 GMI3-W 구성에서 나옴
- EPYC 9575F는 I/O 다이와 연결되는 GMI 링크가 2개임
- Ryzen 9950X는 단일 GMI 링크를 사용함
- 서버용 GMI 쓰기 링크는 링크당 32B로, 데스크톱 Zen 5의 링크당 16B보다 큼
12채널 메모리와 전체 소켓 성능
- Turin은 12채널 메모리를 지원하며 최대 DDR5-6400MT/s까지 가능함
- DDR5-6400MT/s는 특정 검증 시스템에서만 지원됨
- 해당 속도는 채널당 1개 DIMM 구성에서만 가능함
- 테스트 시스템은 DDR5-6000MT/s로 동작함
- 대부분의 시스템은 채널당 1개 DIMM 구성에서 DDR5-6000MT/s를 지원함
- 채널당 2개 DIMM을 사용하면 메모리 속도는 4400MT/s로 낮아짐
- DIMM 슬롯이 채널당 2개인 메인보드에서 채널당 1개 DIMM만 쓰면 5200MT/s를 예상할 수 있음
- 전체 9575F 소켓의 읽기 대역폭은 이론상 576GB/s의 거의 99%에 도달함
- 쓰기: 435GB/s
- add: 453GB/s
- AMD Volcano Platform에서는 2개 9575F 사이의 소켓 간 대역폭도 측정됨
- 해당 플랫폼은 두 CPU 사이에 3개 GMI 링크만 갖고 있음
- 결과는 Bergamo 테스트와 매우 비슷했으며, Bergamo 시스템도 같은 3개 GMI 링크 구성이었음
부하 지연시간과 코어 간 지연시간
- Turin의 비부하 메모리 지연시간은 Genoa와 매우 비슷함
- Hot Chips 2024에서 Ampere Computing이 AmpereOne 칩과 AMD Genoa CPU의 부하 상태 메모리 지연시간 그래프를 공개했고, 이를 참고해 유사한 부하 지연시간 테스트가 만들어짐
- 테스트는 메모리 대역폭 벤치마크로 IOD-CCD 링크 또는 전체 메모리 시스템을 채운 뒤, 남은 코어 또는 CCD로 메모리 지연시간을 측정하는 방식임
- 단일 CCD 테스트에서는 한 CCD의 7개 코어에서 메모리 대역폭 벤치마크를 실행하고 8번째 코어에서 지연시간을 측정함
- 전체 시스템 테스트에서는 9575F의 7개 CCD에서 메모리 대역폭 벤치마크를 실행하고 8번째 CCD에서 지연시간을 측정함
- 부하 상태에서 9575F의 메모리 지연시간 증가는 조건별로 비슷한 수준임
- 단일 CCD 부하에서는 비부하 대비 약 39ns 증가함
- 전체 시스템 부하에서는 비부하 대비 약 31ns 늘어남
- 코어 간 지연시간은 Genoa보다 높아졌고, 특히 CCD 내부 증가가 두드러짐
- Intra-CCD 지연시간: 약 45ns
- Inter-CCD 지연시간: 약 150ns
- Socket to Socket 지연시간: 약 260ns
클럭 속도와 제품 포지션
- EPYC 9575F는 단일 스레드 테스트에서 64개 코어 모두 최대 5GHz에 도달할 수 있었음
- 메모리 대역폭 테스트에서는 한 CCD의 8개 코어 모두를 5GHz로 실행할 수 있었음
- Cinebench 2024에서 128개 스레드를 모두 사용했을 때는 약 4.3GHz 범위를 유지함
- Level1Techs의 Wendell은 웹 서버/TLS 트랜잭션 워크로드에서 약 4.9GHz 올코어를 확인했으며, 해당 워크로드는 벡터화가 덜 된 작업임
- Turin 라인업은 높은 코어 수와 높은 주파수 SKU를 함께 제공함
- AMD는 9755, 9965 같은 높은 코어 수 SKU를 보유함
- 9575F처럼 낮은 코어 수와 매우 높은 주파수를 갖춘 SKU도 제공함
- 64코어가 ‘낮은 코어 수’로 취급되는 점 자체가 서버 CPU 시장의 변화를 보여줌
- Turin은 Naples에서 Rome으로 넘어갈 때 같은 급격한 혁명보다는 Milan에서 Genoa로 넘어갈 때처럼 메모리 대역폭 증가, 코어 수 증가, 코어 업데이트가 결합된 진화에 가까움