GPU Interconnect Benchmarks für LLM-Inference:
NVLink vs. PCIe Switch vs. PCIe Direct
Leistungsvergleich von drei GPU-Interconnect-Architekturen für vier NVIDIA H200 NVL GPUs
auf Basis real gemessener LLM-Inference-Workloads im MEGWARE Benchmark Center.
Was Sie in diesem Interconnect Vergleich erfahren
NVLink vs. PCIe
Wie stark beeinflusst die Verbindung zwischen den GPUs die Performance von LLM-Inference?
Performance unter Last
Wie verändern sich Antwortzeit und Durchsatz bei bis zu 64 gleichzeitig laufenden Requests?
Long-Context-Workloads
Wie verhalten sich NVLink und PCIe Direct bei langen Prompts mit bis zu 128.000 Tokens?
Getestete Konfigurationen
Verglichen wurden drei unterschiedliche GPU-Interconnect-Architekturen in einem Server mit vier NVIDIA H200 NVL GPUs.
NVLink
Dedizierte Full-Mesh-Verbindung zwischen allen vier GPUs
PCIe Switch
Vier GPUs über einen gemeinsamen PCIe-Switch
PCIe Direct
Direkte PCIe-Verbindung der GPUs zur CPU
Hardware: 4× NVIDIA H200 NVL, Dual-Socket AMD EPYC 9654
Software: vLLM, Tensor Parallelism (TP=4).
Was wurde im Benchmark-Report untersucht?
Interconnect-Bandbreite
Wie unterscheiden sich die drei Architekturen bei der GPU-to-GPU-Kommunikation und bei All-Reduce-Operationen?
Response Time & Throughput
Wie beeinflusst Interconnect Antwortzeit und Durchsatz von LLMs bei steigender Auslastung?
Long-Context-Inference
Wie verhalten sich die verschiedenen Interconnects bei langen Eingabekontexten?