Skip to main navigation Skip to main content Skip to page footer

MEGWARE Blog

NVLink, PCIe Switch oder PCIe Direct?

  • ca. 3 Min. Lesezeit
Interconnect Benchmark Report

Wie wichtig ist die GPU-zu-GPU Verbindung für LLM-Inference? Neben der Wahl der richtigen GPU ist entscheidend, wie die GPUs miteinander verbunden sind. Wir haben im MEGWARE Benchmark Center drei unterschiedliche GPU-Interconnect-Architekturen in einem Server mit vier NVIDIA H200 NVL GPUs verglichen.

Bei der Planung von KI-Servern stehen meist die GPUs im Mittelpunkt: Rechenleistung, HBM-Speicher und Anzahl der GPUs. Doch gerade beim Betrieb großer Language Models gibt es einen weiteren Faktor, der entscheidend sein kann: 

Wie sind die GPUs miteinander verbunden?

Denn sobald ein Modell auf mehrere GPUs verteilt wird, müssen diese während der Berechnung kontinuierlich Daten austauschen. Bei Tensor Parallelism (die Gewichtsmatrizen jeder Schicht werden auf mehrere GPUs aufgeteilt, sodass jede GPU nur einen Teil jeder Rechenoperation übernimmt) betrifft das unter anderem sogenannte All-Reduce-Operationen – und damit wird der Interconnect zu einem Teil der eigentlichen Rechenleistung des Systems.

Drei GPU-Topologien im Vergleich

MEGWARE hat deshalb im aktuellen Benchmark Report drei unterschiedliche Ansätze untersucht:

  • NVLink – direkte Verbindung zwischen allen vier GPUs
  • PCIe Switch – vier GPUs über einen gemeinsamen PCIe-Switch
  • PCIe Direct – jede GPU mit einer eigenen direkten PCIe-Verbindung zur CPU

Getestet wurde auf einem System mit vier NVIDIA H200 NVL GPUs und mehreren aktuellen Large Language Models (Qwen3-32B, Llama-3.3-70B, Qwen3.8-Flash-Next-FP8). Dabei ging es nicht nur um theoretische Bandbreite, sondern vor allem um eine praxisrelevante Frage:

Wie stark beeinflusst die Wahl des Interconnects die Antwortzeit eines LLM unter realer Last?

Unter Last zeigt sich der Unterschied

Bei einer einzelnen Anfrage können die Unterschiede zwischen den verschiedenen Konfigurationen vergleichsweise gering erscheinen.

Doch was passiert, wenn gleichzeitig viele Anfragen verarbeitet werden?

Genau hier wird die Kommunikation zwischen den GPUs zunehmend relevant. In unserem Benchmark Report haben wir deshalb unter anderem eine dauerhaft hohe Parallelität von 64 gleichzeitig laufenden Requests untersucht. Die Ergebnisse zeigen: Die Wahl des Interconnects kann einen erheblichen Einfluss darauf haben, wie schnell Anwender die erste Antwort erhalten.

Und dabei gibt es einen besonders interessanten Unterschied zwischen einer direkten PCIe-Anbindung und einer Konfiguration, bei der die GPUs über einen gemeinsamen Switch kommunizieren.

Wie groß dieser Unterschied tatsächlich ausfällt und ab welchem Punkt er für produktive LLM-Anwendungen relevant wird, zeigen wir im vollständigen Benchmark Report.

Die Antwort ist weniger trivial, als es auf den ersten Blick scheint.
Wenn NVLink verfügbar ist, liegt die Vermutung nahe, dass die schnellere GPU-zu-GPU-Verbindung automatisch die beste Wahl ist. Doch wie groß ist der tatsächliche Performance-Unterschied?

Und falls NVLink nicht eingesetzt werden kann:
Ist eine direkte PCIe-Anbindung ausreichend – oder wird ein gemeinsamer PCIe-Switch zum Flaschenhals?

Auch die Frage nach der CPU-Topologie haben wir untersucht: Macht es einen Unterschied, ob vier GPUs an einem CPU-Socket oder auf zwei CPU-Sockets verteilt angebunden werden?

Die Antworten darauf finden Sie im vollständigen Benchmark Report.

Besonders relevant für moderne KI-Workloads

Die Untersuchung beschränkt sich außerdem nicht auf kurze Chat-Prompts.

Denn aktuelle Anwendungen wie Coding-Assistenten, Retrieval-Augmented Generation und autonome Agenten arbeiten zunehmend mit sehr großen Kontexten. Lange Quelltexte, Dokumente oder umfangreiche Tool-Historien können die Anforderungen an das Inference-System deutlich verändern.

Deshalb haben wir zusätzlich untersucht, wie sich die Interconnects bei deutlich längeren Kontexten verhalten.

Verändert ein 16-mal längerer Prompt tatsächlich das Verhältnis zwischen den verschiedenen GPU-Verbindungen?

Dazu liefert der Benchmark Report konkrete Messergebnisse.