Große Sprachmodelle, kurz LLMs, sind KI-Modelle, die menschliche Sprache verstehen und erzeugen. Bekannte Beispiele sind GPT von OpenAI, Llama von Meta und die Modelle von Mistral. LLMs gehören zur generativen KI. Sie beantworten Fragen, fassen Dokumente zusammen, übersetzen oder schreiben Programmcode.
Wie funktioniert ein LLM?
Ein LLM lernt im Training aus riesigen Textmengen, wie Wörter und Sätze zusammenhängen. Dabei passt es Milliarden von Parametern an. In diesen Parametern steckt das Wissen des Modells. Bei einer Anfrage berechnet das Modell Token für Token, welche Fortsetzung am besten passt. Die Grundlage bildet die Transformer-Architektur, auf der seit 2017 die meisten Sprachmodelle aufbauen.
Was sind Token, Kontext und Kontextlänge?
Ein Token ist die kleinste Texteinheit, mit der ein LLM arbeitet. Das kann ein ganzes Wort, ein Wortteil oder ein Satzzeichen sein. Im Deutschen entspricht ein Token grob drei bis vier Zeichen, ein längeres Wort besteht oft aus mehreren Token.
Der Kontext umfasst alles, was das Modell bei einer Anfrage berücksichtigt: Ihre Frage, den bisherigen Chatverlauf, mitgegebene Dokumente und die bereits erzeugte Antwort. Die Kontextlänge gibt an, wie viele Token das Modell maximal auf einmal verarbeiten kann. Aktuelle Modelle schaffen oft 128.000 Token oder mehr, das entspricht mehreren hundert Seiten Text. Je länger der Kontext, desto mehr Speicher braucht das Modell.
Was unterscheidet Training, Feintuning und Inferenz?
Beim Training entsteht das Modell von Grund auf. Das dauert Wochen und belegt oft Tausende GPUs. Beim Feintuning passen Unternehmen ein fertiges Modell mit eigenen Daten an, etwa an Fachbegriffe oder interne Dokumente. Die Inferenz ist der laufende Betrieb, in dem das Modell Anfragen beantwortet.
Welche Hardware braucht ein LLM?
Die Größe eines Modells bestimmt seinen Speicherbedarf. Als Faustregel braucht jeder Parameter bei 16-Bit-Genauigkeit zwei Byte, bei 8-Bit-Genauigkeit (FP8) nur ein Byte. Da viele aktuelle Modelle in FP8 veröffentlicht werden, ist das die praxisnahe Rechengrundlage: Ein Modell mit 70 Milliarden Parametern belegt damit rund 70 GB, allein für die Modellgewichte (bei 16 Bit wären es 140 GB).
Hinzu kommt der KV-Cache. Das ist der Zwischenspeicher, in dem das Modell die Zwischenergebnisse (Keys und Values) aller bisherigen Token des Kontexts ablegt. So muss es diese bei jedem neuen Token nicht erneut berechnen. Der KV-Cache wächst mit der Kontextlänge und der Zahl paralleler Anfragen und kann bei vielen Nutzern mehrere zehn GB belegen.
Eine einzelne NVIDIA H200 hat 141 GB GPU-Speicher. Ein 70B-Modell in FP8 passt hier samt großzügigem KV-Cache auf eine Karte. Größere Modelle laufen dagegen meist verteilt auf mehrere GPUs, zum Beispiel in einem GPU-Server mit acht GPUs.
Eine kostengünstigere Alternative ist die NVIDIA RTX PRO 6000 Blackwell mit 96 GB GDDR7-Speicher. Ein 70B-Modell in FP8 passt mit rund 70 GB auf eine einzelne Karte. Es bleiben etwa 26 GB für den KV-Cache, genug für lange Kontexte und mehrere parallele Anfragen. Wer mehr Kontext oder Parallelität braucht, kann auf 4-Bit-Formate wie NVFP4 ausweichen, die Blackwell nativ unterstützt. Sie halbieren die Gewichte auf etwa 35 GB, bei leichten Qualitätseinbußen vor allem im komplexen Reasoning. Mit zwei bis vier Karten in einem Server lassen sich auch Modelle mit über 100 Milliarden Parametern betreiben, ohne gleich ein großes Acht-GPU-System zu benötigen. Dank PCIe-Anbindung und luftgekühlten Varianten lässt sich die Karte zudem in Standard-Racks integrieren.
Viele Unternehmen betreiben LLMs lokal im eigenen Rechenzentrum, damit sensible Daten im Haus bleiben.
Im MEGWARE Benchmark Center können Sie testen, welche Hardware Ihr Modell braucht.
FAQ LLM
Parameter sind die Zahlenwerte, die ein Modell im Training lernt. Sie legen fest, wie das Modell Wörter gewichtet und verknüpft. Ein Modell mit 70 Milliarden Parametern hat also 70 Milliarden solcher Werte gespeichert.
Ein LLM ist das Sprachmodell selbst. ChatGPT ist eine Anwendung von OpenAI, die auf den GPT-Modellen aufbaut. Sie ergänzt das Modell um eine Chat-Oberfläche, Sicherheitsfilter und weitere Funktionen.
Ein LLM halluziniert, wenn es plausibel klingende, aber falsche Aussagen erzeugt. Das passiert, weil das Modell wahrscheinliche Wortfolgen berechnet und keine Fakten prüft. Unternehmen verringern das Risiko, indem sie das Modell mit geprüften eigenen Dokumenten verbinden. Diese Methode heißt Retrieval Augmented Generation (RAG).
Ja. Offene Modelle wie Llama, Mistral oder Qwen laufen auch auf eigenen Servern. Kleinen Modellen reicht oft schon eine einzelne GPU, große Modelle verteilen Sie auf mehrere GPUs. Der lokale Betrieb hält sensible Daten im eigenen Rechenzentrum.
Große Modelle trainieren Anbieter über Wochen bis Monate auf Tausenden GPUs. Für Unternehmen ist meist das Feintuning relevant. Damit passen Sie ein fertiges Modell an eigene Daten an, was je nach Modellgröße und Hardware Stunden bis Tage dauert.
Ihr LLM auf eigener Hardware betreiben?
Wir ermitteln mit Ihnen, wie viele GPUs Ihr Modell braucht. Testen Sie vorab auf NVIDIA H200 und B200.