VRAM
HardwareWas ist VRAM?
VRAM ist Arbeitsspeicher, der direkt auf der Grafikkarte sitzt und ausschließlich der GPU zur Verfügung steht. Für GPU-beschleunigte Sprachmodell-Inferenz müssen die Parameter des Modells vollständig im VRAM Platz finden - reicht der VRAM nicht aus, kann das Modell auf dieser GPU nicht vollständig beschleunigt ausgeführt werden.
Wie es funktioniert
Während der normale RAM eines Systems der CPU zugeordnet ist, ist VRAM fest mit der GPU verbunden und für sehr schnellen Datenzugriff während paralleler Berechnungen optimiert. Beim Laden eines Modells auf die GPU werden die Parameter in den VRAM geladen, wo sie für die gesamte Inferenz-Sitzung verbleiben.
Warum VRAM meist der eigentliche Engpass ist
VRAM ist bei aktuellen Grafikkarten deutlich knapper bemessen als normaler System-RAM, was ihn zum häufigsten Engpass beim lokalen Betrieb größerer Modelle macht. Ein Modell, das mehr VRAM benötigt, als die GPU bietet, kann nicht vollständig GPU-beschleunigt laufen oder muss teilweise auf CPU und RAM ausgelagert werden - mit entsprechendem Geschwindigkeitsverlust.
Viel System-RAM gleicht fehlenden VRAM bei GPU-Inferenz dabei nicht einfach aus - beide Speicherarten sind unterschiedlichen Komponenten zugeordnet und nicht beliebig austauschbar. Ein System mit viel RAM, aber wenig VRAM, ist für große Modelle auf der GPU trotzdem eingeschränkt.
Warum VRAM praktische Auswirkungen hat
- Modellauswahl: Verfügbarer VRAM bestimmt maßgeblich, welche Modellgröße vollständig GPU-beschleunigt läuft
- Quantisierung als Hebel: Stärkere Quantisierung senkt den VRAM-Bedarf und macht größere Modelle auf kleinerem VRAM nutzbar
- Teilauslagerung: Reicht der VRAM nicht ganz, kann ein Teil des Modells auf CPU und RAM ausgelagert werden, allerdings mit spürbarem Geschwindigkeitsverlust
Typisches Beispiel
Eine Grafikkarte mit 8 GB VRAM kann ein Modell, das quantisiert rund 6 GB belegt, vollständig im Grafikspeicher halten - ein unquantisiertes Modell gleicher Parameteranzahl würde denselben VRAM oft deutlich überschreiten.
Weiterführend
Grundlagen → Lokale KI-Modelle: Konzepte und Anforderungen
Verwandte Begriffe
→ GPU
→ Quantisierung
Weiterführender Artikel
Lokale KI-Modelle: Konzepte und AnforderungenLokale KI-Modelle vs. Cloud-APIs: Speicherung, RAM-Anforderungen, Quantisierung, Offline-Betrieb und Tool-Landschaft
Quellen
Hauptquellen
Quellen archiviert am: 2026-08-02