RAM

Hardware
Auch bekannt als: Arbeitsspeicher, Random Access Memory, Hauptspeicher
Schneller, flüchtiger Arbeitsspeicher eines Computers, der Modell-Parameter für die Verarbeitung durch die CPU bereithält
RAM ist der Arbeitsspeicher, in dem ein Computer aktuell benötigte Daten und Programme ablegt, solange sie gebraucht werden - im Unterschied zu dauerhaftem Speicher wie einer Festplatte oder SSD. Bei CPU-basierter Sprachmodell-Inferenz müssen die Parameter des Modells vollständig im RAM verfügbar sein.

Was ist RAM?

RAM ist der Arbeitsspeicher, in dem ein Computer aktuell benötigte Daten und Programme ablegt, solange sie gebraucht werden - im Unterschied zu dauerhaftem Speicher wie einer Festplatte oder SSD. Bei CPU-basierter Sprachmodell-Inferenz müssen die Parameter des Modells vollständig im RAM verfügbar sein.

Wie es funktioniert

RAM ist deutlich schneller als dauerhafter Speicher, verliert seinen Inhalt aber beim Ausschalten des Geräts - daher “flüchtig”. Bei der Ausführung eines Modells auf der CPU werden die Modellparameter in den RAM geladen, damit die CPU während der Berechnung schnell auf alle Parameter zugreifen kann.

Warum RAM die praktikable Modellgröße mitbestimmt

Reicht der verfügbare RAM nicht aus, um ein Modell vollständig zu laden, kann es entweder gar nicht oder nur mit deutlichen Geschwindigkeitseinbußen durch Auslagerung auf langsameren Speicher ausgeführt werden. Die RAM-Größe ist deshalb neben dem VRAM einer GPU einer der wichtigsten Faktoren dafür, welche Modellgröße lokal überhaupt praktikabel ist.

RAM und VRAM sind dabei nicht dasselbe und meist nicht direkt austauschbar - RAM steht der CPU zur Verfügung, VRAM ist der GPU direkt zugeordnete Speicher. Für das eigentliche Modell zählt bei GPU-beschleunigter Inferenz in erster Linie der VRAM, während System-RAM weiterhin für Betriebssystem und Laufzeitumgebung benötigt wird.

Warum RAM praktische Auswirkungen hat

  • Modellauswahl: Verfügbarer RAM begrenzt, welche Modellgröße auf einem System ohne GPU sinnvoll lauffähig ist
  • Systemlast: Neben dem Modell benötigen Betriebssystem und andere Programme ebenfalls RAM
  • Auslagerung: Nicht ausreichender RAM führt oft zu deutlich spürbaren Geschwindigkeitseinbußen statt zu einem klaren Fehler

Typisches Beispiel

Ein quantisiertes Modell, das rund 6 GB Speicher belegt, benötigt auf einem System ohne dedizierte GPU entsprechend freien RAM, zusätzlich zum Speicherbedarf des Betriebssystems und anderer laufender Programme.

Weiterführend

GrundlagenLokale KI-Modelle: Konzepte und Anforderungen

Verwandte BegriffeVRAM
CPU

Weiterführender Artikel

Lokale KI-Modelle: Konzepte und Anforderungen

Lokale KI-Modelle vs. Cloud-APIs: Speicherung, RAM-Anforderungen, Quantisierung, Offline-Betrieb und Tool-Landschaft

Quellen

Quellen archiviert am: 2026-08-02