GGUF

Hardware
Auch bekannt als: GGUF-Format, GGUF-Datei
Dateiformat für quantisierte Sprachmodelle, das lokale Ausführung mit Tools wie llama.cpp oder Ollama ermöglicht
GGUF ist ein Dateiformat, in dem Sprachmodelle - meist bereits quantisiert - für den lokalen Betrieb gespeichert werden. Es bündelt Modell-Parameter, Metadaten und Tokenizer-Informationen in einer einzelnen Datei, die von Tools wie llama.cpp oder Ollama direkt geladen werden kann.

Was ist GGUF?

GGUF ist ein Dateiformat, in dem Sprachmodelle - meist bereits quantisiert - für den lokalen Betrieb gespeichert werden. Es bündelt Modell-Parameter, Metadaten und Tokenizer-Informationen in einer einzelnen Datei, die von Tools wie llama.cpp oder Ollama direkt geladen werden kann.

Wie es funktioniert

Eine GGUF-Datei enthält die quantisierten Parameter eines Modells zusammen mit allen Informationen, die eine Inferenz-Engine benötigt, um das Modell korrekt zu laden und auszuführen - darunter Architekturdetails und den passenden Tokenizer. Der Name der Datei gibt meist auch die Quantisierungsstufe an, etwa als Q4 oder Q8.

Warum GGUF zum Standard für lokale Modelle wurde

Vor GGUF mussten lokale Nutzer oft mehrere separate Dateien und Konfigurationen zusammenführen, um ein Modell lauffähig zu machen. GGUF bündelt das in einer einzigen, portablen Datei und hat sich dadurch als De-facto-Standard für lokal betriebene, quantisierte Sprachmodelle etabliert.

GGUF ist dabei ein Dateiformat, keine eigene Quantisierungsmethode oder ein bestimmtes Modell - dieselbe Modellarchitektur kann in unterschiedlichen GGUF-Dateien mit unterschiedlicher Quantisierung vorliegen. Das Format sagt für sich genommen nichts über die Qualität der enthaltenen Quantisierung aus.

Warum GGUF praktische Auswirkungen hat

  • Portabilität: Für das Modell genügt in der Regel eine einzelne GGUF-Datei; die eigentliche Inferenz übernimmt anschließend eine passende Laufzeitumgebung wie llama.cpp oder Ollama
  • Auswahl nach Speicher: Mehrere GGUF-Varianten desselben Modells erlauben die Wahl der passenden Quantisierungsstufe für die eigene Hardware
  • Werkzeug-Kompatibilität: Viele gängige lokale Inferenz-Tools wie llama.cpp oder Ollama setzen direkt auf GGUF auf

Typisches Beispiel

Ein Modell wird häufig in mehreren GGUF-Dateien mit unterschiedlicher Quantisierungsstufe angeboten - etwa “modell-Q4.gguf” oder “modell-Q8.gguf” - aus denen Nutzer je nach verfügbarem Speicher wählen können.

Weiterführend

GrundlagenLokale KI-Modelle: Konzepte und Anforderungen

Verwandte BegriffeQuantisierung
Lokales Modell

Weiterführender Artikel

Lokale KI-Modelle: Konzepte und Anforderungen

Lokale KI-Modelle vs. Cloud-APIs: Speicherung, RAM-Anforderungen, Quantisierung, Offline-Betrieb und Tool-Landschaft

Quellen

Quellen archiviert am: 2026-08-02