Tokenisierung
KonzeptWas ist Tokenisierung?
Tokenisierung ist der Vorgang, bei dem ein Tokenizer Text in Token zerlegt und jedem Token eine Zahl zuweist. Erst dieser Schritt macht Text für ein Sprachmodell verarbeitbar - das Modell selbst kennt keine Buchstaben oder Wörter, nur Zahlen-Sequenzen.
Wie es funktioniert
Der Tokenizer eines Modells wird aus großen Textmengen erstellt und lernt dabei eine feste Menge an Fragmenten - typischerweise einige zehntausend bis über hunderttausend verschiedene Token. Dieser Tokenizer wird anschließend fixiert und gemeinsam mit dem Modell verwendet. Jedes Fragment bekommt eine eindeutige Nummer.
Bei einer Anfrage läuft die Zerlegung in zwei Richtungen:
- Eingabe: Text wird in Token zerlegt, Token werden in Zahlen umgewandelt
- Ausgabe: Das Modell berechnet Zahlen, der Tokenizer wandelt sie zurück in lesbaren Text
Die Zerlegung ist beim jeweiligen Modell fest vorgegeben - zwei unterschiedliche Modelle können denselben Satz unterschiedlich tokenisieren, weil sie mit unterschiedlichen Tokenizern trainiert wurden.
Warum Tokenisierung nicht an Wortgrenzen endet
Ein Tokenizer orientiert sich nicht an Wörtern, sondern an der Häufigkeit von Zeichenfolgen im Trainingsmaterial. Häufige Wörter bleiben als ein Token erhalten, seltene Wörter oder Komposita werden in mehrere Fragmente zerlegt.
Das erklärt, warum deutsche Texte oft mehr Token benötigen als englische: Trainingsdaten sind überwiegend englischsprachig, wodurch der Tokenizer für englische Wortfolgen effizientere - also größere - Fragmente gelernt hat. Ein deutsches Kompositum wie “Datenschutzgrundverordnung” zerfällt entsprechend in mehrere kleinere Token.
Warum Tokenisierung praktische Auswirkungen hat
- Kontext-Verbrauch: Stärker fragmentierte Sprachen verbrauchen bei gleicher Textmenge mehr vom verfügbaren Kontext-Fenster
- Kosten: Bei tokenbasierter Abrechnung wirkt sich stärkere Fragmentierung direkt auf den Preis aus
- Modellwechsel: Da jedes Modell einen eigenen Tokenizer nutzt, ist die Token-Anzahl für denselben Text zwischen Modellen nicht direkt vergleichbar
Typisches Beispiel
Ein englisches Wort wie “tokenization” bleibt bei vielen Tokenizern nah an einem Stück erhalten. Das deutsche Pendant “Tokenisierung” wird häufiger in mehrere Fragmente zerlegt - trotz vergleichbarer Bedeutung und Länge. Die genaue Zerlegung hängt jedoch immer vom verwendeten Tokenizer ab.
Weiterführend
Grundlagen
→ Prompts: Warum Formulierungen die Antwort verändern
→ Wie ein Sprachmodell funktioniert
Verwandte Begriffe
→ Token
→ Kontextfenster
Weiterführender Artikel
Prompts: Warum Formulierungen die Antwort verändernTokenisierung, System-Prompts, Temperatur und die Grenzen von Prompt Engineering
Quellen
Education
Quellen archiviert am: 2026-08-02