Tokenisierung

Konzept
Auch bekannt als: Tokenizing, Tokenizer
Zerlegung von Text in Token, bevor ein Sprachmodell ihn verarbeiten kann

Was ist Tokenisierung?

Tokenisierung ist der Vorgang, bei dem ein Tokenizer Text in Token zerlegt und jedem Token eine Zahl zuweist. Erst dieser Schritt macht Text für ein Sprachmodell verarbeitbar - das Modell selbst kennt keine Buchstaben oder Wörter, nur Zahlen-Sequenzen.

Wie es funktioniert

Der Tokenizer eines Modells wird aus großen Textmengen erstellt und lernt dabei eine feste Menge an Fragmenten - typischerweise einige zehntausend bis über hunderttausend verschiedene Token. Dieser Tokenizer wird anschließend fixiert und gemeinsam mit dem Modell verwendet. Jedes Fragment bekommt eine eindeutige Nummer.

Bei einer Anfrage läuft die Zerlegung in zwei Richtungen:

  • Eingabe: Text wird in Token zerlegt, Token werden in Zahlen umgewandelt
  • Ausgabe: Das Modell berechnet Zahlen, der Tokenizer wandelt sie zurück in lesbaren Text

Die Zerlegung ist beim jeweiligen Modell fest vorgegeben - zwei unterschiedliche Modelle können denselben Satz unterschiedlich tokenisieren, weil sie mit unterschiedlichen Tokenizern trainiert wurden.

Warum Tokenisierung nicht an Wortgrenzen endet

Ein Tokenizer orientiert sich nicht an Wörtern, sondern an der Häufigkeit von Zeichenfolgen im Trainingsmaterial. Häufige Wörter bleiben als ein Token erhalten, seltene Wörter oder Komposita werden in mehrere Fragmente zerlegt.

Das erklärt, warum deutsche Texte oft mehr Token benötigen als englische: Trainingsdaten sind überwiegend englischsprachig, wodurch der Tokenizer für englische Wortfolgen effizientere - also größere - Fragmente gelernt hat. Ein deutsches Kompositum wie “Datenschutzgrundverordnung” zerfällt entsprechend in mehrere kleinere Token.

Warum Tokenisierung praktische Auswirkungen hat

  • Kontext-Verbrauch: Stärker fragmentierte Sprachen verbrauchen bei gleicher Textmenge mehr vom verfügbaren Kontext-Fenster
  • Kosten: Bei tokenbasierter Abrechnung wirkt sich stärkere Fragmentierung direkt auf den Preis aus
  • Modellwechsel: Da jedes Modell einen eigenen Tokenizer nutzt, ist die Token-Anzahl für denselben Text zwischen Modellen nicht direkt vergleichbar

Typisches Beispiel

Ein englisches Wort wie “tokenization” bleibt bei vielen Tokenizern nah an einem Stück erhalten. Das deutsche Pendant “Tokenisierung” wird häufiger in mehrere Fragmente zerlegt - trotz vergleichbarer Bedeutung und Länge. Die genaue Zerlegung hängt jedoch immer vom verwendeten Tokenizer ab.

Weiterführend

GrundlagenPrompts: Warum Formulierungen die Antwort verändern
Wie ein Sprachmodell funktioniert

Verwandte BegriffeToken
Kontextfenster

Weiterführender Artikel

Prompts: Warum Formulierungen die Antwort verändern

Tokenisierung, System-Prompts, Temperatur und die Grenzen von Prompt Engineering

Quellen

Quellen archiviert am: 2026-08-02