Token

Konzept
Auch bekannt als: Tokens, Sprachmodell-Token
Kleinste Texteinheit, mit der ein Sprachmodell rechnet - Wortteil, Wort oder Zeichenfolge

Was ist ein Token?

Ein Token ist die kleinste Texteinheit, die ein Sprachmodell verarbeitet. Kein Wort, kein Buchstabe - ein Fragment dazwischen, festgelegt durch den Tokenizer des jeweiligen Modells.

Ein Token kann sein:

  • ein ganzes Wort (“Haus”)
  • ein Wortteil (“Container” + “isierung”)
  • ein einzelnes Zeichen (bei seltenen Zeichenfolgen)
  • ein Leerzeichen oder Satzzeichen

Wie es funktioniert

Bevor ein Modell einen Text verarbeitet, zerlegt ein Tokenizer ihn in Token und wandelt jedes Token in eine Zahl um. Das Modell rechnet ausschließlich mit diesen Zahlen - Text existiert für das Modell nur in tokenisierter Form.

Bei der Antwort-Generierung läuft der Prozess umgekehrt: Das Modell berechnet Token für Token, jedes basierend auf allen vorherigen Token im Kontext. Ein Ausgabe-Token wird erst am Ende zurück in lesbaren Text übersetzt.

Warum Token statt Wörter?

Eine feste Wortliste wäre zu groß und zu starr - neue Wörter, Komposita, Tippfehler oder Fachbegriffe würden fehlen. Ein Tokenizer wird stattdessen aus großen Trainingsdaten erstellt und legt dabei eine begrenzte Menge häufiger Fragmente fest. Häufige Wörter bleiben oft als Ganzes erhalten, seltene oder zusammengesetzte Wörter werden zerlegt.

Deutsche Komposita zerfallen dadurch oft stärker als englische Wörter: “Containerisierung” wird eher in “Container” und “isierung” zerlegt, weil die Kombination im überwiegend englischsprachigen Training seltener als Ganzes vorkam.

Warum Token die Kosten und Grenzen bestimmen

  • Kontext-Fenster: Die maximale Anzahl Token, die ein Modell gleichzeitig verarbeiten kann - Prompt und Antwort zusammen
  • API-Preise: Viele Cloud-Anbieter berechnen nach Token-Anzahl, nicht nach Zeichen oder Wörtern
  • Sprachunterschiede: Deutsche Texte benötigen wegen stärkerer Fragmentierung oft mehr Token als englische Texte gleicher Wortzahl

Typisches Beispiel

Der Satz “Die Bank am Fluss” kann je nach verwendetem Tokenizer unterschiedlich zerlegt werden - Leerzeichen werden oft dem folgenden Token zugeschlagen.

Weiterführend

GrundlagenWie ein Sprachmodell funktioniert
Prompts: Warum Formulierungen die Antwort verändern

Verwandte BegriffeTokenisierung
Kontextfenster
Parameter

Weiterführender Artikel

Wie ein Sprachmodell funktioniert

Neuronale Netze, Parameter, Training und Inferenz - Token als Grundeinheit der Verarbeitung

Quellen

Quellen archiviert am: 2026-08-02