Was ist ein Token?
Ein Token ist die kleinste Texteinheit, mit der ein Sprachmodell intern arbeitet. Tokens sind weder identisch mit Wörtern noch mit einzelnen Zeichen – sie liegen oft dazwischen: Ein Wort wie „Maschinenbau" kann in zwei oder drei Tokens aufgeteilt werden, während kurze, häufige Wörter wie „der" oder „is" meist als einzelner Token zählen. Die Einteilung übernimmt ein sogenannter Tokenizer, der je nach Modell unterschiedlich funktioniert.
Wie funktioniert ein Token?
Bevor ein Sprachmodell Text verarbeitet, zerlegt der Tokenizer den Eingabetext in eine Folge von Tokens. Dabei wird häufig auf Algorithmen wie Byte-Pair Encoding (BPE) gesetzt: Häufige Zeichenkombinationen werden zu einem einzigen Token zusammengefasst, seltene Kombinationen in kleinere Einheiten aufgeteilt. Das Ergebnis ist eine Liste von Token-IDs, also Zahlen, mit denen das Modell rechnet. Die Ausgabe wird anschließend wieder in lesbaren Text zurückübersetzt.
Als Faustregel gilt für Englisch: Ein Token entspricht etwa 0,75 Wörtern oder 4 Zeichen. Deutsch kommt aufgrund zusammengesetzter Wörter und längerer Begriffe auf mehr Tokens pro Wort – das hat direkte Auswirkungen auf Kosten und Performance.
Vorteile für Unternehmen
- Kostenkontrolle: Die meisten KI-APIs rechnen pro Token ab – wer das Prinzip versteht, kann Prompts gezielt kürzen und Kosten senken, ohne Qualität einzubüßen.
- Kontextplanung: Das Context Window eines Modells ist in Tokens gemessen. Wer lange Dokumente verarbeitet, muss wissen, wie viel Platz Eingabe und Ausgabe jeweils verbrauchen.
- Prompt-Optimierung: Beim Prompt Engineering hilft Tokenwissen, effizientere Anweisungen zu formulieren – weniger Overhead, präzisere Ergebnisse.
- Budgetplanung für KI-Projekte: Token-Volumen lässt sich schätzen und damit der monatliche API-Verbrauch kalkulieren, bevor ein Projekt live geht.
Praxisbeispiele
Beispiel 1: Kundenservice-Automatisierung im Handel
Ein Onlinehändler setzt einen Chatbot für Kundenanfragen ein. Jede Konversation verbraucht Tokens – sowohl für die eingehende Kundennachricht als auch für die Modellantwort. Wird der System-Prompt zu lang oder der Gesprächsverlauf nicht regelmäßig gekürzt, steigen die Kosten pro Anfrage überproportional. Durch gezieltes Context Compression lässt sich das Token-Volumen reduzieren, ohne dass die Antwortqualität leidet.
Beispiel 2: Dokumentenverarbeitung im Maschinenbau
Ein mittelständischer Maschinenbauer nutzt ein Sprachmodell, um technische Handbücher automatisch zusammenzufassen. Ein 50-seitiges PDF enthält schnell 30.000 bis 50.000 Tokens. Da viele Modelle ein begrenztes Context Window haben, muss der Text in Abschnitte aufgeteilt werden – ein Verfahren, das als Chunking bekannt ist. Das Token-Verständnis ist hier Voraussetzung für eine funktionierende Architektur.
Worauf du achten solltest
Token-Zählung variiert je nach Modell und Anbieter – ein Prompt, der bei GPT-4 500 Tokens verbraucht, kann bei einem anderen Modell 600 ergeben. Nutze immer den Tokenizer des jeweiligen Modells zur Schätzung. Außerdem gilt: Nicht nur der Eingabe-Text zählt, sondern auch der System Prompt und der gesamte bisherige Gesprächsverlauf. Wer das ignoriert, erlebt schnell unerwartet hohe Rechnungen oder abgeschnittene Ausgaben, weil das Context Window ausgeschöpft ist. Bei mehrsprachigen Anwendungen solltest du beachten, dass nicht-lateinische Schriften (z. B. Chinesisch, Arabisch) besonders token-intensiv sein können.
Häufige Fragen
Ist ein Token dasselbe wie ein Wort?
Nein. Kurze, häufige Wörter entsprechen oft einem Token, längere oder seltene Wörter werden in mehrere Tokens aufgeteilt. Satzzeichen, Leerzeichen und Sonderzeichen zählen ebenfalls als eigene Tokens.
Wie kann ich die Token-Anzahl eines Textes vorab prüfen?
OpenAI stellt den Tokenizer-Tool „Tokenizer" öffentlich bereit, Anthropic bietet ähnliche Möglichkeiten über die Anthropic API. Für lokale Schätzungen eignet sich die Python-Bibliothek tiktoken.
Haben Tokens Einfluss auf die Antwortqualität?
Indirekt ja. Wird der verfügbare Token-Raum durch einen langen Kontext ausgeschöpft, fehlt dem Modell Platz für eine ausführliche Antwort. Eine saubere Token-Strategie verbessert damit auch die Ausgabequalität.
Fazit
Tokens sind das grundlegende Maß, an dem sich Kosten, Kontextlänge und Performance von Sprachmodellen bemessen. Für Unternehmen, die KI-gestützte Anwendungen betreiben oder evaluieren, ist ein solides Token-Verständnis kein optionales Detailwissen – es ist die Basis für realistische Budgetplanung, saubere Architekturentscheidungen und effizientes Prompt Engineering.