StartGlossarToken
Sprachmodelle

Token

Kleinste Texteinheit, mit der ein Sprachmodell intern arbeitet – meist ein Wortteil oder ein Zeichen. Die Anzahl der Tokens bestimmt unter anderem Kosten und Kontextlänge.

Was ist ein Token?

Ein Token ist die kleinste Texteinheit, mit der ein Sprachmodell intern arbeitet. Tokens sind weder identisch mit Wörtern noch mit einzelnen Zeichen – sie liegen oft dazwischen: Ein Wort wie „Maschinenbau" kann in zwei oder drei Tokens aufgeteilt werden, während kurze, häufige Wörter wie „der" oder „is" meist als einzelner Token zählen. Die Einteilung übernimmt ein sogenannter Tokenizer, der je nach Modell unterschiedlich funktioniert.

Wie funktioniert ein Token?

Bevor ein Sprachmodell Text verarbeitet, zerlegt der Tokenizer den Eingabetext in eine Folge von Tokens. Dabei wird häufig auf Algorithmen wie Byte-Pair Encoding (BPE) gesetzt: Häufige Zeichenkombinationen werden zu einem einzigen Token zusammengefasst, seltene Kombinationen in kleinere Einheiten aufgeteilt. Das Ergebnis ist eine Liste von Token-IDs, also Zahlen, mit denen das Modell rechnet. Die Ausgabe wird anschließend wieder in lesbaren Text zurückübersetzt.

Als Faustregel gilt für Englisch: Ein Token entspricht etwa 0,75 Wörtern oder 4 Zeichen. Deutsch kommt aufgrund zusammengesetzter Wörter und längerer Begriffe auf mehr Tokens pro Wort – das hat direkte Auswirkungen auf Kosten und Performance.

Vorteile für Unternehmen

  • Kostenkontrolle: Die meisten KI-APIs rechnen pro Token ab – wer das Prinzip versteht, kann Prompts gezielt kürzen und Kosten senken, ohne Qualität einzubüßen.
  • Kontextplanung: Das Context Window eines Modells ist in Tokens gemessen. Wer lange Dokumente verarbeitet, muss wissen, wie viel Platz Eingabe und Ausgabe jeweils verbrauchen.
  • Prompt-Optimierung: Beim Prompt Engineering hilft Tokenwissen, effizientere Anweisungen zu formulieren – weniger Overhead, präzisere Ergebnisse.
  • Budgetplanung für KI-Projekte: Token-Volumen lässt sich schätzen und damit der monatliche API-Verbrauch kalkulieren, bevor ein Projekt live geht.

Praxisbeispiele

Beispiel 1: Kundenservice-Automatisierung im Handel

Ein Onlinehändler setzt einen Chatbot für Kundenanfragen ein. Jede Konversation verbraucht Tokens – sowohl für die eingehende Kundennachricht als auch für die Modellantwort. Wird der System-Prompt zu lang oder der Gesprächsverlauf nicht regelmäßig gekürzt, steigen die Kosten pro Anfrage überproportional. Durch gezieltes Context Compression lässt sich das Token-Volumen reduzieren, ohne dass die Antwortqualität leidet.

Beispiel 2: Dokumentenverarbeitung im Maschinenbau

Ein mittelständischer Maschinenbauer nutzt ein Sprachmodell, um technische Handbücher automatisch zusammenzufassen. Ein 50-seitiges PDF enthält schnell 30.000 bis 50.000 Tokens. Da viele Modelle ein begrenztes Context Window haben, muss der Text in Abschnitte aufgeteilt werden – ein Verfahren, das als Chunking bekannt ist. Das Token-Verständnis ist hier Voraussetzung für eine funktionierende Architektur.

Worauf du achten solltest

Token-Zählung variiert je nach Modell und Anbieter – ein Prompt, der bei GPT-4 500 Tokens verbraucht, kann bei einem anderen Modell 600 ergeben. Nutze immer den Tokenizer des jeweiligen Modells zur Schätzung. Außerdem gilt: Nicht nur der Eingabe-Text zählt, sondern auch der System Prompt und der gesamte bisherige Gesprächsverlauf. Wer das ignoriert, erlebt schnell unerwartet hohe Rechnungen oder abgeschnittene Ausgaben, weil das Context Window ausgeschöpft ist. Bei mehrsprachigen Anwendungen solltest du beachten, dass nicht-lateinische Schriften (z. B. Chinesisch, Arabisch) besonders token-intensiv sein können.

Häufige Fragen

Ist ein Token dasselbe wie ein Wort?

Nein. Kurze, häufige Wörter entsprechen oft einem Token, längere oder seltene Wörter werden in mehrere Tokens aufgeteilt. Satzzeichen, Leerzeichen und Sonderzeichen zählen ebenfalls als eigene Tokens.

Wie kann ich die Token-Anzahl eines Textes vorab prüfen?

OpenAI stellt den Tokenizer-Tool „Tokenizer" öffentlich bereit, Anthropic bietet ähnliche Möglichkeiten über die Anthropic API. Für lokale Schätzungen eignet sich die Python-Bibliothek tiktoken.

Haben Tokens Einfluss auf die Antwortqualität?

Indirekt ja. Wird der verfügbare Token-Raum durch einen langen Kontext ausgeschöpft, fehlt dem Modell Platz für eine ausführliche Antwort. Eine saubere Token-Strategie verbessert damit auch die Ausgabequalität.

Fazit

Tokens sind das grundlegende Maß, an dem sich Kosten, Kontextlänge und Performance von Sprachmodellen bemessen. Für Unternehmen, die KI-gestützte Anwendungen betreiben oder evaluieren, ist ein solides Token-Verständnis kein optionales Detailwissen – es ist die Basis für realistische Budgetplanung, saubere Architekturentscheidungen und effizientes Prompt Engineering.

Vertiefen im Blog

KI-Tools · 8 Min. Lesezeit
Langdock: DSGVO-konforme KI-Plattform für den Mittelstand?
KI-Wissen · 11 Min. Lesezeit
Lokale KI im Mittelstand: 5 Vorteile für Datenschutz & Kosten
Wissensmanagement · 11 Min. Lesezeit
Wissens-Chatbot und Onboarding-Agent — und wann RAG schadet

Verwandte Begriffe

Context WindowPrompt EngineeringLarge Language ModelChunkingTokenomics

Fragen zu Token in deinem Unternehmen?

In einer kostenlosen Prozessanalyse klären wir, wo KI bei dir wirklich Hebel hat.