Was ist Throughput?
Throughput bezeichnet die Menge an Anfragen oder Tokens, die ein KI-System innerhalb einer bestimmten Zeiteinheit verarbeiten kann – typischerweise gemessen in Tokens pro Sekunde oder Anfragen pro Minute. Die Kennzahl zeigt, wie leistungsfähig ein System unter Last ist, und ist damit eine der zentralen Größen, wenn du KI-Dienste in produktiven Umgebungen betreibst. Anders als Latenz, die misst, wie schnell eine einzelne Anfrage beantwortet wird, beschreibt Throughput die Gesamtkapazität des Systems.
Wie funktioniert Throughput?
Stell dir ein Restaurant vor: Latenz ist die Zeit, bis ein Gast sein Essen bekommt. Throughput ist dagegen die Anzahl der Gäste, die das Restaurant pro Abend bedienen kann. Ein KI-System mit hohem Throughput kann viele Anfragen gleichzeitig oder in schneller Folge abarbeiten – durch Parallelisierung, effiziente Hardwarenutzung und optimierte Modellarchitektur. Entscheidend sind dabei die eingesetzte Hardware (GPU oder TPU), die Modellgröße und Techniken wie Batch Inference, bei der mehrere Anfragen gebündelt verarbeitet werden.
Der Throughput wird direkt beeinflusst durch Optimierungen wie Quantisierung (kleinere Modelle, schnellere Verarbeitung), Speculative Decoding oder Pruning. Wer produktive KI-Anwendungen baut, muss Throughput und Latenz gemeinsam im Blick behalten – beide Kennzahlen konkurrieren oft miteinander.
Vorteile für Unternehmen
- Skalierbarkeit planbar machen: Mit klaren Throughput-Werten weißt du, wie viele Nutzer oder Prozesse dein System gleichzeitig bedienen kann – und wann du mehr Kapazität brauchst.
- Kosten kontrollieren: Höherer Throughput bedeutet, dass du mehr Anfragen mit derselben Infrastruktur abwickelst. Das senkt direkt die Kosten pro verarbeitetem Token oder Request.
- SLA-Einhaltung sicherstellen: Wer Kunden oder internen Abteilungen Antwortzeiten zusichert, braucht verlässliche Throughput-Werte als Grundlage für realistische Service Level Agreements.
- Engpässe frühzeitig erkennen: Throughput-Monitoring zeigt, ob ein System an seine Grenzen stößt – bevor Nutzer Fehler oder Timeouts erleben.
Praxisbeispiele
Beispiel 1: Kundenservice-Automatisierung im Handel
Ein mittelständischer Onlinehändler betreibt einen KI-gestützten Chatbot für Kundenanfragen. An Spitzentagen – etwa Black Friday – treffen innerhalb weniger Minuten Tausende Anfragen ein. Ist der Throughput des Systems zu niedrig, stauen sich die Anfragen, Antwortzeiten steigen, und Kunden brechen ab. Durch Batch Inference und eine optimierte Modellkonfiguration kann das Team den Throughput verdoppeln, ohne zusätzliche Server aufzusetzen.
Beispiel 2: Dokumentenverarbeitung im Maschinenbau
Ein Maschinenbauunternehmen nutzt ein KI-System, um täglich Hunderte technische Dokumente automatisch zu klassifizieren und zusammenzufassen. Hier ist nicht Echtzeit-Latenz entscheidend, sondern Throughput: Das System soll alle Dokumente bis Tagesende verarbeitet haben. Durch den Einsatz von Batch Inference und einem quantisierten Modell schafft das Team den nötigen Durchsatz, ohne die Cloud-Kosten ausufern zu lassen.
Worauf du achten solltest
Throughput und Latenz stehen häufig im Widerspruch: Mehr parallele Anfragen zu bündeln erhöht den Durchsatz, kann aber einzelne Anfragen langsamer machen. Definiere deshalb vorab, was für deinen Anwendungsfall wichtiger ist. Außerdem misst du Throughput idealerweise unter realistischer Last – synthetische Tests spiegeln selten das echte Nutzungsverhalten wider. Achte zudem darauf, dass Throughput-Angaben von Modellanbietern oft unter Idealbedingungen gemessen werden; plane einen Sicherheitspuffer ein. Wer auf geteilte API-Infrastruktur setzt (etwa OpenAI API oder Anthropic API), hat weniger Kontrolle über den tatsächlich verfügbaren Throughput und sollte Rate Limits und Tier-Grenzen im Blick behalten.
Häufige Fragen
Was ist der Unterschied zwischen Throughput und Latenz?
Latenz misst die Zeit für eine einzelne Anfrage von Eingang bis Antwort. Throughput misst, wie viele Anfragen oder Tokens das System insgesamt pro Zeiteinheit schafft. Beide Kennzahlen ergänzen sich – eine allein reicht für eine vollständige Bewertung nicht aus.
Wie verbessere ich den Throughput meines KI-Systems?
Die wirksamsten Hebel sind Batch Inference, Quantisierung des Modells, leistungsfähigere Hardware sowie Architekturentscheidungen wie Mixture of Experts. Auch Prompt Caching kann helfen, wenn viele Anfragen ähnliche Eingaben haben.
Ab welcher Nutzerzahl wird Throughput kritisch?
Das hängt stark vom Anwendungsfall ab. Als Faustregel: Sobald mehr als eine Handvoll Nutzer gleichzeitig auf ein KI-System zugreifen oder Prozesse im Batch-Betrieb laufen, solltest du Throughput aktiv messen und monitoren – nicht erst dann, wenn Probleme auftreten.
Fazit
Throughput ist keine abstrakte Systemkenngröße, sondern ein direkter Hebel für Nutzererfahrung, Betriebskosten und Skalierbarkeit. Wer KI-Dienste produktiv einsetzt – ob im Kundenservice, in der Dokumentenverarbeitung oder in automatisierten Workflows –, sollte Throughput von Anfang an in die Systemplanung einbeziehen und regelmäßig unter realer Last messen.