Wer „KI-Agent" hört, denkt an etwas Kompliziertes: an Code, Schnittstellen und Entwickler, die wochenlang daran bauen. Dabei besteht jeder Agent, egal ob in einer Oberfläche zusammengeklickt oder von Grund auf programmiert, aus denselben sechs Bauteilen. Wer sie kennt, kann jedes Angebot einordnen, jeden Fehler lokalisieren und den eigenen ersten Agenten Stück für Stück aufbauen.
Dieser vierte Teil der Serie Der erste KI-Mitarbeiter beantwortet die Frage, wie man eigene Agenten baut. Welche Werkzeuge dafür in Frage kommen, von Claude Projects über n8n bis zur Eigenentwicklung, steht im Beitrag KI-Agenten selbst erstellen. Hier geht es um das, was in allen diesen Werkzeugen gleich ist.
Workflow oder Agent: Die Frage vor dem Bauen
Nicht alles, was „Agent" genannt wird, ist einer, und das ist gut so. Es gibt zwei Bauweisen.
Ein Workflow folgt einem festen Weg: Schritt eins, dann Schritt zwei, dann Schritt drei. Das Sprachmodell erledigt einzelne Schritte, zum Beispiel das Zusammenfassen oder das Einsortieren, aber die Reihenfolge legt der Bauplan fest.
Ein Agent entscheidet selbst, welchen Schritt er als Nächstes geht. Er bekommt ein Ziel und Werkzeuge und plant seinen Weg dorthin selbst, prüft Zwischenergebnisse und korrigiert sich.
Für die erste Stelle ist fast immer der Workflow die bessere Wahl: vorhersehbar, billiger, leichter zu prüfen. Auch Anthropic empfiehlt, mit der einfachsten Lösung anzufangen und nur dort Autonomie hinzuzunehmen, wo sie nachweislich etwas bringt. Mehr dazu in Deterministische vs. KI-Automatisierung. Die sechs Bauteile brauchst du trotzdem in beiden Fällen.
Die sechs Bauteile
1. Der Auslöser. Was bringt den Agenten zum Arbeiten? Eine neue Mail, ein Zeitpunkt, ein Eintrag im CRM, ein Knopfdruck. Der Auslöser entscheidet, ob du einen Assistenten hast, den jemand fragen muss, oder einen Mitarbeiter, der von selbst tätig wird. Ohne Auslöser kein KI-Mitarbeiter.
2. Das Modell. Das Sprachmodell, das liest, entscheidet und schreibt. Es ist das Bauteil, über das am meisten geredet wird, und das, bei dem es für die erste Stelle am wenigsten darauf ankommt. Die aktuellen großen Modelle können die typischen Büroaufgaben alle. Wichtiger ist, dass du es später austauschen kannst, ohne den Rest neu zu bauen. Warum, steht in Anbieterabhängigkeit.
3. Die Anweisungen. Stellenbeschreibung, Arbeitsweise und Beispiele, also das Ergebnis der Einarbeitung aus dem dritten Teil. Dieses Bauteil entscheidet über die Qualität mehr als jedes andere.
4. Das Wissen. Der Zugriff auf das, was nicht in den Anweisungen steht: Firmenwissen, Kundendaten, Preislisten, frühere Fälle. Entweder als Dateien, die der Agent durchsucht, oder über ein Abrufsystem.
5. Die Werkzeuge. Alles, womit der Agent etwas tut, statt nur zu schreiben: im CRM nachschlagen, ein Ticket anlegen, eine Datei speichern, einen Kalender prüfen. Für die Anbindung solcher Werkzeuge hat sich mit dem Model Context Protocol (MCP) ein offener Standard durchgesetzt. Viele Programme bieten dafür fertige Anschlüsse, sodass ein Agent zum Beispiel lesend auf ein CRM zugreifen kann, ohne dass dafür eigens programmiert werden muss. Welche Werkzeuge ein Agent bekommt und mit welchen Rechten, ist eine Frage der Befugnisse, und die klärt der nächste Teil.
6. Protokoll und Gedächtnis. Was hat der Agent getan, mit welchem Ergebnis, und was soll er sich für das nächste Mal merken? Das Protokoll ist nicht optional. Ohne es kannst du weder Fehler nachvollziehen noch die Qualität messen noch beweisen, was passiert ist. Das Gedächtnis ist optional und für die erste Stelle meist überflüssig.
Die Schleife, die aus Bauteilen einen Agenten macht
Die sechs Teile arbeiten in einer Schleife zusammen, die bei jedem Auftrag gleich abläuft:
- Verstehen: Der Auslöser liefert einen Eingang, das Modell liest ihn zusammen mit den Anweisungen.
- Nachschlagen: Fehlt etwas, holt es sich Wissen oder ruft ein Werkzeug auf.
- Handeln: Es erstellt das Ergebnis oder führt einen Schritt aus.
- Prüfen: Es vergleicht das Ergebnis mit dem, was in den Anweisungen als fertig gilt.
- Abschließen oder abgeben: Passt alles, liefert es ab. Passt etwas nicht, versucht es einen zweiten Weg oder eskaliert an einen Menschen.
Die meisten Probleme in der Praxis entstehen an zwei Stellen dieser Schleife: beim Prüfen, weil nirgends steht, wogegen geprüft wird, und beim Abgeben, weil nirgends steht, wann Schluss ist. Ein Agent ohne Abbruchbedingung kann sich endlos im Kreis drehen und dabei Kosten produzieren. Deshalb gehört in jeden Agenten eine feste Obergrenze: höchstens so viele Schritte, höchstens so viel Zeit, danach Übergabe an einen Menschen.
Den ersten Agenten in vier Stufen bauen
Du musst nicht alles auf einmal bauen. Jede Stufe liefert schon Nutzen und zeigt dir, ob sich die nächste lohnt.
Stufe 1: Von Hand im Chat. Lege in Claude oder ChatGPT ein Projekt an, kopiere die Anweisungen hinein und gib echte Fälle von Hand ein. Das kostet einen Nachmittag und zeigt dir, ob die Anweisungen tragen. Viele Stellen scheitern schon hier, und das ist die billigste Stelle zum Scheitern.
Stufe 2: Mit Lesezugriff. Verbinde das Projekt mit den Quellen, die der Agent zum Nachschlagen braucht, erst einmal nur lesend. Jetzt sucht er sich Kundendaten oder Preise selbst, statt dass du sie hineinkopierst.
Stufe 3: Mit Auslöser. Jetzt wird aus dem Assistenten ein Mitarbeiter. Ein Workflow-Werkzeug wie n8n startet den Ablauf bei jeder neuen Mail, übergibt den Inhalt an das Modell und legt das Ergebnis dort ab, wo es gebraucht wird, zunächst als Entwurf, den ein Mensch sieht.
Stufe 4: Eigene Entwicklung. Erst wenn die Werkzeuge an ihre Grenzen stoßen, etwa bei vielen Werkzeugaufrufen, eigenen Rechteregeln oder großen Mengen, lohnt sich ein selbst entwickelter Agent, zum Beispiel mit dem Agent SDK eines Modellanbieters. Er ist flexibler, braucht aber jemanden, der ihn pflegt.
Die meisten ersten Stellen im Mittelstand landen auf Stufe drei und bleiben dort. Das ist kein Mangel, sondern ein Zeichen dafür, dass die Stelle richtig zugeschnitten ist.
Häufige Fragen
Brauche ich zum Bauen eines Agenten Programmierkenntnisse?
Für die Stufen eins bis drei nicht. Du brauchst Sorgfalt beim Beschreiben und die Bereitschaft, echte Fälle durchzuspielen. Programmierkenntnisse werden erst auf Stufe vier nötig, und dort ist die Frage eher, ob du das selbst pflegen willst.
Welches Modell ist das beste für meinen ersten Agenten?
Für die typischen Aufgaben im Büro reicht jedes der aktuellen großen Modelle. Nimm das, für das ihr bereits einen geschäftlichen Zugang habt, und bau so, dass du es austauschen kannst. Warum die Modellfrage selten die entscheidende ist, steht in ChatGPT oder Claude?
Was kostet der Betrieb eines Agenten?
Das hängt vor allem daran, wie viel Text bei jedem Durchlauf verarbeitet wird. Ein Agent, der eine Mail sortiert, kostet pro Durchlauf Bruchteile eines Cents bis wenige Cent. Teuer wird es, wenn bei jedem Aufruf das halbe Firmenwissen mitgeschickt wird. Die Hebel dafür stehen in KI-Kosten senken.
Fazit
Jeder Agent besteht aus Auslöser, Modell, Anweisungen, Wissen, Werkzeugen und Protokoll, verbunden durch eine Schleife aus Verstehen, Nachschlagen, Handeln, Prüfen und Abgeben. Bau ihn in Stufen: erst von Hand, dann mit Lesezugriff, dann mit Auslöser und erst ganz am Ende selbst programmiert. Wenn du beim Aufbau Unterstützung willst, ist das der Kern meiner Arbeit in der KI-Automatisierung. Welche Aufgaben sich bei euch dafür eignen, zeigt der KI-Potenzial-Check.
Alles Wichtige zum Thema auf einer Seite: Ratgeber KI-Agenten →
