Was KI-Agenten kosten, entscheidet sich selten an der Länge des Auftrags. Es entscheidet sich daran, was der Agent bei jedem Arbeitsschritt an das Modell sendet, und das ist fast immer weit mehr als der Auftrag. Dieser Beitrag zeigt, woraus dieser Kontext besteht, wie er im Lauf einer Aufgabe wächst und welcher Teil davon zu welchem Preis abgerechnet wird. Alle Zahlen stammen aus Messungen an unserer eigenen Agenten-Flotte.
Auf einen Blick
- Der Auftrag ist der kleinste Teil: Bevor ein Agent unserer Flotte den ersten Schritt tut, stehen rund 23.800 Token im Kontext. Der Auftragstext ist davon etwa ein Fünftel.
- Jede Runde sendet alles erneut: In einem Lauf mit 13 Anfragen wurden 376.771 Token gesendet, fast das Zehnfache dessen, was am Ende im Kontext stand.
- Derselbe Text hat drei Preise: Je nach Zeitpunkt zählt er als neue Eingabe, als Cache-Lesen oder als Ausgabe.
- Die Rechnung besteht aus Wiederholung: 70 % der Kosten entfielen in unseren Läufen auf das erneute Lesen von Text, der schon da war.
Woraus der Kontext eines KI-Agenten besteht
Ein Sprachmodell merkt sich zwischen zwei Anfragen nichts. Was es wissen soll, muss in der Anfrage stehen, und zwar jedes Mal vollständig.
Ein KI-Agent besteht deshalb aus zwei Teilen: aus dem Modell und aus dem Harness. Das Harness ist das Programm um das Modell herum. Es baut die Anfragen zusammen, führt Werkzeuge aus und führt den Verlauf. Jede Anfrage setzt es aus denselben Bausteinen zusammen.
| Baustein | Inhalt | Wer ihn schreibt |
|---|---|---|
| Werkzeug-Definitionen | Beschreibung der eingebauten Werkzeuge: Datei lesen, Befehl ausführen, suchen, schreiben | Harness |
| MCP-Definitionen | Beschreibung der Werkzeuge angebundener Systeme, zum Beispiel ERP oder Ticketsystem | Betreiber |
| Systemprompt des Harness | Rolle, Arbeitsregeln, Angaben zur Umgebung | Harness |
| Skill-Liste | Namen und Kurzbeschreibungen von Anleitungen, die der Agent bei Bedarf nachlädt | Betreiber |
| AGENTS.md | Regeln und Besonderheiten des Projekts | Betreiber |
| Auftrag des Nutzers | die eigentliche Aufgabe | Nutzer |
| Denken | Überlegungen des Modells, für Anwender meist unsichtbar | Modell |
| Antworttext | sichtbare Zwischenmeldung oder Schlussantwort | Modell |
| Werkzeugaufruf | Anforderung des Modells, ein Werkzeug mit bestimmten Angaben auszuführen | Modell |
| Werkzeug-Ergebnis | was das Werkzeug zurückgibt: Dateiinhalt, Befehlsausgabe, Suchtreffer | Werkzeug |
Die ersten fünf Bausteine bilden den festen Rahmen. Er ist in jeder Anfrage gleich und überraschend groß. Bei einem Agenten unserer Flotte stehen rund 23.800 Token im Kontext, bevor er den ersten Schritt tut. Der Auftragstext macht davon etwa ein Fünftel aus.
Wie ein Agent arbeitet: die Schleife
Ein Agent löst eine Aufgabe nicht mit einer Anfrage, sondern in Runden.
- Das Harness baut die Anfrage aus Rahmen, Auftrag und bisherigem Verlauf.
- Das Modell antwortet mit Denken, Text und Werkzeugaufrufen.
- Das Harness führt die angeforderten Werkzeuge aus.
- Die Ergebnisse kommen in den Verlauf, und die nächste Runde beginnt.
Die Schleife endet, wenn das Modell ohne Werkzeugaufruf antwortet. Das ist die finale Antwort.
Eine Antwort kann mehrere Werkzeugaufrufe zugleich enthalten. In unseren Läufen enthielt jede fünfte Antwort mit Werkzeugaufruf mehr als einen, in der Spitze fünf. Für die Kosten ist das ein Vorteil: Drei Aufrufe in einer Runde senden den Kontext einmal, drei einzelne Runden senden ihn dreimal.
Wann ein Token Eingabe ist, wann Cache und wann Ausgabe
Anbieter unterscheiden bei der Abrechnung bis zu vier Klassen.
| Klasse | Was dazu zählt | Preis im Verhältnis |
|---|---|---|
| Ausgabe | alles, was das Modell erzeugt: Denken, Antworttext, Werkzeugaufrufe | am teuersten |
| Neue Eingabe | gesendeter Text, den der Anbieter in dieser Form zum ersten Mal sieht | voller Eingabepreis |
| Cache-Lesen | gesendeter Text, den der Anbieter unverändert schon zwischengespeichert hat (siehe Prompt Caching) | ein Bruchteil des Eingabepreises |
| Cache-Schreiben | Aufschlag mancher Anbieter für das erstmalige Zwischenspeichern | etwas über dem Eingabepreis |
Wie groß die Abstände sind, zeigt das Modell, mit dem wir die folgenden Messungen gefahren haben (GLM-5.3-Flash von Z.AI, Stand September 2026): 0,20 USD je Million Token für neue Eingabe, 0,05 USD für Cache-Lesen und 0,50 USD für Ausgabe.
Welcher Baustein in welche Klasse fällt, hängt nicht vom Baustein ab, sondern vom Zeitpunkt.
Daraus ergeben sich vier Regeln:
- Jeder Text kostet einmal voll und danach immer wieder ein wenig. Beim ersten Senden gilt der volle Eingabepreis, in jeder weiteren Anfrage der Cache-Preis.
- Was das Modell schreibt, kostet doppelt. Beim Entstehen zählt es als Ausgabe. In der nächsten Anfrage steht es im Verlauf und zählt als Eingabe. Das gilt auch für das Denken, das der Anwender meist nie sieht.
- Der Cache gilt nur für den unveränderten Anfang. Ändert sich eine Stelle, zählt alles dahinter wieder als neue Eingabe.
- Der Cache verfällt. Wie lange ein Anbieter zwischenspeichert, steht in seinen Bedingungen. Üblich sind wenige Minuten nach der letzten Nutzung. Wartet ein Agent länger, zum Beispiel auf einen langen Testlauf, zahlt die nächste Anfrage den gesamten Kontext zum vollen Preis.
Gemessen: So wächst der Kontext in 13 Anfragen
So sieht das in einem echten Lauf aus. Ein Agent unserer Flotte hat eine Aufgabe in viereinhalb Minuten und 13 Anfragen erledigt.
| Anfrage | Cache-Lesen | Neue Eingabe | Ausgabe | Werkzeugaufrufe |
|---|---|---|---|---|
| 1 | 704 | 22.274 | 93 | 1 |
| 2 | 16.192 | 6.957 | 144 | 1 |
| 3 | 23.104 | 273 | 51 | 1 |
| 4 | 23.360 | 390 | 211 | 1 |
| 5 | 23.744 | 222 | 42 | 1 |
| 6 | 23.936 | 1.066 | 244 | 1 |
| 7 | 24.960 | 2.211 | 2.265 | 1 |
| 8 | 27.136 | 2.531 | 1.128 | 1 |
| 9 | 29.632 | 1.518 | 3.777 | 2 |
| 10 | 31.104 | 4.067 | 508 | 1 |
| 11 | 35.136 | 638 | 392 | 1 |
| 12 | 35.712 | 713 | 2.457 | 1 |
| 13 | 36.416 | 2.775 | 965 | 0 |
| Summe | 331.136 | 45.635 | 12.277 | 13 |
Drei Dinge fallen auf. Die erste Anfrage besteht fast nur aus neuer Eingabe, ab der dritten wird fast alles aus dem Cache gelesen. Der Kontext wächst von 22.978 auf 39.191 Token, also um 70 %. Gesendet wurden in Summe aber 376.771 Token, fast das Zehnfache dessen, was am Ende im Kontext stand. Bezahlt wird nicht der Kontext, sondern jede Wiederholung des Kontexts.
Was KI-Agenten kosten: wenige Token, viel Geld
Über 24 Läufe mit 3.258 Anfragen ergibt sich dasselbe Bild in groß.
| Klasse | Token | Anteil an den Token | Anteil an den Kosten |
|---|---|---|---|
| Cache-Lesen | 168,6 Mio. | 92,6 % | 70,5 % |
| Neue Eingabe | 10,8 Mio. | 5,9 % | 18,0 % |
| Ausgabe | 2,7 Mio. | 1,5 % | 11,5 % |
Die Kosten sind zum Listenpreis gerechnet, die Läufe selbst liefen über ein Abo. Zwei Verhältnisse sind trotzdem übertragbar. Ausgabe macht 1,5 % der Token aus, aber 11,5 % der Kosten. Und obwohl Cache-Lesen nur ein Viertel kostet, entfallen darauf 70 % der Rechnung, weil es 93 % der Menge sind.
Drei Hebel, die wirken, und einer, der enttäuscht
Aus diesen Messungen folgt, wo sich Sparen lohnt.
- Weniger Runden. Jede Runde liest den gesamten Kontext erneut. Ein Agent, der mehrere Werkzeuge in einer Antwort anfordert und mit einem klaren Auftrag startet, kommt mit weniger Runden ans Ziel.
- Ein schlanker Rahmen. Der feste Rahmen machte in unseren Läufen ein Fünftel aller gesendeten Token aus. Jeder Absatz im Systemprompt kostet nicht seine Länge, sondern seine Länge mal die Zahl aller Anfragen.
- Ein stabiler Anfang. Wer den Anfang einer Anfrage verändert, verliert den Cache für alles dahinter. Wie teuer das werden kann, zeigt unsere Messung zu den KI-Kosten im Unternehmen: Eine Kürzung sparte 26 % Text und verteuerte den Lauf um 17,5 %.
Enttäuscht hat uns der naheliegendste Hebel. Befehlsausgaben zu kürzen, brachte in der Nachrechnung an denselben 24 Läufen 0,7 % der gesendeten Token. Die Modelle kürzen ihre Ausgaben längst selbst.
Was das für Ihr Budget bedeutet: Der größte Posten eines KI-Agenten ist das wiederholte Vorlesen dessen, was schon da ist. Wer die Kosten eines Agenten beurteilen will, fragt deshalb nicht zuerst nach dem Preis je Token. Er fragt, wie viele Runden eine typische Aufgabe braucht, wie groß der Rahmen ist und ob die Auswertung Eingabe, Cache und Ausgabe getrennt zeigt.
Diese Messungen führen wir täglich an einem produktiven System durch. Die Erfahrung daraus bringen wir in Beratungsprojekte ein, damit Sie wissen, was ein Agent in Ihrem Unternehmen kosten wird, bevor Sie ihn einführen.
Häufige Fragen
Was ist ein Harness?
Das Harness ist das Programm, das ein Sprachmodell zum Agenten macht. Es baut jede Anfrage zusammen, führt die vom Modell angeforderten Werkzeuge aus und hält den Verlauf fest. Das Modell selbst liest nur Text und schreibt Text.
Was ist MCP?
MCP steht für Model Context Protocol. Das ist ein offener Standard, über den sich Systeme wie ERP, Ticketsystem oder Datenbank als Werkzeuge an einen Agenten anbinden lassen. Jedes angebundene Werkzeug bringt eine Beschreibung mit, und diese Beschreibung steht in jeder Anfrage.
Was ist ein Token?
Ein Token ist die kleinste Texteinheit, die ein Sprachmodell verarbeitet, meist ein Wort oder ein Wortteil. Abgerechnet wird je Million Token. Bei einem Agenten zählt dabei nicht der Text einmal, sondern jedes Mal, wenn er gesendet wird: Ein Werkzeug-Ergebnis aus Runde drei steht in jeder weiteren Runde wieder in der Anfrage.
Was ist der Kontext eines KI-Agenten?
Kontext ist alles, was ein Modell bei einer Anfrage sieht: der feste Rahmen, der Auftrag und der gesamte bisherige Verlauf. Da Sprachmodelle zwischen zwei Anfragen nichts behalten, wird der Kontext bei jedem Schritt vollständig neu gesendet.
Was ist Prompt Caching?
Beim Prompt Caching speichert der Anbieter den unveränderten Anfang einer Anfrage zwischen. Wird er erneut gesendet, muss er nicht neu verarbeitet werden und wird deutlich günstiger abgerechnet. Ändert sich der Anfang, entfällt der Vorteil ab der geänderten Stelle. Wie hoch der Rabatt ausfällt, unterscheidet sich je Anbieter und Modell erheblich.
Warum zählt das Denken des Modells als Ausgabe?
Weil das Modell es erzeugt. Für die Abrechnung ist unerheblich, ob ein Mensch den Text je liest. Bei anspruchsvollen Aufgaben kann das Denken den größeren Teil der Ausgabe ausmachen.
Wie lange bleibt Text im Cache?
Das legt jeder Anbieter selbst fest. Üblich sind wenige Minuten nach der letzten Nutzung, manche Anbieter bieten gegen Aufpreis längere Zeiten. Jede Nutzung verlängert die Frist.
Gilt das auch für einen Chat-Assistenten?
Die Mechanik ja, die Größenordnung nein. Auch ein Chat sendet bei jeder Nachricht den bisherigen Verlauf erneut. Ein Agent durchläuft aber in Minuten Dutzende Runden mit großen Werkzeug-Ergebnissen, ein Chat in derselben Zeit nur wenige.
Über den Autor
Thomas LeiberTechnische Leitung (CTO)
Verantwortet die Technik der K&K Software AG und betreibt die lokale KI-Installation, mit der das Team täglich arbeitet.
Sie haben eine konkrete Frage?
Wir ordnen mit Ihnen ein, was in Ihrem Fall realistisch und wirtschaftlich ist. Im Erstgespräch, unverbindlich.