Dunklen Modus aktivierenHellen Modus aktivieren

Wirtschaftlichkeit · KI-Modelle 14 Minuten Lesezeit

KI-Agenten und ihre Kosten: Woraus der Kontext besteht und wie er wächst

Woraus der Kontext besteht und wie er wächst

Was KI-Agenten kosten, entscheidet sich selten an der Länge des Auftrags. Es entscheidet sich daran, was der Agent bei jedem Arbeitsschritt an das Modell sendet, und das ist fast immer weit mehr als der Auftrag. Dieser Beitrag zeigt, woraus dieser Kontext besteht, wie er im Lauf einer Aufgabe wächst und welcher Teil davon zu welchem Preis abgerechnet wird. Alle Zahlen stammen aus Messungen an unserer eigenen Agenten-Flotte.

Auf einen Blick

  • Der Auftrag ist der kleinste Teil: Bevor ein Agent unserer Flotte den ersten Schritt tut, stehen rund 23.800 Token im Kontext. Der Auftragstext ist davon etwa ein Fünftel.
  • Jede Runde sendet alles erneut: In einem Lauf mit 13 Anfragen wurden 376.771 Token gesendet, fast das Zehnfache dessen, was am Ende im Kontext stand.
  • Derselbe Text hat drei Preise: Je nach Zeitpunkt zählt er als neue Eingabe, als Cache-Lesen oder als Ausgabe.
  • Die Rechnung besteht aus Wiederholung: 70 % der Kosten entfielen in unseren Läufen auf das erneute Lesen von Text, der schon da war.

Woraus der Kontext eines KI-Agenten besteht

Ein Sprachmodell merkt sich zwischen zwei Anfragen nichts. Was es wissen soll, muss in der Anfrage stehen, und zwar jedes Mal vollständig.

Ein KI-Agent besteht deshalb aus zwei Teilen: aus dem Modell und aus dem Harness. Das Harness ist das Programm um das Modell herum. Es baut die Anfragen zusammen, führt Werkzeuge aus und führt den Verlauf. Jede Anfrage setzt es aus denselben Bausteinen zusammen.

So ist eine Anfrage an das Modell aufgebautGestapelte Bausteine einer Anfrage: Werkzeug-Definitionen, MCP-Definitionen, Systemprompt des Harness, Skill-Liste, AGENTS.md, Auftrag des Nutzers, danach der Verlauf aus Denken, Antworttext, Werkzeugaufrufen und Werkzeug-Ergebnissen. Unter der Trennlinie steht die Antwort des Modells.KI-AGENTEN UND IHRE KOSTEN · BILD 1So ist eine Anfrage an das Modell aufgebautDas Modell liest von oben nach unten. Alles bis zur Trennlinie wird gesendet, der Rest wird erzeugt.Reihenfolge am Beispiel gängiger Agenten-Werkzeuge. Je nach Werkzeug stehen Skill-Liste und AGENTS.md im Systemprompt oder in der ersten Nachricht.Werkzeug-DefinitionenDatei lesen, Befehl ausführen, suchen, schreibenHARNESSMCP-DefinitionenWerkzeuge angebundener Systeme, etwa ERP oder TicketsBETREIBERSystemprompt des HarnessRolle, Arbeitsregeln, UmgebungHARNESSSkill-ListeNamen und Kurzbeschreibungen abrufbarer AnleitungenBETREIBERAGENTS.mdRegeln und Besonderheiten des ProjektsBETREIBERAuftrag des Nutzersdie eigentliche AufgabeNUTZERDenkenÜberlegungen des Modells, für Anwender meist unsichtbarMODELLAntworttextkurze ZwischenmeldungMODELLWerkzeugaufrufeeiner oder mehrere je AntwortMODELLWerkzeug-ErgebnisseDateiinhalte, Befehlsausgaben, SuchtrefferWERKZEUG… und so weiterderselbe Viererblock für jeden weiteren SchrittTrennlinie: gesendet | erzeugtAntwort dieser AnfrageDenken, Text und Werkzeugaufrufe oder die finale AntwortMODELLFester RahmenIn jeder Anfrage gleich.Steht vorn, damit derZwischenspeicher greift.AuftragEinmal gestellt, in jederAnfrage wieder dabei.VerlaufWächst mit jedem Schritt.Enthält auch, was dasModell selbst geschrieben hat.AusgabeErzeugt das Modell neu.Teuerste Klasse.
Aufbau einer Anfrage an ein Sprachmodell: fester Rahmen, Auftrag, Verlauf und Antwort
Baustein Inhalt Wer ihn schreibt
Werkzeug-DefinitionenBeschreibung der eingebauten Werkzeuge: Datei lesen, Befehl ausführen, suchen, schreibenHarness
MCP-DefinitionenBeschreibung der Werkzeuge angebundener Systeme, zum Beispiel ERP oder TicketsystemBetreiber
Systemprompt des HarnessRolle, Arbeitsregeln, Angaben zur UmgebungHarness
Skill-ListeNamen und Kurzbeschreibungen von Anleitungen, die der Agent bei Bedarf nachlädtBetreiber
AGENTS.mdRegeln und Besonderheiten des ProjektsBetreiber
Auftrag des Nutzersdie eigentliche AufgabeNutzer
DenkenÜberlegungen des Modells, für Anwender meist unsichtbarModell
Antworttextsichtbare Zwischenmeldung oder SchlussantwortModell
WerkzeugaufrufAnforderung des Modells, ein Werkzeug mit bestimmten Angaben auszuführenModell
Werkzeug-Ergebniswas das Werkzeug zurückgibt: Dateiinhalt, Befehlsausgabe, SuchtrefferWerkzeug

Die ersten fünf Bausteine bilden den festen Rahmen. Er ist in jeder Anfrage gleich und überraschend groß. Bei einem Agenten unserer Flotte stehen rund 23.800 Token im Kontext, bevor er den ersten Schritt tut. Der Auftragstext macht davon etwa ein Fünftel aus.

Wie ein Agent arbeitet: die Schleife

Ein Agent löst eine Aufgabe nicht mit einer Anfrage, sondern in Runden.

Die Agenten-SchleifeKreislauf aus vier Schritten: Harness baut die Anfrage, Modell antwortet mit Denken, Text und Werkzeugaufrufen, Harness führt die Werkzeuge aus, Ergebnisse kommen in den Verlauf. Der Kreislauf endet, wenn das Modell ohne Werkzeugaufruf antwortet.KI-AGENTEN UND IHRE KOSTEN · BILD 2Die Agenten-SchleifeJede Runde ist eine eigene Anfrage, und jede Anfrage sendet den gesamten Kontext erneut.Harness: das Programm um das Modell, das Anfragen baut, Werkzeuge ausführt und den Verlauf führt.1Harness baut die AnfrageRahmen, Auftrag und bisheriger Verlauf2Modell antwortetDenken, Text und ein odermehrere Werkzeugaufrufe3Harness führt Werkzeuge ausmehrere Aufrufe laufen nebeneinander4Ergebnisse in den Verlaufalle Ergebnisse gesammelt,der Kontext ist gewachsenAuftraggesendetEingabe undCache-LesenWerkzeugaufrufeErgebnissenächste RundeEine Runde =eine AnfrageFinale Antwort an den NutzerAntwortohneAufruf
Agenten-Schleife in vier Schritten: Anfrage bauen, Modell antwortet, Werkzeuge ausführen, Ergebnisse in den Verlauf
  1. Das Harness baut die Anfrage aus Rahmen, Auftrag und bisherigem Verlauf.
  2. Das Modell antwortet mit Denken, Text und Werkzeugaufrufen.
  3. Das Harness führt die angeforderten Werkzeuge aus.
  4. Die Ergebnisse kommen in den Verlauf, und die nächste Runde beginnt.

Die Schleife endet, wenn das Modell ohne Werkzeugaufruf antwortet. Das ist die finale Antwort.

Eine Antwort kann mehrere Werkzeugaufrufe zugleich enthalten. In unseren Läufen enthielt jede fünfte Antwort mit Werkzeugaufruf mehr als einen, in der Spitze fünf. Für die Kosten ist das ein Vorteil: Drei Aufrufe in einer Runde senden den Kontext einmal, drei einzelne Runden senden ihn dreimal.

Wann ein Token Eingabe ist, wann Cache und wann Ausgabe

Anbieter unterscheiden bei der Abrechnung bis zu vier Klassen.

Klasse Was dazu zählt Preis im Verhältnis
Ausgabealles, was das Modell erzeugt: Denken, Antworttext, Werkzeugaufrufeam teuersten
Neue Eingabegesendeter Text, den der Anbieter in dieser Form zum ersten Mal siehtvoller Eingabepreis
Cache-Lesengesendeter Text, den der Anbieter unverändert schon zwischengespeichert hat (siehe Prompt Caching)ein Bruchteil des Eingabepreises
Cache-SchreibenAufschlag mancher Anbieter für das erstmalige Zwischenspeichernetwas über dem Eingabepreis

Wie groß die Abstände sind, zeigt das Modell, mit dem wir die folgenden Messungen gefahren haben (GLM-5.3-Flash von Z.AI, Stand September 2026): 0,20 USD je Million Token für neue Eingabe, 0,05 USD für Cache-Lesen und 0,50 USD für Ausgabe.

Welcher Baustein in welche Klasse fällt, hängt nicht vom Baustein ab, sondern vom Zeitpunkt.

Derselbe Text, drei PreiseDrei Spalten für drei Anfragen. In der ersten ist alles neue Eingabe, die Antwort ist Ausgabe. In der zweiten wird der Inhalt der ersten aus dem Cache gelesen, neu sind die vorige Antwort und das Werkzeug-Ergebnis. In der dritten wächst der günstige Anteil weiter.KI-AGENTEN UND IHRE KOSTEN · BILD 3Derselbe Text, drei PreiseDrei aufeinanderfolgende Anfragen eines Laufs. Die Farbe zeigt, wie jeder Baustein abgerechnet wird.Schema, nicht maßstäblich. Manche Anbieter berechnen für das erstmalige Zwischenspeichern einen Aufschlag auf den Eingabepreis.Cache-LesengünstigNeue Eingabevoller EingabepreisAusgabeteuerste KlasseAnfrage 1Fester RahmenWerkzeuge, MCP, Systemprompt,Skill-Liste, AGENTS.mdAuftrag des NutzersAntwortDenken, Werkzeugaufruf AAnfrage 2Fester RahmenWerkzeuge, MCP, Systemprompt,Skill-Liste, AGENTS.mdAuftrag des NutzersVorige AntwortDenken, Werkzeugaufruf AErgebnis Azum Beispiel ein DateiinhaltAntwortDenken, Text, Aufrufe B und CAnfrage 3Fester RahmenWerkzeuge, MCP, Systemprompt,Skill-Liste, AGENTS.mdAuftrag des NutzersAntwort aus Anfrage 1Ergebnis AVorige AntwortDenken, Text, Aufrufe B und CErgebnisse B und Czwei Aufrufe, eine RundeAntwortfinale Antwort an den Nutzer
Drei aufeinanderfolgende Anfragen: dieselben Bausteine wechseln von neuer Eingabe zu Cache-Lesen

Daraus ergeben sich vier Regeln:

  1. Jeder Text kostet einmal voll und danach immer wieder ein wenig. Beim ersten Senden gilt der volle Eingabepreis, in jeder weiteren Anfrage der Cache-Preis.
  2. Was das Modell schreibt, kostet doppelt. Beim Entstehen zählt es als Ausgabe. In der nächsten Anfrage steht es im Verlauf und zählt als Eingabe. Das gilt auch für das Denken, das der Anwender meist nie sieht.
  3. Der Cache gilt nur für den unveränderten Anfang. Ändert sich eine Stelle, zählt alles dahinter wieder als neue Eingabe.
  4. Der Cache verfällt. Wie lange ein Anbieter zwischenspeichert, steht in seinen Bedingungen. Üblich sind wenige Minuten nach der letzten Nutzung. Wartet ein Agent länger, zum Beispiel auf einen langen Testlauf, zahlt die nächste Anfrage den gesamten Kontext zum vollen Preis.

Gemessen: So wächst der Kontext in 13 Anfragen

So sieht das in einem echten Lauf aus. Ein Agent unserer Flotte hat eine Aufgabe in viereinhalb Minuten und 13 Anfragen erledigt.

Gemessen: So wächst der Kontext in einem echten LaufGestapelte Säulen für 13 Anfragen. Der Kontext wächst von 22.978 auf 39.191 Token. Ab der dritten Anfrage besteht fast jede Säule aus Cache-Lesen.KI-AGENTEN UND IHRE KOSTEN · BILD 4Gemessen: So wächst der Kontext in einem echten LaufEin Lauf unserer Flotte mit 13 Anfragen in viereinhalb Minuten. Höhe der Säule: Token je Anfrage.Quelle: eigene Messung, Lauf vom 20.09.2026, Modell GLM-5.3-Flash. Säulen enthalten gesendete und erzeugte Token.Cache-LesengünstigNeue Eingabevoller EingabepreisAusgabeteuerste Klasse010.00020.00030.00040.000TokenAnfrage 1: Cache-Lesen 704 TokenAnfrage 1: Neue Eingabe 22.274 TokenAnfrage 1: Ausgabe 93 Token22.978gesendet1Anfrage 2: Cache-Lesen 16.192 TokenAnfrage 2: Neue Eingabe 6.957 TokenAnfrage 2: Ausgabe 144 Token2Anfrage 3: Cache-Lesen 23.104 TokenAnfrage 3: Neue Eingabe 273 TokenAnfrage 3: Ausgabe 51 Token3Anfrage 4: Cache-Lesen 23.360 TokenAnfrage 4: Neue Eingabe 390 TokenAnfrage 4: Ausgabe 211 Token4Anfrage 5: Cache-Lesen 23.744 TokenAnfrage 5: Neue Eingabe 222 TokenAnfrage 5: Ausgabe 42 Token5Anfrage 6: Cache-Lesen 23.936 TokenAnfrage 6: Neue Eingabe 1.066 TokenAnfrage 6: Ausgabe 244 Token6Anfrage 7: Cache-Lesen 24.960 TokenAnfrage 7: Neue Eingabe 2.211 TokenAnfrage 7: Ausgabe 2.265 Token7Anfrage 8: Cache-Lesen 27.136 TokenAnfrage 8: Neue Eingabe 2.531 TokenAnfrage 8: Ausgabe 1.128 Token8Anfrage 9: Cache-Lesen 29.632 TokenAnfrage 9: Neue Eingabe 1.518 TokenAnfrage 9: Ausgabe 3.777 Token92 Werkzeugaufrufein einer AntwortAnfrage 10: Cache-Lesen 31.104 TokenAnfrage 10: Neue Eingabe 4.067 TokenAnfrage 10: Ausgabe 508 Token10Anfrage 11: Cache-Lesen 35.136 TokenAnfrage 11: Neue Eingabe 638 TokenAnfrage 11: Ausgabe 392 Token11Anfrage 12: Cache-Lesen 35.712 TokenAnfrage 12: Neue Eingabe 713 TokenAnfrage 12: Ausgabe 2.457 Token12Anfrage 13: Cache-Lesen 36.416 TokenAnfrage 13: Neue Eingabe 2.775 TokenAnfrage 13: Ausgabe 965 Token39.191gesendet13AnfrageIn Summe gesendet: 376.771 Token. Erzeugt: 12.277 Token. Die letzte Anfrage war 39.191 Token groß.
Gestapelte Säulen: der Kontext wächst über 13 Anfragen von 22.978 auf 39.191 Token
Anfrage Cache-Lesen Neue Eingabe Ausgabe Werkzeugaufrufe
170422.274931
216.1926.9571441
323.104273511
423.3603902111
523.744222421
623.9361.0662441
724.9602.2112.2651
827.1362.5311.1281
929.6321.5183.7772
1031.1044.0675081
1135.1366383921
1235.7127132.4571
1336.4162.7759650
Summe331.13645.63512.27713

Drei Dinge fallen auf. Die erste Anfrage besteht fast nur aus neuer Eingabe, ab der dritten wird fast alles aus dem Cache gelesen. Der Kontext wächst von 22.978 auf 39.191 Token, also um 70 %. Gesendet wurden in Summe aber 376.771 Token, fast das Zehnfache dessen, was am Ende im Kontext stand. Bezahlt wird nicht der Kontext, sondern jede Wiederholung des Kontexts.

Was KI-Agenten kosten: wenige Token, viel Geld

Über 24 Läufe mit 3.258 Anfragen ergibt sich dasselbe Bild in groß.

Wenige Token, viel Geld: Anteile nach KlasseZwei waagerechte Balken. Nach Menge sind 92,6 Prozent der Token Cache-Lesen, 5,9 Prozent neue Eingabe und 1,5 Prozent Ausgabe. Nach Kosten sind es 70,5 Prozent, 18,0 Prozent und 11,5 Prozent.KI-AGENTEN UND IHRE KOSTEN · BILD 5Wenige Token, viel Geld: Anteile nach Klasse24 Läufe unserer Flotte, 3.258 Anfragen. Oben nach Menge, unten nach Kosten zum Listenpreis.Quelle: eigene Messung, 19. und 20.09.2026. Gerechnet je Million Token mit 0,20 USD Eingabe, 0,05 USD Cache-Lesen, 0,50 USD Ausgabe.Cache-LesengünstigNeue Eingabevoller EingabepreisAusgabeteuerste KlasseAnteil an den TokenAnteil an den Token: Cache-Lesen 92,6 %92,6 %Anteil an den Token: Neue Eingabe 5,9 %5,9 %Anteil an den Token: Ausgabe 1,5 %1,5 %AusgabeAnteil an den KostenAnteil an den Kosten: Cache-Lesen 70,5 %70,5 %Anteil an den Kosten: Neue Eingabe 18,0 %18,0 %Anteil an den Kosten: Ausgabe 11,5 %11,5 %
Zwei Balken: Anteile von Cache-Lesen, neuer Eingabe und Ausgabe nach Token und nach Kosten
Klasse Token Anteil an den Token Anteil an den Kosten
Cache-Lesen168,6 Mio.92,6 %70,5 %
Neue Eingabe10,8 Mio.5,9 %18,0 %
Ausgabe2,7 Mio.1,5 %11,5 %

Die Kosten sind zum Listenpreis gerechnet, die Läufe selbst liefen über ein Abo. Zwei Verhältnisse sind trotzdem übertragbar. Ausgabe macht 1,5 % der Token aus, aber 11,5 % der Kosten. Und obwohl Cache-Lesen nur ein Viertel kostet, entfallen darauf 70 % der Rechnung, weil es 93 % der Menge sind.

Drei Hebel, die wirken, und einer, der enttäuscht

Aus diesen Messungen folgt, wo sich Sparen lohnt.

  • Weniger Runden. Jede Runde liest den gesamten Kontext erneut. Ein Agent, der mehrere Werkzeuge in einer Antwort anfordert und mit einem klaren Auftrag startet, kommt mit weniger Runden ans Ziel.
  • Ein schlanker Rahmen. Der feste Rahmen machte in unseren Läufen ein Fünftel aller gesendeten Token aus. Jeder Absatz im Systemprompt kostet nicht seine Länge, sondern seine Länge mal die Zahl aller Anfragen.
  • Ein stabiler Anfang. Wer den Anfang einer Anfrage verändert, verliert den Cache für alles dahinter. Wie teuer das werden kann, zeigt unsere Messung zu den KI-Kosten im Unternehmen: Eine Kürzung sparte 26 % Text und verteuerte den Lauf um 17,5 %.

Enttäuscht hat uns der naheliegendste Hebel. Befehlsausgaben zu kürzen, brachte in der Nachrechnung an denselben 24 Läufen 0,7 % der gesendeten Token. Die Modelle kürzen ihre Ausgaben längst selbst.

Was das für Ihr Budget bedeutet: Der größte Posten eines KI-Agenten ist das wiederholte Vorlesen dessen, was schon da ist. Wer die Kosten eines Agenten beurteilen will, fragt deshalb nicht zuerst nach dem Preis je Token. Er fragt, wie viele Runden eine typische Aufgabe braucht, wie groß der Rahmen ist und ob die Auswertung Eingabe, Cache und Ausgabe getrennt zeigt.

Diese Messungen führen wir täglich an einem produktiven System durch. Die Erfahrung daraus bringen wir in Beratungsprojekte ein, damit Sie wissen, was ein Agent in Ihrem Unternehmen kosten wird, bevor Sie ihn einführen.

Häufige Fragen

Was ist ein Harness?

Das Harness ist das Programm, das ein Sprachmodell zum Agenten macht. Es baut jede Anfrage zusammen, führt die vom Modell angeforderten Werkzeuge aus und hält den Verlauf fest. Das Modell selbst liest nur Text und schreibt Text.

Was ist MCP?

MCP steht für Model Context Protocol. Das ist ein offener Standard, über den sich Systeme wie ERP, Ticketsystem oder Datenbank als Werkzeuge an einen Agenten anbinden lassen. Jedes angebundene Werkzeug bringt eine Beschreibung mit, und diese Beschreibung steht in jeder Anfrage.

Was ist ein Token?

Ein Token ist die kleinste Texteinheit, die ein Sprachmodell verarbeitet, meist ein Wort oder ein Wortteil. Abgerechnet wird je Million Token. Bei einem Agenten zählt dabei nicht der Text einmal, sondern jedes Mal, wenn er gesendet wird: Ein Werkzeug-Ergebnis aus Runde drei steht in jeder weiteren Runde wieder in der Anfrage.

Was ist der Kontext eines KI-Agenten?

Kontext ist alles, was ein Modell bei einer Anfrage sieht: der feste Rahmen, der Auftrag und der gesamte bisherige Verlauf. Da Sprachmodelle zwischen zwei Anfragen nichts behalten, wird der Kontext bei jedem Schritt vollständig neu gesendet.

Was ist Prompt Caching?

Beim Prompt Caching speichert der Anbieter den unveränderten Anfang einer Anfrage zwischen. Wird er erneut gesendet, muss er nicht neu verarbeitet werden und wird deutlich günstiger abgerechnet. Ändert sich der Anfang, entfällt der Vorteil ab der geänderten Stelle. Wie hoch der Rabatt ausfällt, unterscheidet sich je Anbieter und Modell erheblich.

Warum zählt das Denken des Modells als Ausgabe?

Weil das Modell es erzeugt. Für die Abrechnung ist unerheblich, ob ein Mensch den Text je liest. Bei anspruchsvollen Aufgaben kann das Denken den größeren Teil der Ausgabe ausmachen.

Wie lange bleibt Text im Cache?

Das legt jeder Anbieter selbst fest. Üblich sind wenige Minuten nach der letzten Nutzung, manche Anbieter bieten gegen Aufpreis längere Zeiten. Jede Nutzung verlängert die Frist.

Gilt das auch für einen Chat-Assistenten?

Die Mechanik ja, die Größenordnung nein. Auch ein Chat sendet bei jeder Nachricht den bisherigen Verlauf erneut. Ein Agent durchläuft aber in Minuten Dutzende Runden mit großen Werkzeug-Ergebnissen, ein Chat in derselben Zeit nur wenige.

Thomas Leiber, Technische Leitung der K&K Software AG

Über den Autor

Thomas LeiberTechnische Leitung (CTO)

Verantwortet die Technik der K&K Software AG und betreibt die lokale KI-Installation, mit der das Team täglich arbeitet.

Sie haben eine konkrete Frage?

Wir ordnen mit Ihnen ein, was in Ihrem Fall realistisch und wirtschaftlich ist. Im Erstgespräch, unverbindlich.