Auf Ihrem Tisch liegt ein Angebot für eine KI-Lösung. Darin steht ein Preis, vielleicht je Beleg, je Vorgang oder je Arbeitsplatz. Die Zahl sieht belastbar aus. Sie ist es selten, und zwar aus Gründen, die in keinem Angebot stehen.
Die meisten KI-Kosten im Unternehmen werden kalkuliert wie Strom: mehr Nutzung, höhere Rechnung. Diese Annahme greift zu kurz. Wer auf ihrer Grundlage Budgets plant oder Angebote vergleicht, arbeitet mit falschen Zahlen und spart im Zweifel an der falschen Stelle.
Wir betreiben seit Monaten eine eigene Flotte von KI-Agenten und erfassen die Kosten jedes einzelnen Laufs. Im September haben uns vier Messungen selbst überrascht. Am Ende dieses Beitrags stehen vier Fragen, die Sie jedem KI-Angebot stellen können. Bis dahin zeigen wir, woher sie kommen.
Auf einen Blick
- Weniger Text kann mehr kosten: Eine Kürzung sparte 26 % Text und verteuerte den Lauf um 17,5 %.
- Der Listenpreis ist nicht Ihr Preis: Für vierzehn Tage wies unsere Auswertung rund 37.000 USD aus. Tatsächlich bezahlt haben wir dafür höchstens rund 1.000 USD.
- Die Uhrzeit zählt mit: 29 % der Laufzeit auf einem unserer Zugänge fielen in ein Tagesfenster, in dem das Kontingent doppelt so schnell verbraucht wird.
- Eine steigende Rechnung erklärt sich nicht selbst: Erst die Kosten je Vorgang zeigen, ob der Preis oder die Menge gestiegen ist.
Was kostet KI? So rechnen Anbieter ab
KI-Anbieter rechnen nach Token ab, getrennt nach gesendetem und zurückgegebenem Text. Was ein Token kostet, hängt von drei Faktoren ab: vom Modell, von der Art des Textes (neu oder wiederholt, siehe Prompt Caching) und vom Tarif, der je nach Vertrag und teilweise sogar nach Uhrzeit variiert. Die Textmenge allein sagt deshalb wenig über die Rechnung aus. Ausführlich erklärt im FAQ.
Wir arbeiten mit mehreren Zugängen parallel, und zwar aus zwei Gründen: Kosten und Datenschutz. Stand September 2026 sind das vier Wege:
- Abonnements bei Anthropic, in unterschiedlichen Stufen bis hin zu Premium-Zugängen. Die höheren Stufen wählen wir nicht wegen des Kontingents, sondern wegen der Datenschutzbedingungen.
- Coding-Pläne bei Z.AI (Modellfamilie GLM)
- Open-Weight-Modelle über Anbieter mit Rechenzentren in der EU und Zero Data Retention, also ohne Speicherung der übermittelten Inhalte. Diesen Weg nehmen wir für alles, was Kundendaten berührt.
- Open-Weight-Modelle auf eigener Hardware im Haus
Der letzte Weg ist der, über den am wenigsten gesprochen wird, und wirtschaftlich der interessanteste. Unsere Photovoltaikanlage hat 2025 37,6 Megawattstunden erzeugt und das Unternehmen 27,5 verbraucht. Im Sommer sind wir damit vollständig autark, und rund 10 Megawattstunden im Jahr gehen ungenutzt ins Netz, für etwa 6 Cent je Kilowattstunde. Ein Teil unserer KI läuft im eigenen Keller und im Sommer mit Strom, der sonst verschenkt würde.
Die Messungen in diesem Beitrag stammen aus den beiden erstgenannten Zugängen. Dort ist die Abrechnung je Vorgang sichtbar, und nur deshalb lassen sich die folgenden Zahlen überhaupt bilden.
Bei einem KI-Agenten kommt eine Besonderheit hinzu: Er arbeitet in Runden, und jede Runde sendet den gesamten bisherigen Verlauf erneut. Derselbe Text wird deshalb beim ersten Senden voll berechnet und in jeder weiteren Runde noch einmal zum günstigeren Cache-Preis. In unseren Läufen entfallen 70 % der Kosten auf dieses wiederholte Lesen. Woraus der Kontext eines Agenten besteht und wie er mit jeder Runde wächst, zeigen wir Schritt für Schritt in einem eigenen Beitrag über KI-Agenten und ihre Kosten.
Warum weniger Text höhere KI-Kosten verursachen kann
Lange Agenten-Läufe senden bei jedem Arbeitsschritt den gesamten bisherigen Kontext erneut an das Modell. Ein Zwischenergebnis von vor vierzig Schritten wird also vierzigmal übertragen und vierzigmal berechnet. Naheliegend ist deshalb, alte und umfangreiche Zwischenergebnisse durch einen kurzen Platzhalter zu ersetzen. Genau diese Kürzung haben wir entwickelt.
Um ihre Wirkung zu prüfen, haben wir denselben Auftrag zweimal mit demselben Modell ausgeführt, GLM-5.3-Flash von Z.AI, abgerechnet je Token. Einziger Unterschied: die eingeschaltete Kürzung.
| ohne Kürzung | mit Kürzung | |
|---|---|---|
| gesendeter Text (Token) | 309.246 | 229.773 |
| davon aus dem Cache, günstig abgerechnet | 171.008 | 26.112 |
| Kosten | 0,04354 USD | 0,05117 USD |
Das Ergebnis: 26 % weniger Text, aber 17,5 % höhere Kosten. Die Ursache steht in der mittleren Zeile. Viele Anbieter rechnen wiederholt gesendeten Text über Prompt Caching deutlich günstiger ab, im Vergleichslauf zu einem Viertel des regulären Preises. Voraussetzung ist, dass dieser Text unverändert am Anfang der Anfrage steht. Jede Kürzung verändert diesen Anfang, und ab dieser Stelle gilt wieder der volle Preis. Der günstig abgerechnete Anteil sank dadurch um 85 %.
Die absoluten Beträge in dieser Tabelle sind klein, weil sie einen einzelnen, kurzen Vergleichsauftrag beschreiben, der in zehn Minuten zweimal lief. Die 18,25 USD im nächsten Abschnitt messen etwas anderes: einen Listenwert über vollständige Produktionsläufe. Die beiden Zahlen lassen sich deshalb nicht gegeneinander lesen.
Was das für Ihr Budget bedeutet: Entscheidend ist nicht der Centbetrag, sondern das Verhältnis, und das lässt sich auf jede Größe übertragen.
Gerechnet für ein mittelständisches Unternehmen Angenommen, Sie geben monatlich 5.000 Euro für KI aus, verteilt auf Belegverarbeitung, Auswertungen und ein paar Dutzend Arbeitsplätze. Eine Optimierung wie die oben beschriebene verteuert diese Rechnung um 17,5 Prozent. Das sind 875 Euro im Monat und 10.500 Euro im Jahr, verursacht durch eine Maßnahme, die eigentlich sparen sollte. Niemand würde das bemerken, denn auf der Rechnung steht nur eine Summe.
Je höher der Cache-Rabatt eines Anbieters, desto stärker schlägt eine ungeschickte Kürzung auf die Kosten durch. Optimierungen, die intuitiv einleuchten, gehören deshalb vor dem Einsatz auf den Prüfstand.
Für den Vergleich hatten wir die Schwelle der Kürzung bewusst niedrig gesetzt, damit sie in einem kurzen Lauf überhaupt greift. Im Betrieb ist sie weiter im Einsatz, greift aber erst ab einer hohen Schwelle, damit kurze Läufe unverändert bleiben. Offen ist noch, ob sich das Verhältnis bei mehrstündigen Läufen umkehrt, wenn der gekürzte Teil tatsächlich alt ist. Das messen wir als Nächstes.
Listenpreis oder tatsächlicher Preis: was Ihre Kostenübersicht zeigt
Unsere Kostenübersicht wies für 2.028 Agenten-Läufe in vierzehn Tagen durchschnittlich 18,25 USD je Lauf aus, in Summe rund 37.000 USD. Tatsächlich bezahlt haben wir im selben Zeitraum rund zehn Monatsabonnements bei Anthropic. Ein solches Abo kostet laut Preisliste bis zu 200 USD im Monat, für vierzehn Tage sind das zusammen höchstens rund 1.000 USD. Zwischen beiden Zahlen liegt mindestens der Faktor 37.
Die Spalte war nicht falsch. Sie beantwortete nur eine andere Frage: was dieselbe Arbeit bei Einzelabrechnung zum Listenpreis gekostet hätte.
Was das für Ihr Budget bedeutet: Viele Werkzeuge und Dashboards zeigen standardmäßig Listenpreise. Wer damit plant, blockiert Budget, das nie abfließt und an anderer Stelle fehlt. Wer damit Angebote vergleicht, bewertet ein Abo nach Kosten, die dort gar nicht anfallen, und trifft die Entscheidung auf falscher Grundlage.
Dieselbe Messung zeigte ein zweites Problem: 222 Läufe, also rund jeder neunte, waren unter dem Modell erfasst, das unser Werkzeug angefragt hatte, nicht unter dem, das tatsächlich geantwortet hat. Der Grund liegt in der Parallelität der beiden Zugänge: Wir nutzen die Z.AI-Pläne über dieselbe Schnittstelle wie Anthropic. Fragt unser Werkzeug dort ein Claude-Modell an, antwortet tatsächlich ein GLM-Modell. Kosten und Qualität werden so dem falschen Modell zugeordnet. Wer auf dieser Basis entscheidet, welches Modell sich bewährt, entscheidet mit verfälschten Daten. In der Auswertung selbst ist davon nichts zu sehen.
Wann KI arbeitet, bestimmt mit, was sie kostet
Unsere Z.AI-Pläne sind Abos mit einem festen Kontingent. In einem festen Tagesfenster verbraucht dieselbe Arbeit doppelt so viel von diesem Kontingent wie außerhalb. Das Fenster liegt montags bis freitags von 14 bis 18 Uhr in der Zeitzone des Anbieters, bei uns also vormittags. Unsere Auswertung der Laufzeit auf diesen Zugängen ergab: 1.197 von 4.073 Laufminuten, also 29 %, fielen in dieses Fenster.
Was das für Ihr Budget bedeutet: Fast ein Drittel der Arbeit auf diesem Zugang verbrauchte das Kontingent doppelt so schnell. Die Rechnung eines Abos steigt dadurch nicht. Das Kontingent ist aber früher erschöpft, und dann steht der Zugang still oder ein teurerer springt ein. Viele KI-Aufgaben wie Auswertungen, Prüfungen oder Berichte sind nicht an eine Uhrzeit gebunden. Wer sie gezielt verschiebt, holt aus demselben Abo mehr Arbeit heraus.
Seitdem prüft unser System alle fünf Minuten, ob das Fenster bevorsteht, und pausiert die betroffenen Zugänge dreißig Minuten vorher. Entscheidend war, was danach geschah: Die Flotte arbeitete in derselben Stunde weiter. Die Pause verschiebt Arbeit in günstigere Zeiten, sie stoppt sie nicht. Das ist der Unterschied zwischen Sparen und Bremsen.
Weil das Fenster in der Zeitzone des Anbieters definiert ist, hat jede Umrechnung ein Verfallsdatum, spätestens zur nächsten Zeitumstellung. Wer solche Fenster automatisiert umgeht, sollte die Umrechnung als wartungspflichtig behandeln.
Dazu gehört ein Grundsatz, der über Kosten hinausgeht: Eine Maßnahme, die nur meldet, dass sie eingeschaltet wurde, beschreibt eine Absicht. Erst die Messung danach belegt eine Wirkung. Unser Protokoll hält deshalb nicht nur „gesperrt“ fest, sondern auch die Gegenprobe: Zugang inaktiv, laufende Aufträge null.
KI-Kosten messen: ist der Preis gestiegen oder die Menge?
An einem Freitag im September stieg unsere Kostensumme innerhalb einer Stunde um 182 USD, ausgerechnet während die Pause aus dem vorigen Abschnitt lief. Die naheliegende Erklärung: Die günstigen Zugänge pausieren, jetzt übernehmen teurere Modelle. Die naheliegende Reaktion wäre gewesen, Modelle einzuschränken.
Beides wäre falsch gewesen. Eine einfache Rechnung hat das gezeigt: Kosten geteilt durch Anzahl der Läufe.
| Uhrzeit | 03:52 | 04:52 | 05:52 | 06:52 | 07:52 | 08:52 |
|---|---|---|---|---|---|---|
| Kostensumme seit Tagesbeginn (USD) | 84,76 | 219,23 | 321,92 | 444,17 | 477,39 | 659,38 |
| Läufe seit Tagesbeginn | 6 | 10 | 18 | 23 | 30 | 42 |
| Durchschnitt je Lauf (USD) | 14,13 | 21,92 | 17,88 | 19,31 | 15,91 | 15,70 |
Alle Beträge sind Listenwerte aus der Kostenübersicht, wie im Abschnitt zum Listenpreis beschrieben. Für die Frage nach Preis oder Menge spielt das keine Rolle, solange man durchgehend mit derselben Art Zahl rechnet.
Der Durchschnitt je Lauf schwankte zwischen 14,13 und 21,92 USD, ohne erkennbaren Anstieg. Der letzte Wert ist der zweitniedrigste der Reihe.
Gestiegen war die Menge: zwölf zusätzliche Läufe in der letzten Stunde, mehr als in jeder Stunde davor. Der Durchschnitt je Lauf sank dabei sogar, von 15,91 auf 15,70 USD. Die Pause hatte also getan, was sie sollte, und die Flotte hatte trotzdem mehr geschafft.
Was das für Ihr Budget bedeutet: Menge und Preis verlangen gegensätzliche Reaktionen. Mehr Menge heißt meist mehr erledigte Arbeit und ist oft gewollt. Ein steigender Preis je Vorgang ist dagegen ein Warnsignal. Wer nur die Summe sieht, kann beides nicht unterscheiden und bremst im schlimmsten Fall genau die produktive Arbeit, für die KI eingeführt wurde. Jede Kostenüberraschung beginnt deshalb mit derselben Frage: Was kostet ein einzelner Vorgang?
Vier Fragen, die Sie jedem KI-Angebot stellen sollten
Aus diesen Messungen haben wir vier Prüffragen abgeleitet, die wir jedem Unternehmen empfehlen, das KI einführt oder ein Angebot bewertet:
- Welches Modell hat geantwortet? Zeigt das System je Vorgang das tatsächlich genutzte Modell, nicht nur das angefragte?
- Welcher Preis wird angezeigt? Steht in der Kostenübersicht Ihr tatsächlicher Preis oder ein Listenpreis?
- Sind Menge und Preis getrennt sichtbar? Nur dann lässt sich eine Kostensteigerung richtig erklären.
- Wird die Wirkung gemessen? Gilt eine Sparmaßnahme als wirksam, weil sie eingeschaltet ist, oder weil ihre Wirkung belegt ist?
Wer diese Fragen nicht beantworten kann, weiß nicht, ob sich KI rechnet, sondern nur, dass sie läuft. Gerade im Mittelstand, wo KI-Budgets eng geplant und Investitionen gut begründet werden müssen, entscheidet dieser Unterschied über den Erfolg eines KI-Projekts.
Diese Messungen führen wir täglich an einem produktiven System durch. Die Erfahrung daraus bringen wir in Beratungsprojekte ein, damit Sie diese Fragen vor der Investition klären und nicht erst danach.
Häufige Fragen
Was ist ein Token?
Ein Token ist die kleinste Texteinheit, die ein Sprachmodell verarbeitet, meist ein Wort oder ein Wortteil. KI-Anbieter berechnen ihre Preise pro Token, üblicherweise pro Million. Deutsche Texte ergeben dabei oft mehr Token als gleich lange englische.
Was ist ein KI-Agent?
Ein KI-Agent ist eine Anwendung, die mehrstufige Aufgaben selbstständig abarbeitet, dabei Werkzeuge nutzt und Zwischenergebnisse weiterverarbeitet. Ein Lauf bezeichnet einen Auftrag vom Start bis zum Ergebnis.
Was bedeutet Kontext?
Kontext ist alles, was ein Modell bei einer Anfrage sieht: Anweisung, bisheriger Verlauf und Zwischenergebnisse. Da Sprachmodelle zwischen zwei Anfragen nichts behalten, wird der Kontext bei jedem Schritt vollständig neu gesendet und neu berechnet. Wie sich der Kontext eines Agenten zusammensetzt, zeigt unser Beitrag über den Aufbau des Kontexts.
Was ist Prompt Caching?
Beim Prompt Caching speichert der Anbieter den unveränderten Anfang einer Anfrage zwischen. Wird er erneut gesendet, muss er nicht neu verarbeitet werden und wird deutlich günstiger abgerechnet. Ändert sich der Anfang, entfällt der Vorteil ab der geänderten Stelle. Wie hoch der Rabatt ausfällt, unterscheidet sich je Anbieter und Modell erheblich und gehört vor jeder Optimierung nachgeschlagen.
Wie rechnen KI-Anbieter ab?
Grundlage ist der Preis pro Token, getrennt nach gesendetem und zurückgegebenem Text. Hinzu kommen Unterschiede je Modell, Rabatte für zwischengespeicherten Text und das Tarifmodell: entweder nutzungsbasiert oder als Abo mit festem Kontingent. Manche Anbieter rechnen zusätzlich je nach Tageszeit unterschiedlich ab.
Was ist der Unterschied zwischen Listenpreis und tatsächlichem Preis?
Der Listenpreis ist der offizielle Preis bei Einzelabrechnung pro Token. Wer ein Abo oder einen individuellen Vertrag nutzt, zahlt oft deutlich weniger. Viele Kostenübersichten zeigen trotzdem den Listenpreis an.
Gelten diese Zahlen auch, wenn wir KI nur für Texte und E-Mails nutzen?
Die Größenordnungen nicht, die Mechanik schon. Caching-Rabatte und der Unterschied zwischen Listenpreis und Abopreis gelten unabhängig vom Anwendungsfall. Bei geringer Nutzung fallen sie wirtschaftlich nur kaum ins Gewicht.
Ist ein Abo für KI sinnvoller als nutzungsbasierte Abrechnung?
Für planbare, regelmäßige Nutzung ist ein Abo oft wirtschaftlich sinnvoll, wir nutzen selbst welche. Wichtig ist, dass Sie trotzdem sehen, wofür wie viel verbraucht wird. Ohne diese Transparenz lässt sich weder die Nutzung steuern noch beurteilen, ob das gewählte Modell zu Ihrem Bedarf passt.
Wie oft sollte man KI-Kosten messen?
Fortlaufend statt monatlich. In einer Monatssumme gleichen sich Schwankungen bei Menge und Preis aus. Ein Kostensprung wie der oben beschriebene wäre darin nicht erkennbar gewesen.
Lohnt sich lokale KI aus Kostengründen?
Ab einer gewissen Zahl von Arbeitsplätzen ja. Das ist aber eine eigene Rechnung mit Hardware, Betrieb und Modellwahl, die wir in einem separaten Beitrag aufmachen.
Über den Autor
Arnulf KochVorstand
Führt die K&K Software AG und verantwortet den Einsatz von KI im eigenen Betrieb, aus dem die Messungen in diesem Beitrag stammen.
Sie haben eine konkrete Frage?
Wir ordnen mit Ihnen ein, was in Ihrem Fall realistisch und wirtschaftlich ist. Im Erstgespräch, unverbindlich.