Eine KI soll einen Fehler in einer Anwendung beheben. Sie liest Dateien, ändert Code und startet Tests. Dann beginnt die nächste Runde. Auf der Rechnung stehen am Ende viele Modellaufrufe, obwohl der Mensch nur einen Auftrag erteilt hat. Wer die Kosten dafür einschätzen will, braucht mehr als die Preisliste des Modells.
Ein am 24. September veröffentlichter und am 26. September überarbeiteter Preprint untersucht genau diese Frage. „Harness Tokenomics“ richtet den Blick auf die Software, die Agenten steuert. Für Unternehmen entsteht daraus eine praktische Frage: An welcher Stelle lohnt sich eine andere Modellwahl wirklich?
Die Steuerung arbeitet mit
Ein Harness ist die Laufzeitumgebung rund um einen KI-Agenten. Sie organisiert den Ablauf zwischen Modell, Werkzeugen und Ausführungsumgebung. Anthropic beschreibt diese Trennung in seinem technischen Beitrag zu Managed Agents: Der Harness ruft das Modell auf und leitet dessen Werkzeugaufrufe an die passende Infrastruktur weiter. Ein getrenntes Protokoll hält den Verlauf fest, eine Sandbox stellt die Umgebung für Code und Dateien bereit. Technische Einordnung von Anthropic.
Für die Kostenbetrachtung heißt das zunächst: Wir müssen den gesamten Auftrag sehen können. Ein Preisvergleich pro Million Tokens beantwortet noch nicht, wie viel Arbeit bis zum brauchbaren Ergebnis anfällt. Tokens sind die Einheiten, in denen Modelle Eingaben und Ausgaben verarbeiten. Auch mitgeschickte Informationen zählen dabei mit.
Unser Ausgangspunkt wäre deshalb eine einfache Frage an das eigene Team: Können wir für einen abgeschlossenen Auftrag nachvollziehen, welche Schritte der Agent ausgeführt hat und welche davon nötig waren? Solange das unklar bleibt, lässt sich eine auffällige Rechnung kaum sinnvoll erklären.
Was die neue Untersuchung zeigt
Die Autoren modellieren eine Organisation mit 10.000 Nutzern und errechnen Einsparungen von 13 bis 21 Prozent der Modellausgaben. Das Ergebnis beruht auf einer Emulation, synthetischen Aufgaben, zwei öffentlichen Datensammlungen und den Listenpreisen einer Anbieterfamilie vom 21. September. Es ist kein gemessener Sparerfolg eines deutschen Unternehmens.
Eine zentrale Beobachtung betrifft lange Sitzungen: Unter den untersuchten Preisbedingungen kann das nominell teuerste Modell insgesamt günstiger sein. Die Autoren berücksichtigen dabei die Wiederverwendung bereits verarbeiteter Eingaben. Ihr Router verteilt Arbeit bevorzugt an geeigneten Übergängen, statt laufend mitten im Auftrag das Modell zu wechseln.
Die Grenzen sind erheblich. Der Simulator und der Szenariokatalog sind nicht veröffentlicht. Die Autoren weisen zudem darauf hin, dass sich eine eigene Router-Entwicklung für kleine Organisationen möglicherweise nicht rechnet. Preprint, Version 2: Ergebnisse und Einschränkungen.
Wir lesen die Untersuchung als Anlass, die eigene Kostenmessung genauer anzusehen. Die Prozentwerte gehören zu ihren Annahmen. Sie eignen sich nicht als Budgetzusage für ein anderes Team.
Ein Modellwechsel hat einen Übergangspreis
Die Claude-Code-Dokumentation erklärt den technischen Hintergrund unabhängig von der Modellrechnung. Prompt Caching erlaubt die Wiederverwendung bereits verarbeiteter Eingabeteile. Claude Code verwaltet diesen Zwischenspeicher automatisch. Jedes Modell hat jedoch seinen eigenen Cache. Nach einem Modellwechsel muss die nächste Anfrage den bisherigen Gesprächsverlauf ohne diese Cache-Treffer verarbeiten. Claude Code: Prompt Caching.
Das ist eine konkrete Produkteigenschaft, keine allgemeine Regel für sämtliche KI-Werkzeuge. Wer einen anderen Agenten nutzt, sollte dessen Dokumentation und Abrechnung prüfen. Für Claude Code empfiehlt der Hersteller, die Modellwahl möglichst am Beginn einer Sitzung zu treffen.
Ein günstigerer Tarif kann also mit zusätzlichen Übergangskosten verbunden sein. Ob sich der Wechsel trotzdem lohnt, hängt vom weiteren Verlauf ab. Für eine belastbare Entscheidung würden wir die Rechnung vor und nach einem Wechsel vergleichen und gleichzeitig prüfen, ob die Ergebnisse dieselben Anforderungen erfüllen.
Ein brauchbarer Vergleich für kleinere Teams
Als hypothetischen Test nehmen wir eine Softwarefirma, die regelmäßig Änderungen an einer internen Anwendung erledigt. Für einen Vergleich könnte sie einige abgeschlossene, voneinander getrennte Aufgaben mit bekannten Abnahmekriterien auswählen. Eine davon wäre etwa die Korrektur eines fehlerhaften Datumsfilters. Eine weitere könnte eine klar beschriebene Ergänzung im Export sein.
Das Team hält zunächst fest, was als fertig gilt. Beim Datumsfilter reicht ein erfolgreicher Programmstart kaum aus: Auch Monatswechsel, leere Ergebnisse und vorhandene Tests gehören in die Prüfung. Die Kriterien müssen vor dem Versuch stehen, damit ein billiger, aber unvollständiger Durchlauf nicht versehentlich gewinnt.
Danach werden zwei freigegebene Einstellungen mit vergleichbaren Ausgangsbedingungen erprobt. Wir würden neben der abgerechneten Nutzung die Bearbeitungszeit und den menschlichen Prüfaufwand notieren. Ein Ergebnis, das erst nach längerer Nacharbeit verwendbar ist, sollte im Vergleich entsprechend behandelt werden. Aus wenigen Versuchen entsteht zunächst eine Arbeitshypothese, kein allgemeines Urteil über ein Modell.
Für solche Tests braucht es nicht zwingend eine selbst entwickelte Steuerungsplattform. Die vorhandenen Werkzeuge und ihre Nutzungsberichte können ein sinnvoller Anfang sein. Im Rahmen einer KI-Beratung lässt sich zuerst klären, welche wiederkehrenden Aufgaben überhaupt häufig genug vorkommen, um diesen Aufwand zu rechtfertigen.
Eine Kostenentscheidung braucht ein Abbruchkriterium
Unsere Empfehlung für den Einstieg: Ein Agentenversuch erhält ein begrenztes Budget und eine klare Regel für den Fall, dass er sich festläuft. Bleibt derselbe Test nach mehreren Änderungen rot, sollte jemand auf den Verlauf schauen können. Ein weiterer automatischer Versuch ist erst dann sinnvoll, wenn er einen nachvollziehbaren neuen Ansatz verfolgt.
Ebenso wichtig ist die Entscheidung gegen zusätzliche Infrastruktur. Wer mit den vorhandenen Einstellungen zuverlässig arbeitet und nur geringe variable Ausgaben hat, muss keinen Router bauen. Für Teams mit vielen wiederkehrenden Agentenaufträgen kann sich eine genauere Auswertung dagegen lohnen. Eine individuelle KI-Softwareentwicklung sollte dann mit einer überprüfbaren Anforderung beginnen: Welche Entscheidung soll die Steuerung besser treffen, und woran erkennen wir das?
Die neue Studie liefert dafür einen interessanten Anstoß. Für den eigenen Betrieb bleibt der Maßstab das abgenommene Ergebnis samt Aufwand bis dorthin. Erst diese Rechnung zeigt, ob die vermeintlich günstigere Einstellung tatsächlich hilft.
Quellen und Links
Harness Tokenomics, Version 2 vom 26. September 2026: aktueller Forschungsanlass; Preprint, keine eigene Replikation durch CodeCell.
Claude Code: Prompt Caching: technische Dokumentation zum Cache und zum Modellwechsel.
Anthropic: Architektur von Managed Agents: Hintergrund zum Begriff Harness, veröffentlicht am 8. April 2026.
Quellenstand: 30. September 2026. Anwendungsvorschläge sind redaktionelle Einordnung; das Softwareteam im Beispiel ist hypothetisch. Titelbild: KI-generierte Illustration auf Basis des freigegebenen Porträts von Nikolas Gottschol.

:quality(78))
:quality(78))
:quality(78))
:quality(78))
