· KI & Tools
Was kostet ein Gedanke? Die Betriebswirtschaft der KI-Nutzung
Ich arbeite jeden Tag mit ChatGPT Plus samt Codex auf der einen Seite und Claude samt Claude Code auf der anderen. Oft laufen mehrere Agenten am selben Projekt. Und ich könnte bis heute nicht sagen, was ein Arbeitstag davon kostet. Nicht ungefähr – gar nicht. Ich zahle einen Festbetrag, bekomme ein Kontingent, das niemand in einer nachvollziehbaren Einheit ausdrückt, und stehe irgendwann vor der Meldung, dass mein Fünf-Stunden-Fenster erschöpft ist. Warum ausgerechnet jetzt? Genau das ist die Frage dieses Beitrags.
Die Kernthese ist unbequem: Nicht der Preis pro Token entscheidet allein, sondern die Menge der Tokens. Und der teuerste Teil davon, das Denken, ist unsichtbar. Deshalb kann ein kleines, günstiges Modell auf hoher Denkstufe am Ende mehr kosten als ein größeres Modell auf niedriger Stufe. Im Agenten wird es noch deutlicher, weil Werkzeugaufrufe, Dateiinhalte und jeder Zwischenschritt den Kontext verlängern.
Die Rechnung, die niemand aufmacht: Das Modell vergisst zwischen zwei Zügen alles
Ein Sprachmodell führt kein Gespräch mit einem dauerhaften Gedächtnis. Jede Anfrage wird neu zusammengestellt. Anthropic beschreibt es für Claude Code ausdrücklich: Systemprompt, Projektkontext, bisherige Nachrichten, Werkzeugergebnisse und die neue Frage werden erneut gesendet. Für Nicht-Informatiker ist das Bild ziemlich passend: Vor jedem neuen Satz wird dem Gegenüber das Protokoll aller vorherigen Sätze noch einmal vorgelesen.
Eine kurze Frage in einer Sitzung, die den ganzen Tag offen war, ist deshalb nicht nur eine kurze Frage. Sie trägt den alten Kontext mit. Prompt-Caching senkt den Preis wiederholter Tokens – bei Opus 5.5 kann der Cache-Read bei 0,20 statt 4 US-Dollar pro Million Tokens liegen. Die Menge der Tokens verschwindet dadurch aber nicht. Caching ist ein Rabatt, kein Freifahrtschein für endlose Sitzungen.
Denktokens sind Ausgabetokens – der teuerste Teil ist unsichtbar
OpenAI und Anthropic dokumentieren denselben Grundsatz: Reasoning-Tokens sind nicht unbedingt sichtbar, werden aber als Ausgabetokens abgerechnet. Anthropic warnt sogar ausdrücklich, dass die abgerechnete Ausgabe nicht mit dem sichtbaren Text übereinstimmt. Bezahlt wird der komplette Denkprozess, nicht nur die kurze Zusammenfassung, die ich am Ende lese.
Das erklärt auch, warum „das Modell ist doch billig“ oft die falsche Rechnung ist. Ausgabe kostet bei den API-Tarifen typischerweise ein Mehrfaches der Eingabe. OpenAI nennt je nach Aufgabe wenige hundert bis mehrere zehntausend Reasoning-Tokens. Wer hohe Effort-Stufen für jede Überschrift, jede Zusammenfassung und jede kleine Korrektur aktiviert, bezahlt also schnell für Denkarbeit, die gar keinen zusätzlichen Nutzen bringt.
Die Leitthese: Klein plus viel Denken kann teurer sein als groß plus wenig
Das ist keine pauschale Regel, aber der Effekt ist real. Ein kleines Modell hat einen niedrigeren Tokenpreis. Wenn es an einer schweren Aufgabe lange herumprobiert, kann es trotzdem mehr Tokens erzeugen als ein größeres Modell, das die Aufgabe schneller löst. Dann kippt die Rechnung.
Die Forschungsdaten zeigen das Muster deutlich. In einer Phi-4-Untersuchung erreichte die Variante ohne zusätzliches Reasoning 78,92 Prozent mit rund 379 Tokens; die Reasoning-Variante kam auf 72,23 Prozent mit rund 6.066 Tokens. Sechzehnmal mehr Tokens für ein schlechteres Ergebnis. In einer Qwen-Auswertung war das große Modell gleichzeitig dreimal genauer und 4,4-mal sparsamer als die kleine Variante. Mehr Denken ist also kein Qualitätsknopf.
Stand 23.09.2026. Die identischen Balken sind kein Darstellungsfehler: In dieser Messreihe unterscheiden sich die ausgewiesenen Werte nicht. Der Test misst nur eine enge Coding-Aufgabe – nicht Produktqualität, Kosten pro Sitzung oder den gesamten Agenten-Workflow.
Für die Kosten-Nutzen-Frage reicht dieser Ausschnitt aber nicht. Spitzenmodelle liefern bei schwierigen Aufgaben häufig die saubersten Ergebnisse, sind aber nicht automatisch die wirtschaftlichste Wahl für jede Zeile, jeden Meta-Titel oder jede kleine Korrektur. Für Routine und klar begrenzte Aufgaben sind günstigere Modelle wie GPT-6 Luna oder Terra sowie Claude Sonnet oft der vernünftigere Startpunkt. Die folgende Darstellung ist deshalb bewusst eine qualitative Arbeitskarte aus meinem Alltag – kein neuer Benchmark und keine exakte Preisangabe.
Die Balken zeigen keine gemessenen Prozentwerte. Sie markieren nur meine Entscheidungslogik: Bei schwierigen Aufgaben kann die höhere Modellklasse trotz höherem Preis pro brauchbarem Ergebnis günstiger sein; bei Routine gewinnt meist das kleinere Modell.
OpenClaw schließt diesen Kreis: Es kann als agentische Orchestrierung zwischen Cloud-Modellen und lokalen Modellen dienen. Je nach Konfiguration lassen sich OpenAI-Zugänge – in der Provider-Dokumentation sowohl API-Key- als auch ChatGPT/Codex-Subscription-Authentifizierung – und Ollama als lokaler Provider einbinden. Bei Google ist die Anbindung stärker vom gewählten Connector, API-Key oder Vertex-Setup abhängig; ein Gemini-Pro-Abo ist deshalb nicht automatisch ein unbegrenzter API-Pool. Mit etwas Konfigurationsarbeit kann Gemini trotzdem Teil desselben Workflows werden.
Das ist für mich der eigentliche Notfallplan: Wenn die Kontingente von OpenAI, Anthropic oder Google aufgebraucht sind, kann OpenClaw auf ein Qwen-, GLM- oder DeepSeek-Modell ausweichen – lokal über Ollama oder über einen passenden Provider. Mit einem guten Rechner bleibt damit auch ohne weiteres Cloud-Kontingent ein brauchbarer Fallback. Kostenlos ist das nicht vollständig: Strom, Hardware, Einrichtung, Wartung und die teilweise deutlich schwächere Tool- beziehungsweise Reasoning-Qualität gehören in die Rechnung. Außerdem braucht ein autonomer Agent klare Rechte, eine Sandbox und eine Begrenzung für Datei-, Netzwerk- und Computerzugriffe.
Ab wann lohnt eine neue Sitzung, ab wann ein Fork?
Die praktische Frage stelle ich mir ständig: weiterarbeiten oder neu anfangen? Claude Code fragt bei einer sehr großen, länger pausierten Sitzung selbst nach, ob aus einer Zusammenfassung oder unverändert fortgesetzt werden soll. Der Grund ist der Cache: Im Abo ist der Hauptkontext ungefähr eine Stunde warm, bei API- oder Usage-Credit-Abrechnung deutlich kürzer.
Fork ist sinnvoll, wenn ich zwei Wege parallel brauche und die gemeinsame Vorgeschichte relevant bleibt. Der Start ist vergleichsweise günstig, danach trägt der neue Strang seine kopierte Historie weiter. Rewind ist besser, wenn ich mich verrannt habe: auf einen bereits gecachten, früheren Zustand zurückgehen, statt den ganzen Ballast zu komprimieren. Compact hilft, wenn die Historie inhaltlich bleiben muss, kostet aber eine eigene Verarbeitung. Clear ist die billigste Variante, wenn ich wirklich neu anfangen kann.
Bei OpenAI gibt es zusätzlich eine harte Kante: Ab mehr als 272.000 Eingabetokens wird die gesamte Anfrage neu bepreist. Das ist keine Einladung, jedes Projekt in eine einzige Mega-Sitzung zu packen.
Agent oder Chat – und wohin mit den Bildern?
Für eine E-Mail, einen Blogabsatz oder eine Bildidee brauche ich keinen Agenten. Im Chat sehe ich die Antwort, korrigiere sie und bin fertig. Ein Agent ist für mich dann sinnvoll, wenn Dateien gelesen, Änderungen über mehrere Schritte verteilt, Tests ausgeführt oder Ergebnisse kontrolliert werden müssen.
Der Preis dafür ist der Werkzeugkontext. Anthropic nennt allein für Werkzeugdefinitionen mehrere hundert bis mehrere tausend Eingabetokens pro Anfrage. Eine Webseite, eine große Dokumentationsseite oder ein PDF bleibt nach dem Einlesen im laufenden Kontext. Agenten-Teams können laut Anthropic ungefähr siebenmal so viele Tokens verbrauchen wie eine normale Sitzung. Bilder erzeuge ich deshalb in einer eigenen, möglichst leeren Oberfläche. OpenAI weist darauf hin, dass Bildgenerierung das enthaltene Kontingent im Schnitt drei- bis fünfmal schneller verbrauchen kann als ein vergleichbarer Zug ohne Bild.
Das ist kein Plädoyer gegen Agenten. Es ist ein Plädoyer dafür, sie dort einzusetzen, wo sie wirklich Arbeit abnehmen. Ein Agent, der 30 Dateien prüft und Tests ausführt, kann jeden Token wert sein. Ein Agent, der nur eine Überschrift formulieren soll, ist meistens überdimensioniert.
Meine Entscheidungsmatrix für den Alltag
| Aufgabe | Mein Startpunkt | Sitzungsentscheidung |
|---|---|---|
| Blogbeitrag mit Quellen recherchieren | Agent für Recherche, Sol oder Sonnet auf low/medium; Schreiben separat mit Astra oder Opus. | Zwei Läufe statt eine endlose Sitzung. |
| Tippfehler in drei HTML-Dateien | Luna oder Haiku, low. | Frische Sitzung, klarer Auftrag, Test danach. |
| Navigation und Schema auf 40 Seiten | Astra/Opus für Plan, Sol/Sonnet für Umsetzung. | Ein Plan, ein kontrollierter Durchlauf. |
| Fehler nur auf iOS Safari | Astra oder Opus, high bis xhigh. | Bei Sackgasse rewind statt blindem Weiterdrehen. |
| 50 Produktbilder verarbeiten | Luna/Haiku schreiben das Skript. | Bildbearbeitung getrennt vom Coding-Agenten. |
| Titelbild erzeugen | ChatGPT beziehungsweise ein Bildwerkzeug. | Eigene leere Oberfläche. |
| Datenschutzerklärung prüfen | Astra/Opus, hoher Aufwand. | Eigene Sitzung mit Quellen. |
| PDF-Tabelle in HTML übernehmen | Agent mit vorgeschaltetem Auszug, Sol/Sonnet. | Nach dem Import clear. |
| 30 Meta-Titel überarbeiten | Subagent für Bestandsaufnahme, Sol/Sonnet für Text. | Ergebnis bündeln, nicht 30 Einzelchats. |
| Kundenmail oder Angebot | Chat, Terra/Sonnet, low/medium; Luna reicht für Varianten und Korrekturen. | Kein Agent nötig. |
| Kosten sparen oder Daten lokal halten | Lokales Modell über Ollama oder LM Studio; GLM, Qwen oder DeepSeek als zusätzliche Fallbacks testen. | Ergebnis gegen ein starkes Modell prüfen, Hardware- und Wartungskosten mitrechnen. |
| Architekturfrage | Astra/Opus, xhigh. | Plan-Modus, aber nicht automatisch max. |
| Gestrige Sitzung fortsetzen | Dasselbe Modell und dieselbe Effort-Stufe. | Nach langer Pause Zusammenfassung oder neuer Start. |
Was die Anbieter verschweigen – und warum das wichtig ist
Weder OpenAI noch Anthropic veröffentlichen für ihre Abos absolute Tokenbudgets, die ich sauber nachrechnen könnte. Anthropic nennt Relationen wie „fünfmal Pro“ oder „zwanzigmal Pro“, aber nicht die zugrunde liegende Zahl. OpenAI veröffentlicht Spannen, die innerhalb desselben Plans sehr breit sind. Einen dokumentierten Multiplikator zwischen low, medium, high und max gibt es ebenfalls nicht. Anthropic sagt sogar ausdrücklich, dass Effort ein Verhaltenssignal und kein fixes Tokenbudget ist.
Auch Benchmarks sind nicht automatisch miteinander vergleichbar. Anthropic meldet für Opus 5.5 auf Terminal-Bench 4.0 einen anderen Wert als Artificial Analysis. Harness, Wiederholungszahl und Testumgebung verschieben die Ergebnisse. Wer eine Zahl zitiert, muss deshalb Modell, Effort, Quelle und Datum nennen. Sonst ist es keine Orientierung, sondern Marketing mit Dezimalstellen.
Meine acht Regeln für weniger Blindflug
- Denktokens sind Ausgabetokens. Der teuerste Teil der Rechnung ist unsichtbar.
- Modell und Effort am Anfang der Sitzung festlegen.
- Verrannt? Rewind. Fertig? Clear. Ballast, aber Kontext nötig? Compact.
- Forks sind für parallele Wege, Subagenten für laute, abgegrenzte Nebenarbeiten.
- Klein ist nicht automatisch billig, wenn die Aufgabe an der Fähigkeitsgrenze liegt.
- Im Agenten multipliziert sich Effort mit der Zahl der Werkzeugschritte.
- Die höchste Stufe ist selten die beste Kaufentscheidung.
- Bilder gehören nicht in die laufende Codesitzung, wenn sie dort keinen Kontextwert haben.
Mein wichtigstes Werkzeug bleibt /usage. Dort sehe ich in Claude Code die ungefähre Zurechnung auf Skills, Subagenten, Plugins und MCP-Server sowie die Cache-Zeile. Das sind Schätzungen aus der lokalen Sitzungshistorie, keine universelle Kostenrechnung. Aber sie sind besser als das Gefühl, dass ein Kontingent „irgendwie plötzlich“ verschwunden ist.
Fazit: Wer nicht misst, zahlt blind
Die Frage „Was kostet ein Gedanke?“ ist keine Spielerei. Sie entscheidet darüber, ob ich ein Projekt sauber zu Ende bringe oder mein Kontingent an unnötigen Schleifen verbrenne. Für mich heißt das: kleine Modelle für klar umrissene Routine, starke Modelle für echte Unsicherheit, Agenten für Arbeit mit Dateien und Tests – und neue Sitzungen, bevor der Kontext zum Selbstzweck wird.
Die Anbieter könnten diese Rechnung transparenter machen. Solange sie es nicht tun, muss ich selbst auf Modell, Effort, Kontext, Toolchain und Nacharbeit schauen. Am Ende zählt nicht der billigste Token, sondern das brauchbare Ergebnis pro eingesetztem Euro und pro Stunde.
Stand der Recherche: 27. September 2026. Persönliche Einschätzungen stammen aus meinem Workflow; Herstellerangaben und Benchmarks sind im jeweiligen Abschnitt verlinkt. Preise, Modelle, Limits und Messwerte ändern sich – die historischen Messwerte sind deshalb jeweils mit ihrem tatsächlichen Testdatum gekennzeichnet.
Quellen
- Anthropic: Claude Code – Kosten und Nutzung
- Anthropic: Prompt-Caching
- Anthropic: API-Preise und Tokenabrechnung
- OpenAI: Reasoning und Ausgabetokens
- OpenAI: Modell- und Preisdokumentation
- Artificial Analysis: Terminal-Bench 4.0
- arXiv: Do LLMs Overthink Basic Math Reasoning?
- arXiv: OckBench und Qwen-Vergleich
- Ollama: Sprachmodelle lokal ausführen
- LM Studio: Lokale Modelle testen
- OpenClaw: Modell-Provider und Fallbacks
- OpenClaw: OpenAI- und ChatGPT/Codex-Anbindung
- OpenClaw: Ollama als lokaler Provider
- Tian Pan: Conversation AI Chat Spend