Zum SEO Marketing Blog

· KI & Tools

Welche KI ist die beste? Modelle, Aufgaben und Budget im Vergleich

Die beste KI? Kommt drauf an: Aufgabe, Workflow und Budget für Coding, Bilder, Recherche und Office
Für mich entscheiden Aufgabe, Workflow und Budget darüber, welche KI passt.

Welche KI ist die beste? ChatGPT, Claude, Gemini, Copilot oder DeepSeek? Meine klare Antwort lautet: Ich suche gar keinen Sieger, ich verteile Aufgaben. Programmieren geht bei mir an den einen Anbieter, Bilder an den nächsten, die Organisation rund um Google an den dritten. Diese Zuordnung ändere ich, sobald einer in seiner Disziplin nachlässt. Wer immer nur „KI“ sagt, wirft Sprachmodell, Chat-App, Plugin, CLI und Agent in einen Topf – und verpasst genau den Unterschied, der im Alltag Zeit und Geld spart.

Ich nutze mehrere Angebote in der 20-Euro-Klasse: Claude Pro von Anthropic, ChatGPT Plus von OpenAI und Google AI Pro von Google. Das sind die Namen der Abos, nicht der Sprachmodelle. Die Preisregion ist dabei nur eine grobe Einordnung; Abrechnung, Steuern und Aktionen unterscheiden sich. Die aktuellen Konditionen stehen bei Anthropic, OpenAI und Google.

Ich setze diese Angebote nicht nach Markenloyalität ein, sondern nach Ergebnis. In Programmiererkreisen höre ich öfter: „Ich nutze ausschließlich Claude“ oder „Für mich gibt es nur Codex“. So pauschal würde ich das nicht sagen. Ich arbeite ziemlich intensiv mit Agenten. Gerade die Kontingente von OpenAI und Anthropic sind für mich ein handfester Grund, beide Abos zu haben. Wenn bei Codex und Claude Code Schluss ist, kann ich mit Googles Antigravity weiterarbeiten. Das ist dann nicht unbedingt meine erste Wahl, aber besser, als mitten im Projekt auf das nächste freie Kontingent zu warten.

Beispielsweise nehme ich für Coding-Aufgaben momentan meistens Codex oder Claude Code. Bilder entstehen bei mir inzwischen fast ausschließlich mit ChatGPT, gelegentlich mit Gemini. Das war auch schon anders: Eine Zeit lang lag Google mit Nano Banana bei mir vorne. Und bei Google bezahle ich eben nicht nur für einen Chatbot. Ich nutze ohnehin den Speicher und mehrere Dienste aus diesem Kosmos. Dazu gleich mehr.

Solche Zuordnungen finde ich deutlich hilfreicher als „Ich mag Anbieter X“ oder „Die sind doch alle ähnlich“. Sie haben unterschiedliche Stärken und Schwächen. Entscheidend ist, welche davon ich in meiner Arbeit tatsächlich merke.

Mein Resümee in einem Satz: Wenn ich nur ein Abo behalten dürfte, wäre es aktuell ChatGPT Plus von OpenAI – wegen der Kombination aus Codex, Spracheingabe und Bildgenerierung. Beim Programmieren sehe ich Claude Code qualitativ auf einem ähnlich starken Niveau; Googles Paket lohnt sich für mich zusätzlich durch den gesamten Google-Kosmos.

Erst die Begriffe sortieren: LLM, Chatbot, CLI und Agent

Bevor wir Modelle vergleichen, müssen wir auseinanderhalten, worüber wir überhaupt reden. „Ich nutze KI“ kann inzwischen alles Mögliche bedeuten.

LLM: das Sprachmodell
Ein Large Language Model ist vereinfacht der Motor hinter dem System. GPT-6 Luna, GPT-6 Astra oder Claude Sonnet 5 sind beispielsweise Modellnamen. Das Modell verarbeitet den Kontext und erzeugt Antworten oder Werkzeugaufrufe. Welche Dateien und Programme es erreichen darf, entscheidet aber die Umgebung, in der es arbeitet.
Chatbot, App und Entwicklungswerkzeug
ChatGPT und Claude sind Produkte mit Chat-Oberfläche und zusätzlichen Funktionen. Codex und Claude Code sind Werkzeuge für die praktische Arbeit an Projekten: Sie verbinden Modelle mit Dateien, Terminal, Tests und beispielsweise Git. Eine CLI, ausgeschrieben Command Line Interface, ist die Bedienoberfläche im Terminal. Git ist dabei kein Muss. Mit entsprechender Einrichtung und Freigabe können auch andere Werkzeuge hinzukommen, etwa SFTP für Dateiübertragungen.
Plugin, Connector, API und MCP
Ein Plugin ist eine Erweiterung, die zusätzliche Fähigkeiten bereitstellt. Ein Connector bindet beispielsweise einen Kalender oder eine Dateiablage an. Eine API ist die technische Schnittstelle, über die Software Daten abfragen oder Aktionen auslösen kann. MCP, das Model Context Protocol, vereinheitlicht die Anbindung von Werkzeugen und Datenquellen an KI-Anwendungen. Ein Plugin kann solche Anbindungen bündeln, muss aber nicht zwingend einen externen Dienst ansprechen. Der praktische Unterschied: Das Modell redet nicht nur über einen Termin, sondern kann ihn mit der passenden Anbindung und Berechtigung auch anlegen.
Agenten und agentische Workflows
Ein Agent plant Arbeitsschritte, benutzt Werkzeuge und prüft Zwischenergebnisse. In geeigneten Anwendungen können mehrere Agenten parallel recherchieren, programmieren oder Tests ausführen. Mit einer laufenden Umgebung und passenden Auslösern können sie auch Prozesse überwachen und selbstständig weiterarbeiten. Das bedeutet allerdings nicht, dass jede Chat-Unterhaltung nach dem Schließen automatisch zum dauerhaften Hintergrunddienst wird.
Computer Use: wenn der Agent selbst klickt
Hier bedient der Agent eine grafische Oberfläche: Er öffnet Anwendungen, klickt, tippt und bearbeitet Aufgaben am Computer. Natürlich nur innerhalb der erteilten Zugriffe. Als ich das zum ersten Mal genutzt habe, war das für mich wirklich mindblowing. Es fühlt sich ein bisschen wie Zauberei an – und ich glaube, dass darin ein großer Teil der Zukunft liegt. Gleichzeitig ist es sicherheitssensibel: Darf ein Agent nur lesen, auch Dateien ändern oder sogar Nachrichten verschicken? Diese Grenzen will ich vorher festlegen und wichtige Aktionen bestätigen.

Die Trennung zwischen Modell, Werkzeugen und Berechtigungen ist auch in den Werkzeug-Dokumentationen von OpenAI und der MCP-Anbindung von Claude Code nachvollziehbar. Ein Werkzeugzugriff ist keine automatische Vollmacht.

„Ich nutze ChatGPT“ sagt daher ungefähr so viel wie „Ich nutze einen Computer“. Für eine faire Bewertung muss ich sagen: welches Modell, welches Produkt, welche Werkzeuge, welcher Kontext und welche Berechtigungen? Wer bisher nur die Chatblase kennt, hat damit einen Einstieg gefunden – aber längst nicht den gesamten Funktionsumfang gesehen.

Meine Rangliste nach Aufgabe und eigener Erfahrung

Das hier ist meine Zuordnung aus der Praxis, keine Weltmeisterschaft sämtlicher KI-Produkte. Mir hilft sie mehr als eine abstrakte Gesamtrangliste, in der am Ende nur steht, welches Modell angeblich am schlausten ist. Ich möchte wissen: Was nehme ich für meine Aufgabe, wie viel muss ich nacharbeiten und reicht mein Kontingent dafür?

1. Programmieren: aktuell zuerst Codex, daneben Claude Code

Für meine Website- und Softwareprojekte sind Codex und Claude Code die erste Wahl. Momentan arbeite ich überwiegend mit Codex. Die Handhabung gefällt mir aktuell besser, die Remote-Funktionen passen gut zu meinem Alltag und die Spracheingabe ist für mich ein echter Vorteil. Das ist keine Aussage, dass Claude Code den schlechteren Code schreibt.

Qualitativ erlebe ich beide als ähnlich stark. Beide können umfangreiche Projekte überblicken, Zusammenhänge zwischen Dateien berücksichtigen und bei Fehlersuche, Umbauten und aufwendigen Aufgaben helfen. Ich würde Claude Code deshalb nicht allein das gute Repository-Verständnis zuschreiben. Wenn das Projekt vernünftig dokumentiert ist, kommen beide gut damit zurecht. Wer lieber tippt und sich in Claude Code wohler fühlt, hat deshalb nicht automatisch das schlechtere Ergebnis.

Natürlich macht die Aufgabe einen Unterschied. Eine normale Website zu bearbeiten ist etwas anderes als ein Projekt mit mehreren Datenbanken, verschiedenen Programmiersprachen und gewachsenen Abhängigkeiten. Bei Letzterem werden Modellwahl, Projektkontext und Tests wichtiger. Bei einem klar beschriebenen CSS-Fix brauche ich dagegen nicht zwangsläufig das teuerste Flaggschiff.

Antigravity mit Gemini war in meinen bisherigen Coding-Versuchen häufig sehr schnell, aber auch deutlich fehleranfälliger: Änderungen blieben unvollständig, Prozesse wurden nicht zu Ende geführt oder unerwünschte Textreste standen weiterhin im Projekt. Für ein grobes Gerüst kann ich damit etwas anfangen. Wenn ich danach viel kontrollieren und reparieren muss, relativiert sich der Geschwindigkeitsvorteil allerdings schnell. Deshalb bleibt es für mich derzeit eher Ergänzung und Ausweichlösung.

2. Bilder: meistens ChatGPT, gelegentlich Gemini

Bei Bildern liegt ChatGPT für mich inzwischen klar vorne. Mir gefallen die Ergebnisse besser, und ich habe das Gefühl, dass meine Anweisungen zuverlässiger ankommen. Gerade bei Überarbeitungen macht das einen Unterschied: Ich will nicht nach einem ausführlichen Korrekturprompt praktisch dasselbe Bild noch einmal bekommen. Genau das ist mir bei Gemini mehrfach passiert.

Früher habe ich dafür überwiegend Google genutzt. Zur Einordnung der Namen: Das ursprüngliche Nano Banana war Gemini 2.5 Flash Image; später kam Nano Banana Pro auf Basis von Gemini 3 Pro Image hinzu. Welche Variante bei jedem meiner damaligen Bilder lief, lässt sich daraus nicht rückwirkend ableiten. Google erläutert diese Entwicklung in der Vorstellung von Nano Banana Pro. Den ersten Platz, den Google damals in meinem Workflow hatte, hat mittlerweile ChatGPT übernommen.

Außerdem nervt mich das sichtbare Gemini-Zeichen unten im Bild. Google beschreibt dieses Zeichen für die kostenlose und die Pro-Nutzung von Nano Banana Pro; davon getrennt gibt es die unsichtbare SynthID-Kennzeichnung. Bei meinen ChatGPT-Ergebnissen habe ich dieses sichtbare Ecksymbol nicht. „Kein störendes Logo im Motiv“ heißt aber nicht automatisch „keine Herkunftsinformationen in der Datei“.

Und Claude? „Kann keine Bilder“ wäre zu pauschal. SVGs sind Vektorgrafiken und können selbstverständlich Illustrationen sein. Für SVGs, die Bearbeitung von Vektordaten oder das Nachbauen einfacher Logos nutze ich auch Claude beziehungsweise Claude Code. Anthropic dokumentiert ausdrücklich Grafiken aus HTML und SVG. Das ist etwas anderes als ein natives Modell zur Erzeugung fotorealistischer Rasterbilder. Über passende Erweiterungen kann Claude Code zudem externe Bildwerkzeuge ansprechen; dann erzeugt das angebundene Werkzeug das Bild. Quelle: Claude und Bilderstellung.

3. Google: für mich vor allem das Gesamtpaket

Bei Gemini zählt für mich mehr als die Antwort in der Chatblase. Ich arbeite mit Gmail, Drive, Fotos und weiteren Google-Diensten. Den zusätzlichen Drive-Speicher hatte ich schon, bevor die KI-Funktionen für meine Entscheidung relevant wurden. Deshalb betrachte ich Google AI Pro als Paket, nicht als isolierten Konkurrenten zu Claude Code.

Interessant sind für mich die Kombination aus Speicher, KI-Funktionen in Dokumenten und Meetings sowie Notiz- und Recherchewerkzeugen wie NotebookLM. Auch YouTube gehört in diesen Paketvergleich. Eine wichtige Unterscheidung: Die aktuell verlinkte Tarifübersicht nennt für AI Pro YouTube Premium Lite in ausgewählten Ländern, nicht das vollständige YouTube Premium. Funktionsumfang und regionale Verfügbarkeit sollte man deshalb im eigenen Konto prüfen. Quelle: Google-AI-Tarifübersicht.

Gmail, Kalender, Docs oder Fotos sind grundsätzlich auch ohne dieses Pro-Abo nutzbar; bezahlt werden zusätzliche Leistungen und Grenzen, nicht erst die Existenz dieser Programme. Und Google-Anbindungen gibt es auch bei anderen KI-Anbietern. Für einen Kalendereintrag muss ich mich nicht zwangsläufig auf Gemini festlegen. Für mich ist die Alles-aus-einer-Hand-Lösung trotzdem interessant, weil ich ohnehin für Speicher bezahle. Ohne diesen Hintergrund sähe meine Entscheidung möglicherweise anders aus.

Alternativen im Blick: Copilot, DeepSeek, Qwen und Kimi

Mit Copilot habe ich bisher nicht genug gearbeitet, um ihm hier seriös einen persönlichen Spitzenplatz zu geben. Und GitHub allein wäre für mich kein Argument: Meine Projekte kann ich auch mit Codex und Claude Code bearbeiten. Welches Produkt in einem Microsoft-Team sinnvoll ist, hängt von den tatsächlich benötigten Funktionen und Freigaben ab – nicht vom Namen des Code-Hosters.

DeepSeek, Qwen oder Kimi möchte ich als Alternativen im Blick behalten. Daraus mache ich aber kein ungetestetes „Beste Wahl für günstige API-Experimente“. Für einen konkreten Einsatz würde ich Qualität, Preis, Datenverarbeitung und Nacharbeit vergleichen. Soll ein Modell lokal laufen, muss außerdem die konkrete Modellvariante mit passenden Gewichten, Lizenz und Hardware dafür geeignet sein. Ein bekannter Modellname allein sagt darüber noch nichts. Für diese Anbieter fehlt mir bislang die eigene Vergleichsbasis, die ich bei OpenAI und Anthropic habe.

Programmieren: Was sagen die aktuellen Benchmarks?

Der Terminal-Bench 4.0 bei Artificial Analysis umfasst 66 anspruchsvolle Terminal-Aufgaben. Getestet wird mit dem mini-swe-agent-Testsystem; ausgewiesen wird pass@1, gemittelt über drei Wiederholungen. Am 23. September 2026 teilen sich die ausgewählten OpenAI- und Anthropic-Spitzenkonfigurationen die Spitze mit jeweils 59,6 Prozent. Für ein vollständigeres Bild ergänze ich Google, Qwen und Xiaomi mit Werten aus derselben Artificial-Analysis-Messreihe:

Terminal-Bench 4.0: Anbieter im ausgewählten Vergleich
OpenAI · GPT-6 Astra · xhigh59,6 %
Anthropic · Claude Opus 5.5 · xhigh/max59,6 %
Google · Gemini 3.8 Flash · high19,1 %
Alibaba · Qwen3.8 Max (0902)39 %
Xiaomi · MiMo-V2.6-Pro35 %
OpenAI Anthropic Google Qwen Xiaomi MiMo

Skala: 0 bis 100 Prozent bestandene Aufgaben. Stand: 23.09.2026. Quelle: Artificial Analysis, oben verlinkt; der Gemini-Wert ist zusätzlich in Googles Modellkarte für Gemini 3.8 Flash dokumentiert. Die Balken vergleichen Modellkonfigurationen im Testsystem, nicht die Produkte Codex und Claude Code als Ganzes.

Das Bild ist jetzt deutlich interessanter: OpenAI und Anthropic liegen in dieser Auswahl gleichauf, Qwen und Xiaomi folgen mit Abstand, Gemini liegt mit 19,1 Prozent deutlich dahinter. Das passt erstaunlich gut zu meiner Praxiserfahrung: Gemini ist schnell und günstig, erledigt agentische Coding-Aufgaben in diesem Test aber deutlich seltener erfolgreich. Gleichzeitig beweist auch das nicht, dass Gemini „schlecht“ ist. Die Testversion 4.0 ist härter als frühere Terminal-Bench-Versionen – und Benchmark-Ergebnisse hängen an Modell, Effort, Agenten-Harness und Testumgebung.

Qwen3.8 Max und Xiaomis MiMo-V2.6-Pro zeigen, warum es sich lohnt, auch außerhalb der üblichen US-Anbieter hinzuschauen. Sie sind in dieser Messreihe keineswegs chancenlos. Das macht sie aber noch nicht automatisch zur besseren Alltagslösung: Kosten, Verfügbarkeit, Datenverarbeitung, Tooling und Nacharbeit entscheiden im echten Projekt mindestens genauso mit.

Aus dem identischen Score von OpenAI und Anthropic folgt auch kein identischer Tokenverbrauch. Und die Werte messen weder die Qualität deutscher Blogtexte noch die Diktierfunktion.

Für meine Entscheidung bleibt wichtig, wie gut ein Werkzeug mit meinem Projekt zurechtkommt: Sind die Zusammenhänge dokumentiert? Werden Tests wirklich ausgeführt? Wie viel Nacharbeit bleibt? Ein paar Punkte auf einer Rangliste ersetzen diese Fragen nicht. Codex und Claude Code würde ich deshalb an derselben realen Aufgabe vergleichen – mit demselben Ausgangsstand und denselben Erfolgskriterien.

Welches Modell reicht für welche Aufgabe?

Nur die teuersten Modelle gegeneinanderzustellen hilft mir bei meinem Wochenkontingent wenig. Die spannendere Frage lautet: Wo bekomme ich ein gutes Ergebnis, ohne für jede Kleinigkeit das größte Modell zu bemühen? Die folgende Auswahl ist eine praktische Startempfehlung, keine von mir durchgemessene Rangliste.

Meine Startpunkte für Modell und Aufwand
AufgabeWomit ich starten würdeWann ich hochschalte
Überschriften, Textvarianten, klar umrissene KorrekturenGPT-6 Luna, niedriger bis mittlerer Effort; alternativ Claude Sonnet 5. Bei Google: Gemini 3.5 Flash-Lite für einfache, klar definierte Aufgaben.Wenn Ton, Aussage oder wichtige Einschränkungen trotz präzisem Briefing verloren gehen.
Blog-Rohfassung oder Kapitelentwurf mit gelieferten QuellenGPT-6 Luna oder Claude Sonnet 5. GPT-6 Sol, wenn mehr redaktionelle Abwägung nötig ist.Für schwierige Argumentation, Widersprüche und fachliche Schlussprüfung zu Astra oder Opus wechseln.
Normale Projektarbeit: Funktionen ergänzen, überschaubare Fehler behebenGPT-6 Sol mit mittlerem Effort oder Claude Sonnet 5. Gemini 3.8 Flash ist eine aktuelle Google-Alternative zum Ausprobieren.Wenn die Ursache mehrere Komponenten betrifft oder der Agent wiederholt nur Symptome repariert.
Architektur, Migration oder schwer nachvollziehbarer FehlerGPT-6 Astra oder Claude Opus 5.5 mit hohem Aufwand; kleine Arbeitspakete und konkrete Tests.Nicht einfach immer höher: fehlende Informationen beschaffen und gegebenenfalls eine unabhängige Prüfung einplanen.
Recherche und komplexe Analyse im Google-WorkflowGemini 3.8 Flash; bei anspruchsvollen Schlussfolgerungen auch Gemini 3.1 Pro prüfen, in der API derzeit als Preview geführt.Wenn Quellen unklar bleiben: Originalquellen prüfen, statt nur ein größeres Modell nach seiner Meinung zu fragen.

Die Modellnamen und Hersteller-Einordnungen stammen aus dem OpenAI-Modellkatalog, dem OpenAI-Leitfaden zur Modellwahl, der Vorstellung von Sonnet 5 und Opus 5.5 sowie der Gemini-Modellübersicht. Die Zuordnung zu meinen Aufgaben ist meine Empfehlung daraus. Ein API-Eintrag bedeutet nicht, dass jede Chat-App oder jedes Abo dieses Modell bereits auswählbar anbietet.

Opus 5.5 ist seit dem 22. September neu hinzugekommen. Anthropic ordnet es bei vielen Aufgaben in die Nähe von Fable 5.1 ein – das ist zunächst die Aussage des Herstellers, kein eigener Langzeittest von mir. Fable 5.1 bleibt ebenfalls ein Modell für anspruchsvolle Aufgaben; bei Claude Pro läuft der Zugriff laut Tarifübersicht über Nutzungsguthaben. „Nimm einfach das stärkste Modell“ kann also auch zusätzliche Kosten bedeuten.

Texte, Blogbeiträge und Bücher: Nicht jedes Wort braucht das teuerste Modell

Für einen sauber beschriebenen Schreibauftrag würde ich zunächst mit GPT-6 Luna oder Claude Sonnet 5 starten: Gliederung, Überschriften, Varianten und eine Rohfassung auf Basis vorhandener Informationen. Wenn Zielgruppe, Ton und Quellen feststehen, muss das Modell nicht erst das ganze Thema für mich erfinden. Genau hier kann ein kleineres Modell vollkommen ausreichen.

Für die schwierigen Stellen nehme ich eher GPT-6 Astra oder Claude Opus 5.5: Ist die Argumentation schlüssig? Widersprechen sich zwei Quellen? Wird aus meiner Meinung versehentlich eine Tatsachenbehauptung? Bei solchen Fragen lohnt sich die zusätzliche Prüfung eher als beim zehnten Vorschlag für eine Zwischenüberschrift. Auch das stärkste Modell ersetzt dabei nicht den Blick in die Originalquelle.

Bei einem Buch würde ich genauso vorgehen: erst Kapitelplan und Stilvorgaben, dann einzelne Abschnitte, danach Konsistenz und Argumentation prüfen. Nicht bei jeder kleinen Änderung das gesamte Manuskript wieder mitgeben. Das spart unnötigen Kontext und macht die Aufgabe überschaubarer. Für deutsche Texte nutze ich ChatGPT und Claude; mein häufiger Einstieg ist ChatGPT, weil ich meine Gedanken gern diktiere.

Mein Spartrick ist deshalb kein geheimes Wundermodell. Es ist eine saubere Aufgabenstellung: Quellen mitgeben, gewünschte Länge nennen, nur die betroffene Passage bearbeiten lassen und erst bei Bedarf hochschalten. Entscheidend ist der Aufwand bis zum brauchbaren Ergebnis. Ein günstiger Entwurf mit fünf Reparaturrunden kann die schlechtere Wahl sein. Und weniger Tokens, geringere API-Kosten und weniger Verbrauch im Abo sind nicht automatisch dasselbe.

Spracheingabe: Für mich ein echter Produktivitätsvorteil

Bei der Spracheingabe liegt OpenAI in meinem Alltag klar vorne. Ich diktiere sehr viel. Bei ChatGPT und Codex kommt für mich häufiger ein sinnvoller, gut weiterverwendbarer Text heraus. Bei Claude hatte ich öfter Transkriptfehler, störende Füllwörter oder Formulierungen, die sogar den Sinn verändert haben. Wenn ich den Auftrag hinterher erst reparieren muss, ist der Vorteil des Diktierens schnell weg.

Ich würde Claude vermutlich häufiger nutzen, wenn die Spracheingabe für mich ähnlich zuverlässig wäre. Das ist kein kleiner Komfortpunkt. Sie entscheidet mit darüber, wie schnell ich meine Gedanken überhaupt in einen brauchbaren Arbeitsauftrag bekomme.

Was dabei technisch passiert – und was nicht dokumentiert ist

Beim Diktieren wird gesprochene Sprache in bearbeitbaren Prompt-Text umgewandelt. OpenAI beschreibt genau diesen Ablauf für die Desktop-App: sprechen, das Transkript im Eingabefeld prüfen, bei Bedarf ändern und erst dann abschicken. Für Codex dokumentiert das Änderungsprotokoll außerdem eine Diktat-Bereinigung und ein anpassbares Wörterbuch für Namen, Dateipfade und Codesymbole. Quelle: Diktieren · Quelle: Codex-Änderungsprotokoll.

Auch Claude Code verarbeitet Audio: Laut Anthropic wird die Aufnahme zur Transkription an Anthropic-Server gestreamt, nicht rein lokal verarbeitet. Die Dokumentation nennt zudem Hinweise aus Projekt und Git-Branch, die bei Coding-Begriffen helfen sollen. Die Erklärung „OpenAI versteht Audio, Claude benutzt nur die Browser-Diktierfunktion“ wäre also zu einfach und für Claude Code nicht richtig. Quelle: Claude-Code-Diktierfunktion.

Welches Transkriptionsmodell und welche vollständige Verarbeitungskette hinter jeder App-Version stecken, legen diese Dokumentationen nicht vollständig offen. Einen pauschalen technischen Beweis für meinen Qualitätsunterschied kann ich daraus nicht machen. Mein praktisches Ergebnis bleibt trotzdem: Mit den OpenAI-Transkripten muss ich weniger nacharbeiten.

Davon zu unterscheiden ist der Live-Sprachdialog, bei dem die KI direkt hörbar antwortet. Für die aktuelle Desktop-Sprachfunktion in Chat, Work und Codex nennt OpenAI GPT-Live. Das ist nicht automatisch die Modellangabe für den Diktierknopf. Quelle: ChatGPT Voice.

Reasoning und Effort: Wann lohnt sich mehr Aufwand?

Modellwahl und Denkaufwand sind zwei verschiedene Stellschrauben. „High“, „xhigh“ oder „max“ sind außerdem keine anbieterübergreifend identischen Maßeinheiten. Für mich ist das ein Arbeitsbudget, kein Qualitätsknopf mit Erfolgsgarantie.

  • Routine: etwa zehn Headline-Varianten oder eine genau beschriebene HTML-Korrektur. Start mit GPT-6 Luna bei niedrigem bis mittlerem Effort oder Sonnet 5 mit moderatem Aufwand. Für einfache Google-Aufgaben kommt Flash-Lite infrage.
  • Normale Programmierung: etwa eine Funktion samt Tests in einem bekannten Projekt. GPT-6 Sol oder Claude Sonnet 5 sind meine vernünftigen Startpunkte. Nicht gleich das Flaggschiff einschalten, nur weil irgendwo Code steht.
  • Schwierige Zusammenhänge: etwa eine Datenbankmigration oder ein Fehler über mehrere Dienste hinweg. Hier würde ich Astra oder Opus 5.5 mit hohem Aufwand einsetzen, einen Plan verlangen und Zwischenschritte kontrollieren.
  • Wenn der Agent feststeckt: erst Fehlermeldung, relevante Dateien und Erfolgskriterium nachliefern. Dreht sich Luna oder Sonnet danach weiter im Kreis, gezielt Astra oder Opus für die Ursachenanalyse einsetzen. Anschließend kann ein kleineres Modell den geklärten Fix umsetzen.

Ich nutze gern Luna mit höherem Effort, wenn die Aufgabe klar genug ist. Daraus würde ich aber keine allgemeine Gleichung „Luna high ist genauso gut wie Astra medium“ machen. Wie stark sich Aufwand auswirkt, hängt vom Modell und der Aufgabe ab. Anthropic dokumentiert Effort ausdrücklich als Steuerung des Arbeitsaufwands; eine Qualitätssicherung ist der Regler nicht.

„Ich nutze KI“ heißt noch lange nicht „Ich arbeite mit Agenten“

Mein Eindruck ist, dass viele Menschen KI noch hauptsächlich als Chatblase kennenlernen: Frage rein, Antwort raus. Das ist völlig legitim. Es erklärt aber, warum Gespräche über „die beste KI“ so oft aneinander vorbeigehen. Ein Gesprächspartner meint Hilfe bei einer E-Mail, der andere einen Agenten, der ein Softwareprojekt bearbeitet und Tests ausführt.

Meine spontane Vermutung, längst hätten 80 Prozent der Erwachsenen einen Chatbot benutzt, würde ich deshalb nicht als Zahl veröffentlichen. Eine Pew-Erhebung vom Februar 2026 kommt für die USA auf 44 Prozent der Erwachsenen, die ChatGPT schon einmal genutzt haben. Nach Alter: 61 Prozent bei den 18- bis 29-Jährigen, 55 Prozent bei 30 bis 49, 37 Prozent bei 50 bis 64 und 19 Prozent ab 65. Das sind weder deutsche Nutzungszahlen noch eine Messung agentischer Arbeit.

Die interessante Grenze verläuft für mich dort, wo aus Antworten Handlungen werden. Ob das in Codex, Claude Code oder einer anderen Agentenumgebung passiert: Zugriffe, Freigaben und nachvollziehbare Ergebnisse gehören dazu. Die Möglichkeiten faszinieren mich. Blind laufen lassen möchte ich solche Systeme trotzdem nicht.

Wenn ich nur ein Abo behalten dürfte: OpenAI

Meine persönliche Entscheidung wäre aktuell ChatGPT Plus. Codex für die Projektarbeit, ChatGPT für Bilder und die für mich bessere Spracheingabe: Diese Kombination deckt den größten Teil meiner täglichen Aufgaben ab. Genau deshalb würde ich OpenAI zuerst behalten.

Claude Pro ist für mich eine wertvolle Ergänzung, gerade durch Claude Code und das zusätzliche Kontingent bei einem zweiten Anbieter. Qualitativ sehe ich die beiden Coding-Werkzeuge nah beieinander. Google AI Pro rechne ich anders: Dort zählen mein ohnehin benötigter Speicher und die übrigen Google-Dienste mit. Es wäre unehrlich, so zu tun, als bezahlte ich diese drei Pakete aus exakt demselben Grund.

Fazit: Die beste KI ist für mich eine Aufgabenentscheidung

Gefühlt ruft jede Woche ein anderer Anbieter: das stärkste Modell, das schnellste Modell, die beste KI für irgendeine Disziplin. Ich kann nicht jede Veröffentlichung bis ins letzte Detail durchtesten. Ich will meine Arbeit erledigen – und dabei weder Qualität noch mein Wochenkontingent unnötig verheizen.

Meine Auswahl ist deshalb ziemlich konkret: aktuell vor allem Codex fürs Programmieren, Claude Code auf ähnlich starkem Niveau daneben, meistens ChatGPT für Bilder und Sprache, Google als Gesamtpaket samt Ausweichmöglichkeit. Für überschaubare Text- und Codeaufgaben beginne ich kleiner. Die großen Modelle kommen dahin, wo die Aufgabe sie wirklich braucht.

Das muss niemand genauso machen. Wer andere Aufgaben hat oder anders arbeitet, wird andere Schwerpunkte setzen. Aber probiert die Werkzeuge an einer echten Aufgabe aus. Eine sauber gelöste Arbeit sagt mir mehr als zehn Ankündigungen, dass schon wieder jemand den besten Benchmark erreicht hat.

Wie ich KI bei meinen Websites einsetze, zeige ich in meinen Arbeitsproben. Die Auswirkungen auf die Auffindbarkeit beschreibe ich im Beitrag SEO vs. GEO. Meine Einschätzung zu agentischen Risiken steht im Beitrag über KI-Agenten.

Als Nächstes nehme ich mir ein Feld vor, das ich selbst ziemlich undurchsichtig finde: Was kostet die Arbeit mit KI eigentlich? Wann lohnt eine neue Sitzung, wann ein Fork? Was gehört in den Agenten, was in den Chat – und warum kann ein kleines Modell mit hohem Reasoning am Ende teurer sein als ein großes? Sobald der Beitrag fertig ist, steht er im Blog und im RSS-Feed.

Quellen und Stand der Recherche

Stand: 24. September 2026. Meine Erfahrungen sind persönliche Einschätzungen aus meiner Arbeit, kein kontrollierter Produkttest. Die Modellvorschläge sind Startpunkte, keine gemessenen Sieger für jede Text- oder Coding-Aufgabe. Benchmarks, Tarifleistungen und Modellverfügbarkeit können sich ändern. Herstellerangaben und externe Messungen sind im jeweiligen Abschnitt verlinkt.