Zum Inhalt springen
Logo von nextlevels
Projekt anfragen

KI-Modelle im Vergleich: State of AI, Benchmarks, Abos und Praxis

Wöchentlich aktualisiert: Modelle, Benchmarks, Abos und was Entwickler wirklich erleben

KI & Automatisierung
Slawa Ditzel
Slawa DitzelCEO

Stand: 1. Oktober 2026 · nächste Prüfung: Montag, 5. Oktober 2026. Dieser Beitrag ist ein Living Post: Modelle, Benchmarks, Preise und Limits werden jede Woche neu verifiziert. Was sich geändert hat, steht datiert im Changelog am Ende.

Die Benchmark-Tabelle, die du gerade irgendwo im Newsletter liest, ist schon falsch. In den letzten vier Wochen hat sich die Spitze fünfmal neu sortiert. Und trotzdem ist die Frage, die in den Entwickler-Foren wirklich brennt, eine andere. Ein ChatGPT-Pro-Nutzer schreibt: „Wochenlimit gestern zurückgesetzt, heute noch 20 % übrig." Die Modellfrage ist zur Nebensache geworden. Über deine Produktivität entscheiden Kosten pro Aufgabe und Wochenlimit; der letzte Prozentpunkt auf dem Leaderboard ist Rauschen.

Vier Dinge klärt dieser Beitrag deshalb jede Woche neu: welche Modelle vorne liegen, welche Benchmarks das überhaupt noch messen können, was die Abos für 20, 100 und 200 Euro wirklich enthalten, und was Entwickler mit Claude Max, Codex und Kimi im Alltag erleben.

KI-Modelle im Vergleich: Zeitleiste der Spitzenmodelle von GPT-6 Astra bis GPT-6.1 Sol
KI-Modelle im Vergleich: Zeitleiste der Spitzenmodelle von GPT-6 Astra bis GPT-6.1 Sol

KI-Modelle im Vergleich: wer derzeit vorne liegt

Die eigentliche Nachricht dieses Sommers kommt aus dem offenen Lager. Vier chinesische Labore haben seit Juli Modelle mit ein bis drei Billionen Parametern und einer Million Tokens Kontext unter offener Lizenz veröffentlicht: Kimi K3 von Moonshot (2,8 Billionen Parameter, 104 Milliarden aktiv, Gewichte seit 27. Juli), Qwen3.8-Max von Alibaba, DeepSeek V4-Pro unter MIT-Lizenz und zuletzt Xiaomis MiMo-V2.6-Pro, mit Index-Score 46 das stärkste offene Modell im Artificial-Analysis-Ranking.

Wie groß ist der Rückstand? Das US-Institut CAISI beziffert ihn für DeepSeek V4 Pro auf rund acht Monate hinter der US-Spitze; für GLM-5.3 misst es auf Cyber-Benchmarks etwa vier Monate. Nathan Lambert von Interconnects sieht die Lücke durch K3 von sechs bis neun auf drei bis fünf Monate geschrumpft. Drei bis acht Monate: Das ist die Zeit, die du heute an Vorsprung kaufst, wenn du für ein geschlossenes Spitzenmodell zahlst.

Rückstand offener KI-Modelle hinter der US-Spitze: GLM-5.3, Kimi K3 und DeepSeek V4 Pro in Monaten
Rückstand offener KI-Modelle hinter der US-Spitze: GLM-5.3, Kimi K3 und DeepSeek V4 Pro in Monaten

Und die Spitze? Ein Duopol. Anthropic hat im Juni die Klasse „Fable/Mythos 5" oberhalb von Opus eingezogen; Fable 5.1 und Mythos 5.1 kamen am 1. September, Mythos bleibt Programmen mit Sicherheitsfreigabe vorbehalten. Es folgten Claude Opus 5.5 zu 4/20 US-Dollar je Million Tokens, laut Anthropic „auf dem Niveau von Fable 5.1 bei den meisten Aufgaben", und Sonnet 5.5 zum unveränderten Preis von 2/10.

OpenAI hat parallel die komplette Linie getauscht. GPT-6 Astra ist der größte Trainingslauf des Unternehmens (über 100.000 GPUs), mit 1,05 Millionen Tokens Kontext und 10/50 US-Dollar je Million. Darunter GPT-6 Sol und Luna zum halben Preis der 5.6-Generation, und am 29. September GPT-6.1 Sol, das laut OpenAI Astra-Niveau bei DeepSWE für ein Fünftel der Kosten liefert.

Google hat das Jahr ohne neues Pro-Modell verbracht. Gemini 3.5 Pro wurde auf der I/O angekündigt und nie ausgeliefert; stattdessen kamen drei Flash-Modelle in sechs Wochen, zuletzt Gemini 3.8 Flash am 2. September. Gemini 4 soll laut Google deutlich vor Jahresende kommen. xAI liefert monatlich (Grok 4.7 am 21. September, 2/6 US-Dollar). Meta hat die Llama-Linie faktisch eingestellt: Seit April gibt es mit Muse Spark nur noch ein proprietäres Modell, aktuell in Version 1.3.

Modell Anbieter Release Kontext API-Preis (In/Out je 1M Tokens) Open Weights
Claude Fable 5.1 Anthropic 01.09.2026 1M 10 $ / 50 $ nein
Claude Opus 5.5 Anthropic 22.09.2026 1M 4 $ / 20 $ nein
Claude Sonnet 5.5 Anthropic 28.09.2026 1M 2 $ / 10 $ nein
GPT-6 Astra OpenAI 04.09.2026 1,05M 10 $ / 50 $ nein
GPT-6.1 Sol OpenAI 29.09.2026 1,05M 2 $ / 10 $ nein
GPT-6 Luna OpenAI 22.09.2026 1,05M 0,10 $ / 0,50 $ nein
Gemini 3.8 Flash Google 02.09.2026 k. A. 0,75 $ / 3,75 $ (Einführungspreis bis 31.12.) nein
Grok 4.7 xAI 21.09.2026 500K 2 $ / 6 $ nein
Kimi K3 Moonshot 16.07.2026 (Gewichte 27.07.) 1M 3 $ / 15 $ ja (Umsatzstaffel-Lizenz)
DeepSeek V4-Pro (0813) DeepSeek 13.08.2026 1M k. A. ja (MIT)
Qwen3.8-Max Alibaba 03.08.2026 1M k. A. ja (eigene Lizenz; Apache 2.0 nur für Qwen3.8-27B)
MiMo-V2.6-Pro Xiaomi 21.09.2026 1M 0,43 $ / 0,87 $ ja (MIT)

Listenpreise der Anbieter, Stand 01.10.2026; Batch- und Cache-Rabatte kommen obendrauf. Und genau dort steckt die wichtigste Zahl des Monats: Anthropic hat die Cache-Lesepreise bei Fable 5.1 um 75 % gesenkt (auf 0,25 US-Dollar je Million) und bei Opus 5.5 um 60 % (auf 0,20). In einem Agentenlauf, der denselben 200.000-Token-Kontext fünfzigmal neu liest, sind das zehn Millionen Cache-Tokens: bei Opus 5.5 zwei US-Dollar statt fünf. Der Listenpreis für frische Tokens ist für solche Workloads fast egal.

Benchmarks: was noch trägt und was gesättigt ist

Wer Modelle nach Tabellen auswählt, hat ein Problem: Die Benchmarks, die du kennst, sind tot. OpenAI hat SWE-bench Verified im Februar aus der eigenen Berichterstattung gestrichen, weil 59 % der geprüften Aufgaben fehlerhaft waren und Spitzenmodelle die menschliche Referenzlösung wörtlich reproduzieren konnten. GPQA Diamond hat Artificial Analysis im September aus dem Index geworfen, weil alle Spitzenmodelle es „einfach lösen". AIME 2026 liegt bei 97 bis 99 % für die Top 3. Bei FrontierMath musste Epoch AI Tier 4 im Juni neu ausgeben, nachdem 42 % der Aufgaben Fehler enthielten.

Was stattdessen zählt, sind interaktive und wirtschaftlich fundierte Tests, bei denen Kontamination schwer ist. Terminal-Bench 4.0 umfasst 66 kuratierte Aufgaben; acht wurden entfernt (gesättigt, öffentlich gelöst oder mit Qualitätsproblemen), 19 überarbeitet. ARC-AGI-3 ist interaktiv, das Modell muss die Regeln einer Umgebung durch Ausprobieren lernen, also gibt es keine Lösung, die im Trainingsdatensatz stehen könnte. GDPval-AA misst in blinden Paarvergleichen echte Berufsaufgaben aus 44 Berufen. Und Artificial Analysis gewichtet im Index v4.3 private, nie veröffentlichte Testsets mit 45 %, nach 40 % in v4.2 und 20 % davor.

Benchmark Was er misst Top 3 (Stand 01.10.) Status
AA Intelligence Index v4.3 10 Evals, 45 % private Sets, unabhängig Opus 5.5 (58), Opus 5.5 xhigh / Sonnet 5.5 (56), Fable 5.1 / GPT-6 Astra (53) aktuell
Terminal-Bench 4.0 agentische Terminal-Aufgaben, unabhängig Sonnet 5.5 (63,6 %), Opus 5.5 max (59,6 %), Opus 5.5 xhigh (59,6 %) aktuell
Arena WebDev Web-Apps im Blindvergleich, 795.000 Votes Opus 5.5 (1827), GPT-6 Astra (1792), Fable 5.1 (1751) aktuell
GDPval-AA v2.1 220 Berufsaufgaben, 44 Berufe, Elo, unabhängig Opus 5.5 (1846), Sonnet 5.5 (1844), Opus 5.5 xhigh (1820) aktuell
Humanity's Last Exam Expertenwissen, ohne Tools, unabhängig (Scale) GPT-6 Astra (54,2 %), Gemini 3.1 Pro (47,3 %), Fable 5.1 (46,8 %) aktuell
ARC-AGI-3 interaktives Schlussfolgern, unabhängig (ARC Prize) GPT-6 Astra 62,7 % im Standard-Harness (99,9 % im Anbieter-Harness), Opus 5 30,2 %; Opus 5.5 noch nicht gemessen aktuell, Harness-Streit
SWE-bench Verified Coding-Tickets Spitze bei 96 %, Plätze 11 bis 15 innerhalb eines halben Punktes bei 80 % gesättigt, von OpenAI abgesetzt
GPQA Diamond Naturwissenschaft Anbieterangaben: Astra 96,0 %, GPT-5.6 Sol 94,6 % gesättigt, aus AA-Index entfernt
AIME 2026 Mathe-Olympiade Top 3 innerhalb von 2,1 Punkten bei 97 bis 99 % gesättigt

„xhigh"/„max" bezeichnen die Denkstufe (Reasoning-Effort), mit der gemessen wurde. „Harness" ist die Testumgebung: Welche Tools bekommt das Modell, wie viele Versuche, welches Rechenbudget.

Die Zahlen aus Anbieter-Blogs liegen fast durchweg über den unabhängigen Messungen. Anthropic meldet für Sonnet 5.5 auf Terminal-Bench 4.0 70,6 %, Artificial Analysis misst 63,6 %. OpenAI meldet für Astra auf ARC-AGI-3 99,9 %, der Standard-Harness von ARC Prize ergibt 62,7 %, bei rund 26.000 US-Dollar Rechenkosten für den Testlauf. Beides ist nicht gelogen, es sind verschiedene Harnesses und Denkstufen. Nur vergleichbar ist es nicht. Kurz gesagt: Vertrau der Zahl, die jemand gemessen hat, der das Modell nicht verkauft.

Artificial Analysis Intelligence Index v4.3: Opus 5.5, Sonnet 5.5, Fable 5.1, GPT-6 Astra und MiMo-V2.6-Pro
Artificial Analysis Intelligence Index v4.3: Opus 5.5, Sonnet 5.5, Fable 5.1, GPT-6 Astra und MiMo-V2.6-Pro

Was sich in den letzten Wochen gedreht hat: Anthropic führt seit Opus und Sonnet 5.5 die agentischen Coding-Tests und die Berufsaufgaben-Indizes, OpenAI führt bei Wissen, Mathematik und ARC. Beide Anbieter werben inzwischen mit derselben Kennzahl. Anthropic rechnet vor, dass Opus 5.5 auf mittlerer Denkstufe Astra auf maximaler schlägt, bei etwa einem Fünftel der Kosten pro Aufgabe. OpenAI kontert am 29. September mit GPT-6.1 Sol und exakt derselben Formel.

KI-Abos im Vergleich: was du für 20, 100 und 200 Euro bekommst

Der KI-Abos-Vergleich ist einfacher, als er aussieht. Alle Anbieter haben sich auf drei Stufen eingeschossen (rund 20, 100 und 200 US-Dollar), und alle steuern den Preis über Limits. Die Preise in Euro inklusive Umsatzsteuer, wo der Anbieter sie nennt:

Anbieter Einstieg Mitte Oben Was die Stufen unterscheidet
Claude Pro 21,42 € (Opus, Sonnet, Claude Code) Max 5× 107,10 € Max 20× 214,20 € 5-Stunden-Fenster plus Wochenlimit; Fable 5.1 nur auf Max und Team Premium, bis 50 % des Wochenlimits
ChatGPT Plus 23 € (15 bis 150 Sol-Nachrichten je 5 h) Pro 5× 103 € Pro 20× 229 € (Neuanmeldung seit 29.09. mit halbiertem Kontingent) Wochenkontingente auf allen Stufen; Astra Ultrafast nur auf Pro für 500 $
Gemini AI Pro 19,99 $ (3.1 Pro, Antigravity-Einstieg) AI Ultra 99,99 $ AI Ultra 199,99 $ Gemini CLI seit 18.06. für Abos abgeschaltet, Ersatz ist die geschlossene Antigravity CLI
Kimi Code Andante 49 ¥ (K2.7 Code) Moderato 99 ¥ / Allegretto 199 ¥ (K3, 1M) Allegro 699 ¥ Monatspool plus Wochenkontingent plus 5-h-Rate; Verarbeitung durch Moonshot AI Pte. Ltd. in Singapur
Cursor Pro 20 $ (20 $ Guthaben) Pro+ 60 $ (70 $ Guthaben) Ultra 200 $ (400 $ Guthaben) seit 2025 Guthaben statt Requests; auch der Auto-Modus zehrt vom Guthaben
GitHub Copilot Pro 10 $ (10 $ Guthaben) Pro+ 39 $ Business 19 $ / Enterprise 39 $ je Nutzer seit 01.06.2026 verbrauchsbasiert nach API-Preisen

Euro-Preise für Claude nach ssdnodes, für ChatGPT nach heise; Google und Kimi nennen für Deutschland keine Euro-Preise. Für Teams sind die Unternehmenssitze relevant: Claude Team Premium mit Claude Code kostet 100 US-Dollar je Sitz im Jahresabo, ChatGPT Business Premium ebenfalls 100; mit USt-ID landet Claude Max 20× bei 180 Euro netto.

Der Unterschied zwischen den Stufen ist kein Modell-Upgrade. Bei Claude bekommt schon Pro für 21 Euro Opus 5.5 und Claude Code. Bei OpenAI bekommt Plus GPT-6 Astra, nur eben fünf bis 45 Astra-Nachrichten je fünf Stunden. Du zahlst für Volumen. Die spannendere Frage lautet deshalb: Wie schnell bin ich am Limit?

Praxis: was Entwickler mit Claude Max, Codex und Kimi wirklich erleben

Auf der Abo-Seite steht „5× Pro". Was davon ankommt, haben in den letzten Wochen beide großen Anbieter nach unten korrigiert.

Anthropic hat am 14. September die im Mai gestartete Aktion „+50 % Wochenlimit" durch ein dauerhaftes „+25 % gegenüber dem alten Basiswert" ersetzt. Das klingt nach Zugabe, ist aber gegenüber dem Stand der letzten vier Monate eine Kürzung um 17 %, was Anthropic nach Kritik auf Hacker News auch so beziffert hat. Geblieben sind die im Mai verdoppelten 5-Stunden-Fenster.

Parallel läuft in den USA seit Juni eine Sammelklage, die behauptet, Max 20× liefere real das Sechs- bis Achtfache von Pro, nicht das Zwanzigfache. Ein Max-20×-Nutzer, der seinen Verbrauch seit Monaten protokolliert, meldet 20 % Wochenverbrauch am ersten Tag nach dem Reset. Sein Fazit: Für 200 US-Dollar noch ja, „in einem Jahr würde ich nicht darauf wetten".

Ein Effekt, den kaum jemand nachrechnet: Fable 5.1 ist auf Max bei 50 % des Wochenlimits gedeckelt und kostet je Token das 2,5-Fache von Opus 5.5. Wer Opus 5.5 als Default setzt, hat nach einer kursierenden Schätzung von Theo Browne rund das Vierfache an effektivem Kontingent.

OpenAI hat das Problem von der anderen Seite gelöst. Am 10. September wurden die Neuanmeldungen für Pro 20× pausiert, weil dieses Segment laut Codex-Chef Tibo Sottiaux die meiste Last auf den Systemen erzeugt; am 29. September wurde es mit halbiertem Kontingent wieder geöffnet, Bestandskunden werden bis 29. Oktober geschont. Das Zitat aus dem Hook stammt aus dieser Phase: „Wochenlimit gestern zurückgesetzt, heute noch 20 % übrig", schreibt ein Pro-5×-Nutzer im OpenAI-Forum.

Die verbreitete Praxis ist eine Arbeitsteilung: Codex für die Masse an kleinen Änderungen und die Cloud-Parallelisierung, Claude Code für lange, zusammenhängende Sessions. In einer Auswertung von 500 Reddit-Kommentaren bevorzugten 65 % Codex, vor allem wegen der Limits, während Claude Code acht von zwölf Blindrunden gewann, was sich nicht widerspricht.

Abo-Realität: Claude-Code-Wochenlimit minus 17 Prozent, ChatGPT Pro 20x halbiert, Sammelklage 6- bis 8-fach
Abo-Realität: Claude-Code-Wochenlimit minus 17 Prozent, ChatGPT Pro 20x halbiert, Sammelklage 6- bis 8-fach

Kimi ist die dritte Spur, und sie ist ernst zu nehmen. Moonshots Kimi K2.7 Code läuft als Drop-in in Claude Code (ANTHROPIC_BASE_URL auf https://api.moonshot.ai/anthropic umbiegen, fertig) und kostet mit 0,95/4 US-Dollar je Million Tokens rund ein Viertel bis ein Fünftel von Opus 5.5.

Eine Beispielrechnung gegen das damalige Opus 4.8 kam für einen 50-Turn-Agentenlauf auf 0,69 statt 4,00 US-Dollar. Ein Praktiker, der K2.7 rund zwei Wochen in Claude Code gefahren hat, beschreibt es als diszipliniert im Befolgen von Anweisungen, ohne Scope Creep, aber ohne Extended Thinking und mit weniger Community-Wissen um die besten Prompts.

Der Haken liegt woanders. Die internationale Kimi-Plattform betreibt Moonshot AI Pte. Ltd. in Singapur, die Daten werden dort verarbeitet; ein Auftragsverarbeitungsvertrag nach DSGVO-Standard wird öffentlich nicht angeboten. Singapur ist ein Drittland ohne Angemessenheitsbeschluss der EU, die Muttergesellschaft sitzt in Peking. Für einen deutschen Mittelständler mit Kundendaten im Repository ist das ein Ausschlusskriterium, solange keine EU-Instanz mit AVV existiert.

Für Code ohne personenbezogene Daten ist es eine günstige Zweitspur. Ramp misst, dass inzwischen 6,1 % der KI-zahlenden US-Firmen Plattformen einsetzen, die offene oder chinesische Modelle bereitstellen.

Zwei Zahlen zur Einordnung, wie weit die Praxis von den Foren entfernt ist. Nach Menlo Ventures entfielen 2025 rund 54 % der Unternehmensausgaben für KI-Coding auf Anthropic, 21 % auf OpenAI; im Ramp AI Index vom August zahlen 43,5 % der US-Unternehmen an Anthropic und rund 40 % an OpenAI.

Die Nutzerzahlen erzählen eine andere Geschichte als die Budgets. Die Stack-Overflow-Umfrage 2026 mit über 49.000 Antworten: 84 % nutzen KI-Tools, 29 % vertrauen der Genauigkeit, 3 % „stark", und 66 % sagen, der Code sei „fast richtig, aber nicht ganz". Bei den Werkzeugen führt Copilot mit 68 % der KI-Nutzer, Cursor liegt bei 18 %, Claude Code bei knapp 10 %.

Was das für dein Setup heißt

Ich halte es für einen Fehler, ein Team auf ein einziges Modell zu setzen. Der Grund ist Ökonomie: Die Kosten pro Aufgabe hängen mehr an der Denkstufe als am Modell. Opus 5.5 liefert auf Terminal-Bench 4.0 auf „max" und „xhigh" identische 59,6 %, die höhere Stufe kostet nur mehr Tokens. Meine Empfehlung, Stand heute:

Default ist ein Mittelklasse-Modell auf mittlerer Denkstufe. Heute heißt das Opus 5.5 medium oder GPT-6.1 Sol; beide liefern Spitzenergebnisse bei einem Fünftel der Kosten. Frontier-Modelle, also die jeweils teuerste Spitzenklasse eines Anbieters (Fable 5.1, Astra), sind für das reserviert, wo ein Fehler teuer wird: Security-Review, Architekturentscheidungen, das letzte Auge vor dem Merge.

Für Massenaufgaben mit klaren Anweisungen (Tests generieren, Migrationen schreiben, Dokumentation) lohnt sich eine dritte, günstige Spur, wenn Datenschutz und Auftragsverarbeitung geklärt sind. Das kann Luna sein, Gemini Flash oder ein offenes Modell auf europäischer Infrastruktur.

Drei-Spuren-Setup für KI-Modelle im Vergleich: Default, Review und Masse innerhalb eines Harness
Drei-Spuren-Setup für KI-Modelle im Vergleich: Default, Review und Masse innerhalb eines Harness

Wie ich im Beitrag „Agent = Harness + Modell" beschrieben habe, entscheidet der Harness aus Kontext, Gedächtnis, Tools und Evals darüber, ob ein Agent produktiv ist. In einem sauber gebauten Setup ist der Modellwechsel eine Konfigurationszeile, die ANTHROPIC_BASE_URL von oben ist das Beispiel.

Wenn ein Wechsel von Opus 5 auf 5.5 Tage kostet, sitzt die Abhängigkeit an der falschen Stelle. Und wer Kundendaten durch ein Modell außerhalb der EU schickt, weil es fünfmal billiger ist, sollte vorher unseren Beitrag zum europäischen KI-Stack lesen.

Für die Abo-Entscheidung: Ein Team von fünf Entwicklern fährt mit Claude Team Premium (100 US-Dollar je Sitz, Claude Code inklusive) oder ChatGPT Business Premium besser als mit fünf privaten Max-Abos. SSO und Audit-Logs sind der eine Grund.

Der andere: Auf dem Team- und Business-Plan werden Chats standardmäßig nicht zum Training verwendet und gehören dem Unternehmenskonto, auf privaten Abos hängen sie am Mitarbeiter und wandern mit ihm. Wer Cursor oder Copilot behält, sollte wissen, dass beide inzwischen nach API-Preisen abrechnen und das 20-Dollar-Abo ein Guthaben ist.

Was ich bis zur nächsten Prüfung beobachte

Vier offene Fäden, an denen sich dieser Beitrag in den nächsten Wochen ändern wird.

Haiku 5.5 hat Anthropic am 22. September „in den kommenden Wochen" angekündigt und ist noch nicht da. Bei OpenAI endet am 29. Oktober die Schonfrist für Pro-20×-Bestandskunden, danach gilt das halbierte Kontingent für alle. Gemini 4 soll deutlich vor Jahresende kommen und wäre Googles erstes neues Pro-Modell seit Februar. Und die Sammelklage gegen Anthropics Max-Limits ist anhängig; ein Urteil oder Vergleich würde die Abo-Tabelle oben direkt betreffen.

Häufige Fragen

Welches KI-Modell ist derzeit das beste? Für agentisches Coding und Berufsaufgaben führt Claude Opus 5.5 die unabhängigen Indizes (Artificial Analysis, Terminal-Bench 4.0, GDPval-AA), für Wissen und interaktives Schlussfolgern GPT-6 Astra (Humanity's Last Exam, ARC-AGI-3). Der Abstand ist kleiner als der Preisunterschied.

Lohnt sich Claude Max 20× noch? Wenn du täglich mehrere Stunden in Claude Code arbeitest und Opus 5.5 statt Fable als Default setzt, ja. Rechne mit 214 Euro brutto und damit, dass ein einziger großer Agentenlauf spürbar am Wochenlimit zehrt. Für Teams ist Team Premium mit 100 US-Dollar je Sitz meist die bessere Konstruktion.

Kann ich Kimi K3 in Deutschland geschäftlich nutzen? Technisch ja, per API oder als Drop-in in Claude Code. Rechtlich hängt es davon ab, welche Daten du sendest: Die Verarbeitung läuft über Moonshot AI Pte. Ltd. in Singapur, einem Drittland ohne EU-Angemessenheitsbeschluss, und ein Auftragsverarbeitungsvertrag wird öffentlich nicht angeboten. Für Code ohne personenbezogene Daten ist es eine günstige Zweitspur, für Kundendaten nicht.

Warum stehen in Anbieter-Blogs andere Benchmark-Zahlen als hier? Weil Anbieter mit eigenem Harness, maximaler Denkstufe und teils mehreren Versuchen messen. Unabhängige Stellen wie Artificial Analysis, ARC Prize oder Scale messen mit festem Harness und Budget. Dieser Beitrag nennt bevorzugt die unabhängigen Werte und markiert Anbieterangaben als solche.

Changelog

Hier steht ab dem 5. Oktober jede Änderung an Modellen, Preisen, Limits und Top-3-Platzierungen, mit Datum. Was nicht hier steht, hat sich nicht geändert.

  • 01.10.2026 — Erstveröffentlichung (Datenstand 30.09.). Stand: Opus 5.5, Sonnet 5.5, GPT-6 Astra, GPT-6.1 Sol, Gemini 3.8 Flash, Grok 4.7, Kimi K3, MiMo-V2.6-Pro. Claude-Wochenlimit −17 % seit 14.09., ChatGPT Pro 20× seit 29.09. wieder offen (halbiert).

Bereit für den nächsten Schritt?

Setz das Gelernte direkt um – wir unterstützen dich dabei.

Weitere Beiträge