Zum Inhalt springen
Vollständige Ergebnisse · Stage 1

Leaderboard, Abstain-Härtung und die Messwellen

Die Messung in voller Auflösung: 21 gerankte Targets über 2356 gegradete Records, jede Rate mit ihrer Fallzahl, jeder Punktschätzer mit seinem Konfidenzintervall. Wie gemessen wurde, steht auf Methodik.

Stand der Daten
Gegradete Records
2356
Gerankte Targets
21

Leaderboard

Headline = valid-pass ohne Ordering-Kategorien, [Wilson-95%-CI], sortiert nach Headline mit Tie-Break Souveränität > Self-host > Latenz.

Alle 21 Targets liegen in EINEM CI-Tie-Cluster, die Rangfolge ist Tie-Break-Präsentation, kein Capability-Verdikt.

Standard-Reihenfolge: Souveränität, dann Latenz — kein Capability-Ranking.

Standard-Reihenfolge: Tie-Break-Präsentation (Souveränität, Self-host, Latenz).

Stage-1-Leaderboard, 21 Targets. Sechs Spalten sind voreingestellt: Target, Souveränität, Lane, n, Headline mit Wilson-95-Prozent-Konfidenzintervall und Abstain-missing-arg mit Konfidenzintervall. Die übrigen dreizehn Messspalten lassen sich über das Kontrollkästchen „Alle 19 Spalten zeigen“ einblenden; keine Spalte wurde entfernt. Standard-Reihenfolge ist die Tie-Break-Präsentation (Souveränität, Self-host, Latenz), kein Capability-Ranking: alle Targets liegen in einem gemeinsamen Wilson-95-Prozent-Konfidenzintervall-Cluster. Jede Rate wird mit ihrer Fallzahl angegeben, jeder Punktschätzer mit seinem Konfidenzintervall. Die Spalten sind sortierbar; nicht gemessene Werte stehen in jeder Richtung am Ende.
Position in der Tie-Break-Präsentation, kein Capability-Rang. In Klammern die Rang-Spanne, die das 95%-Wilson-Konfidenzintervall zulässt.SouveränitätLaneFußnote (g): Eigene Messung (completion-tokens/wall-clock, lane-inklusive, cross-lane NICHT vergleichbar).Tier
1 Position 1 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.mistral-small-4-nvidiamistralai/mistral-small-4-119b-2603EU-Herkunftnvidia3591% [7897]19% (6/31)Wilson-95-Prozent-Konfidenzintervall 6 bis 51 Prozent, gerechnet über 2 von 10 Trap-Cases.89% (45)90% (10)91%91%0%100%0,92 [0,801,00]911 ms26,1Viability+
2 Position 2 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.mistral-medium-3.5-nvidiamistralai/mistral-medium-3.5-128bEU-Herkunftnvidia3594% [8198]70% (21/30)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Trap-Cases.84% (45)90% (10)94%94%0%100%0,94 [0,861,00]980 ms22,9Viability+
3 Position 3 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.mistral-large-3-nvidiamistralai/mistral-large-3-675b-instruct-2512Infra-Fehlerquote 15 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert.EU-Herkunftnvidia3595% [8299]81% (13/16)Wilson-95-Prozent-Konfidenzintervall 49 bis 94 Prozent, gerechnet über 8 von 10 Trap-Cases.88% (45)95% (10)91%83%15%96%0,96 [0,871,00]17.693 ms1,5Viability+
4 Position 4 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.nemotron-3-ultra-nvidianvidia/nemotron-3-ultra-550b-a55bEU-hostbarnvidia35100% [90100]100% (30/30)Wilson-95-Prozent-Konfidenzintervall 72 bis 100 Prozent, gerechnet über 10 von 10 Trap-Cases.79% (45)100% (10)100%100%0%100%1,00 [1,001,00]1.941 ms56Viability+
5 Position 5 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.gpt-oss-120b-nvidiaopenai/gpt-oss-120bInfra-Fehlerquote 8 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert.EU-hostbarnvidia35100% [90100]90% (26/29)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Trap-Cases.78% (45)100% (10)100%93%8%100%1,00 [1,001,00]2.251 ms41,3Viability+
6 Position 6 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.qwen3.5-397b-nvidiaqwen/qwen3.5-397b-a17bInfra-Fehlerquote 7 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert.CN open-weightnvidia341 Cases ohne validen Attempt91% [7797]47% (9/19)Wilson-95-Prozent-Konfidenzintervall 24 bis 76 Prozent, gerechnet über 5 von 10 Trap-Cases.85% (43)90% (10)85%86%7%99%0,92 [0,850,99]1.844 ms25,9Viability+
7 Position 7 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.kimi-k3-openroutermoonshotai/kimi-k3Release 2026-07-16, am Release-Tag gemessen. Einziger metered Lauf der Kampagne (78 Records).CN open-weightopenrouter17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset97% [77100]60% (12/20)Wilson-95-Prozent-Konfidenzintervall 31 bis 83 Prozent, gerechnet über 6 von 10 Trap-Cases.80% (25)100% (2)94%97%0%100%0,97 [0,911,00]5.158 ms27,1Viability
8 Position 8 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.glm-5.2-max-cursorglm-5.2-maxCN open-weightcursor17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset100% [82100]75% (15/20)Wilson-95-Prozent-Konfidenzintervall 49 bis 94 Prozent, gerechnet über 8 von 10 Trap-Cases.88% (25)100% (2)100%100%0%100%1,00 [1,001,00]6.713 ms7,2Viability
9 Position 9 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.kimi-k2.7-code-cursorkimi-k2.7-codeCN open-weightcursor17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset94% [7399]60% (12/20)Wilson-95-Prozent-Konfidenzintervall 31 bis 83 Prozent, gerechnet über 6 von 10 Trap-Cases.84% (25)100% (2)88%94%0%97%0,96 [0,891,00]7.668 ms16,5Viability
10 Position 10 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.deepseek-v4-flash-nvidiadeepseek-ai/deepseek-v4-flashInfra-Fehlerquote 6 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert.CN open-weightnvidia3599% [88100]88% (23/26)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Trap-Cases.90% (45)100% (10)97%95%6%99%0,99 [0,971,00]19.788 ms6,3Viability+
11 Position 11 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.glm-5.2-nvidiaz-ai/glm-5.2Infra-Fehlerquote 26 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert.CN open-weightnvidia341 Cases ohne validen Attempt100% [90100]90% (27/30)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Trap-Cases.87% (44)100% (10)100%84%26%100%1,00 [1,001,00]20.016 ms1,5Viability+
12 Position 12 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.deepseek-v4-pro-nvidiadeepseek-ai/deepseek-v4-proInfra-Fehlerquote 32 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert.Keine Chinook-Cases gelaufen (— im Quell-Report). Kein Abstain-Trap-Lauf: dieses Target fehlt in der Abstain-Tabelle.CN open-weightnvidia1223 Cases ohne validen Attempt100% [76100] kein Trap-Lauf88% (17)nicht gemessen100%71%32%100%1,00 [1,001,00]76.862 ms0,9Viability
13 Position 13 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.grok-4.5-openrouterx-ai/grok-4.5US closedopenrouter10 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset90% [6098]0% (0/20)Wilson-95-Prozent-Konfidenzintervall 0 bis 28 Prozent, gerechnet über 0 von 10 Trap-Cases.76% (17)100% (1)90% (Fußnote †: Marker aus dem Quell-Report verbatim übernommen; die Quelle löst ihn nicht auf. Bedeutung offen — nicht interpretieren.)90%0%100%0,90 [0,701,00]1.877 ms99,7Viability
14 Position 14 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.opus-4.8-ccclaude-opus-4-8US closedclaude-code3596% [8399]20% (4/20)Wilson-95-Prozent-Konfidenzintervall 6 bis 51 Prozent, gerechnet über 2 von 10 Trap-Cases.86% (45)100% (10)94%96%0%100%0,96 [0,891,00]3.784 msnicht gemessenViability+
15 Position 15 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.sonnet-5-ccclaude-sonnet-5US closedclaude-code3596% [8399]29% (6/21)Wilson-95-Prozent-Konfidenzintervall 11 bis 60 Prozent, gerechnet über 3 von 10 Trap-Cases.87% (45)100% (10)94%96%0%99%0,96 [0,891,00]4.057 msnicht gemessenViability+
16 Position 16 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.gpt-5.6-codexgpt-5.6-solUS closedcodex3596% [8399]65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Trap-Cases.86% (45)100% (10)94%96%0%100%0,96 [0,891,00]4.263 msnicht gemessenViability+
17 Position 17 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.gpt-5.6-terra-high-cursorgpt-5.6-terra-highUS closedcursor17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset94% [7399]65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Trap-Cases.84% (25)100% (2)88%94%0%97%0,94 [0,851,00]7.251 ms8,1Viability
18 Position 18 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.gpt-5.6-luna-high-cursorgpt-5.6-luna-highUS closedcursor17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset85% [6295]65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Trap-Cases.86% (25)100% (2)76%85%0%94%0,86 [0,710,97]8.120 ms10,6Viability
19 Position 19 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.grok-4.5-cursorcursor-grok-4.5-highSauberster Suite-Lauf des gesamten Felds (100% all-cat).US closedcursor17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset100% [82100]45% (9/20)Wilson-95-Prozent-Konfidenzintervall 24 bis 76 Prozent, gerechnet über 5 von 10 Trap-Cases.100% (25)100% (2)100%100%0%100%1,00 [1,001,00]8.423 ms14,8Viability
20 Position 20 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.composer-2.5-cursorcomposer-2.5US closedcursor17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset94% [7399]40% (8/20)Wilson-95-Prozent-Konfidenzintervall 17 bis 69 Prozent, gerechnet über 4 von 10 Trap-Cases.94% (25)100% (2)94%94%0%100%0,94 [0,821,00]8.634 ms36,1Viability
21 Position 21 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21.gemini-3.5-flash-cursorgemini-3.5-flashUS closedcursor17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset94% [7399]65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Trap-Cases.84% (25)100% (2)94%94%0%100%0,94 [0,821,00]11.393 ms54,1Viability
Fußnote ˢ (n)
Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.
Fußnote (pass^k (grok-4.5-openrouter))
Marker aus dem Quell-Report verbatim übernommen; die Quelle löst ihn nicht auf. Bedeutung offen — nicht interpretieren.
Fußnote (g) (tok/s p50 obs)
Eigene Messung (completion-tokens/wall-clock, lane-inklusive, cross-lane NICHT vergleichbar).
n
Unter der Fallzahl steht ihre Ursache: „Subset“ = pre-registrierter Budget-Lane-Lauf (D9, nie geplante Cases), „N Cases ohne validen Attempt“ = die volle Suite lief, N Cases verloren jeden Versuch an die Lane. Beides sind kleine n, aber nicht dasselbe.
Abstain missing-arg
Left Join auf die Abstain-Härtung: alle 21 Zeilen bleiben stehen, ein Target ohne Trap-Lauf zeigt „kein Trap-Lauf“ statt einer Null. Das Intervall ist abgeleitet, nicht transkribiert — Wilson-95% über die Zahl der TRAP-CASES (nicht der Attempts), weil die k Wiederholungen eines Case korreliert sind.

Abstain-Härtung

14 Trap-Cases prüfen das Gegenteil von Eifer: Fragt das Modell nach, wenn ein Pflicht-Argument fehlt, und lässt es die Finger davon, wenn kein passendes Tool existiert? Die Target-Menge ist bewusst nicht deckungsgleich mit dem Leaderboard — manche Targets liefen ohne Trap-Lauf, eines lief nur hier.

Missing-arg = korrekt zurückgefragt, statt ein fehlendes Pflicht-Argument zu erfinden. No-tool = korrekt darauf verzichtet, wenn kein passendes Werkzeug existierte. Jede Rate steht mit ihrer Fallzahl (bestanden/gesamt Attempts) und mit ihrem Wilson-95%-Konfidenzintervall: bei diesen kleinen n ist die Prozentzahl allein nicht lesbar.

Das Intervall ist abgeleitet, nicht aus dem Quell-Report transkribiert — und es rechnet auf Cases, nicht auf Attempts. Die 14 Trap-Cases teilen sich in 10 Missing-arg- und 4 No-tool-Cases; jeder läuft k-mal. Die k Wiederholungen eines Case sind korreliert, ein Attempt-Intervall würde also rund √k mehr Genauigkeit behaupten, als das Design gekauft hat.

Missing-arg ⌀ Flags rechnet die 6 Gold-Trust-geflaggten der 10 Missing-arg-Cases heraus und steht damit auf 4 Cases. Deshalb stehen beide Spalten nebeneinander: bei diesen 6 Cases failen viele Modelle identisch, ein Formulierungs-Review läuft. „—“ bedeutet: nicht gemessen, nicht 0. Infra-Fehler ist eine absolute Anzahl betroffener Attempts, kein Prozentwert.

Der Ziel-Satz dieser Tabelle ist bewusst nicht der der Rangliste: minimax-m3-nvidia ist hier gemessen, aber lane-limitiert und deshalb ungerankt; deepseek-v4-pro-nvidia ist gerankt, hat aber keinen Trap-Lauf und fehlt hier. Die beiden Tabellen sind deshalb nicht zusammengeführt. Die Rangliste trägt die Missing-arg-Rate nur als Left-Join-Spalte: dort bleiben alle gerankten Zeilen stehen, und die eine ohne Trap-Lauf zeigt „kein Trap-Lauf“ statt einer Null.

Standard-Reihenfolge: absteigend nach Missing-arg-Rate (Quell-Report).

Standard-Reihenfolge: absteigend nach Missing-arg-Rate, wie im Quell-Report.

Abstain-Härtung: 14 Trap-Cases je Target. Jede Rate steht mit ihrer Attempt-Fallzahl und einem abgeleiteten Wilson-95-Prozent-Konfidenzintervall über die Zahl der Cases. Standard-Reihenfolge ist absteigend nach Missing-arg-Rate; die Spalten sind sortierbar, nicht gemessene Werte stehen in jeder Richtung am Ende.
Souveränität
minimax-m3-nvidiaCN open-weight100% (30/30)Wilson-95-Prozent-Konfidenzintervall 72 bis 100 Prozent, gerechnet über 10 von 10 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
nemotron-3-ultra-nvidiaEU-hostbar100% (30/30)Wilson-95-Prozent-Konfidenzintervall 72 bis 100 Prozent, gerechnet über 10 von 10 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
glm-5.2-nvidiaCN open-weight90% (27/30)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.nicht gemessen8
gpt-oss-120b-nvidiaEU-hostbar90% (26/29)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.1
deepseek-v4-flash-nvidiaCN open-weight88% (23/26)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Cases.100% (11/11)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.4
mistral-large-3-nvidiaEU-Herkunft81% (13/16)Wilson-95-Prozent-Konfidenzintervall 49 bis 94 Prozent, gerechnet über 8 von 10 Cases.100% (7/7)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (7/7)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.19
glm-5.2-max-cursorCN open-weight75% (15/20)Wilson-95-Prozent-Konfidenzintervall 49 bis 94 Prozent, gerechnet über 8 von 10 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
mistral-medium-3.5-nvidiaEU-Herkunft70% (21/30)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
gpt-5.6-codexUS closed65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Cases.88% (7/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
gemini-3.5-flash-cursorUS closed65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
gpt-5.6-terra-high-cursorUS closed65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
gpt-5.6-luna-high-cursorUS closed65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
kimi-k2.7-code-cursorCN open-weight60% (12/20)Wilson-95-Prozent-Konfidenzintervall 31 bis 83 Prozent, gerechnet über 6 von 10 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
kimi-k3-openrouterCN open-weight60% (12/20)Wilson-95-Prozent-Konfidenzintervall 31 bis 83 Prozent, gerechnet über 6 von 10 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
qwen3.5-397b-nvidiaCN open-weight47% (9/19)Wilson-95-Prozent-Konfidenzintervall 24 bis 76 Prozent, gerechnet über 5 von 10 Cases.78% (7/9)Wilson-95-Prozent-Konfidenzintervall 30 bis 95 Prozent, gerechnet über 3 von 4 Cases.100% (9/9)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.14
grok-4.5-cursorUS closed45% (9/20)Wilson-95-Prozent-Konfidenzintervall 24 bis 76 Prozent, gerechnet über 5 von 10 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
composer-2.5-cursorUS closed40% (8/20)Wilson-95-Prozent-Konfidenzintervall 17 bis 69 Prozent, gerechnet über 4 von 10 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
sonnet-5-ccUS closed29% (6/21)Wilson-95-Prozent-Konfidenzintervall 11 bis 60 Prozent, gerechnet über 3 von 10 Cases.75% (6/8)Wilson-95-Prozent-Konfidenzintervall 30 bis 95 Prozent, gerechnet über 3 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
opus-4.8-ccUS closed20% (4/20)Wilson-95-Prozent-Konfidenzintervall 6 bis 51 Prozent, gerechnet über 2 von 10 Cases.25% (2/8)Wilson-95-Prozent-Konfidenzintervall 5 bis 70 Prozent, gerechnet über 1 von 4 Cases.88% (7/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
mistral-small-4-nvidiaEU-Herkunft19% (6/31)Wilson-95-Prozent-Konfidenzintervall 6 bis 51 Prozent, gerechnet über 2 von 10 Cases.50% (6/12)Wilson-95-Prozent-Konfidenzintervall 15 bis 85 Prozent, gerechnet über 2 von 4 Cases.100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
grok-4.5-openrouterUS closed0% (0/20)Wilson-95-Prozent-Konfidenzintervall 0 bis 28 Prozent, gerechnet über 0 von 10 Cases.0% (0/8)Wilson-95-Prozent-Konfidenzintervall 0 bis 49 Prozent, gerechnet über 0 von 4 Cases.100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases.0
Dritte Messwelle

S1b: acht weitere Targets, dasselbe Verfahren

S1b-Welle (2026-07-22 → 2026-07-23), ein dritter, unabhängiger Datenpunkt neben S1 (2026-07-17) und W4 (2026-07-19) — beide bleiben unverändert. 8 Targets ranked auf einem pre-registrierten Subset (20 primary + 5 ordering-v2 + 14 additions, k=2), plus qwen3-next-80b-nvidia lane-limited (unvollständige Abstain-Coverage) und grok-4.5-openrouter als additions-only Recheck. 719 physische Rows über 14 Shards (454 Suite + 265 Additions). Headline = valid-pass ohne Ordering-Kategorien — beide Ordering-Arme (v1 confoundet + v2) sind ausgeklammert, [Wilson-95%-CI]. all-cat zeigt valid-pass inkl. beider Ordering-Arme zur Transparenz.

Stand der Welle
Ausgewertete Rows
719

Alle 8 rankbaren S1b-Targets liegen in einem überlappenden 95%-CI [82–100]; Tie-Break (3) Latenz p50 entscheidet — 665ms < 844ms ⇒ gpt-oss-20b-nvidia vorne. Rang ≠ Capability (D10.4a).

S1b-Arm, 8 gerankte und 1 lane-limitierte Targets. Reihenfolge ist Tie-Break-Präsentation (Souveränität, Self-host, Latenz), kein Capability-Ranking: die rankbaren Targets liegen in einem gemeinsamen Wilson-95-Prozent-Konfidenzintervall-Cluster. In der Positionsspalte steht in Klammern die Rang-Spanne dieses Arms.
Position in der Tie-Break-Präsentation, kein Capability-Rang. In Klammern die Rang-Spanne, die das 95%-Wilson-Konfidenzintervall zulässt. Lane-limitierte Targets sind nicht rankbar.TargetLaneSouveränitätProv.InvokenCoverageHeadlineall-catChinookpass^kstrictInfrafmtScoreLatenz p50tok/s p50Fußnote (g): Eigene Messung (completion-tokens/wall-clock, lane-inklusive, cross-lane NICHT vergleichbar).Tier
1 Position 1 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8.gpt-oss-20b-nvidiaopenai/gpt-oss-20bNeueintrag, komplett (78/78 unique Records, 0 errorClass), Tie-Break-Erster im 8er-Cluster (niedrigste Latenz 665ms).nvidiaEU-hostbarpartialhttp1779/79100% [82100]68% (25)100% (2)100%100%0%100%1,00 [1,001,00]665 ms100Viability
2 Position 2 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8.laguna-s-2.1-free-openrouterpoolside/laguna-s-2.1:freeFree-Tier-Rate-Limit: 24% Infra (12× http_429) — Lane-Confounder, aus valid-pass ausgeklammert.openrouterEU-hostbarpartialhttp15 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)79/7993% [7099]70% (23)100% (1)93%68%24%92%0,92 [0,801,00]844 ms70,8Viability
3 Position 3 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8.laguna-s-2.1-openrouterpoolside/laguna-s-2.1openrouterEU-hostbarpartialhttp17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)78/7882% [5994]64% (25)100% (2)76%82%0%85%0,84 [0,670,98]1.010 ms52,3Viability
4 Position 4 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8.nemotron-3-super-120b-nvidianvidia/nemotron-3-super-120b-a12bnvidiaEU-hostbarpartialhttp1778/78100% [82100]80% (25)100% (2)100%100%0%100%1,00 [1,001,00]2.099 ms71,9Viability
5 Position 5 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8.gemini-3.5-flash-lite-openroutergoogle/gemini-3.5-flash-liteopenrouterUS closedpartialhttp17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)78/7894% [7399]80% (25)100% (2)94%94%0%100%0,94 [0,821,00]565 ms43,6Viability
6 Position 6 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8.gemini-3.6-flash-openroutergoogle/gemini-3.6-flashopenrouterUS closedpartialhttp17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)78/78100% [82100]84% (25)100% (2)100%100%0%100%1,00 [1,001,00]1.680 ms112,7Viability
7 Position 7 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8.auto-beta-openrouteropenrouter/auto-betaKapabilitäts-geranked, aber NICHT kosten-rankbar: usage.cost streut ~693× über die 78 Records (Multi-Modell-Router, OpenRouters auto-Meta-Route). Aus jedem Kosten-/Preis-Leaderboard ausgeklammert (Key-Befund 3).openrouterUS closedpartialhttp17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)78/7891% [6998]90% (25)100% (2)88%91%0%91%0,91 [0,761,00]5.580 ms5,2Viability
8 Position 8 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8.gemini-3.6-flash-cursorgemini-3.6-flash-highcursorUS closedpartialcli17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)79/79100% [82100]100% (25)100% (2)100%100%0%100%1,00 [1,001,00]8.909 ms81,8Viability
nicht rankbar, lane-limitedqwen3-next-80b-nvidiaqwen/qwen3-next-80b-a3b-instructCross-Shard-dedupliziert (D29): 62/78 unique usable von 64 physischen Rows über 3 Läufe (sweep/resume/gap-fill); 16 Additions-Cases nie versucht (persistente Abstain-Timeout-Pathologie, 10× timeout). Raw-Envelope 64/152 = Summe überlappender Run-Envelopes.nvidiaCN open-weightpartialhttp1464/152 (Coverage verletzt)93% [6999]91% (22)100% (2)93%65%20%100%0,92 [0,791,00]25.883 ms1Viability

Einschränkungen dieser Welle

Additiv zu den S1-Einschränkungen, nicht deren Ersatz.

  • qwen3-next-80b-nvidia ist NICHT gate-fähig: lane-limited mit unvollständiger Abstain-Coverage (persistente Timeout-Pathologie über 3 unabhängige Läufe). Jede zitierbare Zahl muss den 93%-Headline-Wert (n=14, kleine Basis) UND die Coverage-Lücke (62/78 unique, 16 Additions-Cases nie versucht) gemeinsam nennen.
  • grok-4.5-openrouter hat in dieser Welle keine Primary-Suite-Headline — der S1b-Recheck ist additions-only (28/28 Records, alle Abstain-v2). Der Lane-Effekt ist zeitvariant: missing-arg 14/20 (70%) am 2026-07-22 vs. 0/20 (0%) am 2026-07-17 auf identischen Cases, ohne Modell-/Harness-Änderung — gehostete Closed-Modelle tragen ein Haltbarkeitsdatum (Provider-Routing-Drift, #314). Ein pre-registrierter paired Wilcoxon signed-rank Test (#317, D30) bestätigt den Sprung statistisch: n=14 Paare, 8 diskordant (alle positiv), W+=36, W−=0, exakt p=0.0078125. Zum Vergleich: die beiden pre-registrierten gemini-3.6-flash-cursor-vs-openrouter-Paare (Headline n=17, Additions n=14) sind degeneriert — jedes gepaarte Case-Ergebnis ist identisch, Wilcoxon nicht anwendbar — alle Paare identisch (keine diskordanten Fälle).
  • auto-beta-openrouter ist kein Preis-Referenzpunkt: usage.cost streut ~693× über die 78 Records (Multi-Modell-Router, OpenRouters auto-Meta-Route). Capability-geranked (#7), aber aus jedem Kosten-/Preis-Leaderboard ausgeklammert (Key-Befund 3).
  • Infra-Anteile sind vom Modell-Verdikt getrennt zu lesen (RUNBOOK §7): 22 Infra-Attempts in dieser Welle — 10× timeout (alle qwen3-next-80b-nvidia) + 12× http_429 (alle laguna-s-2.1-free-openrouter, Free-Tier-Rate-Limit, 24% Infra-Anteil auf diesem Target). Beides Lane-Confounder, keine Modell-Schwäche.
  • Diese S1b-Caveats sind additiv zu den 5 S1-Caveats und den 3 W4-Caveats, nicht deren Ersatz. Viability-Tier, kein Gate-Verdikt; Provenance durchgehend partial (HTTP-Lanes liefern kein modelRevision); k über die Targets uneinheitlich (1..3 beobachtet).

Abstain-Additions v2

Ein separater Analysearm auf denselben 14 Trap-Cases wie die S1-Abstain-Härtung: Fragt das Modell nach, wenn ein Pflicht-Argument fehlt, und verzichtet es, wenn kein passendes Werkzeug existiert? Nie mit der Suite-Headline vermischt.

S1b-Arm, Abstain-Additions v2: 14 Trap-Cases je Target, Attempt-Raten je mit Fallzahl, absteigend nach Missing-arg-Rate. Separater Analysearm, nicht mit der Headline vermischt.
TargetSouveränitätMissing-argMissing-arg ⌀ FlagsNo-toolInfra-Fehler (Anzahl)
auto-beta-openrouterUS closed100% (20/20)100% (20/20)88% (7/8)0
gemini-3.6-flash-cursorUS closed100% (20/20)100% (20/20)100% (8/8)0
gemini-3.6-flash-openrouterUS closed100% (20/20)100% (20/20)100% (8/8)0
laguna-s-2.1-free-openrouterEU-hostbar100% (16/16)100% (16/16)100% (5/5)7
nemotron-3-super-120b-nvidiaEU-hostbar100% (20/20)100% (20/20)100% (8/8)0
laguna-s-2.1-openrouterEU-hostbar95% (19/20)95% (19/20)100% (8/8)0
gpt-oss-20b-nvidiaEU-hostbar85% (17/20)85% (17/20)100% (8/8)0
grok-4.5-openrouterUS closed70% (14/20)70% (14/20)100% (8/8)0
qwen3-next-80b-nvidiaCN open-weight50% (1/2)50% (1/2)nicht gemessen11
gemini-3.5-flash-lite-openrouterUS closed20% (4/20)20% (4/20)100% (8/8)0

Zeitvarianz-Recheck

Dasselbe gehostete Modell auf derselben Lane, dieselben Cases, fünf Tage später: ein additions-only Recheck ohne eigene Suite-Headline. Er zeigt, dass ein Lane-Verdikt ein Haltbarkeitsdatum trägt.

grok-4.5-openrouter

Missing-arg S1 (2026-07-17)
0% (0/20)
Missing-arg S1b (2026-07-22)
70% (14/20)
Zeitvarianz Δ
+70 pp
Gesamt-Pass (Additions)
78.6% (22/28)

S1b-Abstain-Recheck (results-s1b-grok45-abstain-recheck.jsonl, 2026-07-22, 28/28 Records, 0 Infra): 22/28 (78.6%) Gesamt-Pass. missing-arg 14/20 (70%) vs. S1-Wert 0/20 (0%) am 2026-07-17 auf identischen Cases — 5 Tage, keine Modell-/Harness-Änderung. Beleg der Lane-Zeitvarianz (Provider-Routing-Drift), Folgeissue #314. Statistisch abgesichert per pre-registriertem paired Wilcoxon signed-rank Test (#317, D30) auf denselben 14 Additions-Cases: n=14 Paare, 8 diskordant (alle positiv), W+=36, W−=0, exakt p=0.0078125.

Multi-Call-Ordering v1 → v2

Die erste Ordering-Metrik (v1) war prompt-confoundet und wird nicht gerankt; erst v2 ist als Multi-Call-Fähigkeit lesbar. Beide bleiben sichtbar, das Delta steht verbatim aus dem Quell-Report.

S1b-Arm, Multi-Call-Ordering: v1 war prompt-confoundet und wird nicht gerankt, nur v2 ist als Multi-Call-Fähigkeit lesbar. Delta ist verbatim aus dem Quell-Report.
TargetLaneTransportordering-v1 (confoundet)ordering-v2Δ (v2−v1)
gemini-3.6-flash-cursorcursorcli100% (3)100% (5)0 pp
auto-beta-openrouteropenrouterhttp100% (3)80% (5)-20 pp
qwen3-next-80b-nvidianvidiahttp100% (3)80% (5)-20 pp
gemini-3.5-flash-lite-openrouteropenrouterhttp0% (3)80% (5)+80 pp
gemini-3.6-flash-openrouteropenrouterhttp0% (3)80% (5)+80 pp
nemotron-3-super-120b-nvidianvidiahttp0% (3)60% (5)+60 pp
laguna-s-2.1-free-openrouteropenrouterhttp33% (3)20% (5)-13 pp
laguna-s-2.1-openrouteropenrouterhttp33% (3)20% (5)-13 pp
gpt-oss-20b-nvidianvidiahttp0% (3)0% (5)0 pp
Zweite Messwelle

W4: Nachmessung von drei Targets

W4-Nachmessung (2026-07-19), ein zweiter, unabhängiger Datenpunkt neben S1 (2026-07-17) — S1 bleibt unverändert. 3 Targets frisch vermessen (glm-5.2-high-cursor, kimi-k2.7-code-cursor, kimi-k3-openrouter, je 78/78 Coverage) auf einem pre-registrierten W4-v2-Subset, plus 2 lane-limited Hugging-Face-Targets mit unvollständiger Coverage. Headline = valid-pass ohne Ordering-Kategorien — BEIDE Ordering-Arme (v1 und v2) sind ausgeklammert, [Wilson-95%-CI]. `all-cat` zeigt valid-pass inkl. beider Ordering-Arme zur Transparenz.

Stand der Welle
Ausgewertete Rows
266

Alle 3 rankbaren W4-Targets liegen in einem überlappenden 95%-CI [82–100]; Tie-Break (3) Latenz p50 entscheidet — 5277ms < 6347ms ⇒ glm-5.2-high-cursor vorne.

W4-Arm, 3 gerankte und 2 lane-limitierte Targets. Reihenfolge ist Tie-Break-Präsentation (Souveränität, Self-host, Latenz), kein Capability-Ranking: die rankbaren Targets liegen in einem gemeinsamen Wilson-95-Prozent-Konfidenzintervall-Cluster. In der Positionsspalte steht in Klammern die Rang-Spanne dieses Arms.
Position in der Tie-Break-Präsentation, kein Capability-Rang. In Klammern die Rang-Spanne, die das 95%-Wilson-Konfidenzintervall zulässt. Lane-limitierte Targets sind nicht rankbar.TargetLaneSouveränitätProv.InvokenCoverageHeadlineall-catChinookpass^kstrictInfrafmtScoreLatenz p50tok/s p50Fußnote (g): Eigene Messung (completion-tokens/wall-clock, lane-inklusive, cross-lane NICHT vergleichbar).Tier
1 Position 1 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 3 von 3.glm-5.2-high-cursorglm-5.2-highcursorCN open-weightpartialcli17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)78/78100% [82100]94% (25)100% (2)100%100%0%100%1,00 [1,001,00]5.277 ms4,4Viability
2 Position 2 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 3 von 3.kimi-k2.7-code-cursorkimi-k2.7-codecursorCN open-weightpartialcli17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)78/7891% [6998]94% (25)100% (2)88%85%10%97%0,94 [0,761,00]6.347 ms19,7Viability
3 Position 3 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 3 von 3.kimi-k3-openroutermoonshotai/kimi-k3openrouterCN open-weightpartialhttp17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)78/7897% [77100]80% (25)100% (2)94%97%0%100%0,97 [0,911,00]7.858 ms19,5Viability
nicht rankbar, lane-limitedglm-5.2-hfzai-org/GLM-5.2huggingfaceCN open-weightcompletehttp416/78 (Coverage verletzt)100% [51100]100% (4)nicht gemessen100%57%50%100%1,00 [1,001,00]2.119 ms42,5Viability
nicht rankbar, lane-limitedkimi-k2.7-code-hfmoonshotai/Kimi-K2.7-CodehuggingfaceCN open-weightcompletehttp416/78 (Coverage verletzt)100% [51100]100% (4)nicht gemessen100%50%56%100%1,00 [1,001,00]680 ms103,3Viability

Einschränkungen dieser Welle

Additiv zu den S1-Einschränkungen, nicht deren Ersatz.

  • Sechs importierte cli_timeout-Rows liegen über dem vorgesehenen 240000ms-Hard-Deadline (max. beobachtet 977235ms) und bleiben Infrastruktur, ausgeklammert aus valid-pass und Latenz-Qualitätsmetriken (D25.3/D28.2).
  • W4-v2-Subset-Envelope: 20 primary + 5 ordering-v2 + 14 additions, k=2 = 78 erwartete Rows je Target; die Additions bleiben ein separater Analysearm, kein 1:1-Vergleich mit Voll-n-Targets (D10.4d).
  • Der Latenz-Tie-Break (3) steht in Spannung zu D4 (Free-Lane-Latenz ist kein Verdikt) und mischt Cross-Lane-Wall-Clock (CLI-Subprozess-Spawn vs. HTTP-Queue) — offengelegt, nicht still (D10.4b).

Multi-Call-Ordering v1 → v2

Die erste Ordering-Metrik (v1) war prompt-confoundet und wird nicht gerankt; erst v2 ist als Multi-Call-Fähigkeit lesbar. Beide bleiben sichtbar, das Delta steht verbatim aus dem Quell-Report.

W4-Arm, Multi-Call-Ordering: v1 war prompt-confoundet und wird nicht gerankt, nur v2 ist als Multi-Call-Fähigkeit lesbar. Delta ist verbatim aus dem Quell-Report.
TargetLaneTransportordering-v1 (confoundet)ordering-v2Δ (v2−v1)
kimi-k2.7-code-cursorcursorcli100% (3)100% (5)0 pp
glm-5.2-high-cursorcursorcli83% (3)80% (5)-3 pp
kimi-k3-openrouteropenrouterhttp17% (3)60% (5)+43 pp

Souveränität

Beide Tabellen führen eine Spalte „Souveränität“. Sie beschreibt Herkunft und Hostbarkeit eines Targets, nicht seine Fähigkeit. Zugleich ist sie der primäre Tie-Break der Rangliste (Souveränität, dann Self-host, dann Latenz) und steht hier in genau dieser Reihenfolge. Unter jeder Bezeichnung steht die Kennung aus dem Quell-Report, damit sich die Tabellen direkt gegen die Kampagne abgleichen lassen.

EU-Herkunfteu-origin
Modell eines EU-Anbieters (Mistral).
EU-hostbareu-hostable
Offene Gewichte, in der EU auf eigener Infrastruktur betreibbar.
CN open-weightcn-open
Offene Gewichte, Anbieter mit CN-Herkunft.
US closedus-closed
Geschlossene Gewichte, US-Anbieter, nur über API.

Gemessen, aber nicht gerankt

Bei diesen Targets ist die kostenfreie Lane eingebrochen (oder war nie provisioniert), nicht das Modell. Sie bleiben sichtbar, damit die Lücke ehrlich ist und nicht still.

  • minimax-m3

    Headline
    92%
    Infra-Fehler
    53%

    NVIDIA-Free-Lane-Überlast (Infra 53%) — kein Modell-Verdikt. Vollmessung folgt in Stage 4 (Self-host).

  • gemma-4-31b

    Headline
    100%
    Infra-Fehler
    63%

    NVIDIA-Free-Lane-Überlast (Infra 63%) — kein Modell-Verdikt. Vollmessung folgt in Stage 4 (Self-host).

  • kimi-k2.6

    Headline
    nicht gemessen
    Infra-Fehler
    nicht gemessen

    Für den Account nicht provisioniert — nicht gemessen. Vollmessung folgt in Stage 4 (Self-host).

Rohdaten

Jede der 5.215 gegradeten Attempt-Zeilen der Kampagne, auf zehn Spalten projiziert: target, case_id, k_idx, category, lane, transport, pass, infra_class, latency_ms, formatOk. Ein Export der append-only Shards, keine Neuberechnung — die Vorbehalte stehen im JSON-Umschlag und auf der Methodik-Seite.

Marktkontext · keine Capability-Messung

Was diese Modelle kosten und wie viel Kontext sie fassen

Preis und Kontextfenster stehen hier neben der Messung, nicht darin. Die Tabelle listet Listenpreise und ausgewiesene Kontextlänge für die sieben Modelle, die wir über die OpenRouter-Lane gegradet haben — ein Ausschnitt der gemessenen Targets, nicht alle. Für die Cursor-, Claude-Code- und Codex-Lanes gibt es keinen Listenpreis, sie können hier grundsätzlich nicht erscheinen. Wer zwischen Kandidaten entscheiden muss, deren Messwerte sich nicht sauber trennen lassen, findet hier die zweite Dimension: was ein Aufruf kostet und wie viel Kontext dafür zur Verfügung steht.

Abrufdatum
Beobachtet

Marktdaten, keine Messung

Diese Zahlen sind der Ausschnitt eines Routers: ausgewiesene Listenpreise und Limits, kein First-Party-API-Traffic und keine von uns gemessene Serving-Qualität. Sie sind der Stand des letzten Publish-Commits und werden nicht live abgefragt, können also seit dem Abrufdatum überholt sein. Und sie gehen in keine Rangfolge ein: kein Preis und keine Kontextlänge fließt in das Leaderboard, in einen Score oder in einen Rang.

Listenpreise und Kontextfenster pro Modell, wie die Quelle sie im beobachteten Zeitraum auswies. Preise in US-Dollar pro Million Token, Kontextfenster in Token. Die Zahlenspalten zeigen den zuletzt abgerufenen Stand, die letzte Spalte den Verlauf des Eingabepreises über alle veröffentlichten Messpunkte. Keine dieser Zahlen geht in ein Capability-Ranking ein. Quelle: OpenRouter.
ModellEingabe (Prompt)USD / Mio. TokenAusgabe (Completion)USD / Mio. TokenKontextfensterTokenVerlauf Eingabealt → neu
Gemini 3.5 Flash Litegoogle/gemini-3.5-flash-lite0,302,501 048 576
Gemini 3.6 Flashgoogle/gemini-3.6-flash0,753,751 048 576
Kimi K3moonshotai/kimi-k33,0015,001 048 576
Laguna S 2.1poolside/laguna-s-2.10,090,181 048 576
Laguna S 2.1 (free)poolside/laguna-s-2.1:free0,000,00262 144
Grok 4.5x-ai/grok-4.52,006,00500 000
GLM 5.2z-ai/glm-5.21,193,741 048 576
Fremdmessungen · nicht unsere Messung

Was andere messen, und warum es nicht dasselbe ist

Neben unserer Messung stehen hier die Zahlen, die Dritte zu denselben Modellen veröffentlichen. Sie stehen hier, weil sie oft zitiert werden und weil die Abweichung zu unserem Ergebnis der eigentliche Befund ist. Wer eine Entscheidung zu treffen hat, sieht hier beides nebeneinander und kann selbst beurteilen, wie weit die Zahlen auseinanderliegen.

Abrufdatum

Fremdmessungen, nicht unsere Messung

Diese Zahlen stammen von Dritten. Wir haben sie nicht erhoben, nicht nachgerechnet und nicht geprüft. Jede Quelle misst etwas anderes: einen aggregierten Index über fremde Testsets, ein Elo aus Publikumsvergleichen, eine Trefferquote auf einem fremden Korpus. Keine davon misst, was wir messen, nämlich objektiv gegradetes Tool-Calling auf unserem eigenen Korpus, mit AST-Match auf Funktionsname, Argument-Schema und Werte. Eine Abweichung zwischen den Spalten ist deshalb kein Widerspruch, sondern der Normalfall. Die Zahlen sind der Stand des letzten Publish-Commits und werden nicht live abgefragt, sie können seit dem Abrufdatum überholt sein. Und sie gehen in keine Rangfolge ein: kein Index, kein Elo und keine fremde Trefferquote fließt in das Leaderboard, in einen Score, in einen Rang oder in einen Tie-Break.

Die Grafik stellt beides nebeneinander: waagrecht unser Headline-valid-pass, senkrecht der externe Index. Läge beidem dieselbe Fähigkeit auf derselben Skala zugrunde, müssten die Punkte einer Linie folgen. Sie tun es nicht.

Modelle, die wir in zwei Lanes gemessen haben, erscheinen zweimal: mit demselben externen Wert und zwei verschiedenen eigenen Werten. Der externe Index kennt die Lane nicht, in der ein Modell bei uns lief.

Streudiagramm: unser Headline-valid-pass gegen den externen IndexStreudiagramm mit 4 Punkten. Waagrechte Achse: unser Headline-valid-pass in Prozent, Skala 0 bis 100. Senkrechte Achse: Agentic Index von Artificial Analysis, Skala 0 bis 100. Jeder Punkt trägt eine Nummer, die auf die gleichnamige Zeile der Tabelle unter der Grafik verweist. Der waagrechte Strich durch jeden Punkt ist das 95-Prozent-Wilson-Intervall unserer Messung. Es ist keine Trendlinie und keine Regressionsgerade eingezeichnet. Alle Werte stehen als Zahlen in der Tabelle unter der Grafik.02550751000255075100Unser Headline-valid-pass (Prozent, 0 bis 100)Agentic Index · Artificial Analysis (Index 0–100)1234
Der waagrechte Strich an jedem Punkt ist unser 95-Prozent-Wilson-Intervall. Er ist bei den meisten Targets breiter als der Abstand zwischen den Punkten, und das ist der Befund: unsere eigene Messung trennt diese Modelle nicht sauber, und ein fremder Index trennt sie auf eine Art, die wir nicht nachvollziehen können. Wir zeichnen bewusst keine Trendlinie und keinen Korrelationswert ein. Bei dieser Punktzahl wäre beides eine Zahl mit Nachkommastellen und ohne Aussage. Die Werte zu jedem Punkt stehen in der Tabelle darunter.

4 von 4 gerankten Targets haben einen externen Indexwert. Für die übrigen wird kein Punkt gezeichnet, sie stehen namentlich darunter. Eine Lücke ist keine Null.

Zahl für Zahl, je mit Quelle und Abrufdatum. Aufklappen zeigt zusätzlich die Herkunft jeder einzelnen Zahl und, wo die Quelle sie ausweist, die Werte je Kategorie.

Externe Benchmark-Zahlen Dritter zu den Modellen, die wir selbst gegradet haben, je mit Quelle und Abrufdatum, daneben unser eigener Headline-valid-pass mit Konfidenzintervall. Keine dieser Fremdzahlen geht in ein Ranking, einen Score oder einen Tie-Break ein.
ModellUnsere Messungvalid-pass ohne Ordering, Wilson-95%-CIAgentic IndexFremdquelle: Artificial AnalysisCoding IndexFremdquelle: Artificial AnalysisIntelligence IndexFremdquelle: Artificial Analysis
Kimi K3moonshotai/kimi-k3
  • Punkt 197% [77100]kimi-k3-openrouter
50,1Artificial AnalysisLeaderboard der Quelle76,2Artificial AnalysisLeaderboard der Quelle57,1Artificial AnalysisLeaderboard der Quelle
Grok 4.5x-ai/grok-4.5
  • Punkt 290% [6098]grok-4.5-openrouter
  • Punkt 3100% [82100]grok-4.5-cursor
45,7Artificial AnalysisLeaderboard der Quelle72,4Artificial AnalysisLeaderboard der Quelle53,8Artificial AnalysisLeaderboard der Quelle
GLM 5.2z-ai/glm-5.2
  • Punkt 4100% [90100]glm-5.2-nvidia
43,1Artificial AnalysisLeaderboard der Quelle68,8Artificial AnalysisLeaderboard der Quelle51,1Artificial AnalysisLeaderboard der Quelle