Leaderboard, Abstain-Härtung und die Messwellen
Die Messung in voller Auflösung: 21 gerankte Targets über 2356 gegradete Records, jede Rate mit ihrer Fallzahl, jeder Punktschätzer mit seinem Konfidenzintervall. Wie gemessen wurde, steht auf Methodik.
- Stand der Daten
- Gegradete Records
- 2356
- Gerankte Targets
- 21
Leaderboard
Headline = valid-pass ohne Ordering-Kategorien, [Wilson-95%-CI], sortiert nach Headline mit Tie-Break Souveränität > Self-host > Latenz.
Alle 21 Targets liegen in EINEM CI-Tie-Cluster, die Rangfolge ist Tie-Break-Präsentation, kein Capability-Verdikt.
Standard-Reihenfolge: Souveränität, dann Latenz — kein Capability-Ranking.
Standard-Reihenfolge: Tie-Break-Präsentation (Souveränität, Self-host, Latenz).
| Position in der Tie-Break-Präsentation, kein Capability-Rang. In Klammern die Rang-Spanne, die das 95%-Wilson-Konfidenzintervall zulässt. | Souveränität | Lane | Fußnote (g): Eigene Messung (completion-tokens/wall-clock, lane-inklusive, cross-lane NICHT vergleichbar). | Tier | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 Position 1 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | mistral-small-4-nvidiamistralai/mistral-small-4-119b-2603 | EU-Herkunft | nvidia | 35 | 91% [78–97] | 19% (6/31)Wilson-95-Prozent-Konfidenzintervall 6 bis 51 Prozent, gerechnet über 2 von 10 Trap-Cases. | 89% (45) | 90% (10) | 91% | 91% | 0% | 100% | 0,92 [0,80–1,00] | 911 ms | 26,1 | Viability+ |
| 2 Position 2 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | mistral-medium-3.5-nvidiamistralai/mistral-medium-3.5-128b | EU-Herkunft | nvidia | 35 | 94% [81–98] | 70% (21/30)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Trap-Cases. | 84% (45) | 90% (10) | 94% | 94% | 0% | 100% | 0,94 [0,86–1,00] | 980 ms | 22,9 | Viability+ |
| 3 Position 3 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | mistral-large-3-nvidiamistralai/mistral-large-3-675b-instruct-2512Infra-Fehlerquote 15 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert. | EU-Herkunft | nvidia | 35 | 95% [82–99] | 81% (13/16)Wilson-95-Prozent-Konfidenzintervall 49 bis 94 Prozent, gerechnet über 8 von 10 Trap-Cases. | 88% (45) | 95% (10) | 91% | 83% | 15% | 96% | 0,96 [0,87–1,00] | 17.693 ms | 1,5 | Viability+ |
| 4 Position 4 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | nemotron-3-ultra-nvidianvidia/nemotron-3-ultra-550b-a55b | EU-hostbar | nvidia | 35 | 100% [90–100] | 100% (30/30)Wilson-95-Prozent-Konfidenzintervall 72 bis 100 Prozent, gerechnet über 10 von 10 Trap-Cases. | 79% (45) | 100% (10) | 100% | 100% | 0% | 100% | 1,00 [1,00–1,00] | 1.941 ms | 56 | Viability+ |
| 5 Position 5 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | gpt-oss-120b-nvidiaopenai/gpt-oss-120bInfra-Fehlerquote 8 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert. | EU-hostbar | nvidia | 35 | 100% [90–100] | 90% (26/29)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Trap-Cases. | 78% (45) | 100% (10) | 100% | 93% | 8% | 100% | 1,00 [1,00–1,00] | 2.251 ms | 41,3 | Viability+ |
| 6 Position 6 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | qwen3.5-397b-nvidiaqwen/qwen3.5-397b-a17bInfra-Fehlerquote 7 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert. | CN open-weight | nvidia | 341 Cases ohne validen Attempt | 91% [77–97] | 47% (9/19)Wilson-95-Prozent-Konfidenzintervall 24 bis 76 Prozent, gerechnet über 5 von 10 Trap-Cases. | 85% (43) | 90% (10) | 85% | 86% | 7% | 99% | 0,92 [0,85–0,99] | 1.844 ms | 25,9 | Viability+ |
| 7 Position 7 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | kimi-k3-openroutermoonshotai/kimi-k3Release 2026-07-16, am Release-Tag gemessen. Einziger metered Lauf der Kampagne (78 Records). | CN open-weight | openrouter | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset | 97% [77–100] | 60% (12/20)Wilson-95-Prozent-Konfidenzintervall 31 bis 83 Prozent, gerechnet über 6 von 10 Trap-Cases. | 80% (25) | 100% (2) | 94% | 97% | 0% | 100% | 0,97 [0,91–1,00] | 5.158 ms | 27,1 | Viability |
| 8 Position 8 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | glm-5.2-max-cursorglm-5.2-max | CN open-weight | cursor | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset | 100% [82–100] | 75% (15/20)Wilson-95-Prozent-Konfidenzintervall 49 bis 94 Prozent, gerechnet über 8 von 10 Trap-Cases. | 88% (25) | 100% (2) | 100% | 100% | 0% | 100% | 1,00 [1,00–1,00] | 6.713 ms | 7,2 | Viability |
| 9 Position 9 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | kimi-k2.7-code-cursorkimi-k2.7-code | CN open-weight | cursor | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset | 94% [73–99] | 60% (12/20)Wilson-95-Prozent-Konfidenzintervall 31 bis 83 Prozent, gerechnet über 6 von 10 Trap-Cases. | 84% (25) | 100% (2) | 88% | 94% | 0% | 97% | 0,96 [0,89–1,00] | 7.668 ms | 16,5 | Viability |
| 10 Position 10 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | deepseek-v4-flash-nvidiadeepseek-ai/deepseek-v4-flashInfra-Fehlerquote 6 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert. | CN open-weight | nvidia | 35 | 99% [88–100] | 88% (23/26)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Trap-Cases. | 90% (45) | 100% (10) | 97% | 95% | 6% | 99% | 0,99 [0,97–1,00] | 19.788 ms | 6,3 | Viability+ |
| 11 Position 11 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | glm-5.2-nvidiaz-ai/glm-5.2Infra-Fehlerquote 26 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert. | CN open-weight | nvidia | 341 Cases ohne validen Attempt | 100% [90–100] | 90% (27/30)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Trap-Cases. | 87% (44) | 100% (10) | 100% | 84% | 26% | 100% | 1,00 [1,00–1,00] | 20.016 ms | 1,5 | Viability+ |
| 12 Position 12 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | deepseek-v4-pro-nvidiadeepseek-ai/deepseek-v4-proInfra-Fehlerquote 32 Prozent — Versuche, die an Timeout/429/503 der Lane scheiterten. Aus der Capability-Wertung ausgeklammert.Keine Chinook-Cases gelaufen (— im Quell-Report). Kein Abstain-Trap-Lauf: dieses Target fehlt in der Abstain-Tabelle. | CN open-weight | nvidia | 1223 Cases ohne validen Attempt | 100% [76–100] | kein Trap-Lauf | 88% (17) | nicht gemessen | 100% | 71% | 32% | 100% | 1,00 [1,00–1,00] | 76.862 ms | 0,9 | Viability |
| 13 Position 13 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | grok-4.5-openrouterx-ai/grok-4.5 | US closed | openrouter | 10 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset | 90% [60–98] | 0% (0/20)Wilson-95-Prozent-Konfidenzintervall 0 bis 28 Prozent, gerechnet über 0 von 10 Trap-Cases. | 76% (17) | 100% (1) | 90% (Fußnote †: Marker aus dem Quell-Report verbatim übernommen; die Quelle löst ihn nicht auf. Bedeutung offen — nicht interpretieren.) | 90% | 0% | 100% | 0,90 [0,70–1,00] | 1.877 ms | 99,7 | Viability |
| 14 Position 14 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | opus-4.8-ccclaude-opus-4-8 | US closed | claude-code | 35 | 96% [83–99] | 20% (4/20)Wilson-95-Prozent-Konfidenzintervall 6 bis 51 Prozent, gerechnet über 2 von 10 Trap-Cases. | 86% (45) | 100% (10) | 94% | 96% | 0% | 100% | 0,96 [0,89–1,00] | 3.784 ms | nicht gemessen | Viability+ |
| 15 Position 15 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | sonnet-5-ccclaude-sonnet-5 | US closed | claude-code | 35 | 96% [83–99] | 29% (6/21)Wilson-95-Prozent-Konfidenzintervall 11 bis 60 Prozent, gerechnet über 3 von 10 Trap-Cases. | 87% (45) | 100% (10) | 94% | 96% | 0% | 99% | 0,96 [0,89–1,00] | 4.057 ms | nicht gemessen | Viability+ |
| 16 Position 16 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | gpt-5.6-codexgpt-5.6-sol | US closed | codex | 35 | 96% [83–99] | 65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Trap-Cases. | 86% (45) | 100% (10) | 94% | 96% | 0% | 100% | 0,96 [0,89–1,00] | 4.263 ms | nicht gemessen | Viability+ |
| 17 Position 17 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | gpt-5.6-terra-high-cursorgpt-5.6-terra-high | US closed | cursor | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset | 94% [73–99] | 65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Trap-Cases. | 84% (25) | 100% (2) | 88% | 94% | 0% | 97% | 0,94 [0,85–1,00] | 7.251 ms | 8,1 | Viability |
| 18 Position 18 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | gpt-5.6-luna-high-cursorgpt-5.6-luna-high | US closed | cursor | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset | 85% [62–95] | 65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Trap-Cases. | 86% (25) | 100% (2) | 76% | 85% | 0% | 94% | 0,86 [0,71–0,97] | 8.120 ms | 10,6 | Viability |
| 19 Position 19 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | grok-4.5-cursorcursor-grok-4.5-highSauberster Suite-Lauf des gesamten Felds (100% all-cat). | US closed | cursor | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset | 100% [82–100] | 45% (9/20)Wilson-95-Prozent-Konfidenzintervall 24 bis 76 Prozent, gerechnet über 5 von 10 Trap-Cases. | 100% (25) | 100% (2) | 100% | 100% | 0% | 100% | 1,00 [1,00–1,00] | 8.423 ms | 14,8 | Viability |
| 20 Position 20 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | composer-2.5-cursorcomposer-2.5 | US closed | cursor | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset | 94% [73–99] | 40% (8/20)Wilson-95-Prozent-Konfidenzintervall 17 bis 69 Prozent, gerechnet über 4 von 10 Trap-Cases. | 94% (25) | 100% (2) | 94% | 94% | 0% | 100% | 0,94 [0,82–1,00] | 8.634 ms | 36,1 | Viability |
| 21 Position 21 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 21 von 21. | gemini-3.5-flash-cursorgemini-3.5-flash | US closed | cursor | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.)Subset | 94% [73–99] | 65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Trap-Cases. | 84% (25) | 100% (2) | 94% | 94% | 0% | 100% | 0,94 [0,82–1,00] | 11.393 ms | 54,1 | Viability |
- Fußnote ˢ (n)
- Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.
- Fußnote † (pass^k (grok-4.5-openrouter))
- Marker aus dem Quell-Report verbatim übernommen; die Quelle löst ihn nicht auf. Bedeutung offen — nicht interpretieren.
- Fußnote (g) (tok/s p50 obs)
- Eigene Messung (completion-tokens/wall-clock, lane-inklusive, cross-lane NICHT vergleichbar).
- n
- Unter der Fallzahl steht ihre Ursache: „Subset“ = pre-registrierter Budget-Lane-Lauf (D9, nie geplante Cases), „N Cases ohne validen Attempt“ = die volle Suite lief, N Cases verloren jeden Versuch an die Lane. Beides sind kleine n, aber nicht dasselbe.
- Abstain missing-arg
- Left Join auf die Abstain-Härtung: alle 21 Zeilen bleiben stehen, ein Target ohne Trap-Lauf zeigt „kein Trap-Lauf“ statt einer Null. Das Intervall ist abgeleitet, nicht transkribiert — Wilson-95% über die Zahl der TRAP-CASES (nicht der Attempts), weil die k Wiederholungen eines Case korreliert sind.
Abstain-Härtung
14 Trap-Cases prüfen das Gegenteil von Eifer: Fragt das Modell nach, wenn ein Pflicht-Argument fehlt, und lässt es die Finger davon, wenn kein passendes Tool existiert? Die Target-Menge ist bewusst nicht deckungsgleich mit dem Leaderboard — manche Targets liefen ohne Trap-Lauf, eines lief nur hier.
Missing-arg = korrekt zurückgefragt, statt ein fehlendes Pflicht-Argument zu erfinden. No-tool = korrekt darauf verzichtet, wenn kein passendes Werkzeug existierte. Jede Rate steht mit ihrer Fallzahl (bestanden/gesamt Attempts) und mit ihrem Wilson-95%-Konfidenzintervall: bei diesen kleinen n ist die Prozentzahl allein nicht lesbar.
Das Intervall ist abgeleitet, nicht aus dem Quell-Report transkribiert — und es rechnet auf Cases, nicht auf Attempts. Die 14 Trap-Cases teilen sich in 10 Missing-arg- und 4 No-tool-Cases; jeder läuft k-mal. Die k Wiederholungen eines Case sind korreliert, ein Attempt-Intervall würde also rund √k mehr Genauigkeit behaupten, als das Design gekauft hat.
Missing-arg ⌀ Flags rechnet die 6 Gold-Trust-geflaggten der 10 Missing-arg-Cases heraus und steht damit auf 4 Cases. Deshalb stehen beide Spalten nebeneinander: bei diesen 6 Cases failen viele Modelle identisch, ein Formulierungs-Review läuft. „—“ bedeutet: nicht gemessen, nicht 0. Infra-Fehler ist eine absolute Anzahl betroffener Attempts, kein Prozentwert.
Der Ziel-Satz dieser Tabelle ist bewusst nicht der der Rangliste: minimax-m3-nvidia ist hier gemessen, aber lane-limitiert und deshalb ungerankt; deepseek-v4-pro-nvidia ist gerankt, hat aber keinen Trap-Lauf und fehlt hier. Die beiden Tabellen sind deshalb nicht zusammengeführt. Die Rangliste trägt die Missing-arg-Rate nur als Left-Join-Spalte: dort bleiben alle gerankten Zeilen stehen, und die eine ohne Trap-Lauf zeigt „kein Trap-Lauf“ statt einer Null.
Standard-Reihenfolge: absteigend nach Missing-arg-Rate (Quell-Report).
Standard-Reihenfolge: absteigend nach Missing-arg-Rate, wie im Quell-Report.
| Souveränität | |||||
|---|---|---|---|---|---|
| minimax-m3-nvidia | CN open-weight | 100% (30/30)Wilson-95-Prozent-Konfidenzintervall 72 bis 100 Prozent, gerechnet über 10 von 10 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| nemotron-3-ultra-nvidia | EU-hostbar | 100% (30/30)Wilson-95-Prozent-Konfidenzintervall 72 bis 100 Prozent, gerechnet über 10 von 10 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| glm-5.2-nvidia | CN open-weight | 90% (27/30)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | nicht gemessen | 8 |
| gpt-oss-120b-nvidia | EU-hostbar | 90% (26/29)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 1 |
| deepseek-v4-flash-nvidia | CN open-weight | 88% (23/26)Wilson-95-Prozent-Konfidenzintervall 60 bis 98 Prozent, gerechnet über 9 von 10 Cases. | 100% (11/11)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 4 |
| mistral-large-3-nvidia | EU-Herkunft | 81% (13/16)Wilson-95-Prozent-Konfidenzintervall 49 bis 94 Prozent, gerechnet über 8 von 10 Cases. | 100% (7/7)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (7/7)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 19 |
| glm-5.2-max-cursor | CN open-weight | 75% (15/20)Wilson-95-Prozent-Konfidenzintervall 49 bis 94 Prozent, gerechnet über 8 von 10 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| mistral-medium-3.5-nvidia | EU-Herkunft | 70% (21/30)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| gpt-5.6-codex | US closed | 65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Cases. | 88% (7/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| gemini-3.5-flash-cursor | US closed | 65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| gpt-5.6-terra-high-cursor | US closed | 65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| gpt-5.6-luna-high-cursor | US closed | 65% (13/20)Wilson-95-Prozent-Konfidenzintervall 40 bis 89 Prozent, gerechnet über 7 von 10 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| kimi-k2.7-code-cursor | CN open-weight | 60% (12/20)Wilson-95-Prozent-Konfidenzintervall 31 bis 83 Prozent, gerechnet über 6 von 10 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| kimi-k3-openrouter | CN open-weight | 60% (12/20)Wilson-95-Prozent-Konfidenzintervall 31 bis 83 Prozent, gerechnet über 6 von 10 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| qwen3.5-397b-nvidia | CN open-weight | 47% (9/19)Wilson-95-Prozent-Konfidenzintervall 24 bis 76 Prozent, gerechnet über 5 von 10 Cases. | 78% (7/9)Wilson-95-Prozent-Konfidenzintervall 30 bis 95 Prozent, gerechnet über 3 von 4 Cases. | 100% (9/9)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 14 |
| grok-4.5-cursor | US closed | 45% (9/20)Wilson-95-Prozent-Konfidenzintervall 24 bis 76 Prozent, gerechnet über 5 von 10 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| composer-2.5-cursor | US closed | 40% (8/20)Wilson-95-Prozent-Konfidenzintervall 17 bis 69 Prozent, gerechnet über 4 von 10 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| sonnet-5-cc | US closed | 29% (6/21)Wilson-95-Prozent-Konfidenzintervall 11 bis 60 Prozent, gerechnet über 3 von 10 Cases. | 75% (6/8)Wilson-95-Prozent-Konfidenzintervall 30 bis 95 Prozent, gerechnet über 3 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| opus-4.8-cc | US closed | 20% (4/20)Wilson-95-Prozent-Konfidenzintervall 6 bis 51 Prozent, gerechnet über 2 von 10 Cases. | 25% (2/8)Wilson-95-Prozent-Konfidenzintervall 5 bis 70 Prozent, gerechnet über 1 von 4 Cases. | 88% (7/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| mistral-small-4-nvidia | EU-Herkunft | 19% (6/31)Wilson-95-Prozent-Konfidenzintervall 6 bis 51 Prozent, gerechnet über 2 von 10 Cases. | 50% (6/12)Wilson-95-Prozent-Konfidenzintervall 15 bis 85 Prozent, gerechnet über 2 von 4 Cases. | 100% (12/12)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
| grok-4.5-openrouter | US closed | 0% (0/20)Wilson-95-Prozent-Konfidenzintervall 0 bis 28 Prozent, gerechnet über 0 von 10 Cases. | 0% (0/8)Wilson-95-Prozent-Konfidenzintervall 0 bis 49 Prozent, gerechnet über 0 von 4 Cases. | 100% (8/8)Wilson-95-Prozent-Konfidenzintervall 51 bis 100 Prozent, gerechnet über 4 von 4 Cases. | 0 |
S1b: acht weitere Targets, dasselbe Verfahren
S1b-Welle (2026-07-22 → 2026-07-23), ein dritter, unabhängiger Datenpunkt neben S1 (2026-07-17) und W4 (2026-07-19) — beide bleiben unverändert. 8 Targets ranked auf einem pre-registrierten Subset (20 primary + 5 ordering-v2 + 14 additions, k=2), plus qwen3-next-80b-nvidia lane-limited (unvollständige Abstain-Coverage) und grok-4.5-openrouter als additions-only Recheck. 719 physische Rows über 14 Shards (454 Suite + 265 Additions). Headline = valid-pass ohne Ordering-Kategorien — beide Ordering-Arme (v1 confoundet + v2) sind ausgeklammert, [Wilson-95%-CI]. all-cat zeigt valid-pass inkl. beider Ordering-Arme zur Transparenz.
- Stand der Welle
- Ausgewertete Rows
- 719
Alle 8 rankbaren S1b-Targets liegen in einem überlappenden 95%-CI [82–100]; Tie-Break (3) Latenz p50 entscheidet — 665ms < 844ms ⇒ gpt-oss-20b-nvidia vorne. Rang ≠ Capability (D10.4a).
| Position in der Tie-Break-Präsentation, kein Capability-Rang. In Klammern die Rang-Spanne, die das 95%-Wilson-Konfidenzintervall zulässt. Lane-limitierte Targets sind nicht rankbar. | Target | Lane | Souveränität | Prov. | Invoke | n | Coverage | Headline | all-cat | Chinook | pass^k | strict | Infra | fmt | Score | Latenz p50 | tok/s p50Fußnote (g): Eigene Messung (completion-tokens/wall-clock, lane-inklusive, cross-lane NICHT vergleichbar). | Tier |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 Position 1 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8. | gpt-oss-20b-nvidiaopenai/gpt-oss-20bNeueintrag, komplett (78/78 unique Records, 0 errorClass), Tie-Break-Erster im 8er-Cluster (niedrigste Latenz 665ms). | nvidia | EU-hostbar | partial | http | 17 | 79/79 | 100% [82–100] | 68% (25) | 100% (2) | 100% | 100% | 0% | 100% | 1,00 [1,00–1,00] | 665 ms | 100 | Viability |
| 2 Position 2 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8. | laguna-s-2.1-free-openrouterpoolside/laguna-s-2.1:freeFree-Tier-Rate-Limit: 24% Infra (12× http_429) — Lane-Confounder, aus valid-pass ausgeklammert. | openrouter | EU-hostbar | partial | http | 15 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.) | 79/79 | 93% [70–99] | 70% (23) | 100% (1) | 93% | 68% | 24% | 92% | 0,92 [0,80–1,00] | 844 ms | 70,8 | Viability |
| 3 Position 3 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8. | laguna-s-2.1-openrouterpoolside/laguna-s-2.1 | openrouter | EU-hostbar | partial | http | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.) | 78/78 | 82% [59–94] | 64% (25) | 100% (2) | 76% | 82% | 0% | 85% | 0,84 [0,67–0,98] | 1.010 ms | 52,3 | Viability |
| 4 Position 4 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8. | nemotron-3-super-120b-nvidianvidia/nemotron-3-super-120b-a12b | nvidia | EU-hostbar | partial | http | 17 | 78/78 | 100% [82–100] | 80% (25) | 100% (2) | 100% | 100% | 0% | 100% | 1,00 [1,00–1,00] | 2.099 ms | 71,9 | Viability |
| 5 Position 5 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8. | gemini-3.5-flash-lite-openroutergoogle/gemini-3.5-flash-lite | openrouter | US closed | partial | http | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.) | 78/78 | 94% [73–99] | 80% (25) | 100% (2) | 94% | 94% | 0% | 100% | 0,94 [0,82–1,00] | 565 ms | 43,6 | Viability |
| 6 Position 6 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8. | gemini-3.6-flash-openroutergoogle/gemini-3.6-flash | openrouter | US closed | partial | http | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.) | 78/78 | 100% [82–100] | 84% (25) | 100% (2) | 100% | 100% | 0% | 100% | 1,00 [1,00–1,00] | 1.680 ms | 112,7 | Viability |
| 7 Position 7 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8. | auto-beta-openrouteropenrouter/auto-betaKapabilitäts-geranked, aber NICHT kosten-rankbar: usage.cost streut ~693× über die 78 Records (Multi-Modell-Router, OpenRouters auto-Meta-Route). Aus jedem Kosten-/Preis-Leaderboard ausgeklammert (Key-Befund 3). | openrouter | US closed | partial | http | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.) | 78/78 | 91% [69–98] | 90% (25) | 100% (2) | 88% | 91% | 0% | 91% | 0,91 [0,76–1,00] | 5.580 ms | 5,2 | Viability |
| 8 Position 8 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 8 von 8. | gemini-3.6-flash-cursorgemini-3.6-flash-high | cursor | US closed | partial | cli | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.) | 79/79 | 100% [82–100] | 100% (25) | 100% (2) | 100% | 100% | 0% | 100% | 1,00 [1,00–1,00] | 8.909 ms | 81,8 | Viability |
| nicht rankbar, lane-limited | qwen3-next-80b-nvidiaqwen/qwen3-next-80b-a3b-instructCross-Shard-dedupliziert (D29): 62/78 unique usable von 64 physischen Rows über 3 Läufe (sweep/resume/gap-fill); 16 Additions-Cases nie versucht (persistente Abstain-Timeout-Pathologie, 10× timeout). Raw-Envelope 64/152 = Summe überlappender Run-Envelopes. | nvidia | CN open-weight | partial | http | 14 | 64/152 (Coverage verletzt) | 93% [69–99] | 91% (22) | 100% (2) | 93% | 65% | 20% | 100% | 0,92 [0,79–1,00] | 25.883 ms | 1 | Viability |
Einschränkungen dieser Welle
Additiv zu den S1-Einschränkungen, nicht deren Ersatz.
- qwen3-next-80b-nvidia ist NICHT gate-fähig: lane-limited mit unvollständiger Abstain-Coverage (persistente Timeout-Pathologie über 3 unabhängige Läufe). Jede zitierbare Zahl muss den 93%-Headline-Wert (n=14, kleine Basis) UND die Coverage-Lücke (62/78 unique, 16 Additions-Cases nie versucht) gemeinsam nennen.
- grok-4.5-openrouter hat in dieser Welle keine Primary-Suite-Headline — der S1b-Recheck ist additions-only (28/28 Records, alle Abstain-v2). Der Lane-Effekt ist zeitvariant: missing-arg 14/20 (70%) am 2026-07-22 vs. 0/20 (0%) am 2026-07-17 auf identischen Cases, ohne Modell-/Harness-Änderung — gehostete Closed-Modelle tragen ein Haltbarkeitsdatum (Provider-Routing-Drift, #314). Ein pre-registrierter paired Wilcoxon signed-rank Test (#317, D30) bestätigt den Sprung statistisch: n=14 Paare, 8 diskordant (alle positiv), W+=36, W−=0, exakt p=0.0078125. Zum Vergleich: die beiden pre-registrierten gemini-3.6-flash-cursor-vs-openrouter-Paare (Headline n=17, Additions n=14) sind degeneriert — jedes gepaarte Case-Ergebnis ist identisch, Wilcoxon nicht anwendbar — alle Paare identisch (keine diskordanten Fälle).
- auto-beta-openrouter ist kein Preis-Referenzpunkt: usage.cost streut ~693× über die 78 Records (Multi-Modell-Router, OpenRouters auto-Meta-Route). Capability-geranked (#7), aber aus jedem Kosten-/Preis-Leaderboard ausgeklammert (Key-Befund 3).
- Infra-Anteile sind vom Modell-Verdikt getrennt zu lesen (RUNBOOK §7): 22 Infra-Attempts in dieser Welle — 10× timeout (alle qwen3-next-80b-nvidia) + 12× http_429 (alle laguna-s-2.1-free-openrouter, Free-Tier-Rate-Limit, 24% Infra-Anteil auf diesem Target). Beides Lane-Confounder, keine Modell-Schwäche.
- Diese S1b-Caveats sind additiv zu den 5 S1-Caveats und den 3 W4-Caveats, nicht deren Ersatz. Viability-Tier, kein Gate-Verdikt; Provenance durchgehend partial (HTTP-Lanes liefern kein modelRevision); k über die Targets uneinheitlich (1..3 beobachtet).
Abstain-Additions v2
Ein separater Analysearm auf denselben 14 Trap-Cases wie die S1-Abstain-Härtung: Fragt das Modell nach, wenn ein Pflicht-Argument fehlt, und verzichtet es, wenn kein passendes Werkzeug existiert? Nie mit der Suite-Headline vermischt.
| Target | Souveränität | Missing-arg | Missing-arg ⌀ Flags | No-tool | Infra-Fehler (Anzahl) |
|---|---|---|---|---|---|
| auto-beta-openrouter | US closed | 100% (20/20) | 100% (20/20) | 88% (7/8) | 0 |
| gemini-3.6-flash-cursor | US closed | 100% (20/20) | 100% (20/20) | 100% (8/8) | 0 |
| gemini-3.6-flash-openrouter | US closed | 100% (20/20) | 100% (20/20) | 100% (8/8) | 0 |
| laguna-s-2.1-free-openrouter | EU-hostbar | 100% (16/16) | 100% (16/16) | 100% (5/5) | 7 |
| nemotron-3-super-120b-nvidia | EU-hostbar | 100% (20/20) | 100% (20/20) | 100% (8/8) | 0 |
| laguna-s-2.1-openrouter | EU-hostbar | 95% (19/20) | 95% (19/20) | 100% (8/8) | 0 |
| gpt-oss-20b-nvidia | EU-hostbar | 85% (17/20) | 85% (17/20) | 100% (8/8) | 0 |
| grok-4.5-openrouter | US closed | 70% (14/20) | 70% (14/20) | 100% (8/8) | 0 |
| qwen3-next-80b-nvidia | CN open-weight | 50% (1/2) | 50% (1/2) | nicht gemessen | 11 |
| gemini-3.5-flash-lite-openrouter | US closed | 20% (4/20) | 20% (4/20) | 100% (8/8) | 0 |
Zeitvarianz-Recheck
Dasselbe gehostete Modell auf derselben Lane, dieselben Cases, fünf Tage später: ein additions-only Recheck ohne eigene Suite-Headline. Er zeigt, dass ein Lane-Verdikt ein Haltbarkeitsdatum trägt.
grok-4.5-openrouter
- Missing-arg S1 (2026-07-17)
- 0% (0/20)
- Missing-arg S1b (2026-07-22)
- 70% (14/20)
- Zeitvarianz Δ
- +70 pp
- Gesamt-Pass (Additions)
- 78.6% (22/28)
S1b-Abstain-Recheck (results-s1b-grok45-abstain-recheck.jsonl, 2026-07-22, 28/28 Records, 0 Infra): 22/28 (78.6%) Gesamt-Pass. missing-arg 14/20 (70%) vs. S1-Wert 0/20 (0%) am 2026-07-17 auf identischen Cases — 5 Tage, keine Modell-/Harness-Änderung. Beleg der Lane-Zeitvarianz (Provider-Routing-Drift), Folgeissue #314. Statistisch abgesichert per pre-registriertem paired Wilcoxon signed-rank Test (#317, D30) auf denselben 14 Additions-Cases: n=14 Paare, 8 diskordant (alle positiv), W+=36, W−=0, exakt p=0.0078125.
Multi-Call-Ordering v1 → v2
Die erste Ordering-Metrik (v1) war prompt-confoundet und wird nicht gerankt; erst v2 ist als Multi-Call-Fähigkeit lesbar. Beide bleiben sichtbar, das Delta steht verbatim aus dem Quell-Report.
| Target | Lane | Transport | ordering-v1 (confoundet) | ordering-v2 | Δ (v2−v1) |
|---|---|---|---|---|---|
| gemini-3.6-flash-cursor | cursor | cli | 100% (3) | 100% (5) | 0 pp |
| auto-beta-openrouter | openrouter | http | 100% (3) | 80% (5) | -20 pp |
| qwen3-next-80b-nvidia | nvidia | http | 100% (3) | 80% (5) | -20 pp |
| gemini-3.5-flash-lite-openrouter | openrouter | http | 0% (3) | 80% (5) | +80 pp |
| gemini-3.6-flash-openrouter | openrouter | http | 0% (3) | 80% (5) | +80 pp |
| nemotron-3-super-120b-nvidia | nvidia | http | 0% (3) | 60% (5) | +60 pp |
| laguna-s-2.1-free-openrouter | openrouter | http | 33% (3) | 20% (5) | -13 pp |
| laguna-s-2.1-openrouter | openrouter | http | 33% (3) | 20% (5) | -13 pp |
| gpt-oss-20b-nvidia | nvidia | http | 0% (3) | 0% (5) | 0 pp |
W4: Nachmessung von drei Targets
W4-Nachmessung (2026-07-19), ein zweiter, unabhängiger Datenpunkt neben S1 (2026-07-17) — S1 bleibt unverändert. 3 Targets frisch vermessen (glm-5.2-high-cursor, kimi-k2.7-code-cursor, kimi-k3-openrouter, je 78/78 Coverage) auf einem pre-registrierten W4-v2-Subset, plus 2 lane-limited Hugging-Face-Targets mit unvollständiger Coverage. Headline = valid-pass ohne Ordering-Kategorien — BEIDE Ordering-Arme (v1 und v2) sind ausgeklammert, [Wilson-95%-CI]. `all-cat` zeigt valid-pass inkl. beider Ordering-Arme zur Transparenz.
- Stand der Welle
- Ausgewertete Rows
- 266
Alle 3 rankbaren W4-Targets liegen in einem überlappenden 95%-CI [82–100]; Tie-Break (3) Latenz p50 entscheidet — 5277ms < 6347ms ⇒ glm-5.2-high-cursor vorne.
| Position in der Tie-Break-Präsentation, kein Capability-Rang. In Klammern die Rang-Spanne, die das 95%-Wilson-Konfidenzintervall zulässt. Lane-limitierte Targets sind nicht rankbar. | Target | Lane | Souveränität | Prov. | Invoke | n | Coverage | Headline | all-cat | Chinook | pass^k | strict | Infra | fmt | Score | Latenz p50 | tok/s p50Fußnote (g): Eigene Messung (completion-tokens/wall-clock, lane-inklusive, cross-lane NICHT vergleichbar). | Tier |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 Position 1 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 3 von 3. | glm-5.2-high-cursorglm-5.2-high | cursor | CN open-weight | partial | cli | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.) | 78/78 | 100% [82–100] | 94% (25) | 100% (2) | 100% | 100% | 0% | 100% | 1,00 [1,00–1,00] | 5.277 ms | 4,4 | Viability |
| 2 Position 2 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 3 von 3. | kimi-k2.7-code-cursorkimi-k2.7-code | cursor | CN open-weight | partial | cli | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.) | 78/78 | 91% [69–98] | 94% (25) | 100% (2) | 88% | 85% | 10% | 97% | 0,94 [0,76–1,00] | 6.347 ms | 19,7 | Viability |
| 3 Position 3 in der Tie-Break-Präsentation. Rang-Spanne unter 95%-Wilson-CI-Unsicherheit: Rang 1 bis 3 von 3. | kimi-k3-openroutermoonshotai/kimi-k3 | openrouter | CN open-weight | partial | http | 17 (Fußnote ˢ: Pre-registriertes Subset der Budget-Lanes (Cursor, OpenRouter) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.) | 78/78 | 97% [77–100] | 80% (25) | 100% (2) | 94% | 97% | 0% | 100% | 0,97 [0,91–1,00] | 7.858 ms | 19,5 | Viability |
| nicht rankbar, lane-limited | glm-5.2-hfzai-org/GLM-5.2 | huggingface | CN open-weight | complete | http | 4 | 16/78 (Coverage verletzt) | 100% [51–100] | 100% (4) | nicht gemessen | 100% | 57% | 50% | 100% | 1,00 [1,00–1,00] | 2.119 ms | 42,5 | Viability |
| nicht rankbar, lane-limited | kimi-k2.7-code-hfmoonshotai/Kimi-K2.7-Code | huggingface | CN open-weight | complete | http | 4 | 16/78 (Coverage verletzt) | 100% [51–100] | 100% (4) | nicht gemessen | 100% | 50% | 56% | 100% | 1,00 [1,00–1,00] | 680 ms | 103,3 | Viability |
Einschränkungen dieser Welle
Additiv zu den S1-Einschränkungen, nicht deren Ersatz.
- Sechs importierte cli_timeout-Rows liegen über dem vorgesehenen 240000ms-Hard-Deadline (max. beobachtet 977235ms) und bleiben Infrastruktur, ausgeklammert aus valid-pass und Latenz-Qualitätsmetriken (D25.3/D28.2).
- W4-v2-Subset-Envelope: 20 primary + 5 ordering-v2 + 14 additions, k=2 = 78 erwartete Rows je Target; die Additions bleiben ein separater Analysearm, kein 1:1-Vergleich mit Voll-n-Targets (D10.4d).
- Der Latenz-Tie-Break (3) steht in Spannung zu D4 (Free-Lane-Latenz ist kein Verdikt) und mischt Cross-Lane-Wall-Clock (CLI-Subprozess-Spawn vs. HTTP-Queue) — offengelegt, nicht still (D10.4b).
Multi-Call-Ordering v1 → v2
Die erste Ordering-Metrik (v1) war prompt-confoundet und wird nicht gerankt; erst v2 ist als Multi-Call-Fähigkeit lesbar. Beide bleiben sichtbar, das Delta steht verbatim aus dem Quell-Report.
| Target | Lane | Transport | ordering-v1 (confoundet) | ordering-v2 | Δ (v2−v1) |
|---|---|---|---|---|---|
| kimi-k2.7-code-cursor | cursor | cli | 100% (3) | 100% (5) | 0 pp |
| glm-5.2-high-cursor | cursor | cli | 83% (3) | 80% (5) | -3 pp |
| kimi-k3-openrouter | openrouter | http | 17% (3) | 60% (5) | +43 pp |
Souveränität
Beide Tabellen führen eine Spalte „Souveränität“. Sie beschreibt Herkunft und Hostbarkeit eines Targets, nicht seine Fähigkeit. Zugleich ist sie der primäre Tie-Break der Rangliste (Souveränität, dann Self-host, dann Latenz) und steht hier in genau dieser Reihenfolge. Unter jeder Bezeichnung steht die Kennung aus dem Quell-Report, damit sich die Tabellen direkt gegen die Kampagne abgleichen lassen.
- EU-Herkunfteu-origin
- Modell eines EU-Anbieters (Mistral).
- EU-hostbareu-hostable
- Offene Gewichte, in der EU auf eigener Infrastruktur betreibbar.
- CN open-weightcn-open
- Offene Gewichte, Anbieter mit CN-Herkunft.
- US closedus-closed
- Geschlossene Gewichte, US-Anbieter, nur über API.
Gemessen, aber nicht gerankt
Bei diesen Targets ist die kostenfreie Lane eingebrochen (oder war nie provisioniert), nicht das Modell. Sie bleiben sichtbar, damit die Lücke ehrlich ist und nicht still.
minimax-m3
- Headline
- 92%
- Infra-Fehler
- 53%
NVIDIA-Free-Lane-Überlast (Infra 53%) — kein Modell-Verdikt. Vollmessung folgt in Stage 4 (Self-host).
gemma-4-31b
- Headline
- 100%
- Infra-Fehler
- 63%
NVIDIA-Free-Lane-Überlast (Infra 63%) — kein Modell-Verdikt. Vollmessung folgt in Stage 4 (Self-host).
kimi-k2.6
- Headline
- nicht gemessen
- Infra-Fehler
- nicht gemessen
Für den Account nicht provisioniert — nicht gemessen. Vollmessung folgt in Stage 4 (Self-host).
Rohdaten
Jede der 5.215 gegradeten Attempt-Zeilen der Kampagne, auf zehn Spalten projiziert: target, case_id, k_idx, category, lane, transport, pass, infra_class, latency_ms, formatOk. Ein Export der append-only Shards, keine Neuberechnung — die Vorbehalte stehen im JSON-Umschlag und auf der Methodik-Seite.
Was diese Modelle kosten und wie viel Kontext sie fassen
Preis und Kontextfenster stehen hier neben der Messung, nicht darin. Die Tabelle listet Listenpreise und ausgewiesene Kontextlänge für die sieben Modelle, die wir über die OpenRouter-Lane gegradet haben — ein Ausschnitt der gemessenen Targets, nicht alle. Für die Cursor-, Claude-Code- und Codex-Lanes gibt es keinen Listenpreis, sie können hier grundsätzlich nicht erscheinen. Wer zwischen Kandidaten entscheiden muss, deren Messwerte sich nicht sauber trennen lassen, findet hier die zweite Dimension: was ein Aufruf kostet und wie viel Kontext dafür zur Verfügung steht.
- Abrufdatum
- Beobachtet
- –
Marktdaten, keine Messung
Diese Zahlen sind der Ausschnitt eines Routers: ausgewiesene Listenpreise und Limits, kein First-Party-API-Traffic und keine von uns gemessene Serving-Qualität. Sie sind der Stand des letzten Publish-Commits und werden nicht live abgefragt, können also seit dem Abrufdatum überholt sein. Und sie gehen in keine Rangfolge ein: kein Preis und keine Kontextlänge fließt in das Leaderboard, in einen Score oder in einen Rang.
| Modell | Eingabe (Prompt)USD / Mio. Token | Ausgabe (Completion)USD / Mio. Token | KontextfensterToken | Verlauf Eingabealt → neu |
|---|---|---|---|---|
| Gemini 3.5 Flash Litegoogle/gemini-3.5-flash-lite | 0,30 | 2,50 | 1 048 576 | |
| Gemini 3.6 Flashgoogle/gemini-3.6-flash | 0,75 | 3,75 | 1 048 576 | |
| Kimi K3moonshotai/kimi-k3 | 3,00 | 15,00 | 1 048 576 | |
| Laguna S 2.1poolside/laguna-s-2.1 | 0,09 | 0,18 | 1 048 576 | |
| Laguna S 2.1 (free)poolside/laguna-s-2.1:free | 0,00 | 0,00 | 262 144 | |
| Grok 4.5x-ai/grok-4.5 | 2,00 | 6,00 | 500 000 | |
| GLM 5.2z-ai/glm-5.2 | 1,19 | 3,74 | 1 048 576 |
Was andere messen, und warum es nicht dasselbe ist
Neben unserer Messung stehen hier die Zahlen, die Dritte zu denselben Modellen veröffentlichen. Sie stehen hier, weil sie oft zitiert werden und weil die Abweichung zu unserem Ergebnis der eigentliche Befund ist. Wer eine Entscheidung zu treffen hat, sieht hier beides nebeneinander und kann selbst beurteilen, wie weit die Zahlen auseinanderliegen.
- Abrufdatum
Fremdmessungen, nicht unsere Messung
Diese Zahlen stammen von Dritten. Wir haben sie nicht erhoben, nicht nachgerechnet und nicht geprüft. Jede Quelle misst etwas anderes: einen aggregierten Index über fremde Testsets, ein Elo aus Publikumsvergleichen, eine Trefferquote auf einem fremden Korpus. Keine davon misst, was wir messen, nämlich objektiv gegradetes Tool-Calling auf unserem eigenen Korpus, mit AST-Match auf Funktionsname, Argument-Schema und Werte. Eine Abweichung zwischen den Spalten ist deshalb kein Widerspruch, sondern der Normalfall. Die Zahlen sind der Stand des letzten Publish-Commits und werden nicht live abgefragt, sie können seit dem Abrufdatum überholt sein. Und sie gehen in keine Rangfolge ein: kein Index, kein Elo und keine fremde Trefferquote fließt in das Leaderboard, in einen Score, in einen Rang oder in einen Tie-Break.
Die Grafik stellt beides nebeneinander: waagrecht unser Headline-valid-pass, senkrecht der externe Index. Läge beidem dieselbe Fähigkeit auf derselben Skala zugrunde, müssten die Punkte einer Linie folgen. Sie tun es nicht.
Modelle, die wir in zwei Lanes gemessen haben, erscheinen zweimal: mit demselben externen Wert und zwei verschiedenen eigenen Werten. Der externe Index kennt die Lane nicht, in der ein Modell bei uns lief.
4 von 4 gerankten Targets haben einen externen Indexwert. Für die übrigen wird kein Punkt gezeichnet, sie stehen namentlich darunter. Eine Lücke ist keine Null.
Zahl für Zahl, je mit Quelle und Abrufdatum. Aufklappen zeigt zusätzlich die Herkunft jeder einzelnen Zahl und, wo die Quelle sie ausweist, die Werte je Kategorie.
| Modell | Unsere Messungvalid-pass ohne Ordering, Wilson-95%-CI | Agentic IndexFremdquelle: Artificial Analysis | Coding IndexFremdquelle: Artificial Analysis | Intelligence IndexFremdquelle: Artificial Analysis | |||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Kimi K3moonshotai/kimi-k3 |
| 50,1Artificial Analysis — Leaderboard der Quelle | 76,2Artificial Analysis — Leaderboard der Quelle | 57,1Artificial Analysis — Leaderboard der Quelle | |||||||||||||||||||||
| |||||||||||||||||||||||||
| Grok 4.5x-ai/grok-4.5 |
| 45,7Artificial Analysis — Leaderboard der Quelle | 72,4Artificial Analysis — Leaderboard der Quelle | 53,8Artificial Analysis — Leaderboard der Quelle | |||||||||||||||||||||
| |||||||||||||||||||||||||
| GLM 5.2z-ai/glm-5.2 |
| 43,1Artificial Analysis — Leaderboard der Quelle | 68,8Artificial Analysis — Leaderboard der Quelle | 51,1Artificial Analysis — Leaderboard der Quelle | |||||||||||||||||||||
| |||||||||||||||||||||||||