Alle 21 gemessenen Targets rufen Tools gleich zuverlässig auf: keines von 210 Modellpaaren ist auf der Hauptmetrik unterscheidbar. Unterscheiden tut sie erst die Gegenprobe — ob sie nachfragen, wenn ein Pflicht-Argument fehlt, oder es einfach erfinden.
Was gemessen wurde
21 Targets · 45 Cases
2 356 gegradete Records über 5 Zugangs-Lanes, Stand 17.07.2026. AST-Match auf Funktionsname, Argument-Schema und Werte. Kein LLM-Judge.
Wie trennscharf
0 von 210
Modellpaare sind auf der Hauptmetrik unterscheidbar. Bei n=35 bräuchte es 20 Prozentpunkte Abstand — das ganze Feld spannt 15.
Was sich trotzdem trennt
0 bis 100 %
Abstain-Disziplin, also Nachfragen statt Raten: 28 von 210 Paaren sind unterscheidbar — dieselbe Regel, ein anderes Ergebnis.
Was den Vergleich kippt
0 % vs. 45 %
Derselbe Modellname, andere Zugangs-Lane. Dieselbe Lane fünf Tage später: 0 % → 70 %.
Wie belastbar
n = 10 bis 35
Viability-Tier, kein Gate-Verdikt. So viele Cases pro Target; belastbare Gate-Aussagen brauchen 200 bis 400 Cases.
Tool-Calling: das Feld ist ein Gleichstand
Hauptmetrik ist valid-pass ohne die Ordering-Kategorien: der Anteil der Cases, in denen der Tool-Call nach Funktionsname, Argument-Schema und Werten exakt stimmt. Jede Zeile ist ein Modell in einer Zugangs-Lane, der Punkt der Messwert, der Balken sein 95-%-Wilson-Intervall — kurze Balken bedeuten viele Cases, lange wenige.
Alle 21 Targets liegen in EINEM CI-Tie-Cluster, die Rangfolge ist Tie-Break-Präsentation, kein Capability-Verdikt.
Achse ab 50 %, nicht ab 0 %: In einem Punktdiagramm kodiert die Position, nicht die Länge — die Null-Basislinie ist nicht erforderlich, und die Vergrößerung arbeitet gegen die eigene These. Selbst doppelt aufgelöst überlappen alle 21 Intervalle im grau hinterlegten Bereich 90–95 %.
Abstain-Disziplin: hier trennt sich das Feld
Dieselbe Darstellung, dieselben Modelle, andere Frage: 14 Trap-Cases prüfen, ob ein Modell nachfragt statt zu raten, wenn ein Pflicht-Argument fehlt. Hier trennen sich 28 von 210 Paaren — nach genau derselben Regel, die oben 0 ergibt. Die Target-Menge ist bewusst nicht deckungsgleich mit der oberen: manche Targets liefen ohne Trap-Lauf, eines lief nur hier.
Achse ab 0 %, weil die Null hier eine echte Beobachtung ist: grok-4.5-openrouter hat in keinem von 10 Versuchen nachgefragt. Und die trennbaren Paare sind die Enden, nicht die Mitte — mistral-medium-3.5-nvidia (70 % [40–89]) und gpt-5.6-codex (65 % [40–89]) trennen sich nicht.
Der wichtigste Einzelbefund: der Kanal zählt, nicht nur das Modell
Dasselbe Modell über zwei Zugangswege: grok-4.5-openrouter erfand in 20 von 20 Trap-Cases ein fehlendes Pflicht-Argument; grok-4.5-cursor fragte in 9 von 20 Fällen nach — und lieferte zugleich den saubersten Suite-Lauf des Felds. Fünf Tage später lag dieselbe OpenRouter-Lane bei 70 %, ohne Modell- oder Harness-Änderung. Ohne Angabe von Lane und Messzeitpunkt ist ein Modell-Verdikt unvollständig.
Einschränkungen
Viability-Tier, kein Gate-Verdikt: n pro Target meist unter 30 Cases; belastbare Gate-Aussagen brauchen 200 bis 400 Cases (geplant).
Budget-Lanes (Cursor, OpenRouter) liefen auf pre-registrierten Subsets (n=20 bzw. 25) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.
CLI-Lanes können temperature/seed nicht pinnen (beobachtete Flake-Rate bis 11%).
6 der 14 Trap-Cases sind Gold-Trust-geflaggt (viele Modelle failen identisch, Formulierungs-Review läuft); deshalb die Doppel-Ausweisung mit/ohne Flags.
Latenz- und tok/s-Werte sind lane-inklusive Beobachtungen, keine Serving-Verdikte (die kommen aus Stage 4).
Stand der Daten: · Fast alles lief auf marginal kostenfreien Lanes (lokal, NVIDIA-Free, Subscriptions, Firmen-Guthaben); der einzige metered Lauf (Kimi K3 via OpenRouter, 78 Records) kostete rund 0,42 EUR. Harness: pre-registriertes RUNBOOK, append-only JSONL-Shards, deterministische Report-Generierung; ein Dritter kann den Aufbau 1:1 nachstellen (Cases, Grader-Tests, Provenienz-Pins dokumentiert). Quell-Harness liegt derzeit in einem privaten Repo; bei Publikation können Cases + Grader + RUNBOOK als sanitized Fork veröffentlicht werden.