Zum Inhalt springen
Agentic Model Bakeoff · Stage 1

Welches Modell ruft Tools zuverlässig auf?

Alle 21 gemessenen Targets rufen Tools gleich zuverlässig auf: keines von 210 Modellpaaren ist auf der Hauptmetrik unterscheidbar. Unterscheiden tut sie erst die Gegenprobe — ob sie nachfragen, wenn ein Pflicht-Argument fehlt, oder es einfach erfinden.

Was gemessen wurde
21 Targets · 45 Cases
2 356 gegradete Records über 5 Zugangs-Lanes, Stand 17.07.2026. AST-Match auf Funktionsname, Argument-Schema und Werte. Kein LLM-Judge.
Wie trennscharf
0 von 210
Modellpaare sind auf der Hauptmetrik unterscheidbar. Bei n=35 bräuchte es 20 Prozentpunkte Abstand — das ganze Feld spannt 15.
Was sich trotzdem trennt
0 bis 100 %
Abstain-Disziplin, also Nachfragen statt Raten: 28 von 210 Paaren sind unterscheidbar — dieselbe Regel, ein anderes Ergebnis.
Was den Vergleich kippt
0 % vs. 45 %
Derselbe Modellname, andere Zugangs-Lane. Dieselbe Lane fünf Tage später: 0 % → 70 %.
Wie belastbar
n = 10 bis 35
Viability-Tier, kein Gate-Verdikt. So viele Cases pro Target; belastbare Gate-Aussagen brauchen 200 bis 400 Cases.

Tool-Calling: das Feld ist ein Gleichstand

Hauptmetrik ist valid-pass ohne die Ordering-Kategorien: der Anteil der Cases, in denen der Tool-Call nach Funktionsname, Argument-Schema und Werten exakt stimmt. Jede Zeile ist ein Modell in einer Zugangs-Lane, der Punkt der Messwert, der Balken sein 95-%-Wilson-Intervall — kurze Balken bedeuten viele Cases, lange wenige.

Alle 21 Targets liegen in EINEM CI-Tie-Cluster, die Rangfolge ist Tie-Break-Präsentation, kein Capability-Verdikt.

Tool-Calling: Anteil bestandener Cases je Target, mit 95-%-Wilson-Intervall21 Targets, absteigend nach Messwert, ohne Platzziffern. Jeder Balken ist ein 95-%-Wilson-Intervall. Alle 21 Intervalle überschneiden sich im Bereich 90 bis 95 Prozent, hinterlegt als graues Band. Von 210 Modellpaaren trennt sich 0. Die Achse beginnt bei 50 Prozent.alle 21 Intervalle überlappen hier: 90–95 %5060708090100Anteil bestandener Cases (%) · Punkt = Messwert, Balken = 95-%-Wilson-Intervallgpt-oss-120b-nvidian=35100 %[90100]EU-hostbarnemotron-3-ultra-nvidian=35100 %[90100]EU-hostbarglm-5.2-nvidian=34100 %[90100]CN open-weightglm-5.2-max-cursorn=17100 %[82100]CN open-weightgrok-4.5-cursorn=17100 %[82100]US closeddeepseek-v4-pro-nvidian=12100 %[76100]CN open-weightdeepseek-v4-flash-nvidian=3599 %[88100]CN open-weightkimi-k3-openroutern=1797 %[77100]CN open-weightgpt-5.6-codexn=3596 %[8399]US closedopus-4.8-ccn=3596 %[8399]US closedsonnet-5-ccn=3596 %[8399]US closedmistral-large-3-nvidian=3595 %[8299]EU-Herkunftmistral-medium-3.5-nvidian=3594 %[8198]EU-Herkunftcomposer-2.5-cursorn=1794 %[7399]US closedgemini-3.5-flash-cursorn=1794 %[7399]US closedgpt-5.6-terra-high-cursorn=1794 %[7399]US closedkimi-k2.7-code-cursorn=1794 %[7399]CN open-weightmistral-small-4-nvidian=3591 %[7897]EU-Herkunftqwen3.5-397b-nvidian=3491 %[7797]CN open-weightgrok-4.5-openroutern=1090 %[6098]US closedgpt-5.6-luna-high-cursorn=1785 %[6295]US closed
Achse ab 50 %, nicht ab 0 %: In einem Punktdiagramm kodiert die Position, nicht die Länge — die Null-Basislinie ist nicht erforderlich, und die Vergrößerung arbeitet gegen die eigene These. Selbst doppelt aufgelöst überlappen alle 21 Intervalle im grau hinterlegten Bereich 9095 %.

Abstain-Disziplin: hier trennt sich das Feld

Dieselbe Darstellung, dieselben Modelle, andere Frage: 14 Trap-Cases prüfen, ob ein Modell nachfragt statt zu raten, wenn ein Pflicht-Argument fehlt. Hier trennen sich 28 von 210 Paaren — nach genau derselben Regel, die oben 0 ergibt. Die Target-Menge ist bewusst nicht deckungsgleich mit der oberen: manche Targets liefen ohne Trap-Lauf, eines lief nur hier.

Abstain-Disziplin: Anteil korrekt zurückgefragter Trap-Cases je Target, mit 95-%-Wilson-Intervall21 Targets, absteigend nach Messwert, ohne Platzziffern. Anteil der Fälle, in denen ein fehlendes Pflicht-Argument korrekt erfragt statt erfunden wurde. Die Spannweite reicht von 0 bis 100 Prozent. Von 210 Modellpaaren trennen sich 28. Die Achse beginnt bei 0 Prozent.0255075100Anteil korrekt zurückgefragter Trap-Cases (%) · Punkt = Messwert, Balken = 95-%-Wilson-Intervallminimax-m3-nvidian=10100 %[72100]CN open-weightnemotron-3-ultra-nvidian=10100 %[72100]EU-hostbarglm-5.2-nvidian=1090 %[6098]CN open-weightgpt-oss-120b-nvidian=1090 %[6098]EU-hostbardeepseek-v4-flash-nvidian=1088 %[6098]CN open-weightmistral-large-3-nvidian=1081 %[4994]EU-Herkunftglm-5.2-max-cursorn=1075 %[4994]CN open-weightmistral-medium-3.5-nvidian=1070 %[4089]EU-Herkunftgemini-3.5-flash-cursorn=1065 %[4089]US closedgpt-5.6-codexn=1065 %[4089]US closedgpt-5.6-luna-high-cursorn=1065 %[4089]US closedgpt-5.6-terra-high-cursorn=1065 %[4089]US closedkimi-k2.7-code-cursorn=1060 %[3183]CN open-weightkimi-k3-openroutern=1060 %[3183]CN open-weightqwen3.5-397b-nvidian=1047 %[2476]CN open-weightgrok-4.5-cursorn=1045 %[2476]US closedcomposer-2.5-cursorn=1040 %[1769]US closedsonnet-5-ccn=1029 %[1160]US closedopus-4.8-ccn=1020 %[651]US closedmistral-small-4-nvidian=1019 %[651]EU-Herkunftgrok-4.5-openroutern=100 %[028]US closed
Achse ab 0 %, weil die Null hier eine echte Beobachtung ist: grok-4.5-openrouter hat in keinem von 10 Versuchen nachgefragt. Und die trennbaren Paare sind die Enden, nicht die Mitte — mistral-medium-3.5-nvidia (70 % [40–89]) und gpt-5.6-codex (65 % [40–89]) trennen sich nicht.

Der wichtigste Einzelbefund: der Kanal zählt, nicht nur das Modell

Dasselbe Modell über zwei Zugangswege: grok-4.5-openrouter erfand in 20 von 20 Trap-Cases ein fehlendes Pflicht-Argument; grok-4.5-cursor fragte in 9 von 20 Fällen nach — und lieferte zugleich den saubersten Suite-Lauf des Felds. Fünf Tage später lag dieselbe OpenRouter-Lane bei 70 %, ohne Modell- oder Harness-Änderung. Ohne Angabe von Lane und Messzeitpunkt ist ein Modell-Verdikt unvollständig.

Einschränkungen

  • Viability-Tier, kein Gate-Verdikt: n pro Target meist unter 30 Cases; belastbare Gate-Aussagen brauchen 200 bis 400 Cases (geplant).
  • Budget-Lanes (Cursor, OpenRouter) liefen auf pre-registrierten Subsets (n=20 bzw. 25) mit eigenem CI; kein 1:1-Vergleich mit Voll-n-Targets.
  • CLI-Lanes können temperature/seed nicht pinnen (beobachtete Flake-Rate bis 11%).
  • 6 der 14 Trap-Cases sind Gold-Trust-geflaggt (viele Modelle failen identisch, Formulierungs-Review läuft); deshalb die Doppel-Ausweisung mit/ohne Flags.
  • Latenz- und tok/s-Werte sind lane-inklusive Beobachtungen, keine Serving-Verdikte (die kommen aus Stage 4).

Stand der Daten: · Fast alles lief auf marginal kostenfreien Lanes (lokal, NVIDIA-Free, Subscriptions, Firmen-Guthaben); der einzige metered Lauf (Kimi K3 via OpenRouter, 78 Records) kostete rund 0,42 EUR. Harness: pre-registriertes RUNBOOK, append-only JSONL-Shards, deterministische Report-Generierung; ein Dritter kann den Aufbau 1:1 nachstellen (Cases, Grader-Tests, Provenienz-Pins dokumentiert). Quell-Harness liegt derzeit in einem privaten Repo; bei Publikation können Cases + Grader + RUNBOOK als sanitized Fork veröffentlicht werden.