---
title: "PACE: A Proxy for Agentic Capability Evaluation"
source: https://arxiv.org/abs/2607.02032v1
plattform: youtube
channel: cs.CL
duration_seconds: None
thema: Agentic Benchmark Proxy / Cost-Efficient Model Evaluation
nutzen: "Zeigt eine Methode, agentische Modell-Rankings zu <1% der Kosten vorherzusagen — relevant fuer guenstiges Modell-Routing im MRR/KADi-Stack."
umsetzungsidee: ""
prioritaet: P2
klassifikation: Brain-Entry
confidence: 0.72
status: aktiv
tags: [agentic-evaluation, benchmark-proxy, model-selection, cost-efficiency, llm-routing, regression, swe-bench, gaia, akp, video, auto-ingested]
date: 2026-07-04
akp_run: kar-74
---

# PACE: A Proxy for Agentic Capability Evaluation

**Channel:** cs.CL · **Dauer:** 0 min · **URL:** https://arxiv.org/abs/2607.02032v1

## Kernaussage
PACE ist ein Framework, das teure agentische LLM-Benchmarks (SWE-Bench, GAIA) durch ein kleines, sorgfaeltig kuratiertes Subset guenstiger non-agentischer Evaluationsinstanzen approximiert und dabei via Regression agentische Scores mit <4% MAE und ~85% Ranking-Accuracy zu <1% der Kosten vorhersagt.

## 7-Punkt Praxisanalyse
### 1. Was koennen wir lernen?
Agentische Performance laesst sich statistisch aus atomaren Capability-Tests vorhersagen. Zwei Selektionsstrategien (target-relevance local + globally informative global) kuratieren ein Proxy-Set, auf das eine Regression gefittet wird. LOOCV, Spearman und pairwise-ranking als Validierungsmetriken.

### 2. Wie koennen wir es einsetzen?
Bei Modell-Auswahl/Routing im MRR-Stack koennte man teure End-to-End-Agent-Evals durch ein billiges Proxy-Benchmark ersetzen, um Kandidatenmodelle vorzufiltern, bevor volle agentische Tests laufen.

### 3. Konkreter Vorteil fuer Aria / KADi / Supplier Pulse / Workflow / Tools?
Schnelleres, guenstigeres Modell-Benchmarking fuer Aria/KADi-Agenten. Statt tagelanger Agent-Runs koennte eine Proxy-Suite in Minuten Rankings liefern und CI-Kosten drastisch senken.

### 4. Was koennen wir dadurch besser machen?
PACE braucht existierende agentische Ground-Truth zum Fitten der Regression pro Ziel-Benchmark. Man koennte das um domaenenspezifische KADi-Tasks erweitern und die Regression periodisch nachziehen, um Drift bei neuen Modellgenerationen zu vermeiden.

### 5. Lohnt sich die Umsetzung — warum?
Wenn regelmaessig Modelle evaluiert/geroutet werden, ist der Kostenhebel (>99% Ersparnis) enorm. Fuer einmalige Entscheidungen lohnt der Setup-Aufwand des Proxy-Fittings kaum.

### 6. Naechste Schritte
Paper-Details zur Instanz-Selektion lesen, pruefen ob die 19 non-agentischen Benchmarks fuer unsere Use-Cases relevant sind, und einen Mini-Spike zur Uebertragbarkeit auf interne Agent-Tasks planen.

## Kritik (Pflichtfeld)
Der Kernansatz — teure Benchmarks durch billige Proxies via Regression vorherzusagen — ist konzeptionell nicht neu (vgl. tinyBenchmarks, IRT-basierte Benchmark-Kompression, Efficient-Benchmarking-Literatur). Die Regression setzt voraus, dass man die teuren Ground-Truth-Scores ueberhaupt einmal erhebt, was den Kaltstart nicht loest. Generalisierung auf out-of-distribution Modelle/Benchmarks bleibt fragil; 14 Modelle sind eine schmale Fit-Basis, Overfitting-Risiko bei LOOCV mit so wenigen Punkten ist real. Cross-Reference zu 2026-06-18-a-framework-for-evaluating-agentic-skill deutet auf thematische Ueberlappung im Brain hin.

## Multi-Level-Challenge (inline, KAR-72)
**Devils-Advocate:** Der Proxy braucht bereits erhobene teure Ground-Truth pro Ziel-Benchmark und einen wackeligen Fit auf nur 14 Modellen — fuer unsere Kadenz an Modell-Entscheidungen amortisiert sich der Setup-Aufwand womoeglich nie und wir verlassen uns auf eine potenziell nicht generalisierende Korrelation.

**Steel-Man:** Wenn wir haeufig Modelle vorfiltern/routen, ist eine 99%-Kostenreduktion bei ~85% Ranking-Accuracy ein enormer Effizienzhebel, der teure Agent-Evals auf die Endauswahl beschraenkt.

**Synthese:** Refine: Als Brain-Entry festhalten und bei konkretem Bedarf an regelmaessigem Modell-Benchmarking einen Spike zur Uebertragbarkeit auf interne Tasks nachschieben — jetzt kein eigenstaendiges Issue.

## Adversarial-Critic (separater Call, Cross-Model, KAR-747)
**Verdict:** keep · **Confidence:** 0.78 · **Halluzinations-Risiko:** low

**Urteil:** Akkurate, ehrlich-kritische Zusammenfassung eines soliden Papers mit realen Schwaechen korrekt identifiziert — Brain-Entry P2 ist die richtige Einordnung, Transfer-Huerde auf KADi haette staerker gewichtet werden sollen.


**Schwaechen:**
- Die Aussage '14 Modelle sind eine schmale Fit-Basis' ist korrekt kritisiert, aber das Overfitting-Risiko bei LOOCV wird im Transcript selbst nicht adressiert — die Analyse extrapoliert hier berechtigterweise, aber das sollte als Eigenleistung des Analysten markiert sein, nicht als Transcript-Inhalt.
- Der Kaltstart-Einwand (Ground-Truth muss einmalig erhoben werden) ist valide und steht im Transcript implizit drin, aber die Analyse haette staerker betonen koennen, dass dies den Hauptnutzen fuer Ad-hoc-Entscheider faktisch eliminiert.
- Cross-Reference zu '2026-06-18-a-framework-for-evaluating-agentic-skill' ist nicht im Transcript begruendet — das ist eine externe Annahme des Generator-Modells ueber den eigenen Brain-Kontext, die nicht geprueft werden kann.
- Der behauptete Vorteil fuer Aria/KADi ('Statt tagelanger Agent-Runs koennte eine Proxy-Suite in Minuten Rankings liefern') ist eine plausible Extrapolation, aber PACE-Bench ist auf SWE-Bench/GAIA gefittet — Transfer auf proprietary KADi-Tasks erfordert eigenes Fitting und ist nicht trivial. Das wird zwar in '4_besser_machen' erwaehnt, aber im 'nutzen'-Feld unterspezifiziert.
- Confidence 0.72 ist angemessen und nicht inflationiert — die Selbsteinschaetzung des Generators ist hier ehrlich.

## Cross-Reference (Brain-Match)
- [[2026-07-03-cscl-conversable-complexity-agentic-llm-colle]] (score 95.732)
- [[2026-06-18-cscl-a-framework-for-evaluating-agentic-skill]] (score 73.62)
- [[2026-07-03-cscl-multi-turn-agentic-scientific-literature]] (score 71.467)

## Klassifikation: **Brain-Entry** · Prioritaet **P2** · Confidence **0.72**

---
*Auto-generated by aria-akp-deep.py · cost $0.1838 · 2026-07-04T04:02:31.279611+00:00*