---
title: "GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning"
source: https://arxiv.org/abs/2607.26160
plattform: youtube
channel: export-arxiv-org-rss-cs-ai
duration_seconds: None
thema: Executable Declarative Skills
nutzen: "Architektur-Muster fuer regel-basierte, auditierbare, ohne Fine-Tuning aktualisierbare Aria-Skills mit LLM-Fusion."
umsetzungsidee: "Spike anlegen: Evaluieren, ob Arias Skill-System ausfuehrbare deklarative Regel-Funktionen (Compliance/Bewertung) mit LLM-Ranking-Fusion nach GuideSkill-Muster unterstuetzen sollte — inkl. Vergleich zu bestehender declarative-skills-Note und Bewertung des Evo-Loops (Labeling-Aufwand vs. Nutzen)."
prioritaet: P2
klassifikation: Spike
confidence: 0.68
status: aktiv
tags: [llm-agents, declarative-skills, executable-rules, guideline-grounding, model-agnostic, skill-evolution, clinical-reasoning, akp, video, auto-ingested]
date: 2026-08-01
akp_run: kar-74
---

# GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

**Channel:** export-arxiv-org-rss-cs-ai · **Dauer:** 0 min · **URL:** https://arxiv.org/abs/2607.26160

## Kernaussage
GuideSkill kompiliert klinische Leitlinien-Kriterien in ausfuehrbare Funktionen, die ordinale Diagnose-Scores zurueckgeben, und fusioniert diese mit LLM-Differentialdiagnosen. Der Evo-Ansatz verbessert die Makro-Accuracy um bis zu 18,49% gegenueber direkter Inferenz und steigert die Skill-Coverage von 56,5% auf 99,5% ohne Backbone-Update.

## 7-Punkt Praxisanalyse
### 1. Was koennen wir lernen?
Deklaratives Domain-Wissen (Guidelines/Regeln) als ausfuehrbare, versionierbare Skill-Funktionen zu kompilieren statt als RAG-Text zu retrieven — plus einen Evolutionsmechanismus, der aus Case-Outcome-Paaren fehlende Skills ergaenzt und bestehende verfeinert. Der Kern: Regel-Ausfuehrung + LLM-Ranking-Fusion, model-agnostisch.

### 2. Wie koennen wir es einsetzen?
Fuer KADi/MRR: harte Regeln (Compliance, Bewertungskriterien, SOPs) nicht in Prompts stopfen, sondern als deterministische Score-Funktionen kapseln, deren Output das LLM in seine Entscheidung fusioniert. Aria-Skills koennten analog aus wiederkehrenden Feedback-Mustern 'evolvieren'.

### 3. Konkreter Vorteil fuer Aria / KADi / Supplier Pulse / Workflow / Tools?
Trennt deterministische Regel-Logik von probabilistischem LLM-Reasoning → nachvollziehbar, auditierbar, ohne Fine-Tuning aktualisierbar. Genau das Muster, das die Cross-Ref-Note 'declarative-skills-for-ai-agents' schon andeutet.

### 4. Was koennen wir dadurch besser machen?
Das Fusions-Verfahren (wie genau LLM-Ranking und Skill-Scores kombiniert werden) ist der interessante Teil und im Abstract untertheoretisiert — hier lohnt Volltext-Lektuere. Ausserdem: Evo-Mechanismus braucht gelabelte Outcome-Paare, die Aria fuer eigene Domaene erst erzeugen muesste.

### 5. Lohnt sich die Umsetzung — warum?
Lohnt als Architektur-Muster, nicht als Copy-Paste. Die Idee 'executable declarative skills + evolution loop' ist direkt auf Arias Skill-System uebertragbar und deckt sich mit bereits vorhandenen Brain-Notes (hoher Cross-Ref-Score 2523/1322).

### 6. Naechste Schritte
Volltext ziehen, Fusions-Formel und Evo-Loop extrahieren, gegen bestehende Note 'declarative-skills-for-ai-agents' abgleichen, Spike zur Frage 'Executable-Skill-Pattern fuer Arias Feedback/Compliance-Regeln' anlegen.

## Kritik (Pflichtfeld)
Klinisches Domain-Paper, direkter Praxisbezug zu KADi/MRR ist indirekt (Muster, nicht Anwendung). Die Benchmark-Zahlen (13%/18% relativ) sind auf medizinische Diagnose-Datasets bezogen und nicht ohne Weiteres uebertragbar. Das Kernmuster 'declarative/executable skills' ist bei uns bereits durch eine bestehende Brain-Note abgedeckt (Cross-Ref) — Redundanzgefahr. Abstract verschweigt Kosten des Evo-Loops (Labeling-Aufwand, Overfitting auf Case-Patterns).

## Multi-Level-Challenge (inline, KAR-72)
**Devils-Advocate:** Es ist ein rein klinisches Paper ohne direkten KADi/MRR-Anwendungsfall, und das Kernmuster ist durch eine bestehende Brain-Note bereits abgedeckt — Aufwand fuer einen Spike koennte in reinem Doppel-Aufschrieb enden.

**Steel-Man:** Der Evolutionsmechanismus (Skills aus Outcome-Paaren automatisch ergaenzen/verfeinern) geht ueber die bestehende deklarative-Skills-Note hinaus und ist genau die fehlende Zutat, um Arias Skill-System selbstverbessernd zu machen.

**Synthese:** Refine — als leichten Spike promoten, aber eng gekoppelt an die bestehende declarative-skills-Note; Fokus ausschliesslich auf den Evo-Loop-Mehrwert, nicht auf das schon bekannte Executable-Skill-Grundmuster.

## Adversarial-Critic (separater Call, Cross-Model, KAR-747)
**Verdict:** refine · **Confidence:** 0.72 · **Halluzinations-Risiko:** low

**Urteil:** Faktisch sauber und selbstkritisch genug, aber der behauptete direkte Aria-Nutzen ist ueberdehnt und die Spike-Klassifikation ueberbewertet den Handlungsbedarf angesichts der bereits vorhandenen Note.

**Korrigierte Klassifikation:** Brain-Entry
**Schwaechen:**
- Der Cross-Ref-Score '2523/1322' ist im Abstract nicht erwaehnt und klingt wie eine interne Metadaten-Referenz, die nicht aus dem Transcript ableitbar ist — potenziell halluziniert oder aus einem anderen Kontext importiert.
- Die Praesentation der Zahlen (13.45% und 18.49%) ist korrekt aus dem Abstract uebernommen, aber das Wort 'relativ' bei 18.49% ist korrekt — gut. Dennoch wird nicht explizit klargestellt, dass es sich um relative Verbesserung handelt, was die Wirkung leicht ueberzeichnet.
- Der Praxisbezug zu Aria/KADi ist nicht tief begruendet: 'Compliance-Regeln als Skill-Funktionen' ist eine plausible Analogie, aber die Analyse behauptet eine direkte Uebertragbarkeit, die durch das rein klinische Paper nicht gestuetzt wird.
- Die Behauptung 'Genau das Muster, das die Cross-Ref-Note declarative-skills-for-ai-agents andeutet' ist extern und nicht aus dem Transcript ableitbar — reine Eigenreferenz des Analysesystems, keine Substanz aus dem Paper.
- Der Evo-Loop-Mehrwert wird als 'fehlende Zutat fuer selbstverbesserndes Skill-System' promoted, aber das setzt voraus, dass Aria ueberhaupt gelabelte Outcome-Paare erzeugen kann — dieser Aufwand wird zwar erwaehnt, aber im Steel-Man zu schnell weggewischt.
- Klassifikation 'Spike' ist vertretbar, aber angesichts der starken Ueberlappung mit einer bereits bestehenden Brain-Note koennte 'Brain-Entry' (reine Wissensablage, kein Aktionsbedarf) passender sein, da der inkrementelle Mehrwert gering ist.

## Cross-Reference (Brain-Match)
- [[2026-07-09-export-arxiv-org-rss-onnes-a-physics-grounded-multi-agent-llm]] (score 2523.619)
- [[2026-07-01-export-arxiv-org-rss-an-ai-agent-for-treatment-reasoning-over]] (score 1402.642)
- [[2026-06-09-export-arxiv-org-rss-declarative-skills-for-ai-agents-in-know]] (score 1322.734)

## Klassifikation: **Spike** · Prioritaet **P2** · Confidence **0.68**

---
*Auto-generated by aria-akp-deep.py · cost $0.2005 · 2026-08-01T04:18:16.119996+00:00*