---
title: "Inside Typeform's AI Agent Stack"
source: https://www.youtube.com/watch?v=t99qbVBVGmg
plattform: youtube
channel: arizeai
duration_seconds: 501
thema: llm-evaluation-as-product
nutzen: "Impuls fuer systematische Eval von Arias eigenen LLM-Pipelines (Triage, Video-Analyse) mit Goldset und Drift-Check statt nur self-rated confidence."
umsetzungsidee: "Skill-Update '.claude/skills/llm-eval-discipline' oder neuer Skill: Goldset-Pattern fuer Aria-Outputs (Brain-Triage, Video-Deep-Inspect). Inkl. Template fuer Goldset-Files (input -> expected_classification/priority) und einfaches Regression-Skript."
prioritaet: P2
klassifikation: Skill
confidence: 0.72
status: aktiv
linear: KAR-483
tags: [llm-eval, observability, agent-engineering, arize, typeform, product-quality, aria-self-eval, akp, video, auto-ingested]
date: 2026-05-12
akp_run: kar-74
---

# Inside Typeform's AI Agent Stack

**Channel:** arizeai · **Dauer:** 8 min · **URL:** https://www.youtube.com/watch?v=t99qbVBVGmg

## Kernaussage
Typeform behandelt Eval von GenAI-Features als kontinuierlichen Produktbestandteil (nicht als One-off), mit cross-funktionaler Beteiligung (PM, Eng, Design) und Fokus auf kleine, gezielte Eval-Sets statt Edge-Case-Overengineering. Arize wird fuer LLM-Observability/Tracing eingesetzt.

## 7-Punkt Praxisanalyse
### 1. Was koennen wir lernen?
Eval ist Produktbestandteil, nicht Backend-Task. Klein anfangen mit wenigen Testfaellen, iterieren, Edge-Cases bewusst spaeter. Subjektives Feedback in objektive Signale uebersetzen. Agent Engineer als end-to-end Rolle (Ideation -> Guard Rails -> Eval).

### 2. Wie koennen wir es einsetzen?
Fuer KADi/MRR: Eval-Pipeline nicht als Sprint-Aufgabe sondern als Living-Doc/Living-TestSet behandeln. Aria sollte fuer jedes neue LLM-Feature (z.B. Brain-Triage, Video-Analyse) ein kleines kuratiertes Eval-Set anlegen, das mitwaechst.

### 3. Konkreter Vorteil fuer Aria / KADi / Supplier Pulse / Workflow / Tools?
Aria betreibt selbst LLM-Pipelines (Brain-Triage, Video-Deep-Inspect, KAR-Issue-Vorschlaege). Ein leichtes 'Eval-as-Product'-Pattern wuerde Halluzinationen/Drift sichtbar machen und Vertrauen in Auto-Promote (confidence>=0.85) empirisch begruenden statt nur self-rated.

### 4. Was koennen wir dadurch besser machen?
Typeform bleibt vage zu konkreten Metriken/Eval-Methoden (LLM-as-judge? Human-in-loop? Regression-Sets?). Aria kann konkreter werden: definierte Goldset-Files in Brain, automatische Regression bei Prompt-Changes, dokumentierte False-Positive-Rate fuer Triage.

### 5. Lohnt sich die Umsetzung — warum?
Validierung bestehender Annahmen (Eval-first, Klein-anfangen) plus konkreter Impuls: aktuell hat Aria keine systematische Eval ihrer eigenen Outputs (Triage-Scores, Video-Klassifikationen). Das ist eine reale Luecke.

### 6. Naechste Schritte
1) Goldset fuer Video-Deep-Inspect (10-20 manuell gelabelte Videos mit erwarteter Klassifikation/Prioritaet). 2) Drift-Check Skript: Aria-Output vs Goldset bei Prompt-Aenderungen. 3) Confidence-Kalibrierung pruefen (sagt 0.9 wirklich 90% Korrektheit?).

## Kritik (Pflichtfeld)
Sehr vendor-pitchig (Arize-Lobeshymne am Ende), wenig technische Tiefe. Keine konkreten Metriken, keine Beispiele fuer Eval-Cases, keine Zahlen zu Verbesserungen. Die Kern-Insights ('Eval ist kontinuierlich', 'klein starten') sind in der bestehenden Brain-Note 2026-05-12-arizeai-how-to-test-ai-agents-with-traces-evals-.md (score 74) vermutlich schon abgedeckt. Hoher Redundanz-Verdacht mit den drei Cross-Refs - alles arizeai-Content.

## Multi-Level-Challenge (inline, KAR-72)
**Devils-Advocate:** Aria-Pipelines sind low-stakes (Brain-Triage, kein Prod-User-Facing). Ein formales Eval-Framework ist Overhead, der das eigene Anti-Pattern 'overbuilding before learning' aus dem Video selbst verletzt.

**Steel-Man:** Genau weil Aria autonom Issues vorschlaegt und confidence-basiert auto-promotet, braucht es Kalibrierungs-Evidenz. Ohne Goldset ist confidence=0.85 ein Bauchgefuehl-Gate, kein Qualitaets-Gate.

**Synthese:** Refine: Kein neuer Skill jetzt, aber als Brain-Entry festhalten und in 1-2 Wochen pruefen, ob Triage/Video-Pipeline tatsaechlich Fehler-Patterns zeigt, die ein Goldset rechtfertigen. Erst Daten, dann Skill.

## Cross-Reference (Brain-Match)
- [[2026-05-12-arizeai-how-to-test-ai-agents-with-traces-evals-]] (score 74.226)
- [[2026-05-12-arizeai-ai-agent-debugging-four-lessons-from-shi]] (score 61.619)
- [[2026-05-12-arizeai-building-the-next-generation-of-ai-agent]] (score 57.583)

## Klassifikation: **Skill** · Prioritaet **P2** · Confidence **0.72**


## Visual Insights

- Arize-branded moderator slide zeigt exakte Interview-Frage zu 'agent engineer' role (Frame 6)

**Transcript-Ergaenzung:** Alle 8 Frames sind Speaker-Closeups oder ein generischer Arize-Moderationsslide ohne Code, Diagramme oder Daten. Der einzige Slide (Frame 6) zeigt lediglich die Interviewfrage 'What does the agent engineer role look like there — skills, interfaces owned, and decision rights?' — inhaltlich vollständig im Transcript abgedeckt. Kein visueller Mehrwert über das Transcript hinaus.

*Auto-generated by aria-akp-vision.py (claude-sonnet-4-6, cost $0.0196, 2026-05-25T04:20:42.532049+00:00)*

---
*Auto-generated by aria-akp-deep.py · cost $0.1980 · 2026-05-12T01:49:49.228600+00:00*