{
  "video_id": "JsCCrBF7F1g",
  "channel_slug": "aidotengineer",
  "channel_handle": "aidotengineer",
  "title": "LLM Observability, Evaluation, Experimentation Platform — Dat Ngo, Arize",
  "duration_seconds": 992.0,
  "url": "https://www.youtube.com/watch?v=JsCCrBF7F1g",
  "upload_date": "",
  "transcript": "[Musik]\nOkay, ich wusste nicht, ob es da eine\nZwischensequenz gibt, aber okay, also wirklich schön,\neuch alle kennenzulernen.  Mein Name ist Dat.\nIch arbeite bei Arize AI, daher werde ich kurz darüber sprechen,\nwas das ist.\nEin bisschen über mich und was ich\nheute eigentlich mitteilen möchte:\nIch arbeite sehr intensiv in diesem Bereich.\nIch bin KI-Architekt.  Ich arbeite mit vielen\nder größten Unternehmen\nweltweit zusammen, um über\nDinge wie Beobachtbarkeit, Evaluierung und\nExperimente zu sprechen, aber im Grunde geht es doch nur darum, wie\nman KI zum Funktionieren bringt, richtig?  Also,\nich gebe eine Menge Token\nin diesem Bereich aus.  Dies ist also der\nletzte OpenAI DevDay.  Ich glaube, ich habe\nletztes Jahr ungefähr zwischen 100 Milliarden und 1 Billion Token erreicht.  Also, ich genieße es, einfach mal die Atmosphäre auf mich wirken zu lassen\n.  Aber ich\nkenne den Raum wirklich sehr, sehr gut.  Wir\narbeiten mit einigen der weltweit\ngrößten Unternehmen und Konzerne zusammen.\nWir können also ihre Transformation in\ndiesen Raum miterleben.\nUnd eigentlich wollte ich heute darüber sprechen, was\nich in der\nBranche sehe.  Ich denke also, dass wir als Unternehmen eine ganz\nbesondere Perspektive haben\n.\nWir bekommen also zu sehen, was jedes Team\nentwickelt, wie es vorgeht, welche\ngrößten Probleme dabei auftreten\nund wie die Teams versuchen,\ndiese Probleme zu lösen.  Wenn ich also\nwirklich auf den Punkt bringen müsste, was wir\ntun, sozusagen in Kürze, dann sind\nes im Grunde diese drei Dinge.\nVielleicht per Handzeichen, etwa: Wer\nbaut Agenten, wer baut Agenten,\nwer produziert Agenten, wer\nbaut Geschirre, und wer hat keine Ahnung,\nwas ein Geschirr ist?  Okay, uns geht's allen ganz gut, wir sind\nalle ziemlich durchgeknallt, also ist das\ngut.\nWissen Sie, ich finde es wirklich witzig, dass sich der\nBereich der künstlichen Intelligenz im Grunde\nwie neu erfundene Software anfühlt.\nEs sind im Grunde die gleichen Muster,\nnur vielleicht mit einer anderen Note\n.  Und es fühlt sich wirklich wie\nMagie an, aber es ist keine Magie, oder?  Das ist\nalles nur Ingenieurskunst.  Also,\nwir werden heute eigentlich nur drei\nDinge behandeln.  Das erste ist die Beobachtbarkeit,\ndie die Frage beantwortet,\nwas in dem von mir\nerstellten System passiert und wie das aussieht, sei es in Form\neines Harness oder eines Agenten.  Dann kommen\nwir zur Auswertung.  Evaluierungen sind\neinfach die Frage, wie ich\nin irgendeiner Form ein Signal aus meinen Systemen ableite, richtig?\nUnd wenn wir dann darüber sprechen, wie wir\nin dieser neuen,\nnicht-deterministischen Welt Verbesserungen erzielen,\nwerden Sie feststellen, dass Sie, wenn Sie etwas tun, das\nSie als\nLösung wahrnehmen, und das Problem beheben, von dem Sie\ndachten, Sie hätten es behoben, möglicherweise\nzwei oder drei\nRegressionen verursacht haben, von denen Sie nichts wussten\n.  Und so sprechen wir, wie in unserer Welt,\nüber Beobachtbarkeit, richtig?\nAlles, was wir tun – und darauf sind\nwir besonders stolz –,\nist ein wirklich starkes Vorbild für\nIngenieure. Aber\nalles, was wir tun, basiert auf offener\nTelemetrie.  Es spielt also keine Rolle,\nwelchen genauen Typ von\nHarness-Agent-Modellkonfiguration\nSie haben.  Die gute Nachricht ist, dass\nwir als Otel-Unternehmen für viele dieser Anwendungsfälle bestens gerüstet sind\n.  Ob es sich nun um einen\nAuto-Instrumenter handelt, falls Sie wissen, was das\nist, im Grunde fügen Sie eine\nCodezeile hinzu, und diese eine Codezeile wird im\nGrunde sehen, was\nin diesem bestimmten Framework oder\nSDK passiert,\noffene Telemetrie-Traces und Spans erstellen\nund diese Ansichten\nhier erzeugen.  Wenn Sie also schon einmal eine Ablaufverfolgung\noder einen Ablaufabschnitt gesehen haben, handelt es sich im Grunde um das Prüfprotokoll darüber, was\nmein Agent getan hat.  Denn wir wissen jetzt,\ndass der Code keine Agenten oder\nHarnesses prüft, sondern das übernimmt die Telemetrie\n.  Traces sind also ein wichtiger und\ngrundlegender Bestandteil der Beobachtbarkeit.   Es\ngibt jedoch noch viele andere\nAspekte der Beobachtbarkeit, die Sie\nneben Traces und\nSpans berücksichtigen sollten.\nSie können auch an Sitzungen denken.  Ich\nweiß nicht, ob jemand von Ihnen die\nvor zwei Tagen erschienene Studie von Anthropic über Managed Agents gelesen hat.  Echt eine tolle\nLektüre.\nAber Sessions ist ein anderes Thema, das mit einem ähnlichen\nZustand zu tun hat.  Was sind also die wechselseitigen\nGespräche, welche\nZustände finden\nzwischen den einzelnen\nDenkprozessen statt?\nFür viele Mitarbeiter im Unternehmen\nkönnte es sinnvoll sein, am Ende Folgendes zu verwenden:\nMir ist bewusst, dass dies nicht ganz einfach zu erkennen ist,\ndaher wechsle ich in den\nhellen Modus.\nJa, das trifft auf viele Leute zu, tut mir leid.   Ja\n.\nViele Leute\nwürden gerne verstehen, was genau diese\nHin- und\nHergespräche sind.\nDas wird also so etwas wie eine Sitzung sein.   Es geht also darum:\n„Hey, was sind das für Hin-\nund Hergespräche, die da geführt werden\n?“  Großartig.\nNun, die\nLeute bewerten diese gerne.  In\nUnternehmen sieht man daher oft Leute, die sagen:\n„Mir ist die\ntiefere Ebene nicht so wichtig, Hauptsache, der Agent hat diesen oder jenen\nToolaufruf durchgeführt.“  Ihnen ist das vielleicht nicht\nso wichtig wie die Frage: „\nWar der Endnutzer zufrieden? Wurden alle\nseine Fragen beantwortet?“   Und noch\neine Besonderheit: Ich werde das Ganze\nauch in den Lichtmodus schalten.\nEine Besonderheit unserer Arbeit hier\nbei Arize, genauer gesagt bei Arize AX,\nist, dass man manchmal, wenn man den\nAgenten nicht als nicht-deterministischen\nAnruf betrachtet, richtig?  Sie möchten sehen können:\n„Hey, was hat mein Agent gemacht?“  Es\ngibt beispielsweise verschiedene Wege, die\nIhr Agent einschlagen könnte, richtig?  Also\n, verschiedene Geschäftsbereiche.   Was aber,\nwenn Sie\nalle Instanziierungen Ihres Agenten überblicken und\neinen umfassenderen Überblick über das\nGeschehen erhalten möchten?  Das sind so etwas wie Einblicke in\ndie Verteilung Ihres\nAgenten.  Welche\nWege und Verzweigungen, einschließlich Schleifen, sind also alle möglich?\nEs ermöglicht Ihnen, Fragen zu beantworten wie:\n„Welcher Prozentsatz meines Datenverkehrs läuft über den\neinen Zweig im Vergleich zum anderen? Gab\nes eine bestimmte Komponente in diesem\nbestimmten Zweig, den wir\ngewählt haben, die eine signifikante\nLatenz verursacht hat?“\nWenn wir anfangen, über Akteure oder\nverschiedene Wege zu sprechen, denken Sie vielleicht an\nTrajektorienbewertungen.   Eine mögliche\nVorgehensweise wäre zum Beispiel: „Ich bin\ndiesen einen Pfad gegangen, und alles lief super.\nAber aus irgendeinem Grund sinken\ndie Auswertungen oder die gesammelten Signale, wenn ich diesen Pfad weitergehe\n.\nWarum? Was ist die Ursache? Oh, die\nUrsache war, dass\ndiese beiden Komponenten in der falschen\nReihenfolge waren.\nIch habe B vor A ausgeführt, und B ist von\nA abhängig. Es stellte sich heraus, dass die Art und Weise, wie\nmein LLM\ndiese Dinge aufgerufen hatte, nicht übereinstimmte.\nWir müssen Kontext hinzufügen und\nsagen: ‚Bevor du dies\ntust, musst du das tun.‘“ Es gibt also\nviele verschiedene\nSichtweisen auf die Beobachtbarkeit. Natürlich sind\nauch Dinge wie Analytics nicht tot.\nViele Anwender in Unternehmen\nmöchten einfach nur\nAnsichten darüber erstellen, wie ihre\nAgenten in Echtzeit aussehen. Und die\nMöglichkeit, diese Ansichten anzupassen und zu erweitern, ist\nextrem hilfreich.\nDas ist Observability im\nKern. Kann ich alle\nverschiedenen Schichten sehen? Wir haben hier sehr viele\nverschiedene Arten von Schichten.\nDer nächste Schritt ist also: Okay,\nich habe Observability, das ist sozusagen der erste\nSchritt. Das ist dasselbe wie\nin der Softwareentwicklung, richtig? Jetzt\nmuss man das Signal bestimmen, richtig? Und\nSignale gibt es in vielen verschiedenen\nFormen.\nIch unterteile sie gerne in\nfünf Arten.\nIch denke, jeder hier im Raum\nkennt LLM als Bewertungskriterium.\nEs mag wie ein einfaches\nKonzept erscheinen, kann aber in Wirklichkeit\nziemlich komplex sein,\nund wir werden das alles noch durchgehen\n.\nMan darf die Menschen nicht vergessen.\nWenn man an Menschen denkt,\nalso an die Endnutzer, die das\nProdukt verwenden, sind die Signale extrem wertvoll.\nEgal ob Produktmanager oder\njemand mit technischem oder\nnicht-technischem Hintergrund – diese\nSignale sind wichtig.\nWir alle kennen Golden Data Sets.\nSie sind extrem wertvoll, denn\nwenn die dritte Spalte hier die\nQualität repräsentiert, können\nSie der Person vertrauen, die\ndiese Daten annotiert hat, weil sie sich in dem\nBereich auskennt.\nDann wenden Sie\nTechniken an wie: „Ich lasse\nmein LLM als Prüfer an einem Referenzdatensatz laufen, um es zu\noptimieren\n.“ Sie fragen sich im Grunde:\n„Kann mein LLM\ndieses Objekt, diese Person oder diesen\nDatensatz, dem ich vertraue, annähernd genau abbilden?“\nNatürlich spielen auch die\nKosten eine Rolle. Um\nKosten zu sparen, muss man nicht immer\neinen LLM-Aufruf oder gar menschliche Expertise einsetzen.\nDeterministische Auswertungen sind sehr vorteilhaft. Denken Sie also\nan logik- oder deterministisch basierte\nAuswertungen. Wenn ich beispielsweise einen Absatz in eine\nJSON-Nutzlast umwandle: Ist dieses\nJSON gültig? Enthält es das Schema? Sind alle\nFelder\nnicht null?\nUnd natürlich entwickeln wir\ndiese Systeme alle für bestimmte Zwecke.\nIch glaube, das hat einen von drei Zwecken. Die\nGeschäftskennzahlen, die Ihnen wichtig sind, beziehen sich also\nentweder auf etwas wie: „Wie kann ich\nmehr Geld verdienen?“  Wie kann ich Geld sparen?  Oder wie kann\nich Zeit sparen?\nWenn Sie anfangen,\nwirklich gute KI-Produkte zu entwickeln, werden Sie feststellen, dass sich\nzwei Arten von\nNutzerprofilen immer mehr überschneiden\n. Da sind zum einen die\ntechnischen Nutzer, die\nKI-Ingenieure, die Entwickler schlechthin\n. Diese Leute sind extrem\ngut darin, Prozesse zu entwickeln und zu automatisieren.\nSie sind Experten im Framework-Aufbau. Zum anderen gibt es\ndiejenigen, die\nvielleicht weniger technisch versiert sind, aber\nverstehen, wie eine optimale KI-Erfahrung aussehen sollte.\nDas sind die\nFachexperten, die Produktmanager. Ihnen sollte man\nAufgaben wie die Optimierung\nder Prompt-Entwicklung übertragen\n.  Hier sind die [räuspert sich]\nEvaluierungen, die mir wichtig sind.“\nDenn man braucht Leute, die programmieren können\nund die sich\nin der jeweiligen Domäne auskennen.\nIn unserer Welt sieht das etwa so aus:\nWir ermöglichen es Nutzern,\nEvaluierungen auf einfache\nWeise durchzuführen. Natürlich\nkönnen technisch versierte Nutzer\nihre Evaluierungen auch programmatisch einbinden und ausführen\n.\nWir möchten aber, dass\nNutzer\nihr Modell auswählen, eine vorgefertigte Vorlage verwenden\noder eine\nEvaluierung individuell anpassen können.\nWenn wir über die Komplexität der Evaluierungen sprechen, stellen Sie sich vor,\nSie haben eine\nAnwendung, einen Agenten oder ein\nHarness entwickelt.\nDieses Harness enthält Komponenten, die\ndeterministisch oder\nnicht-deterministisch aufgerufen werden können.\nEvaluierungen können also auf verschiedenen Komponenten ausgeführt werden.  Stellen Sie sich\neine einzelne Komponente vor. Wir\nnennen das eine Span-Auswertung. Ich\nkomme gleich hierher.\nDer Bereich wäre also ein einzelner Input\nund Output.\nIch zeige Ihnen gleich eine komplexere\nAnsicht davon, aber Moment, ich schließe das Fenster\n.\nSie können sich die einfache Span-\nEingabe und den Span-Output so vorstellen: Ich möchte mir\nden Input und Output eines Teils\neines LLM-Aufrufs ansehen.\nDas verstehen die meisten, und es ist wirklich sehr\neinfach.\nNun gibt es\nauch Multi-Span-Auswertungen. Das\nkönnen wir uns so vorstellen: Um\ndie gewünschte Auswertung durchzuführen,\nbenötige ich Daten von vielen\nverschiedenen Komponenten im System.\nWenn ich beispielsweise wissen möchte, wie gut\nAgenten Daten untereinander austauschen,\nbenötige ich\ndie Daten von jedem einzelnen Agenten und wie\ndieser Daten austauscht. Das ist eine Multi-Span-\nAuswertung, die komplexere Berechnungen ermöglicht\n. Wenn Sie alle\nSpans insgesamt betrachten möchten, ist das etwa so:\nTrajektorienbewertung. Haben wir die\nrichtigen Schritte ausgeführt, um\nden Geschäftsprozess abzuschließen?\nUnd dann gibt es noch die Sitzungsbewertung\n, richtig? Das ist, als würde man herauszoomen\nund sich fragen: Wie verhält sich der\nZustandsautomat? Wenn ich diesen Zustandsautomaten bewerten möchte – zum Beispiel, wie man\nden Lichtmodus ändert –, dann frage ich mich:\nWar der Benutzer in diesem Gespräch jemals\nfrustriert? Haben wir alle seine\nFragen beantwortet? Man kann sich das so vorstellen: Ich möchte\nden Zustandsautomaten bewerten. Wenn man also\nüber Bewertungen nachdenkt, geht es nicht nur darum, welche\nArt von Bewertungen wir\ndurchführen wollen, sondern auch darum, in welchem ​​Umfang und mit welcher Tiefe. Man\nkann sehr detailliert vorgehen und\nauch herauszoomen.\nUnd nur weil man etwas bewerten kann,\nheißt das nicht, dass man es immer tun sollte. Es ist keine\nallumfassende Sache. Man möchte herausfinden,\nwelche minimalen\nBewertungen ausreichen, um zu\nverstehen, ob die\nAnwendung wie vorgesehen funktioniert.\nDas\nGanze hat seinen Preis, richtig? Kurz gesagt,\ndas ist Observability\nund Evaluierung in Kürze. Wir werden\nüber Experimente und Verbesserungen sprechen.\nNicht jeder beginnt mit Traces. Wenn\nSie mit Traces beginnen, können Sie damit\nwirklich coole Dinge anstellen, z. B.\nsagen: „Hey,\nzeig mir, wo ein bestimmtes Signal\nfehlerhaft ist. Wo fehlen mir Daten\n?“ Dann können Sie diese Informationen finden und\nin einem Datensatz sammeln.\nWenn Sie keine Traces haben, können Sie\neinfach einen Datensatz mit\nEingabe-Ausgabe-Paaren hochladen.\nVon hier aus können Sie dann\nbeispielsweise auf diesen Datensatz zugreifen, der nur Datenzeilen und\n-spalten enthält. Anschließend können Sie\nExperimente durchführen. Experimente können\nÄnderungen sein. Wenn Sie also darüber nachdenken, wie Sie\nIhren Agenten oder Ihr\nHarness verbessern können, geht es im Allgemeinen um Änderungen. Änderungen\nan Prompts, Änderungen an Modellen, Änderungen\nan der Orchestrierung, Änderungen an\nKonfigurationen. Denken Sie so.\nWir erlauben  Wir möchten, dass Nutzer diese\nDinge über eine Benutzeroberfläche oder programmatisch testen können.\nAber wissen Sie, was ich\nunseren Kunden immer gerne sage: Wohin entwickelt sich\ndie Softwareentwicklung? Wir\nbei Arize haben schnell erkannt, dass die\nmeisten Nutzer nicht mehr mit\nDashboards, Schaltflächen oder manuellen Abläufen arbeiten wollen.\nUnd das verstehen wir sehr gut.\nWenn wir darüber nachdenken, wohin die Reise\ngeht, wird Software komprimierter. Sie wird\neinfacher zu entwickeln und\nanzupassen sein.\nAlles, was ich Ihnen gerade gezeigt habe, war\ndie gewohnte manuelle Vorgehensweise.\nWir haben jedoch alles so gestaltet, dass\nSie dieses Programm\nüber Ihren Coding-Agenten ausführen können. Wir wissen, dass\nviele Nutzer mit ihrem\nCloud-Code und Code X sehr vertraut sind. Deshalb stellen wir\nalle grundlegenden Funktionen über die Befehlszeilenschnittstelle (CLI) sowie eine\nReihe von Tools und Funktionen bereit.\nDas ist natürlich etwas speziell. Außerdem\nist ein KI-System integriert, das\nheißt,\nIhr KI-System kann\nunser System aufrufen. So können Sie beispielsweise Dinge tun, die\nSie nicht selbst\nherausfinden möchten.\nWir glauben, dass sich vieles davon\nautomatisieren lässt. Ich kann also hierher gehen und\nAlex fragen – natürlich kann Cloud-Code oder etwas\naußerhalb des Systems Alex aufrufen. Und\nSie können einfach fragen: „Hey,\nsiehst du irgendwelche Probleme mit meiner Anwendung?“ Und\nda wir alle\nDaten, die Hooks und\nalles andere haben,\nplant und\nführt Alex diese Aufgaben aus.\nUnser oberstes Ziel als Unternehmen ist es,\ndiesen Prozess für Sie zu automatisieren:\nObservability, Evaluierungen,\nExperimente und Verbesserungen. Wir\ndenken, dass der gesamte Prozess\nweitgehend\nautomatisierbar ist. Das heißt,\nes ist keine Magie, sollte sich aber so anfühlen\n. Unser Hauptziel ist, dass\nSie eines Tages mit Arize arbeiten,\ndas\nÖkosystem nutzen\nund es einfach funktioniert. Wir sind fest davon\nüberzeugt, dass Sie\nIhre Evaluierungen nicht einmal auswählen sollten. Eine KI\nsollte den Kontext kennen: „Hey, hier sind\ndie Traces, hier passiert das. Lass\nmich Evaluierungen erstellen.“  Fliegen Sie und denken Sie darüber nach, ob sich\netwas geändert hat. Ich brauche eine\nneue Bewertung.\nAber Sie bemerken, dass Alex bereits anfängt, sich damit auseinanderzusetzen und zu fragen: „\nWas passiert hier? Es scheint eine\nhohe Latenz zu geben. Es wurden\nFehler festgestellt\n.“\nKurz gesagt, das ist unser Ziel.\nUnd während wir über\ndiese Welt nachdenken, haben\nwir heute zwei Produkte auf dem Markt.\nFür die Entwickler\nhaben wir Arize Phoenix, das\nOpen Source ist. Das Tolle an\nPhoenix ist, dass es in einem einzigen Container läuft.\nMan kann es lokal bereitstellen. Es\nbenötigt keine Kubernetes-Schicht. Und für\nunsere größten Unternehmen nutzen wir\nArize AX.\nDas ist im Allgemeinen für\neinige der größten\nUnternehmen wie Uber,\nBooking und Reddit reserviert. Ihr\nmerkt es vielleicht nicht, aber wir lieben den Dunkelmodus, daher sollten wir vielleicht\nbei einigen Dingen den Hellmodus ausprobieren. Aber\nja, kurz gesagt, das ist es.  Das ist im Grunde das,\nwas wir tun und wer wir sind. Und\nwisst ihr was? Wenn ihr über etwas anderes reden wollt, immer her damit! Vielen\nDank\nfür eure Zeit heute.\n[Applaus]\n[Musik]",
  "transcript_chars": 17176,
  "ingested_at": "2026-06-15T00:52:11.603554+00:00",
  "source": "channel",
  "yt_meta": {
    "view_count": 5836,
    "like_count": 139,
    "channel_id": "UCLKPca3kwwd-B59HNr-_lvA",
    "categories": [
      "Science & Technology"
    ],
    "tags": [
      "ai",
      "ai engineer",
      "ai engineering",
      "software development",
      "tech",
      "startups",
      "software architecture",
      "machine learning"
    ]
  }
}