{
  "video_id": "7VISmcJpqis",
  "channel_slug": "deeplearningai",
  "channel_handle": "deeplearningai",
  "title": "AI Dev 26 x SF | Ashwyn Sharma: Every App Needs a Voice UI. Here's How to Build It",
  "duration_seconds": 965.0,
  "url": "https://www.youtube.com/watch?v=7VISmcJpqis",
  "upload_date": "",
  "transcript": "Ich bin Ashin Sharma, CEO und Mitbegründer von\nVocal Bridge.  Ich freue mich riesig,\nüber Sprachschnittstellen zu sprechen und darüber, wie\nman sie mit Vocal Bridge selbst bauen kann\n, einem Unternehmen, das ich zusammen mit dem\nKI-Fonds von Andrew Inc. und deep\nlearning.AI gegründet habe.  Ich persönlich habe das\nletzte Jahrzehnt meines Lebens damit verbracht, Sprach-KI\nin großem Umfang bei Unternehmen wie Meta,\nSalesforce und Auto.AI zu entwickeln und einzusetzen.  Ich habe selbst\nerlebt, wie schwierig es ist,\nProdukte zu entwickeln, die Sprache und\nSprachverarbeitung beinhalten.  So, jetzt geht's los\n.\nFalls Sie sich jemals mit der Entwicklung von\nSprachassistenten, Sprach-KI und Sprachprodukten beschäftigt haben, dürfte\nIhnen das hier sehr bekannt vorkommen.  Ähm, was\nnormalerweise mit einem einfachen „Hey,\nich möchte Sprach-KI entwickeln“ beginnt.  Ähm, vielleicht\nfange ich mit Speech-to-Text und Text-\nto-Speech an.  Vielleicht baue ich auch noch\nein LLM zwischen diese beiden Komponenten ein, und\ndas sollte es dann eigentlich gewesen sein, richtig? Dann fängt man an,\ndas Ganze in die\nProduktion zu überführen, und nach ein paar Wochen stößt man dann auf so\nobskure Begriffe wie Sprachaktivitätserkennung,\nPriorität und Endpunktzuordnung,\nBaron Handling, Turn-Erkennung –\nes entwickelt sich zu einem heillosen Durcheinander, einem\nBuchstabensalat, und was mit\nein paar\nWochen Projektarbeit beginnt, dauert am Ende manchmal\nsechs Monate, manchmal sogar Jahre, bis\ndas Team\ndas Produkt in der Produktion bereitstellen kann.  Was wäre, wenn ich\nIhnen sagen würde, dass ich diesen\nganzen Stapel mit einem Fingerschnippen verschwinden lassen könnte?  Wir\npräsentieren Ihnen Vocab One-Stop Shop für Sprach-\nKI – eine vollständig verwaltete Sprach-KI-Plattform.   Genauer gesagt werde\nich\nIhnen heute drei Oberflächen, drei\nSchnittstellen, drei Möglichkeiten vorstellen, wie Sie\nVocal Bridge in Ihren Stack integrieren können.  Erstens\n, Bewerbungen.  Sie können also\nIhre bestehenden Anwendungen mit Sprachfunktionen ausstatten oder\nmithilfe von Vocal Bridge Sprach-Apps von Grund auf neu entwickeln\n.  Zweitens können Sie\nKI-Agenten eine Sprachausgabe hinzufügen.  Verleihen Sie\nIhrem bestehenden KI-Agenten also eine Stimme.  Drittens\nfreue ich mich ganz besonders über diesen Punkt: die\nNutzung der Stimme als Werkzeug.\nWenn Sie also KI-Agenten entwickeln möchten,\ndie wirklich multimodal sind, dann müssen Sie\ndiesen KI-Agenten die Fähigkeit geben, die\nModalität je nach\nAnwendungsfall und\nanstehender Aufgabe nach eigenem Ermessen zu wechseln.  Also, wir fangen an.  Ich werde\ndrei Demos geben, drei Live-Demos.  Also,\nich bete jetzt schon seit einer Woche zu den Demo-Göttern\n.  Na gut, dann mal los.  Die\nerste Demo wird darin bestehen, dass ich per Sprachsteuerung\nmit einer sehr dynamischen, auf\nReact basierenden Benutzeroberfläche interagiere.  Und ich werde jetzt\neine Runde Tic-Tac-Toe spielen.  Auf geht's\n.\nHey, ich bin dein Bühnen-Co-Pilot.  Frag mich\nalles und ich zeichne dir ein\nHey.  Bereit loszulegen?   Was\nwillst du?\nLass uns Tic-Tac-Toe spielen.\nDein X, dein Zug.\nIch nehme bitte das mittlere.   Ecke\n.  Du bist am Zug.\nIch nehme oben rechts.\nOben Mitte.  Lass uns gehen.  Du bist am Zug.\nOkay, du hast mich erwischt.  Gut gespielt.   So\n, bitte schön.  Hoffentlich wissen\nSie also zu schätzen, dass der\nSprachagent wirklich in die Anwendung integriert war\n.  Es hatte ein vollständiges\nKontextbewusstsein für den Spielstand und dafür,\nwie ich mit dem Spielbrett interagierte.\nSie haben also gesehen, dass ich\nmeine Stimme benutzen konnte, um Markierungen auf der\nTafel zu platzieren.  Aber als ich dann meine Maus benutzte oder auch\nmeine Tastatur hätte benutzen können,\nverstand der Sprachagent sofort, was\npassiert war, richtig?  Es antwortete darauf mit: „\nWeißt du, füge eins hinzu, und gut\ngemacht, nicht wahr?“  Wie können Sie das also\nselbst tun?  Wie kann man selbst eine Sprachbenutzerschnittstelle erstellen\n?  Also, drei einfache\nSchritte.  Nun ja, eigentlich vier einfache Schritte.\nSchritt Null ist: Installieren Sie MPM Vocal Bridge,\nVocalbridge AI, SDK und React. Dadurch wird\nsichergestellt, dass Sie unser\nSDK und die React-Komponenten zur Hand haben.\nSobald Sie das getan haben, können Sie Ihre\nAnwendung mit unserem Vocal Bridge\nProvider einbinden\nund verweisen dann im Wesentlichen\nauf eine serverseitige API, die Vocal\nBridge Tokens mithilfe des Vocal Bridge API-\nSchlüssels generieren kann. Das ist ziemlich einfach.\nSie können in unserem Dashboard\nselbst einen API-Schlüssel erstellen.  Das ist alles, was Sie für den\nAnfang brauchen.  Schritt Nummer zwei.  Das\nist also wirklich der entscheidende Punkt, richtig?  Auf diese\nWeise kann der Sprachagent\nmit Ihrer Anwendung kommunizieren und Ihre Anwendung\nkann mit dem\nSprachagenten antworten.  Das\nReact SDK bietet Ihnen also zwei Hooks.  Der\nerste Hook ist die Aktion „on action“, der\nzweite die Aktion „send action“.  Wenn wir also\nauf das Tic-Tac-Toe-\nBeispiel zurückkommen: Wenn der Sprachagent\nein Zeichen auf dem Spielfeld setzen wollte, sendete er eine\nClient-Aktion namens „Zeichen platzieren“ mit einem\nTyp aus Zeile und Spalte, richtig?  Und dieses\nMuster wurde an die Anwendung gesendet.  Die\nAnwendung zeigte schließlich, dass diese\nMarkierung auf dem Brett vorhanden war.  Als Entwickler mussten Sie also lediglich\nden onaction-Hook verwenden\nund anschließend die Client-Aktion nach Belieben behandeln\n.   Der\nzweite Schritt bzw. der zweite Aspekt\ndieser bidirektionalen Kommunikation zwischen dem\nSprachagenten und der Anwendung ist\ndie Markierungsaktion des Benutzers.  Sie haben also gesehen,\nwie ich mit meiner Maus eine Markierung auf dem\nBrett gesetzt habe.  Die Anwendung sendet ein\nEreignis, äh, eine Clientaktion,\nmit der Position des Benutzers, dem\nTyp und dem Status des Spielbretts an den Sprachagenten zurück, damit\nder Sprachagent versteht, wie das Spiel\nläuft.\nUnd schließlich müssen Sie, um\ndiese bidirektionalen Clientaktionen zu konfigurieren, lediglich\ndieses deklarative Format verwenden, nämlich JSON.\nIn diesem JSON ist die erste Client-\nAktion „base mark“, die Richtung „\nAgent zu App“ und das\nBeschreibungsfeld eine natürlichsprachliche Beschreibung\nder Client-Aktion sowie der\nNutzdaten, die der Agent an\ndie Anwendung senden soll.  In diesem Fall handelte es sich also lediglich um\nein Zeilen-Spalten-Tupel.  Die zweite\nClientaktion ist das Platzieren einer Markierung durch den Benutzer.  Die\nRichtung ist umgekehrt.\nDie App sendet also eine\nClientaktion an den Agenten zurück, woraufhin das\nVerhalten reagiert.  Bei Vocal Bridge\ngibt es im Grunde zwei verschiedene\nVerhaltensweisen, wenn die Anwendung\neine Client-Aktion an den\nAgenten zurücksendet.  Eine Möglichkeit ist also, zu reagieren. Das bedeutet, dass\nder Sprachagent\nsofort auf die eingehende Kundenaktion reagiert\nund sie bestätigt.  Im\nBeispiel mit Tic-Tac-Toe haben Sie gesehen, wie ich\ndie Markierung gesetzt habe.  Das war das entscheidende\nZeichen, und der Sprachagent\nreagierte sofort darauf.  Es gibt jedoch\nUmstände, unter denen man möchte, dass der\nSprachagent dieses Ereignis einfach in das\nKontextfenster aufnimmt und diese\nInformation dann für später verwendet.  Es wird also nicht\nsofort verbal darauf reagieren.\nUnd dann können Sie auch unsere CL\nCLI installieren.  Also installieren Sie die lokale Brücke mit pip.\nAnschließend können Sie über die Befehlszeile\ndie Einstellungen vornehmen, die Eingabeaufforderung und die\nClientaktionen konfigurieren und alle anderen Aktionen ausführen,\ndie Sie auch über die Benutzeroberfläche durchführen können.\nUnd dies ist die zweite Oberfläche.  So\ngeben Sie Ihren KI-Agenten eine Stimme.  Was Sie\nrechts sehen, ist ein typischer LM-Agent,\nrichtig?  In diesem Fall wird es von Claude unterstützt\nund basiert vollständig auf Text.  Es handelt sich um eine\nChat-basierte Benutzeroberfläche.  So kann ich mit ihm chatten und\nhallo sagen.  Und es hat geantwortet.  Aber was wäre,\nwenn ich Ihnen sagen würde, dass Sie mit nur wenigen\nZeilen Code – technisch gesehen ist es\nnur eine einzige Zeile, wenn man\nalles zusammenfasst –\ndiesem speziellen Agenten mit\nnur einem Klick eine Sprachausgabe hinzufügen können\nund schon habe ich im Hintergrund eine Stimme, die „\nClaude“ sagt.  Was möchten Sie\nfragen?\nHey, könntest du mir erklären, wie Lichtjahre\nals Entfernungseinheit funktionieren?\nIch schaue das mal nach.  Hier ist die Antwort.\nEin Lichtjahr ist die Strecke, die das Licht\nin einem Jahr durch den Weltraum zurücklegt – etwa 5,88\nBillionen Meilen.  Astronomen verwenden es,\nweil der Weltraum so unermesslich ist, dass Meilen und\nKilometer unhandlich werden, und trotz des Namens\nist es eine Einheit von …\nAlso, wie groß ist die Entfernung zwischen Mountain\nView und San Francisco in Lichtjahren?   Ich bin auf der\nSuche danach.\nDie beiden Städte liegen etwa 30 m voneinander entfernt,\nwas ungefähr 0,00005\nLichtjahren entspricht, also etwa 5 Milliarden\nLichtjahren.  Es handelt sich um einen so winzigen Bruchteil,\nweil ein Lichtjahr so ​​gewaltig ist, dass\nalltägliche Entfernungen\nin diesem Maßstab fast bedeutungslos werden.\nDas ist ja toll.  Vielen Dank.  Ich\nbin sicher, dass die Leute bei AI Dev Ihre Hilfe zu schätzen wissen\n.   Sehr gern\n.  Gerne helfen wir Ihnen dabei, zu zeigen,\nwas wir können.  Gibt es sonst noch etwas, das Sie\nfragen oder näher erkunden möchten?  Nein, das war's.\nDanke schön.\nFreut mich.  Danke für das Gespräch und\nviel Spaß beim Rest der Veranstaltung.  Bis bald\n.   In Ordnung\n.  Hoffentlich konnten Sie also\nnachvollziehen, dass der Vocal Bridge-\nAgent, der Sprachagent, über ein eigenes Gehirn verfügte\n.  Es ging nicht nur darum, Sprache in\nText und Text in Sprache umzuwandeln und\ndazwischen das LLM-Studium zu absolvieren.  Es hatte ein\neigenes Gehirn.  Es wusste, wann es eine\nAnfrage an Ihren KI-Agenten delegieren sollte und wann es\nSmalltalk und Konversation\nselbst übernehmen sollte.  Und das ist wirklich wichtig,\ndenn wenn man\nden traditionellen\nWeg wählt, also ein Spracherkennungsmodell kaskadiert,\ndann den Sprachlerner (LM) oder KI-\nAgenten und anschließend die Spracherkennung, dann liegt die\nVerantwortung für die Aufrechterhaltung des Gesprächs und die\nVerwaltung des Dialogzustands beim\nSprachlerner, und das will man nicht,\nweil das den Kontextbereich des Sprachlerners überlastet\nund man nicht möchte, dass der\nSprachlerner von seiner eigentlichen Aufgabe abgelenkt wird.  Also,\nSie haben es wieder einmal richtig erraten.  Wir machen es\nIhnen ganz einfach.  Verwenden Sie unsere\nBefehlszeilenschnittstelle VBcon set AI\nagent enable true und geben Sie dann eine\nBeschreibung in natürlicher Sprache an, damit der\nSprachagent weiß, wann er eine\nAnfrage an Ihren Agenten delegieren soll, anstatt\nsie selbst zu bearbeiten.\nUnd dann können Sie auf der Clientseite den\nKI-Agenten-Hook nutzen, den\nwir als Teil unseres SDK anbieten.  Und dann\nmüssen Sie nur noch den onquery-\nCallback verwenden und ihn auf den Endpunkt Ihres LM\noder den Endpunkt Ihres Agenten verweisen.  Sobald\nIhr Agent oder Ihr Sprachmanager\nmit dem Text antwortet, leitet er diesen\nan den Vocal-Bridge-Agenten weiter, der dann\nentscheidet, wie er die Nachricht\nan den Benutzer zurückmeldet.\nUnd schließlich noch mein Favorit, bei dem die\nStimme als Werkzeug eingesetzt wird.  In diesem Fall\nhabe ich also wieder die Chat-Oberfläche auf der\nlinken Seite, und äh, sie fragt mich, wie die Demo\nläuft.  Ich muss sagen, es läuft\nbisher super, aber ich\nbrauche Hilfe beim\nBrainstorming\nfür die nächsten Schritte nach der\nDemo.   In Ordnung\n.  Das System überlegt also und\nsagt: „Ehrlich gesagt, das geht schneller\nals Sprache. Soll ich kurz eine\nSprachsitzung starten?“  Also entschied man sich dafür, dass\nBrainstorming per Spracheingabe einfacher ist\n.  Verringert die kognitive Belastung.  Es ist eine\nnatürlichere Benutzeroberfläche.  Ich werde\nsagen: „Klar.“\nBrainstorming-Modus.  Was hast du im Kopf?\nHey, ich überlege gerade, was ich\nnach dieser Demo machen soll.\nHabe es.  Hast du Lust auf etwas Tiefgründiges\nund Technisches oder möchtest du dich lieber entspannen\nund einfach Ideen aufsaugen?\nIch habe nichts dagegen, auch mal in die Tiefe und ins\nTechnische zu gehen.\nIn diesem Fall klingt Tony Lurs Vortrag bei 405 darüber,\nwarum Agenten Dinge vergessen, passend.   Das\nAgentengedächtnis ist direkt mit dem\nsprachgesteuerten Kontext verknüpft.  Eine weitere Option ist Andrew\nFer um 5:00 Uhr zum Thema Multimodell-Pipelines,\nder Ihnen helfen könnte, Latenz und\nKosten zu reduzieren.  Spricht Sie eines davon an?\nGlaubst du, ich kann beides schaffen?\nWenn Sie Tonys Vortrag um 4:05 Uhr aufnehmen, wären Sie gegen\n4:35 Uhr fertig.  Dann hätten Sie noch etwa\n25 Minuten Zeit, bevor Andrew um 5:00 Uhr anfängt.\nDieser Abstand ist nicht schlecht.  Genug Zeit, um sich\neinen Kaffee zu holen und vielleicht an einem Stand vorbeizuschauen.   Das klingt\nfür mich machbar.\nOkay, klingt gut.  Lass es uns tun.\nGroßartig.  Du hast einen Plan.  Beginnen Sie mit\nTony um 4:05 Uhr und gehen Sie dann um\n5:00 Uhr zur Andrew-Session über.  Viel Spaß bei den Gesprächen und\nwir sehen uns zur Happy Hour.\nDanke schön.\nUnd\nalles klar.  Sobald ich das getan habe, wird\neine Zusammenfassung der Brainstorming-Sitzung erstellt\nund der Darstellungsmodus wieder auf Text umgeschaltet.\nRechts?\nIch werde mich also bedanken und dann\nfragt es mich, was als Nächstes für dich heute Abend ansteht\n.  Ich sage Happy Hour.   Die\nHappy Hour 48B findet um 17 Uhr statt.\nUps.   In Ordnung\n.  Ich wiederhole es noch einmal.   In Ordnung\n.  Es heißt: „Sollen wir\nmeine Freundin Adit anrufen und sie einladen?“  Ich kann\nsie jetzt anrufen, wenn du bereit bist.  Na dann, lasst es uns\nausprobieren.\nDas ist Aditi in der Menge.  Hoffentlich\nbekommt sie gleich einen Anruf\nvon meiner Asiatin.   In Ordnung\n.  Es zeigt also an, dass es klingelt.  Es\nerfasste den gesamten Kontext.  Und dann wird er\ntelefonieren.   Ich wollte\nnur mal kurz vorbeischauen. Es wäre immer noch ein guter Zeitpunkt für ein\nGespräch.\nHey, wer ist da?\nIch rufe im Namen von\nAshwin an, der gerade bei AIDS Dev26 auf der Bühne steht\n.  Und dieser Anruf ist seine Live-Demo.\nOh, wo ist er denn jetzt?\nEr ist gerade hier in San Francisco am Pier\n48B und beendet seinen Vortrag.\nWie geht's?  Was sagen Sie?\nEr beendet seinen Vortrag gerade und\nwürde sich freuen, wenn Sie\num 17:30 Uhr zur Happy Hour für KI-Entwickler am Pier 48B kommen würden.\nGeht er?   Das ist\ner ganz bestimmt.  Und er würde sich sehr freuen, wenn Sie heute Abend\num 17:30 Uhr zur Happy Hour kommen würden.\nOkay, das ist super.  Ich meine, ich habe viele\nFragen zu Vocal Rich, die ich\nihm stellen möchte.  Die Happy Hour klingt also\nperfekt.\nFantastisch.  Er wird sich riesig freuen, dich dort zu sehen\n.\nEindrucksvoll.  Wir sehen uns.\nGroßartig.  Wir sehen uns heute Abend am Pier 48B.  Aufpassen\n.\nOkay, Sie haben also gesehen, dass das Gespräch beendet wurde\n.  Das konnte es von selbst.   Er hat\nden Kontext wirklich gut getroffen und ähm\nja, du hast es wieder einmal richtig erraten.  Du\nkannst es selbst tun.  Du kannst es\nselbst bauen.  Um das Standard-LM2-Schema zu verwenden\nund in diesem Fall einen Telefonanruf zu tätigen.  Das\nEingabeschema besteht lediglich aus der Telefonnummer,\ndem Namen und dem Zweck.  Der Zweck ist eher\neine Art Eingabeaufforderung zusätzlich zur\nBasisansage für den Sprachagenten\nund die Sprachbrücke. Sobald der Sprachmanager\nbeschließt, das Tool aufzurufen, ruft es\nunsere\nBefehlszeilenschnittstelle auf. Wir\nmachen es Ihnen sehr einfach: Ein VB-Aufruf mit\nTelefonnummer und Name der Person sowie\ndem JSON-Objekt, das den Zweck und alle\nzusätzlichen Kontextinformationen enthält, die die Sprachsteuerung\nausblenden soll. Vergessen Sie schließlich\nnicht,\nausgehende Anrufe zu aktivieren und\ndie Nutzungsbedingungen zu akzeptieren.  Stellen Sie sicher, dass\nSie es ausschließlich für gesetzeskonforme Zwecke verwenden\n.\nUnd das waren alle Demos.  Bevor\nich zum Schluss komme, möchte ich Ihnen noch Folgendes mitgeben:\nUnsere Vision.  Wir sind der festen\nÜberzeugung, dass in Zukunft jede Schnittstelle, jede\nAnwendung und jeder KI-Agent über\nSprache als Schnittstelle verfügen wird\n.  So wie jede Webanwendung\nirgendwann auch eine mobile Version erhält, und um\ndiesen Übergang reibungslos zu gestalten,\nist Vocal Bridge hier, um Ihnen zu helfen.",
  "transcript_chars": 16280,
  "ingested_at": "2026-05-22T04:30:51.917627+00:00",
  "source": "channel",
  "yt_meta": {
    "view_count": 82,
    "like_count": 3,
    "channel_id": "UCcIXc5mJsHVYTZR1maL5l9w",
    "categories": [
      "Education"
    ],
    "tags": []
  }
}