{
  "video_id": "P_RI1kCkRbo",
  "channel_slug": "aidotengineer",
  "channel_handle": "aidotengineer",
  "title": "Why Pipelines won't build Voice AGI — Neil Zeghidour, CEO, Gradium AI",
  "duration_seconds": 1167.0,
  "url": "https://www.youtube.com/watch?v=P_RI1kCkRbo",
  "upload_date": "",
  "transcript": "Hallo zusammen.\nVielen Dank, dass Sie alle heute hier sind.  Ich freue mich sehr,\nein wenig zu plaudern.  Daher ist jetzt der\nrichtige Zeitpunkt für dieses Gespräch, denn wir hatten\nheute Morgen viele großartige Präsentationen zum Thema Stimme.  Ich möchte Sie bitten, sich einen Moment\nZeit zu nehmen, um darüber nachzudenken, wo\nwir uns im\nBereich der Sprach-KI gerade befinden und welche\nHerausforderungen noch vor uns liegen.\nKurze Einführung\nzu Gradian.\nUnsere Mission ist es, das ungenutzte\nPotenzial der Sprach-KI zu erschließen.  Wir\ntrainieren also im Grunde Sprachmodelle, Sprach-zu-Text-,\nText-zu-Sprache-, Sprach-zu-Sprache-Modelle,\negal ob es sich um Transformation,\nÜbersetzung, Sprach-zu-Sprache-Dialog usw. handelt\n.  Wir wollen der\nführende Anbieter von Sprachmodellen\nfür alle sein, die Sprachagenten und\nSprachlösungen entwickeln.  Wir arbeiten also nicht\nan der Orchestrierung, wir arbeiten auch nicht an\nspezifischen Branchenlösungen.  Wir stellen lediglich\nBausteine ​​für Menschen bereit, die\nSprach-KI entwickeln möchten.\nIch meine,\nich kann sagen, dass\nein berühmter Podcaster, den ich heute\nMorgen geklont habe, das Wort „sitzen“ verwendet.\nÄh, es\nsollte ein Audioausgang vorhanden sein.\nMann, hast du gesehen, was Gradian\nmit Stimmenklonen macht?  Das ist irgendwie verrückt, echt jetzt\n.  Können wir etwas davon haben?\nZehn Sekunden Ihrer Stimme, das ist alles.  Könnten\nwir bitte eine deutlich höhere Lautstärke bekommen?\nMann, hast du gesehen, was Gradian\nmit Stimmenklonen macht?  Das ist irgendwie verrückt, echt jetzt\n.  Sie nehmen etwa 10\nSekunden Ihrer Stimme auf, das ist alles, und\ndas System analysiert den Tonfall, die Tonhöhe,\nden Akzent, all die kleinen Eigenheiten, die\nIhre Stimme einzigartig machen.  Und dann – zack! –\ntippt man einen Text ein und es antwortet.  Okay, ich\nnehme an, du erkennst Joel vielleicht wieder.  Ich\nhoffe, das hast du.   Also, das hier\nist im Grunde ein Ableger\neines gemeinnützigen Labors, das wir vor zwei Jahren gegründet haben,\nmit finanzieller Unterstützung\nvon Philanthropen wie Eric\nSchmidt,\nRodolphe Saadé und Xavier\nNiel.  Die Hauptidee war die Schaffung eines Labors mit\noffener Forschung, wobei\nwir uns hauptsächlich auf Sprache konzentrieren.  Wir\nhaben also Moshi entwickelt, das erste\nSprach-zu-Sprache-Modell für\nKonversation, Sprach-zu-Sprache-\nÜbersetzung, Pocket TTS und zuletzt ein\nCPU-Modell.\nUnd wir haben uns entschieden, diese\ngewinnorientierte Struktur zu schaffen, um ein\nProdukt herzustellen, das auch jenseits von Open Source in der Produktion eingesetzt werden kann\n.\nDas Ziel des Vortrags\nbasiert also im Grunde auf dem Film „Her“.  Also,\ndas ist wohl die am häufigsten verwendete und\nnervigste\nAnalogie in diesem Bereich.\nGleichzeitig ist es aber auch extrem relevant,\nweil es um einen 13-Jährigen geht, und wenn man sich\neine der Einführungsszenen ansieht, dann ist das der Moment, in dem\ndie Hauptfigur\nzum ersten Mal auf ihre KI-Stimme Samantha trifft\n.\nEs klingt immer noch so, als ob\nes, wissen Sie, eine\nVorwegnahme dessen war, wie eine Interaktion\naussehen könnte.\nOh, wie soll ich dich nennen?  Hast du\neinen Namen?  Ähm ja.\nSamantha.\nHey, woher hast du denn diesen Namen?  Ich habe es mir selbst gegeben.\nWie kommts?\nWeil es sich gut anhört.\nSamantha.\nUnd dann kam so etwas wie der\nTrend des „Her“-Moments.\nUnd wir haben so viele „Her“-Momente auf\nTwitter und\nim realen Leben erlebt.  Ich möchte\nniemanden verletzen, deshalb mache ich mich auch\nüber mich selbst lustig.  Es geht eher darum,\npragmatisch zu sein, was\ndas Versprechen war und wo wir jetzt stehen.\nDies ist eine sehr aktuelle Demo von dem meiner Meinung nach\nbesten Unternehmen für Sprach-KI\nweltweit, nämlich 11 Labs.\nHallo, Sie sprechen mit dem\nKI-Assistenten der Regierung.  Wie kann ich\nIhnen heute helfen?\nIch möchte ein neues Unternehmen gründen.\nUm ein neues Unternehmen zu gründen, müssen Sie\neine Unternehmensstruktur und einen Namen auswählen,\ndie Registrierung abschließen und die\nerforderlichen Dokumente hochladen.\nUnd das hier ist eine Demo, die ich\nvor 2 Monaten mit einem Rich Mini gemacht habe.  Unser heutiger\nModerator hat\nIhnen ja erzählt, dass es sehr riskant war.\nIch gebe zu, dass ich große Angst hatte, als ich es tat\n.  Im Grunde genommen geht es darum, unsere Streaming-\nSprachmodelle in ein umfangreiches Mini-System zu integrieren.\nHandlung, sag einfach ein Wort.\nOkay, vielleicht kannst du etwas\nLustiges machen.\nIch möchte\nmeine allgemeine Gesundheit verbessern und\nsuche deshalb einen Kumpel, mit dem ich ins\nFitnessstudio gehen kann.  Kannst du die Persönlichkeit und\ndie Stimme eines Fitnessstudio-Süchtigen annehmen?\nHey, ich bin Logan, dein Fitness-Kumpel.  Lasst uns\ndiese Gewinne gemeinsam vernichten.  Bist du bereit, Gewichte zu\nheben, zu schwitzen und dich großartig zu fühlen?  Ich stehe hinter dir\n, keine Ausreden, nur Ergebnisse.\nOkay, das\nist in Ordnung.  Es klingt\nnatürlicher als früher.  Aber in beiden\nFällen, Sie wissen doch, dass\nwir noch nicht so weit sind, richtig?\nDie Latenz ist immer noch recht hoch.\nDie Möglichkeit zur gleichzeitigen\nSprachübertragung zwischen Benutzer und System besteht\nnicht.   Die\nkünstliche Intelligenz wird immer\nbesser, und ich denke, das ist auch der Grund, warum wir so viel\nInteresse an Sprachagenten sehen,\ndenn es gibt Agenten,\ndenen wir tatsächlich eine Stimme geben können und die\nnützlich sein können.\nUnd\naußerdem handelt es sich hierbei größtenteils nur um ein\naufgepepptes Textmodell mit einer gesprochenen Sprache drumherum,\nsodass alles, was nicht\nim Text enthalten ist, nicht\ngenutzt werden kann.  Und vielleicht könnte ich ein\nletztes Mal bitten, die Lautstärke etwas zu erhöhen.\nIch glaube, das könnte sogar noch besser sein.\nÄhm,\nund was ist nötig, um dorthin zu gelangen?\nAlso, wir hatten\nheute Morgen eine sehr gute Präsentation von Samuel\nüber kaskadierte Systeme.  Ich werde mich also beeilen\n.  Speech-to-Text, LLM,\nText-to-Speech, das ist das klassische\nCascade.  In unserem Fall bieten wir\nStreaming-Sprache-zu-Text,\nStreaming-Text-zu-Sprache mit\nStimmklonierung, semantische Spracherkennung, die klassischen\nVerfahren an.\nAlso, Latenz, Sie wissen schon, um schnell ein\nGespräch beginnen zu können.  Wir haben also eine sehr schnelle\nTTS-Funktion, daher die geringe Latenz unserer TTS-Funktion\nim Vergleich zu einigen anderen Modellen.  Aber\nwissen Sie, das bedeutet, dass allein die TTS\nimmer noch mehr als 200 Millisekunden beträgt.  Im Gegensatz dazu\nbenötigt man in einem menschlichen Gespräch etwa 200 Millisekunden, um den\ngesamten Prozess des Verstehens, der Formulierung\neiner Antwort und deren Aussprache zu bewältigen.  Das alles wird also\nkein Gespräch ermöglichen, das sich\nmenschlich anhört.\nUnd das ist nur die\nLatenzzeit für Textkonversationen.  Es findet\nkein Tool-Aufruf statt, es wird keine tatsächliche Aufgabe\nausgeführt.  Das ist eine weitere Szene aus\ndem Film.\nOkay, fangen wir mit Ihren E-Mails an.  Sie\nhaben mehrere tausend E-Mails bezüglich\nLA Weekly, aber es sieht so aus, als ob Sie\ndort seit vielen Jahren nicht mehr gearbeitet hätten.   Oh ja\n.  Okay, also ja, es hat\nsofort alle E-Mails abgerufen und\nInformationen gesammelt und so\nweiter.  Offensichtlich sind wir noch lange nicht so weit\n.  Wenn Sie heute einen Sprachagenten haben,\nder ein Tool verwenden soll, müssen\nSie warten.  Beim Toolaufruf\nkämpfen wir um die Latenz der\nTTS, versuchen, 10 Millisekunden, 20 Millisekunden zu erreichen\n, und dann gibt es noch den\nToolaufruf oder den offenen Router, der eine\nLatenz zwischen 500 Millisekunden\nund 4 Sekunden aufweist.  In gewisser Weise hat\nman also manchmal das Gefühl, dass wir für\netwas kämpfen, das gar nicht mehr so ​​relevant ist\n.  Ich denke, der Hauptengpass liegt mittlerweile im\nToolaufruf, der sehr\nunvorhersehbar ist, und wir sollten Modelle haben,\ndie gegenüber sehr komplexen Toolaufrufen robust sind\n.\nEine Lösung dafür ist die Verwendung von\nFüllstoffen.  Im Grunde genommen teilt sich\nIhr LLM-Studium in zwei Teile auf.\nEs sendet also einen Toolaufruf.\nWährend es auf das\nErgebnis wartet, kann es das\nGespräch auf natürliche Weise fortsetzen, ruft\ndann das Ergebnis ab und\nversucht, es wieder auf\nnatürliche Weise in das Gespräch einzufügen.\nDa\nich normalerweise Live-Demos mache, werde ich diesmal eine\nsehr kurze,\nimprovisierte Live-Demo mit etwas geben, das\nsehr schnell live programmiert wurde, sodass dabei auch einiges\nschiefgehen kann.  Die Idee hierbei ist aber,\nquasi einen live programmierten Reiseagenten zu haben\n.\nUnd wenn ich es bitte,\nOrte abzurufen, versucht es, etwas Nettes\nüber den Ort zu sagen, den ich besuchen möchte\n.\nHallo.  Hier spricht Colin von Wanderlust\nTravel.  Ich sehe, Sie möchten eine\nReise für zwei Personen vom 10. bis\n13. April 2026 buchen.\nWohin möchten Sie für\nIhren Kurzurlaub reisen?\nIch möchte nach Tokio reisen.\nTokio ist eine unglaublich tolle Wahl.\nEs ist eine faszinierende Mischung aus hochmodernen\nWolkenkratzern und wunderschönen, friedlichen\nSchreinen.\nIch habe einige fantastische Optionen für Sie gefunden.\nSie könnten im Fairmont übernachten und ein\nschönes... Also, das muss noch etwas verbessert werden, das ist die\nHauptidee, wissen Sie, dass es zwar\nversucht, Daten zu sammeln, aber nicht\nwirklich weiß, wie lange es dauern wird, bis\ndie Daten vorliegen.  Es versucht, etwas Nettes über\nden Ort zu sagen, zu dem Sie gehen.\nDas ist also eine Möglichkeit, eine\nbesser kontrollierbare\nund zuverlässigere Latenz zu erreichen, selbst bei\nkomplexeren Systemen.  Aber\nwir wissen ja, dass die Latenz von kaskadierten\nSystemen prinzipiell hoch ist, richtig?  Und so\nhöre ich immer wieder von Kunden,\nInvestoren usw. die Frage: Wie sieht es mit der\nSprachübertragung aus?  Ich glaube, eine große\nVerwirrung besteht darin, was genau Sprache-zu-Sprache ist.\nDie Idee hinter Speech-to-Speech ist also, dass man\nanstatt der drei Blöcke\nnur noch einen hat, der alles\nzusammen erledigt, richtig?  Anstatt also\nAudio in Sprache-zu-Text und\ndann in Sprachausgabe (LM-Text-zu-Sprache) umzuwandeln, hat man ein Modell,\ndas Sprache als Eingabe nimmt und\nSprache ausgibt.   Das\nreduziert zwar die Latenzzeit erheblich, aber es ist immer noch\nkein menschliches Gespräch.\nInsbesondere, weil alle Sprach-\nzu-Sprache-Modelle außer Moshi halbduplex sind\n.  Das bedeutet, dass\nselbst das beste Sprach-zu-Sprache-Modell –\nich weiß nicht, vielleicht\ndas fortschrittliche Sprachmodell von OpenAI oder\nCezanne, ich bin ein großer Fan des Cezanne-\nSprachmodells –\nimmer noch halbduplex ist.  Das bedeutet,\ndass das Modell entweder zuhört oder\nspricht.\nUnd es kann die Mehrdeutigkeit menschlicher Gespräche nicht bewältigen, bei denen es zu\nÜberschneidungen zwischen Personen kommen kann, die\nübereinander sprechen.  Es passiert eine Menge.\nMan hustet, äh, man macht einfach so ein „mhm“,\nwas man Rückkanalisierung nennt, und dann\nbricht es komplett ab.  Vollduplex –\ndas ist ein menschliches Gespräch.  Das variiert\nje nach Kultur und Sprache, aber\nim Japanischen ist es beispielsweise ein Zeichen von\nHöflichkeit und dafür, dass man aktiv\nzuhört und viel\nRücksprache hält.  Sie werden also ständig „mhm äh äh äh äh“ sagen,\nwenn die andere Person\nspricht, und es kommt zu Überschneidungen zwischen den Gesprächspartnern in bis zu 20 % der\nZeit\n, richtig?  Das ist also das, was ein\nGespräch menschlich macht, und deshalb habe ich mir\nheute Morgen in meinem Hotelzimmer dieses Video angesehen, um\nIhnen zu zeigen, dass es sich um\nein Sprach-zu-Sprache-Modell handelt, aber\nnicht um ein Vollduplex-Modell, und Sie\nsehen, wie es nervig werden kann.\nHey, wie geht's?\nHey, mir geht's richtig gut.  Danke der\nNachfrage.  Und du?  Wie läuft dein Tag\nbisher?  Äh, mir geht's super.  Äh, wissen Sie,\nich bereite mich darauf vor, über Sprach-KI zu sprechen und\nwie weit wir noch von\ndem Film „Her“ entfernt sind, und ich würde gerne\nein bisschen mit Ihnen darüber brainstormen.\nOh, das ist ein tolles Thema.  Ja, ich\nhelfe dir sehr gerne beim Brainstorming.  Denkst du eher: Genau\n.  Ja, ich dachte nur:\nNein, nein, ich wollte nicht unterbrechen.  Du\nweißt doch, dass ich genau das gerade gesagt habe\n.  Du kannst einfach weitermachen.  Äh, wissen\nSie, beachten Sie mich nicht.  Das\nmache ich normalerweise.\nÄh, überhaupt kein Problem.  Ja, ich wollte gerade\nsagen, dass wir es in\nein paar Aspekte unterteilen könnten, so wie:\nJa, genau.\nBitte hören Sie auf, mich zu unterbrechen.  Du weißt, dass man das\nBackchanneling nennt.  Äh, Menschen\ntun das ständig.  Es zeigt, dass du\neinfach dem Gespräch folgst und dich nicht\nin deinem\nRedefluss unterbrechen lässt.  Ich gehe einfach.\nAh, verstanden.  Danke für die Info.   Ja\n.\nAch, komm schon.  Okay, also im Grunde genommen\nwar ich ein bisschen gemein, richtig?  Genau das ist es\n, das ist mein Punkt.  Das ist doch kein\nrichtiges Gespräch, oder?  Und das\nkann besonders ärgerlich werden.\nDas ist auch der Grund, warum die meisten\nSprach-KI-Demos in einem leeren,\nruhigen Raum neben dem Telefon und\nso weiter gedreht werden.\nViele Dinge können kaputtgehen.  Also,\nwas wir stattdessen\nin unserem Fall gemacht haben, war:\nÄh, Entschuldigung, wo bin ich in meiner Präsentation?\nIch bin direkt hier bei Mushi.\nwar äh das erzwungene Duplexsystem.\nHier seht ihr also meinen Mitgründer Alex, der damit\nspricht.\nÄh, es ist jetzt fast 2 Jahre alt.  Ich finde,\nes ist irgendwie gut gealtert, denn\nman sieht ja, dass\nsie\nständig durcheinanderreden, und das ist völlig in Ordnung\n.  Der Planet ist also Sirius 22. Könnten\nSie bitte eine Flugbahn dorthin berechnen\n?   Ja\n, Sir.  Okay.  Wie lange brauchen\nwir, um dorthin zu gelangen?\nes heraus.  Die Anreise dauert ungefähr 5 Monate\n.  Okay, das ist gar nicht so\nschlecht.  Äh, meinst du, wir haben alles\nan Bord des Schiffes, was wir für den Start der Mission benötigen?\nWir haben alles, was wir brauchen.  Okay.\nWissen Sie, selbst wenn das Modell\nerraten hat, was Sie sagen werden,\nbeginnt es zu antworten, bevor Sie fertig sind.\nGleichzeitig kann man darüber hinwegreden, ohne dass das, was\nman sagt, ignoriert wird.   Man muss es sich im\nNachhinein genau ansehen und so weiter, und so\nhat man bis heute die robusteste\nGesprächserfahrung, die unempfindlich gegenüber\nLärm, vielen sprechenden Menschen und so\nweiter ist.\nAber wenn wir es jetzt mit äh äh mit\nihr vergleichen, wissen Sie, was ich gerade denke\n?  Nun, aus Ihrem Tonfall schließe ich,\ndass Sie mich herausfordern.  Vielleicht,\nweil du neugierig bist, wie ich arbeite.\nMöchten Sie wissen, wie ich arbeite?  Ja,\ntatsächlich.  Vielleicht war das nicht ganz\ndeutlich, aber in diesem Ausschnitt erkennt die KI,\ndass sich die Figur etwas\nunwohl fühlt.  Das ist also\nparalinguistisches Verständnis, also das\nVerstehen all der Signale, die sich\naus der Art und Weise ergeben, wie Menschen sprechen.\nGenau genommen ist das bei Mushi der Fall, das ist\nbei jedem Sprachübersetzungsmodell der Fall, da\ndiese Information nicht verloren geht.\nWenn Sie diese Informationen jedoch nicht nutzen,\num Ihr Modell relevante Aussagen treffen zu lassen, wird\nes dies auch nie tun.  Wenn man\nes mit der Audioversion eines Instruktionsdatensatzes trainiert\nund es sich lediglich um die\nBeantwortung von Faktenfragen handelt, warum sollte es dann überhaupt versuchen,\ndiese Informationen zu erfassen?  Also,\nMoshi, ich glaube, wir haben\nbisher nur das einzige Vollduplex-Modell gesehen.  Äh,\nvor kurzem hat Nvidia das darauf\nbasierende Personal Plex-Modell veröffentlicht.  Ähm, was\ngroßartig war, ist immer noch der Fluss, der einfach\nunübertroffen ist,\ndenke ich.\nÄhm,\nes ist dialogisch und äh und sehr\nfundiert.  Gleichzeitig war ein bestimmtes Modell\nsehr dumm.  Also, im Grunde war es einfach\nnutzlos.  Man konnte sich\nein paar Minuten unterhalten, aber dann war es irgendwie\nsinnlos, weil es ja kein\nAgent war.  Es verfügte über keine Werkzeugaufrufe und war zu keiner Funktion fähig\n.\nÄh,\nes ist unmöglich, etwas in der Produktion einzusetzen,\ndas\nkeine Beobachtbarkeit aufweist.  Man weiß nicht, ob es\nsehr schwer ist festzustellen, ob jemand\netwas gesagt hat, was nicht\nakzeptiert werden sollte, und so weiter.  Und es\ngab kein wirkliches paraverbales\nVerständnis.\nDie wichtigste Erkenntnis für mich ist also, dass\nwir wissen, dass diese Art von interaktivem\nModell, das vollduplex sein wird, der Weg\nzu\neiner Interaktion sein wird, die so natürlich ist wie die\nmit einem Menschen.\nAber solange wir nicht in der Lage sind,\ndiesen\nsehr natürlich klingenden Modellen\ndas gleiche Maß an Zuverlässigkeit, Intelligenz\nund Personalisierung zu verleihen wie\nkaskadierten Systemen,\nsehe ich keinen Weg, wie sie\nkaskadierte\nSysteme ersetzen könnten.  Früher war ich also ein regelrechter Gegner von\nKaskadensystemen.  Ich finde, sie\nsind so praktisch und so bequem, dass\ndie größte Herausforderung – ehrlich gesagt – darin besteht, dass\nwir sie mit einem Moshi lösen können.\nWer es implementiert und mit\nBeta-Daten trainiert, wird etwas haben, das sich\nfür\nMenschen nicht mehr unterscheiden lässt, aber genau darin liegt die\nHerausforderung.\nÄh,\nein letzter Punkt ist die Skalierbarkeit.   Nehmen wir also an,\nSie haben das beste äh\nSprachübersetzungsmodell, okay?  Äh, es\nlöst all die Probleme, über die ich gesprochen habe\n.  Um noch einmal die\nAnalogie aus dem Film aufzugreifen:\nMan spricht vielleicht mehrere Stunden\nam Tag mit ihm, oder es ist immer an, weil es ja\nauf dem Computer ist, während man\narbeitet, und man ihm asynchron Aufgaben stellt\nund so weiter.   Ähm,\nich werde die Kosten der\nAPI unserer Konkurrenten nicht erwähnen, aber Sprachkommunikation ist\nsehr teuer.  Wahrscheinlich weiß es jeder in diesem Raum\n.\nDer Sprachmodus der meisten Hyperscaler wird\nmit Verlust betrieben.  Es handelt sich um ein gigantisches\nmultimodales Modell, und sie verlieren\njedes Mal Geld, wenn Sie es benutzen.  Aber es ist halt so eine\nMarketingsache und so weiter, schon gut.  Aber wenn\nwir daraus ein tatsächlich profitables Produkt machen wollen,\ndas von den Menschen in\ngroßem Umfang genutzt wird, dann wird das einfach nicht funktionieren.\nUnd insbesondere jeder, der versucht hat,\neine Verbraucher-App mit Sprachsteuerung zu entwickeln, hat\nfestgestellt, dass LLM heutzutage fast\nnichts mehr kostet.  Die gesamte TTS-Technologie (\nSprache-zu-Text) ist zudem sehr günstig.  Uh\nDiarisierung ist erschwinglich.  TTS wird in Zukunft den\ngrößten Teil des Geldes verschlingen.\nIch habe gesehen, wie Leute ihre\nSpendengelder in TTS-Rechnungen investiert haben und nicht einmal\ndie Chance bekommen, ihre\nNutzerbasis zu vergrößern.  Ein\nweiterer Aspekt ist die Privatsphäre.  Je mehr\nSie sich Ihrer KI öffnen, desto\nmehr werden\nSie sich wünschen, dass sie\nkontrollierter und privater agiert und sich\nwohler fühlen, wenn die Informationen nicht\nöffentlich geteilt werden.  Insbesondere\nsehen wir jetzt Menschen mit Mythos, die\nAngst haben, dass jede beliebige Datenbank\nin ein paar Monaten gehackt werden könnte.  Und\ndeshalb, wissen Sie, fühlen Sie sich\nwohler, wenn all Ihre privaten Daten\nlokal gespeichert sind.\nUnd um das zu lösen, ist unser erster Schritt\näh Gradion Phonon.  Äh, es ist äh, geräteinterne\nTTS.  „Auf dem Gerät“ kann also\nvieles bedeuten.  Für manche\nbedeutet „auf dem Gerät“, dass es auf einer Gaming-GPU läuft.\nFür uns bedeutet „On-Device“, dass es auf der\nCPU eines Smartphones läuft.  Es handelt sich also um ein sehr\nkleines Modell mit weniger als 100 Millionen\nParametern, und für seine Größe funktioniert es\nrecht gut.  Es ist besser als alle bisher\nexistierenden\nOn-Device-Modelle.  Kokoro ist ein gutes Spiel\n, aber es hat keine Stimmenklonfunktion.\nUnd da ich keine Zeit mehr habe, würde ich, wenn möglich, nur\neine kurze\nDemo vorspielen.  Ja.\nAch du meine Güte, Morty, hör auf, nach einem\nSignal zu suchen.  Die Gradio-Telefon-App läuft lokal auf\nder CPU, was bedeutet, dass die\nneuronale Sprachverarbeitung in hoher Qualität direkt hier stattfindet, ohne dass\nintergalaktische Cloud-Regierungs-Hacks nötig sind.  Es geht\num Einfachheit ohne Server und\nWartezeiten, einfach um eine reibungslose, unauffällige\nPerformance, die lokal auf dem Gerät abläuft\nund absolute Privatsphäre gewährleistet.   Was\nnoch?\nLokale Verarbeitung?  Das klingt, als würde die\nMaschine ihren eigenen Donut backen.\nMoment mal, wenn die CPU die ganze Arbeit erledigt,\nkann sie dann nicht auch etwas... Ja, das läuft also\nauf der Smartphone-CPU, was bedeutet, dass\nman damit jede\nArt von Sprachanwendung betreiben kann, ohne\neinen einzigen\nCent API-Gebühr zu zahlen.  Wir starten also eine private\nBeta-Phase für dieses Modell.  Unser Ziel ist es,\nMenschen die Möglichkeit zu geben, Verbraucher-Apps\nmit Sprachsteuerung zu erstellen und\ndie Nutzung zu skalieren, ohne dabei\nGeld mit der API zu verlieren.\nZusammenfassend lässt sich also sagen, dass\nder Weg nach vorn\nfür uns derjenige ist, dem ich entschieden widerspreche, der behauptet,\nStimme sei heutzutage eine Ware.  Ich\nhalte das für völlig falsch.  Stimme ist eine\nsehr anspruchsvolle Aufgabe.  Die letzte Meile wird\ndie größte Herausforderung darstellen.  Und\nfür uns geht es wirklich um Wissenschaft und\nTechnik, und das wird uns schließlich zum\nFilm „Her“ führen.  Entschuldigung.  Sie können uns also\nauf gradium.ai nutzen, und wenn Sie sich uns anschließen möchten, um\nsie zum Leben zu erwecken – ja, das ist ein\nanderes Thema. Jetzt verwende ich diese Analogie.\nNein, doch, wenn Sie an\nsehr spannenden Sprachmodellen arbeiten möchten, können Sie sich\nbewerben und zu uns kommen.  Vielen Dank\nfür Ihre Aufmerksamkeit.   Umwerben\n!",
  "transcript_chars": 21370,
  "ingested_at": "2026-05-12T00:31:00.276248+00:00",
  "source": "channel",
  "yt_meta": {
    "view_count": 2295,
    "like_count": 75,
    "channel_id": "UCLKPca3kwwd-B59HNr-_lvA",
    "categories": [
      "Science & Technology"
    ],
    "tags": [
      "ai",
      "ai engineer",
      "ai engineering",
      "software development",
      "tech",
      "startups",
      "software architecture",
      "machine learning"
    ]
  }
}