{
  "video_id": "ILdE7FaAjVA",
  "channel_slug": "aidotengineer",
  "channel_handle": "aidotengineer",
  "title": "Under 5 minutes to a deployed LLM endpoint — Audry Hsu, RunPod",
  "duration_seconds": 806.0,
  "url": "https://www.youtube.com/watch?v=ILdE7FaAjVA",
  "upload_date": "",
  "transcript": "[Musik]\nAudrey, ähm, ich bin von RunPod.  Dies ist\neine Einführung in RunPod.  Könnte ich\nkurz umhören, wie viele Leute\nschon einmal von RunPod gehört oder es vielleicht sogar schon einmal\nbenutzt haben?\nOkay, für alle Neulinge.  Großartig.\nÄhm\n, also RunPod, wir sind ein Unternehmen für Cloud-KI-\nInfrastruktur.  Wir verfügen also über die\nHardware, wir haben die GPUs, und wir erleichtern es\nEntwicklern,\nUM-Modelle bereitzustellen.  Und das kann Ihr eigenes\nprivates Modell sein, es kann aber auch ein Open-Source-\nModell von Hugging Face sein.  Das ist\nuns egal.  Sie bringen Ihren Code mit, wir kümmern uns um\nden Rest.\nÄhm, nur ganz kurz: Welche Probleme\nlöst RunPod?  Warum sind wir überhaupt\nheute hier?   Die\nVerwaltung der Infrastruktur kann schwierig sein\n.\nIch denke da noch an die Zeit vor\nAWS und Google Cloud zurück, als jeder seine eigenen\nServer vor Ort haben und\ndiese verwalten und warten musste.  Das\n[räuspert sich] ist etwas, was wir\nals Entwickler eigentlich nicht tun wollen.\nDas sind Dinge, von denen wir uns glücklicherweise\nverabschiedet und sie an\nDevOps abgegeben haben, und jetzt ist es\nfür uns sogar noch abstrakter.   Der\nZugriff auf die GPU ist langsam und undurchsichtig.  Also, ähm,\nich weiß nicht, ob irgendjemand in\nletzter Zeit versucht hat, eine GPU zu kaufen, wir befinden uns in einer globalen\nAngebotsknappheit.  Ähm, das ist ein bisschen wie während der\nCOVID-Pandemie, als alle in die Läden rannten\nund das ganze Toilettenpapier kauften, weil\nwir nicht wussten,\nwie lange sie zu Hause bleiben müssten\n.  Wir stecken momentan ein bisschen mittendrin\n.  Ähm, aber wir gehen davon aus, dass sich der Markt\nerholen wird, wenn Kunden, Unternehmen und\nPrivatpersonen etwas besser einschätzen können,\nwelche Art von Rechenleistung sie\nbenötigen.\nUnd schließlich sollte der Hauptfokus des Bauunternehmers auf dem\nBau selbst liegen.  Also, nochmal,\nwir als Softwareentwickler wollen den\nWert durch die von\nuns entwickelten Anwendungen schaffen, nicht durch die Verwaltung der\nInfrastruktur.\nUnd ich glaube, RunPod hat eine ziemlich einzigartige\nGeschichte.  Das sind unsere Gründer,\nZenon und Pardeep.  Also, sie hatten 2022 ein\npaar GPU-Rigs im Keller, ähm, das\nKrypto-Mining ist gescheitert, und dann fragten\nsie sich: „Was machen wir\njetzt mit unseren GPUs?“\nAlso, sie haben einen Prototyp entwickelt, der heute die\nGrundlage für RunPod bildet.  Sie posteten auf\nReddit und sagten: „Hey, hat jemand Lust,\ndiese GPUs kostenlos zu nutzen? Gebt uns einfach\nFeedback dazu.“  Und genau so hat\nunser Unternehmen angefangen, und wir erwirtschaften seitdem ununterbrochen\nUmsätze.\nUnd der Grund, warum ich\ndiese Geschichte erzählen möchte, ist nicht, weil sie\nsehr an Bootstrap erinnert, sondern weil\ndie Entstehungsgeschichte von RunPod schon\nimmer mit Entwicklern und dem\nEinholen von Feedback aus der Community begann, und\ndas gilt auch heute noch.\nIch kann also nicht versprechen, dass wir\nperfekt sein werden, aber wir sind definitiv sehr\naktiv mit unseren Nutzern auf Reddit und\nDiscord.  Also, ähm,\nwir versuchen immer,\nmit euch in Kontakt zu bleiben.\nUm Ihnen einen kurzen Überblick\nüber RunPod zu geben: Wir haben über 500.000\nEntwickler auf unseren Plattformen und mehr als 30\nRechenzentren weltweit, darunter auch in\nEuropa und der EU.\nUnd wir haben gerade einen wichtigen\nUmsatzmeilenstein für uns erreicht: 120 Millionen an\njährlich wiederkehrenden Einnahmen.\nDas sind nur einige unserer Kunden.\nSie werden vielleicht überrascht sein,\nhier auch einige KI-Cloud-native Unternehmen zu sehen,\naber sie kommen aus den gleichen Gründen zu uns\nwie die meisten unserer Kunden\n.  Das liegt daran, dass\nsie eine flexible und\nzuverlässige GPU-Infrastruktur benötigen.\nDies ist ein sehr allgemeiner\nÜberblick über verschiedene Möglichkeiten, wie Sie\nRunPod erweitern können.  Also, ich würde sagen, unser\nKern, unsere Pods, sind unsere\nvirtuelle Sandbox-Umgebung.  Wir starten\neinen Container für Sie, weisen ihm GPUs zu\nund kümmern uns um den Rest.\nBring einfach deine\nDockerfiles und deinen Code mit.\nServerless, ähm, das ist unser Auto-Scaling-\nProdukt.  Wenn Sie also eher an\nkurzzeitige oder Batch-\nWorkloads denken, ist Serverless wirklich großartig,\ndenn im Gegensatz zu\neinem Container, der ständig aktiv ist, werden bei Serverless die\nWorker heruntergefahren, und wenn sie im Leerlauf sind, fallen\nkeine Kosten an.\nClusters, ähm, falls ihr ein\nintensives Training absolviert, gibt es auch für euch einen Platz\nauf RunPod.  Um Multi-Node-\nCluster mit Hochgeschwindigkeitsnetzwerk.\nUnd dann noch der Hub, zu dem ich gleich\nwechseln werde, ähm, das ist so etwas wie\nunser zentrales Repository für KI-\nRepositories.\nDiese sind bereits vorkonfiguriert und\ngeprüft.  Wir haben einige\nBeispiele für Angebote von RunPod für\nbeliebte Modelle, aber auch unsere Community trägt dazu bei\n.  Es\ngibt also Repositories, die man forken,\nbeobachten und dann mit einem Stern markieren und\nauf RunPod bereitstellen kann.   Also\n, heute werden wir\nhauptsächlich über Serverless sprechen.   Also\n, Serverless ist am besten für Echtzeit-\nInferenz geeignet.  Ich habe über die damit verbundene\nautomatische Skalierung gesprochen.   Der Hauptgrund,\nwarum Teams es nutzen, ist, dass sie\nnicht im Voraus abschätzen müssen,\nwie viel Rechenleistung sie benötigen\n.\nSie können die\nmaximale Anzahl der Worker konfigurieren, auf die Sie skalieren möchten\n.  Sie können Obergrenzen für\nAusgaben festlegen.  Und Sie können auch\nWorker konfigurieren, die immer aktiv sind, sodass\nsie\nIhre Modelle bereits heruntergeladen haben und\nsofort auf Anfragen reagieren können.\nFür viele Teams ist Serverless der\nschnellste Weg, wenn man\neine produktionsreife API bereitstellen möchte.\nUnd\njetzt\nzeige ich euch ganz schnell, wie\neinfach der Einstieg und die Bereitstellung von\netwas ist.\nOkay.\nWo sind wir?\nOkay.  Also, ich werde jetzt\nalles über die Konsole machen, damit es\nfür euch schön und übersichtlich aussieht, aber\nwir haben auch CLI-Unterstützung.  Wir haben die nötigen\nFähigkeiten, um mit RunPod zu arbeiten,\nalles ist für Ihren Agenten vorbereitet,\nsodass Sie unsere Dokumente nicht lesen müssen.\nDa wir aber heute alle nur Menschen sind, zeige\nich es Ihnen anhand der Konsole.\nWir beginnen im Hub. Wenn\nSie einfach nur erkunden und sehen möchten, was es so gibt, was\nSie sofort umsetzen können, ist\nder Hub ein idealer Ausgangspunkt.  Wie bereits\nerwähnt, handelt es sich hierbei um\ngeprüfte Open-Source-Einträge für KI-\nRepositories.\nIch werde das LLM auswählen\nund auch das zugrundeliegende\nRepository öffnen, damit ihr\nsehen könnt, was\nes ist – im Grunde nur ein GitHub-\nRepository.\nDarin wird erklärt, wie Sie sich darauf vorbereiten können.\nÄhm,\nwir können sehen, dass die\nDockerfile hier bereits vorhanden ist.  Es ist bereits\nfür Sie vorkonfiguriert.  Es gibt je nach Angebot einige\nStandardeinstellungen\n.  Sie können verschiedene Umgebungsvariablen übergeben,\num es nach Ihren Wünschen zu konfigurieren.\nAber ich klicke jetzt einfach mal auf „\nBereitstellen“.\nUnd\nich habe ein Modell, das ich haben wollte. Mal sehen.\nIch wollte mir einfach einen aussuchen.\nSieht gut aus.\nDies lädt es von\nHugging Face herunter.  Ich öffne einfach\ndie erweiterten Optionen und suche nach der\nmaximalen Modelllänge. Diese werde ich\nfür das Kontextfenster erhöhen\nund alle anderen Einstellungen auf den\nStandardwerten belassen. Es gibt aber auch Einstellungen für die maximale\nLoras-Länge.  Alle diese\nKonfigurationsoptionen werden als\nFlags an den vLLM-Server übergeben.\nUnd\nich werde es hier als Endpunkt einrichten\n.\nDas kann ein oder zwei Minuten dauern,\nda ich es gerade erst erstellt habe\n.  Ich muss meine Worker initialisieren.   Schauen wir mal nach\n.\nDie Standardkonfiguration sieht also vor, dass die Anwendung\nauf einigen H100-Systemen bereitgestellt wird,\nwährend A100-Systeme als Backup dienen.  Ich habe meine\nPreise.  Das ist ein\nBruchteil eines Cents pro Sekunde.  Wie ich\nbereits erwähnt habe, fallen die Kosten nur so\nlange an, wie der Worker\ntatsächlich läuft und eine Anfrage bearbeitet.   Bei\nMax workers kann ich die Anzahl erhöhen,\nwenn ich\nmeine Arbeitslast auf bis zu 15 Worker gleichzeitig skalieren möchte,\nund ich kann\neinige aktive Worker festlegen, die\nimmer laufen sollen, damit der\nContainer niemals heruntergefahren wird.\nUnd das kann ich speichern.\nOkay, wie interagiert man also\nmit dem serverlosen Endpunkt?   Ähm, das hier\nist einfach ein API-\nHTTP-Endpunkt.  Wir\nstellen Ihnen diesen Endpunkt bereit.  Hier können Sie\nAnfragen senden.  Ihre Kunden\nkönnen Anfragen an diese Adresse senden.  Wenn ich einfach auf „Ausführen“ drücke\nund noch\nein paar „\nWelche sollten wir heute dem LLM fragen?“ hinzufügen möchte.   Sag\neins.\nOkay.\nWie kam Bid Then zu seinem Namen? Ich bin Amerikaner, wie kam das Unternehmen zu diesem\nNamen?  Ich weiß nicht.\n[räuspert sich]\nÄhm okay, diese Anfragen befinden sich in der Warteschlange.   Ich werde nach\nunseren Mitarbeitern sehen.\nOkay.\nWir haben eine Handvoll, die sich noch in der\nInitialisierungsphase befinden.  Ähm, hier wird gerade der Container\nerstellt.  Das ist das Modell, das\nheruntergeladen wird.  Diejenigen, die sich vorbereiten, und\ndiejenigen, die bereits laufen, sind schon\nfertig.  Das werden wahrscheinlich\ndiejenigen sein, die die\nAnfragen bearbeiten, die wir gerade hinzugefügt haben.  Ich habe\nTelemetriedaten, die im Moment noch\nleer sind, aber die Anzahl der\nAnfragen, die Ausführungszeit, die Verzögerungszeit, sodass\nSie Einblick in die\nFunktionsweise Ihrer Endpunkte haben.\n[schnaubt] Mal\nsehen.  Okay, es ist bereits erledigt.\n[schnaubt]\nIch habe eine Antwort auf meine Anfrage erhalten, die\netwa 41 Sekunden in der Warteschlange verblieb.  Ähm, das wird\netwas länger dauern als alle\nnachfolgenden Anfragen, aufgrund\nder Kaltstartzeit, von der ich\ngesprochen habe, wie z. B. das Herunterladen des\nModells, ähm die\nInitialisierung des ersten Containers, aber ähm die\nAusführungszeit beträgt nur etwa 1,5\nSekunden, also\nja, das waren wahrscheinlich weniger als 5\nMinuten, um loszulegen und etwas ähm auf\nServerless von einem Hub-Eintrag aus bereitzustellen.\nHat jemand Fragen?  Dies ist\neine sehr kurze und knackige Einleitung.  Ähm, wir\nhaben heute später um 16:00 Uhr noch eine weitere Sitzung, die sich\nauf unser Python SDK konzentrieren wird und\nkomplett über das Terminal stattfinden wird.\nÄhm, und ich werde Ihnen jetzt zeigen, wie\nich\nmeinen Code als\nRemote-Funktion auf einer GPU starten und bereitstellen kann, und wie ich ihn am\nEnde\nauch als produktionsreifen Endpunkt hier einsetzen kann.\nOkay.  Das war's für heute, also\nja, vielen Dank fürs Kommen.\n[Applaus]\n[Musik]",
  "transcript_chars": 10582,
  "ingested_at": "2026-06-15T00:52:29.551888+00:00",
  "source": "channel",
  "yt_meta": {
    "view_count": 3582,
    "like_count": 69,
    "channel_id": "UCLKPca3kwwd-B59HNr-_lvA",
    "categories": [
      "Science & Technology"
    ],
    "tags": [
      "ai",
      "ai engineer",
      "ai engineering",
      "software development",
      "tech",
      "startups",
      "software architecture",
      "machine learning"
    ]
  }
}