So entsteht eine synchrone KI-Stimme für ein Erklärvideo
Freie Nutzung von Text & Abbildungen & Audio & Video mit einem Unidigital-Zugang
Ihr möchtet eurem Erklärvideo nachträglich ein Audio hinzufügen, um es mit einer KI-Stimme zu begleiten? Dies klappt über einen Workflow mit ChatGPT und ElevenLabs. Hierzu wird das Video in ChatGPT hochgeladen und ein passendes Skript generiert, das anschließend mit ElevenLabs in eine KI-generierte Erzählstimme umgewandelt wird.
Audio über 90 Sekunden mit Text-to-Speech-Tool ElevenLabs erstellt
Zuerst lade ich das 90-sekündige Erklärvideo in ChatGPT hoch und formuliere einen geeigneten Prompt, damit sich das Sprachmodell am Upload orientiert und ein passendes Skript generiert, das im besten Fall synchron zum Video abgespielt werden kann. Hierfür zerlegt ChatGPT das Video in Frames und analysiert diese. Es ist sinnvoll, im Prompt die geplante Aufgabe im Hinblick auf das Text-to-Speech-Tools anzugeben.

Prompt für ChatGPT:
Der Upload ist ein kurzes Erklärvideo ohne Audio. Schreibe für dieses Video ein passendes Skript, das ich über ein Text-2-Speech-Tool in ein Audio umwandeln kann.
Nachdem ich das Skript für ein 90-sekündiges Audio durchgelesen habe, füge ich dieses eins zu eins in ElevenLabs auf der Plattform „ElevenCreative“ im Bereich „Text-2-Speech“ ein. Die Anwendung arbeitet multilingual, also kann es den deutschen Text direkt erfassen und auch als deutschsprachige Audiodatei ausgeben. Als KI-Stimme wähle ich „Bella“ aus und starte die Generierung.

Skript für ElevenLabs:
Willkommen bei der interaktiven Lernplattform zur intelligenten Analyse von Dokumenten.
Zu Beginn wird ein Dokument, zum Beispiel eine PDF-Datei, hochgeladen. Die Anwendung analysiert anschließend automatisch die enthaltenen Texte, Abbildungen und Zusammenhänge.
Nach der Verarbeitung stehen vier zentrale Funktionen zur Verfügung.
Mit dem Chat-Assistenten können gezielte Fragen zum hochgeladenen Dokument gestellt werden. Die künstliche Intelligenz beantwortet diese Fragen direkt auf Grundlage der vorhandenen Inhalte. So lassen sich wichtige Informationen schnell finden und verständlich erklären.
Der Bereich Multiple-Choice-Quiz erstellt automatisch passende Fragen zum Dokument. Die Antworten werden sofort ausgewertet, sodass der eigene Wissensstand einfach überprüft werden kann.
Unter Abbildungen und Grafiken werden relevante visuelle Inhalte aus dem Dokument übersichtlich dargestellt. Ergänzende Beschreibungen helfen dabei, Diagramme, Modelle und Zusammenhänge genauer zu verstehen.
Die Prozess-Simulation macht Abläufe interaktiv erlebbar. Verschiedene Parameter können verändert werden, um deren Einfluss auf einen Prozess unmittelbar zu beobachten.
Die Anwendung verbindet damit Dokumentenanalyse, künstliche Intelligenz und interaktives Lernen in einer zentralen Oberfläche. Komplexe Inhalte werden schneller zugänglich, verständlicher aufbereitet und können auf unterschiedliche Weise erkundet werden.
Nach einigen Sekunden ist der Vorgang beendet und es werden zwei Audios präsentiert, die ich abspielen und herunterladen kann. Hierfür nutze ich den Free Plan von ElevenLabs. Zum Schluss spiele ich gleichzeitig das selbst aufgezeichnete Erklärvideo und das KI-generierte Audio ab, um zu überprüfen, ob der Videoinhalt thematisch zum KI-Vortrag passt und beide ungefähr synchron ablaufen. Ja, mit zum Teil leichter Verzögerung zum Video hat die KI-Stimme die App zur Dokumentenanalyse erfolgreich vorgestellt.
Möchtet ihr das Audio exakt synchron zum Video generieren, so können die Feinheiten entweder mit ChatGPT vorgenommen oder auch manuell in ElevenLabs ausgeführt werden. Hier lassen sich zum Beispiel gezielt Wörter oder Textpassagen hinzufügen oder entfernen, damit die abgestimmte Kombination aus Video & Audio insgesamt stimmig ist. Viel Erfolg!
Autor


