Ja. Supavocal kann eine klare Aufnahme Ihrer Stimme verwenden, um einmalig Sprache für einen neuen Text zu erzeugen. Das Ergebnis ist eine synthetische Nachbildung Ihrer Stimme – keine Aufnahme von Wörtern, die Sie tatsächlich gesagt haben, und kein dauerhaftes Modell, das für eine spätere Nutzung trainiert wurde.
Voiceclone ist ein Ratgeber; die Aktion öffnet Supavocal. Neue Konten erhalten einmalig 1,000 Startguthaben-Credits. Melden Sie sich dort an, laden Sie 10–30 seconds einer sauberen Sprachaufnahme mit nur einer sprechenden Person hoch und geben Sie einen kurzen Text ein. Die Vorschau mit Ihrer Stimme wird in eine Warteschlange gestellt und ist meist nach etwa einer Minute fertig; dabei wird kein dauerhaftes Stimmmodell trainiert.
Beim Stimmenklonen wird anhand einer Sprachprobe neue, synthetische Sprache erzeugt, die der Stimme der betreffenden Person ähnelt. Gedanken, Erinnerungen oder nicht aufgezeichnete Gespräche lassen sich damit nicht rekonstruieren.
So funktioniert es
Das Verfahren trennt die Stimme einer Person von den Wörtern in einer Aufnahme und nutzt das daraus gelernte Muster, um andere Wörter zu sprechen.
1
Eine saubere Sprachprobe aufnehmen
Sprechen Sie natürlich in einer ruhigen Umgebung. Ihre Stimme sollte deutlich im Vordergrund stehen, mit möglichst wenig Musik oder Gesprächen im Hintergrund. Unterschiedliche Sätze liefern dem System mehr Anhaltspunkte zu Ihren Vokalen, Ihrem Rhythmus, Ihren Tonhöhenwechseln und Ihrer Aussprache als eine wiederholte Formulierung.
2
Ein Stimmmodell erstellen
Das System analysiert akustische Muster, die Ihre Sprache von der anderer Personen unterscheiden. Es schätzt, wie Sie Laute bilden und Sätze rhythmisieren. Es speichert keine perfekte, wiederverwendbare Kopie jeder Gefühlslage oder Sprechweise, die Sie verwenden könnten.
3
Neue Sprache erzeugen
Sie geben Text ein, und ein Sprachgenerator erzeugt daraus Audio mit den erlernten Stimmmerkmalen. Hören Sie sich das Ergebnis vor der Verwendung an: Namen, ungewöhnliche Wörter, Betonungen und längere Passagen können Fehler erkennen lassen, selbst wenn eine kurze Vorschau überzeugend klingt.
Was möglich ist – und was nicht
Was Stimmenklonen leisten kann
Was es nicht garantieren kann
1
Neue Wörter
Was Stimmenklonen leisten kann
Text vorlesen, der in der Sprachprobe nicht vorkam.
Was es nicht garantieren kann
Beweisen, dass die ursprüngliche sprechende Person diese Worte gesagt oder gebilligt hat.
2
Wiedererkennbarer Klang
Was Stimmenklonen leisten kann
Einen Teil des Stimmklangs, Akzents und Sprechrhythmus einer Person reproduzieren.
Was es nicht garantieren kann
Jede Nuance einer Live-Darbietung treffen.
3
Sprechweise
Was Stimmenklonen leisten kann
Einen wiederholbaren Stil für vorgegebene Textpassagen erzeugen.
Was es nicht garantieren kann
Für jeden Kontext die richtige Emotion oder Betonung ableiten.
4
Sprache
Was Stimmenklonen leisten kann
Text in Sprachen vorlesen, die der gewählte Generator unterstützt.
Was es nicht garantieren kann
In jeder Sprache einen natürlichen Akzent oder eine natürliche Aussprache bewahren.
5
Quellaufnahme
Was Stimmenklonen leisten kann
Aus einer Aufnahme lernen, in der die sprechende Person deutlich zu hören ist.
Was es nicht garantieren kann
Eine Zielstimme zuverlässig von starken Störgeräuschen oder gleichzeitig sprechenden Personen trennen.
6
Identität
Was Stimmenklonen leisten kann
Audio erzeugen, das Zuhörende mit einer Person in Verbindung bringen könnten.
Was es nicht garantieren kann
Einwilligung, Urheberschaft oder Echtheit eigenständig nachweisen.
Wer es nutzt
Sinnvolle Anwendungen beginnen mit einer Einwilligung: Klonen Sie Ihre eigene Stimme oder arbeiten Sie mit einer Person, die der vorgesehenen Nutzung ausdrücklich zugestimmt hat.
Unabhängige Kreative
Jemand muss einen Satz in einem vertonten Video ändern, ohne den gesamten Text erneut aufzunehmen.
Ein kurzer Ersatzsatz kann den vertrauten Klang bewahren, sofern die Person das Timing überprüft und den synthetischen Einsatz gegebenenfalls kenntlich macht.
Dies ist eine visuelle Anleitung für den Ablauf, kein Klangvergleich. Nur wenn Sie sich die Originalprobe und das generierte Audio anhören, können Sie beurteilen, wie ähnlich sie klingen.
Probieren Sie es mit Ihrer eigenen Stimme aus
Hören Sie, was sich aus Ihrer Aufnahme erzeugen lässt
Beginnen Sie mit einer eigenen Sprachaufnahme und einem kurzen Satz, den Sie gut kennen. Vergleichen Sie den erzeugten Satz mit Ihrer Originalaufnahme und ändern Sie dann die Aufnahme oder den Wortlaut, wenn Aussprache, Sprechtempo oder Tonfall nicht stimmen. Reichen Sie niemals die Stimme einer anderen Person ohne deren Erlaubnis ein.
Verwenden Sie eine Aufnahme mit nur einer klar verständlichen Stimme
Prüfen Sie die Audiodatei, bevor Sie sie teilen
Denken Sie an Einwilligung und Kennzeichnung
Häufig gestellte Fragen
Ja. Ein System zum Stimmenklonen kann eine Aufnahme Ihrer Sprache analysieren und daraus neue Audiodateien erzeugen, die Ihrer Stimme ähneln. Wie stark die Ähnlichkeit ist, hängt von der Aufnahme, dem Generator und den Wörtern ab, die Sie ihn sprechen lassen. Sie beweist nicht, dass Sie den erzeugten Satz selbst gesprochen haben.
Nicht unbedingt. Eine ruhige Aufnahme mit wenig Hall und ohne weitere sprechende Person ist hilfreicher als eine professionell bearbeitete Aufnahme, in der die Stimme von Musik überlagert wird. Wenn das Ergebnis dumpf oder uneinheitlich klingt, versuchen Sie es mit einer klareren Aufnahme, bevor Sie annehmen, dass sich die Stimme nicht nachbilden lässt.
Rechnen Sie mit einer Ähnlichkeit, nicht mit einer exakten Kopie. Unbekannte Namen, starke Emotionen oder eine Sprechweise, die in Ihrer Aufnahme nicht vorkommt, können weniger natürlich klingen. Ganze Sätze anzuhören ist aussagekräftiger, als ein einzelnes kurzes Wort zu beurteilen.
Aufnahmen können missbraucht werden. Deshalb ist die Einwilligung wichtig, auch wenn die Technologie leicht zugänglich ist. Verwenden Sie Ihre eigene Stimme oder holen Sie die ausdrückliche Erlaubnis der sprechenden Person ein. Geben Sie synthetische Sprache nicht als echte Aufnahme aus. Überlegen Sie sorgfältig, wo Sie Originalaufnahmen und erzeugte Audioclips teilen.