音声から発話を生成
音声ファイルの録音から音声クローンを作成する方法
自分が所有している、または使用許可を得ている声の録音から始めましょう。Voicecloneは、その音声ファイルを新しいテキストの読み上げに使う音声リファレンスにする手順を案内し、使用前に生成結果を元の音声と比較できるようにします。
Voicecloneはガイドです。操作するとSupavocalが開きます。新規アカウントには、初回限定のウェルカムクレジット1,000が付与されます。そこでサインインし、10–30秒のクリアな単独話者の音声をアップロードして、短い台本を入力してください。キューに入った音声条件付きプレビューは通常約1分で完了します。永続的な音声モデルのトレーニングは行いません。
私の録音の声で、この短いウェルカムメッセージを読み上げてください:ご参加ありがとうございます。次の手順をご案内します。
これは台本の表示例であり、入力欄ではありません。ここではテキストは送信されません。サインイン後、Supavocalで台本を入力してください。
音声ファイルが声のリファレンスとなり、書いたテキストが次に話す言葉になります。
音声から新しい読み上げが生成される理由
録音は声の特徴を参照するためのもので、再生する台本ではありません。生成音声が何を話すかはテキストによって決まります。
-
1
クリアな録音を選ぶ
同意を得た話者が1人だけで、背景雑音の少ない音声ファイルを使用してください。まず最後まで聞いて確認しましょう。声の重なりや音楽、途切れた言葉があると、声を識別しにくくなります。
-
2
短いテスト文を書く
録音とは異なる文を入力してください。短く聞き慣れた文なら、元の音声を繰り返さずに音声クローンが話者らしさを保っているかを聞き取りやすくなります。
-
3
聞いて調整する
生成された音声を音声ファイルと比較してください。不明瞭だったり話者らしくなかったりする場合は、よりクリアな元の録音を試すか、長い文章を作成する前にテキストを調整してください。
ツールセクション
音声クローンは新しい読み上げを生成できますが、参照元の録音にあるすべての問題を修復できるわけではありません。
-
複数の音が重なった音声から、話者の声だけを確実に分離することはできません
複数人の声や大きな音楽が入った音声ファイルでは、参照する声にほかの音が混ざります。
対処法1人の話者の声がはっきり聞こえる録音を選ぶか、音声の明瞭な部分を切り出してから再試行してください。
-
感情表現を正確に再現できるとは限りません
落ち着いた話し方のサンプルだけでは、叫び声やささやき声、演劇的な話し方を忠実に再現するための情報が不足する場合があります。
対処法テスト用の文章を元の話し方に近いものにし、結果を聞いて判断してください。
-
使用許可の有無は確認できません
音声ファイルを持っていても、音声クローンの作成や共有について話者の同意を得ていることにはなりません。
対処法自分の声を使用するか、録音をアップロードする前に話者本人の明確な許可を得てください。
仕様表
- 入力:録音された音声
- 出力:新しい文章の読み上げ音声
入力は話者の声を含む音声ファイルで、出力は文章から生成された音声です。これらの画像は作業の流れを示すものであり、音声の生成前後を聞き比べるテストではありません。両方の録音を聞いて、声の類似性、明瞭さ、発音を確認してください。
録音した声で新しい文章を試す
明瞭な音声ファイルと、使用許可を得た短い文章を用意してください。まず短い音声クローンのサンプルを作り、元の音声と聞き比べてから、長い文章にも使えるか判断しましょう。
Supavocalに進む- 声がはっきり聞こえる話者が1人
- 最初の比較に使う短い文章
- 声の持ち主からの許可
バリエーションに関するFAQ
音声ファイルを参照データとして使い、似た声の音声を生成できます。結果は話者の声がどれだけはっきり聞こえるかに左右されるため、明瞭な録音から始め、短い出力を確認してから使用を判断してください。
元の録音は声の参照として使用され、入力したテキストが新しい言葉になります。元の言葉をそのまま使用したい場合は、新しい読み上げを生成するのではなく、音声ファイルを再生してください。
話者が1人で、発話が明瞭で、音楽や周囲の会話がほとんどない録音を選んでください。ソースとして使用する前に、音の歪みや音節の欠落がないか確認し、所有している声、またはクローンの許可を得ている声のみを使用してください。
ソースに含まれるノイズ、話者の重なり、普段と異なる話し方が結果に影響することがあります。よりクリアな録音を試し、短い文でテストして、出力を耳で比較してください。生成された読み上げが完全なコピーになるとは限りません。