入力する素材
テキスト読み上げ
書かれた文章
音声文字起こし
録音済みまたはライブの音声
音声を扱うワークフローには、次の2つの異なる方向があります。個々のモデルを比較する前に、入力と出力の列を使って候補を絞り込んでください。
テキスト読み上げ
書かれた文章
音声文字起こし
録音済みまたはライブの音声
テキスト読み上げ
聞き取れる音声
音声文字起こし
文字起こしされた文章
テキスト読み上げ
適切な声と話し方
音声文字起こし
録音に適した文字起こしモデル
テキスト読み上げ
読み上げ結果が意図した言葉遣いと発音を保っている
音声の文字起こし
文字起こしが実際に話された言葉を捉えている
テキスト読み上げ
紛らわしい名前、略語、句読点
音声の文字起こし
背景雑音、話者の声の重なり、不明瞭な音声
テキスト読み上げ
元のテキストを読みながら音声を聞く
音声の文字起こし
元の音声を再生しながら文字起こしを読む
どちらの変換でも、元の情報をすべて伝えられるわけではありません。結果が明瞭に見えても完全だと決めつけず、以下の使用例を参考に確認してください。
短い台本をナレーションに変換します。文章上の強調が、意図した間や口調に反映されないことがあります。
編集したシーンに合わせて、名前、タイミング、強調の仕方を聞いて確認しましょう。ナレーションではなく画像の生成には、novitaの画像モデルで画像向けの選択肢を紹介しています。
novitaの画像モデル録音した回答をテキストに変換します。文字起こしでは、言いよどみ、話者の交代、感情が抜け落ちることがあります。
録音を残しておき、誰の発言か、あるいは正確な言葉遣いが重要な箇所は再生して確認しましょう。別の画像出力のワークフローについては、novitaの画像モデルで画像の選択肢を紹介しています。
novitaの画像モデル書面の指示を音声版にします。書式だけでは、聞き手に各手順の区切りが伝わらない場合があります。
ページを見ずに音声を確認し、聞いて理解しにくい文を修正します。プロジェクトで生成画像も必要な場合、novitaの画像モデルはその別の出力形式に対応します。
novitaの画像モデル同じ短い文章を使って音声サンプルを比較します。1つの文で良い結果が出ても、長い文章で同じ結果になるとは限りません。
各テストに名前、数字、完結した指示を含めます。画像素材を比較する場合、novitaの画像モデルは画像出力に特化しています。
novitaの画像モデル繰り返し試せるよう、テストは小規模にします。入力を統一すると、その場で行うデモよりも、違いを聞き取りや読み取りで見分けやすくなります。
入力元がテキストか音声かを決め、必要な出力を書き出します。テストする前に、各候補に記載された入力と出力を確認してください。
音声生成には、プロジェクトで使う名前や句読点を含む文章を使用します。文字起こしには、実際の音源と同じ雑音や話し方を含む短い録音を使用します。
候補間で同じサンプルを使用します。抜けた単語、予期しない発音、話者の取り違え、聞き直しが必要な箇所を記録します。
生成音声は、まず原稿を見ずに聞き、次に一語ずつ原稿を追いながら聞きます。文字起こしでは、不確かな箇所を再生し、名前と数字を手作業で確認します。モデルの変更や素材の修正後に再確認できるよう、元の入力を保管してください。
音声関連の選択肢を探すには、音声モデルの一覧から始めるのが適切です。サンプルを準備する前に、各モデルの一覧に記載されたタスク、受け付ける入力、出力を確認してください。カテゴリ名だけでは、すべてのモデルが同じ用途に対応するとは判断できません。
比較条件をそろえるため、候補の声それぞれで同じ文章を試してください。声の名前だけで判断せず、聞き取りやすさ、発音、話し方が想定する視聴者に合っているかを確認しましょう。
音声モデルの一覧に載っているモデルが、すべて同じ言語に対応しているとは限りません。各モデルの情報を確認し、実際に使用する素材に含まれる言語、アクセント、名前で試してください。
生成された音声は元のテキストと照らし合わせ、単語の抜け、不自然な間、名前の誤読がないかを聞いて確認してください。文字起こしの結果は元の音声を再生しながら、不確かな単語、話者、数字を確認してください。