Ausgangsmaterial
Text zu Sprache
Geschriebene Wörter
Sprache zu Text
Aufgezeichnete oder live gesprochene Sprache
Leitfaden für Sprachmodelle
Die Übersicht der novita-Sprachmodelle ist ein Ausgangspunkt, ersetzt aber nicht das Anhören eines Ergebnisses. Klären Sie zuerst, ob Sie Sprache aus Text erzeugen oder Wörter aus einer Audioaufnahme erkennen möchten. Testen Sie dann eine kurze, repräsentative Probe.
Dies sind zwei unterschiedliche Ansätze für einen Sprach-Workflow. Grenzen Sie Ihre Suche anhand der Eingabe- und Ausgabespalten ein, bevor Sie einzelne Modelle vergleichen.
Text zu Sprache
Geschriebene Wörter
Sprache zu Text
Aufgezeichnete oder live gesprochene Sprache
Text zu Sprache
Hörbare Sprache
Sprache zu Text
Schriftliches Transkript
Text zu Sprache
Eine passende Stimme und Sprechweise
Sprache zu Text
Ein für die Aufnahme geeignetes Transkriptionsmodell
Text-zu-Sprache
Das gesprochene Ergebnis gibt den beabsichtigten Wortlaut und die Aussprache wieder
Sprache-zu-Text
Das Transkript erfasst die gesprochenen Wörter
Text-zu-Sprache
Mehrdeutige Namen, Abkürzungen oder Satzzeichen
Sprache-zu-Text
Hintergrundgeräusche, gleichzeitig sprechende Personen oder undeutliche Audioaufnahmen
Text-zu-Sprache
Hören Sie zu, während Sie den Ausgangstext lesen
Sprache-zu-Text
Lesen Sie das Transkript, während Sie die Aufnahme erneut abspielen
Keine der beiden Richtungen übernimmt alle Hinweise aus der Vorlage. Diese Anwendungsfälle zeigen, was Sie prüfen sollten, statt davon auszugehen, dass ein klar wirkendes Ergebnis vollständig ist.
Wandelt ein kurzes Skript in einen gesprochenen Kommentar um. Schriftliche Hervorhebungen führen möglicherweise nicht zur beabsichtigten Pause oder Tonlage.
Prüfen Sie beim Anhören Namen, Timing und Betonung anhand der bearbeiteten Szene. Für visuelle Generierung statt eines gesprochenen Kommentars finden Sie bei novita-Bildmodellen bildbezogene Optionen.
novita-BildmodelleWandelt aufgezeichnete Antworten in Text um. In einem Transkript können Zögern, Sprecherwechsel oder Emotionen fehlen.
Halten Sie die Aufnahme bereit und spielen Sie Passagen erneut ab, bei denen die Zuordnung zu einer Person oder der genaue Wortlaut wichtig ist. Für einen separaten Workflow zur visuellen Ausgabe beschreiben novita-Bildmodelle die verfügbaren Bildoptionen.
novita-BildmodelleErstellt gesprochene Fassungen schriftlicher Anweisungen. An der Formatierung allein ist für Zuhörende möglicherweise nicht erkennbar, wo ein Schritt endet.
Hören Sie sich die Audiofassung an, ohne auf die Seite zu schauen, und überarbeiten Sie schwer verständliche Sätze. Wenn das Projekt auch generierte Bilder benötigt, decken novita-Bildmodelle diese andere Ausgabeart ab.
novita-BildmodelleVergleicht Sprachproben anhand derselben kurzen Passage. Ein gutes Ergebnis bei einem Satz lässt sich möglicherweise nicht auf längere Inhalte übertragen.
Nehmen Sie in jeden Test einen Namen, eine Zahl und eine vollständige Anweisung auf. Für Vergleiche mit Bildmaterial konzentrieren sich novita-Bildmodelle auf Bildausgaben.
novita-BildmodelleHalten Sie den Test so klein, dass er sich wiederholen lässt. Bei gleichbleibender Eingabe sind Unterschiede leichter zu hören oder zu lesen als bei einer improvisierten Vorführung.
Entscheiden Sie, ob Ihr Ausgangsmaterial Text oder Audio ist, und notieren Sie die benötigte Ausgabe. Prüfen Sie vor dem Testen bei jedem Modell, welche Ein- und Ausgaben angegeben sind.
Verwenden Sie für generierte Sprache eine Passage mit den Namen und Satzzeichen, die in Ihrem Projekt vorkommen. Verwenden Sie für eine Transkription eine kurze Aufnahme mit denselben Hintergrundgeräuschen und demselben Sprechstil wie im tatsächlichen Ausgangsmaterial.
Verwenden Sie für alle Modelle dieselbe Probe. Notieren Sie ausgelassene Wörter, unerwartete Aussprachen, Verwechslungen von Sprechenden und Stellen, die Sie ein zweites Mal anhören müssen.
Hören Sie sich eine generierte Stimme einmal ohne Textvorlage an und ein zweites Mal, während Sie jedes Wort mitlesen. Spielen Sie bei einer Transkription unklare Passagen erneut ab und überprüfen Sie Namen und Zahlen von Hand. Bewahren Sie die ursprüngliche Eingabe auf, damit Sie die Prüfung nach einem Modellwechsel oder einer Überarbeitung des Materials wiederholen können.
Die Liste der Sprachmodelle ist ein guter Ausgangspunkt, um sprachbezogene Optionen zu erkunden. Prüfen Sie vor der Vorbereitung einer Probe bei jedem Eintrag die angegebene Aufgabe sowie die akzeptierten Ein- und Ausgaben. Aus dem Kategorienamen allein geht nicht hervor, dass jedes Modell dieselbe Aufgabe erfüllt.
Testen Sie denselben Textabschnitt mit jeder infrage kommenden Stimme, damit der Vergleich aussagekräftig bleibt. Achten Sie auf Verständlichkeit, Aussprache und darauf, ob die Sprechweise zur Zielgruppe passt, statt allein nach dem Namen der Stimme zu urteilen.
Gehen Sie nicht davon aus, dass alle aufgeführten Stimmmodelle dieselben Sprachen unterstützen. Prüfen Sie die Angaben zum jeweiligen Modell und testen Sie die Sprache, den Akzent und die Namen, die in Ihrem Material vorkommen.
Vergleichen Sie bei generierten Audioaufnahmen die Aufnahme mit dem Ausgangstext und achten Sie auf ausgelassene Wörter, unpassende Pausen und falsch ausgesprochene Namen. Hören Sie bei einem Transkriptionsergebnis das Originalaudio erneut an und überprüfen Sie dabei unklare Wörter, Sprecher und Zahlen.