Leitfaden für Sprachmodelle

So bewerten Sie novita-Sprachmodelle

Die Übersicht der novita-Sprachmodelle ist ein Ausgangspunkt, ersetzt aber nicht das Anhören eines Ergebnisses. Klären Sie zuerst, ob Sie Sprache aus Text erzeugen oder Wörter aus einer Audioaufnahme erkennen möchten. Testen Sie dann eine kurze, repräsentative Probe.

Illustration für die Landingpage von Novita

A/B-Vergleichstabelle zur Struktur

Dies sind zwei unterschiedliche Ansätze für einen Sprach-Workflow. Grenzen Sie Ihre Suche anhand der Eingabe- und Ausgabespalten ein, bevor Sie einzelne Modelle vergleichen.

Text zu Sprache Sprache zu Text
1

Ausgangsmaterial

Text zu Sprache

Geschriebene Wörter

Sprache zu Text

Aufgezeichnete oder live gesprochene Sprache

2

Erwartetes Ergebnis

Text zu Sprache

Hörbare Sprache

Sprache zu Text

Schriftliches Transkript

3

Wichtigste Entscheidung

Text zu Sprache

Eine passende Stimme und Sprechweise

Sprache zu Text

Ein für die Aufnahme geeignetes Transkriptionsmodell

4

Was Genauigkeit bedeutet

Text-zu-Sprache

Das gesprochene Ergebnis gibt den beabsichtigten Wortlaut und die Aussprache wieder

Sprache-zu-Text

Das Transkript erfasst die gesprochenen Wörter

5

Typisches Problem mit der Vorlage

Text-zu-Sprache

Mehrdeutige Namen, Abkürzungen oder Satzzeichen

Sprache-zu-Text

Hintergrundgeräusche, gleichzeitig sprechende Personen oder undeutliche Audioaufnahmen

6

Sinnvolle Überprüfung

Text-zu-Sprache

Hören Sie zu, während Sie den Ausgangstext lesen

Sprache-zu-Text

Lesen Sie das Transkript, während Sie die Aufnahme erneut abspielen

Was bei der Umwandlung verloren geht

Keine der beiden Richtungen übernimmt alle Hinweise aus der Vorlage. Diese Anwendungsfälle zeigen, was Sie prüfen sollten, statt davon auszugehen, dass ein klar wirkendes Ergebnis vollständig ist.

Videoeditor

Wandelt ein kurzes Skript in einen gesprochenen Kommentar um. Schriftliche Hervorhebungen führen möglicherweise nicht zur beabsichtigten Pause oder Tonlage.

Prüfen Sie beim Anhören Namen, Timing und Betonung anhand der bearbeiteten Szene. Für visuelle Generierung statt eines gesprochenen Kommentars finden Sie bei novita-Bildmodellen bildbezogene Optionen.

novita-Bildmodelle

Interviewforscher

Wandelt aufgezeichnete Antworten in Text um. In einem Transkript können Zögern, Sprecherwechsel oder Emotionen fehlen.

Halten Sie die Aufnahme bereit und spielen Sie Passagen erneut ab, bei denen die Zuordnung zu einer Person oder der genaue Wortlaut wichtig ist. Für einen separaten Workflow zur visuellen Ausgabe beschreiben novita-Bildmodelle die verfügbaren Bildoptionen.

novita-Bildmodelle

Autor für barrierefreie Inhalte

Erstellt gesprochene Fassungen schriftlicher Anweisungen. An der Formatierung allein ist für Zuhörende möglicherweise nicht erkennbar, wo ein Schritt endet.

Hören Sie sich die Audiofassung an, ohne auf die Seite zu schauen, und überarbeiten Sie schwer verständliche Sätze. Wenn das Projekt auch generierte Bilder benötigt, decken novita-Bildmodelle diese andere Ausgabeart ab.

novita-Bildmodelle

Produktforschende

Vergleicht Sprachproben anhand derselben kurzen Passage. Ein gutes Ergebnis bei einem Satz lässt sich möglicherweise nicht auf längere Inhalte übertragen.

Nehmen Sie in jeden Test einen Namen, eine Zahl und eine vollständige Anweisung auf. Für Vergleiche mit Bildmaterial konzentrieren sich novita-Bildmodelle auf Bildausgaben.

novita-Bildmodelle

Der Tool-Block

Halten Sie den Test so klein, dass er sich wiederholen lässt. Bei gleichbleibender Eingabe sind Unterschiede leichter zu hören oder zu lesen als bei einer improvisierten Vorführung.

Richtung festlegen

Entscheiden Sie, ob Ihr Ausgangsmaterial Text oder Audio ist, und notieren Sie die benötigte Ausgabe. Prüfen Sie vor dem Testen bei jedem Modell, welche Ein- und Ausgaben angegeben sind.

Repräsentative Probe vorbereiten

Verwenden Sie für generierte Sprache eine Passage mit den Namen und Satzzeichen, die in Ihrem Projekt vorkommen. Verwenden Sie für eine Transkription eine kurze Aufnahme mit denselben Hintergrundgeräuschen und demselben Sprechstil wie im tatsächlichen Ausgangsmaterial.

Mit dem Ausgangsmaterial vergleichen

Verwenden Sie für alle Modelle dieselbe Probe. Notieren Sie ausgelassene Wörter, unerwartete Aussprachen, Verwechslungen von Sprechenden und Stellen, die Sie ein zweites Mal anhören müssen.

Anschließende Überprüfung

Prüfen Sie eine echte Probe, bevor Sie sich auf das Ergebnis verlassen

Hören Sie sich eine generierte Stimme einmal ohne Textvorlage an und ein zweites Mal, während Sie jedes Wort mitlesen. Spielen Sie bei einer Transkription unklare Passagen erneut ab und überprüfen Sie Namen und Zahlen von Hand. Bewahren Sie die ursprüngliche Eingabe auf, damit Sie die Prüfung nach einem Modellwechsel oder einer Überarbeitung des Materials wiederholen können.

  • Vergleichbare Proben gegenüberstellen
  • Namen und Zahlen überprüfen
  • Originalquelle aufbewahren

FAQ zu Varianten

Die Liste der Sprachmodelle ist ein guter Ausgangspunkt, um sprachbezogene Optionen zu erkunden. Prüfen Sie vor der Vorbereitung einer Probe bei jedem Eintrag die angegebene Aufgabe sowie die akzeptierten Ein- und Ausgaben. Aus dem Kategorienamen allein geht nicht hervor, dass jedes Modell dieselbe Aufgabe erfüllt.

Testen Sie denselben Textabschnitt mit jeder infrage kommenden Stimme, damit der Vergleich aussagekräftig bleibt. Achten Sie auf Verständlichkeit, Aussprache und darauf, ob die Sprechweise zur Zielgruppe passt, statt allein nach dem Namen der Stimme zu urteilen.

Gehen Sie nicht davon aus, dass alle aufgeführten Stimmmodelle dieselben Sprachen unterstützen. Prüfen Sie die Angaben zum jeweiligen Modell und testen Sie die Sprache, den Akzent und die Namen, die in Ihrem Material vorkommen.

Vergleichen Sie bei generierten Audioaufnahmen die Aufnahme mit dem Ausgangstext und achten Sie auf ausgelassene Wörter, unpassende Pausen und falsch ausgesprochene Namen. Hören Sie bei einem Transkriptionsergebnis das Originalaudio erneut an und überprüfen Sie dabei unklare Wörter, Sprecher und Zahlen.

Jetzt entwickeln
Jetzt entwickeln