Zum Inhalt springen

Sprachausgaben

companyTRANSCRIBE geht auch den umgekehrten Weg: Neben Audio zu Text erzeugt die Anwendung aus Text wieder Audio. Der Bereich liegt in der Seitenleiste unter Sprachausgaben und verwaltet alle erzeugten Audiodateien.

Die Maske Sprachausgabe erstellen ist mit „Wandle Text mit einer KI-Stimme in Audio um.“ überschrieben.

Maske „Sprachausgabe erstellen“ mit Anbieter, Modell, Stimme, Textfeld und Zeichenzähler

FeldBedeutung
Titel (optional)Bezeichnung der Sprachausgabe in der Übersicht
Beschreibung (optional)Freitext zur Einordnung
AnbieterDienst, der die Stimme erzeugt
ModellStimmmodell des gewählten Anbieters
StimmeKonkrete Stimme des gewählten Modells
TextDer Text, der vorgelesen werden soll

Das Textfeld trägt den Platzhalter „Text eingeben, der in Sprache umgewandelt werden soll…“ und unter dem Feld steht ein Zeichenzähler mit der Obergrenze 50 000 Zeichen. Ein Klick auf Generieren startet die Erzeugung; die Schaltfläche bleibt inaktiv, solange kein Text eingegeben ist.

Zur Auswahl stehen zwei Anbieter mit jeweils eigenem Modell und eigener Stimmenliste:

AnbieterModellBeispielstimme
Azure Speechneuralde-DE-KatjaNeural
Google (Chirp 3 HD)chirp-3-hdCharon, Algieba

Die Stimmen von Azure Speech folgen dem Schema <Sprache>-<Region>-<Name>Neural, sodass die Sprache der Stimme direkt am Namen erkennbar ist. Die Stimmen von Google Chirp 3 HD tragen dagegen Eigennamen ohne Sprachkennung.

Geöffnete Stimmenauswahl für Google Chirp 3 HD

Die Liste für Google Chirp 3 HD umfasst unter anderem Gacrux, Iapetus, Laomedeia, Pulcherrima, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix und Zubenelgenubi.

Die fertige Sprachausgabe zeigt im Kopfbereich Status, Anbieter, Modell, Stimme, Audiolänge sowie Erstellungs- und Fertigstellungszeitpunkt.

Fertige Sprachausgabe mit Metadaten, Audiospieler, Textfeld und der Schaltfläche „Neu generieren“

Unter dem Audiospieler steht der verwendete Text weiterhin bearbeitbar zur Verfügung, darunter erneut die Auswahl von Anbieter, Modell und Stimme. Der Hinweis „Audio aus dem aktuellen Text und der Stimme neu erzeugen.“ beschreibt, was Neu generieren tut: Sie ändern Text oder Stimme und erzeugen daraus eine neue Fassung, ohne die Sprachausgabe neu anlegen zu müssen.

Über den Audiospieler lässt sich das Ergebnis direkt anhören; die Datei kann zudem als Audiodatei heruntergeladen werden.

Sprachausgaben lassen sich auch ohne die Oberfläche erzeugen: Ein Agent im CompanyGPT kann sie über den MCP-Server anlegen, abrufen und neu generieren. Siehe Zugriff über den CompanyGPT.