Text zu Sprache
Tippen oder fügen Sie Ihren Text ein oder laden Sie ein PDF, eine Word-Datei oder ein Foto einer Seite. Wählen Sie eine Stimme, hören Sie sie an und laden Sie sie als MP3 herunter. Die Sprache entsteht auf Ihrem eigenen Gerät — Ihr Dokument verlässt Ihren Computer nie.
So funktioniert es
Ein Sprachmodell läuft direkt in Ihrem Browser und macht aus Ihrem Text eine Stimme — nichts wird hochgeladen, sodass ein Vertrag, eine Diagnose oder ein privater Brief auf Ihrem Gerät bleibt. Ein PDF wird direkt aus seiner Textebene gelesen, eine Word-Datei aus ihrem eigenen Inhalt, und ein Foto einer Seite läuft zuerst durch unsere OCR, sodass auch ein Buch oder ein gedruckter Brief funktioniert. Zahlen, Beträge und Symbole werden vor dem Sprechen ausgeschrieben, sodass „25 €“ als „fünfundzwanzig Euro“ gelesen und nicht verschluckt wird. Wenn Sie zum ersten Mal auf Vorlesen drücken, wird die Sprach-Engine einmalig heruntergeladen (etwa 390 MB) und Ihr Browser behält sie danach.
Welche Sprachen kann sie sprechen?
Vorerst nur Englisch. Das Sprachmodell, das wir verwenden, ist englisch, und jedes mehrsprachige Modell, das wir getestet haben, verbietet entweder die kommerzielle Nutzung oder trägt eine Copyleft-Lizenz, die wir nicht auf eine kostenpflichtige Website setzen. Uns ist eine Sprache lieber, auf die wir ehrlich ein Recht haben, als ein Dutzend, auf die wir keines haben. Andere Sprachen brauchen eine eigene Lizenzrunde.
Darf ich das Audio kommerziell nutzen?
Ja. Das Sprachmodell steht unter MIT-Lizenz und die Stimmen stammen aus einer Sprachdatenbank, die kommerzielle Nutzung erlaubt — ein Video, ein Podcast oder ein Hörbuch ist also kein Problem. Die Stimmen sind synthetisch und gehören niemandem, Sie geben sich also auch nicht als eine reale Person aus.
Warum klingt es bei langen Texten so monoton?
Das Modell liest Satz für Satz, ohne die Geschichte zu kennen, und kann deshalb keine Spannung aufbauen wie ein menschlicher Sprecher. Kurze Absätze mit klarer Zeichensetzung klingen deutlich besser als ein langer Block — Kommas und Punkte sind das, woran es Luft holt.
Kann ich die Stimme nachträglich ändern?
Ja — die Regler für Tonhöhe und Geschwindigkeit decken das meiste ab, und die Geschwindigkeit ist eine echte Zeitdehnung, eine langsamere Stimme wird also nicht tiefer. Für mehr laden Sie die MP3 herunter und schicken Sie sie durch unseren Stimmverzerrer oder direkt ins Audiostudio.
Wie werden Abkürzungen und ungewöhnliche Namen ausgesprochen?
Gängige Abkürzungen ohne Vokale — PDF, XML, HTML, GDPR — werden automatisch Buchstabe für Buchstabe buchstabiert, und Kombinationen wie MP3 oder 4K kommen von selbst richtig heraus. Großgeschriebene Wörter, die Vokale enthalten, bleiben bewusst Wörter, sodass NASA und ein in Großbuchstaben getippter Satz weiterhin normal klingen. Wenn etwas trotzdem falsch herauskommt, schreiben Sie es so, wie es klingen soll — und zwar so, wie ein englischer Leser es aussprechen würde, denn die Stimme ist englisch und liest genau das vor, was Sie tippen. Ein ungewöhnlicher Name oder eine Marke lässt sich einfach phonetisch ausschreiben — "Nike" als "Nykee", "Cicek" als "Cheechek" — bis es richtig klingt.
Ein natürlich klingendes Ergebnis erreichen
Die Stimme liest genau das, was dasteht, und das ist eine Stärke, sobald man damit arbeitet. Sie weiß nicht, was Ihr Text bedeutet, also nimmt sie ihr gesamtes Timing aus der Zeichensetzung: Ein Punkt ist eine Pause, ein Komma eine kürzere, und ein Absatz ohne beides wird zu einer atemlosen Kette. Die größte Verbesserung, die Sie erreichen können, ist keine Einstellung — sie besteht darin, lange Sätze in kürzere zu teilen und die Kommas dorthin zu setzen, wo Sie selbst Luft holen würden.
Bereiten Sie den Text zuerst vor
Fügen Sie Ihren Text ein und lesen Sie ihn einmal durch, bevor Sie auf Vorlesen drücken. Nehmen Sie heraus, was zur Seite gehört und nicht zum Satz: Seitenzahlen, Kopfzeilen, Fußnotenzeichen, die Überbleibsel eines PDF-Layouts. Schreiben Sie alles Ungewöhnliche so, wie es klingen soll — einen seltenen Namen, eine Marke, ein fremdes Wort —, denn die Stimme versucht es wörtlich. Zahlen, Beträge und gängige Abkürzungen werden bereits behandelt, die können Sie in Ruhe lassen.
Wofür Menschen das benutzen
Das Korrekturlesen entdecken die meisten aus Versehen: Den eigenen Text vorgelesen zu hören fängt fehlende Wörter und holprige Sätze ab, über die das Auge glatt hinweggeht. Darüber hinaus — eine Sprecherstimme für ein Video, ohne etwas aufzunehmen, ein langes Dokument, das man im Auto anhören kann, ein Text, der für jemanden mit Leseschwierigkeiten zugänglich wird, und Sprachübung, bei der man einen Satz hören statt lesen will. Weil alles auf Ihrem eigenen Gerät läuft, dürfen Sie auch einen Vertrag oder einen Arztbrief bedenkenlos einfügen.
