Bild in Text (OCR)
Verwandeln Sie ein Foto, einen Screenshot oder einen Scan in Text, den Sie kopieren und bearbeiten können — vollständig auf Ihrem eigenen Gerät ausgelesen, nichts wird hochgeladen.
Was OCR gut liest — und was nie
Zeichenerkennung ist Mustervergleich, kein Verständnis, das Ergebnis spiegelt die Eingabe deshalb mit brutaler Ehrlichkeit wider. Ein gestochen scharfer Screenshot oder ein flacher, gleichmäßig beleuchteter Scan von gedrucktem Text kommt nahezu perfekt heraus. Ein Handyfoto derselben Seite, leicht schräg aufgenommen, mit einem Schatten über einer Ecke, fällt spürbar ab — und Handschrift, dekorative Schriftarten, Text über Fotografien und kontrastarme Drucke (grau auf weiß, Farbe auf Farbe) können kaum brauchbar herauskommen. Drei Gewohnheiten beheben das meiste davon: frontal statt schräg fotografieren, den Text bildfüllend aufnehmen und die Umgebung wegschneiden, und wenn die Quelle bereits auf dem Bildschirm steht, den originalen Screenshot statt eines Fotos vom Monitor verwenden. Jeder dieser Schritte entfernt eine Verzerrung, durch die sich die Erkennung sonst hindurchraten müsste.
Der einmalige Download — und warum es ihn gibt
Wenn Sie das erste Mal auf „Text auslesen“ klicken, lädt Ihr Browser die Erkennungs-Engine samt ihren englischen Sprachdaten herunter — etwa 7 MB, von dieser Website ausgeliefert und zwischengespeichert, sodass spätere Durchläufe binnen Augenblicken starten. Dieser Download ist der Preis für ein echtes Versprechen: Die Engine läuft vollständig auf Ihrem eigenen Gerät als WebAssembly, das Foto Ihres Vertrags, Rezepts oder Ihrer Gehaltsabrechnung wird also nie irgendwohin übertragen. Die meisten Online-OCR-Dienste arbeiten andersherum — eine winzige Seite, und Ihr Dokument wird auf deren Server hochgeladen. Wirkt der erste Durchlauf bei einer langsamen Verbindung ein paar Sekunden lang wie eingefroren, lädt er nur noch, hängt aber nicht — die Fortschrittszeile zeigt Ihnen, in welcher Phase er gerade ist. Nach diesem ersten Besuch lädt die Engine aus dem Cache, und die Erkennung einer normalen Textseite dauert selbst auf einem bescheidenen Laptop nur eine Handvoll Sekunden.
Vorerst nur Englisch — und Zahlen immer gegenprüfen
Diese erste Version liest englischen Text und Zahlen. Weitere Sprachen sind geplant — jede davon ist eine zusätzliche trainierte Datendatei, sie werden also als separate Downloads kommen und nicht als ein riesiges Paket —, aber heute kommt ein niederländischer Brief oder eine türkische Rechnung überall dort verstümmelt heraus, wo die Wörter aufhören, wie Englisch auszusehen. Zahlen verdienen eine eigene, besondere Warnung: eine als 3 statt als 8 gelesene Ziffer in einer IBAN, einer Telefonnummer oder einer Rechnungssumme kostet weit mehr als ein falsch gelesenes Wort, und Ziffern tragen keinen Rechtschreibkontext, aus dem sich die Engine selbst korrigieren könnte. Was auch immer der Text ist, lesen Sie das Ergebnis einmal durch, bevor Sie sich darauf verlassen; was auch immer die Zahlen sind, prüfen Sie sie zweimal.
Der Text ist draußen — jetzt bringen Sie ihn irgendwohin, wo er nützt
„Text kopieren“ legt das Ergebnis in Ihre Zwischenablage, und von dort aus hat es meist eines von drei Zielen. Direkt in ein Dokument oder eine E-Mail ist das naheliegendste — der ganze Sinn von OCR ist, nie wieder eine Seite abzutippen. Weniger naheliegend: Fügen Sie ihn in /de/text-to-speech ein, und die Seite wird zu Audio, was aus einem fotografierten Artikel etwas macht, dem Sie zuhören können, während Sie etwas anderes tun. Und brauchen Sie eigentlich die Seite als teilbares Dokument statt als losen Text, verpackt /de/image-to-pdf das ursprüngliche Foto in ein richtiges PDF — ordentlicher abzulegen und weiterzuleiten als ein bloßes Bild, während dieses Tool die Momente abdeckt, in denen Sie auch seine Wörter brauchen.
So erzielen Sie das beste OCR-Ergebnis
Die Zeichenerkennung funktioniert am besten bei scharfen, gut beleuchteten Bildern mit dunklem Text auf hellem Hintergrund. Fotografieren Sie Dokumente frontal statt schräg, schneiden Sie wenn möglich auf den Text zu, und bevorzugen Sie den originalen Screenshot gegenüber einem Foto eines Bildschirms. Liest derzeit Englisch und Zahlen; weitere Sprachen sind geplant.
Wird mein Bild irgendwohin hochgeladen?
Nein — die Erkennungs-Engine läuft in Ihrem Browser (WebAssembly). Ihr Bild verlässt Ihr Gerät nie, wodurch dies auch für Dokumente sicher ist, die Sie lieber nicht mit einer beliebigen Website teilen möchten.
Warum dauert die erste Nutzung länger?
Bei der ersten Nutzung lädt Ihr Browser die Lese-Engine und ihre englischen Sprachdaten (etwa 7 MB) von dieser Website herunter. Danach wird sie zwischengespeichert, sodass spätere Umwandlungen deutlich schneller starten.
Warum sind manche Wörter falsch?
OCR ist eine bestmögliche Schätzung, und Unschärfe, Handschrift, dekorative Schriftarten oder geringer Kontrast verringern die Genauigkeit. Prüfen Sie das Ergebnis immer sorgfältig — besonders Zahlen.
