Offline-Texterkennung (OCR)

Extrahieren Sie geschriebenen Text aus Fotos, Screenshots und Scans lokal im Browser.

Medien & PDF
100% Client-Side · Sicher & Privat
Offline-Texterkennung (OCR)

Extrahieren Sie geschriebenen Text aus Fotos, Screenshots und Scans lokal im Browser.

Wissensdatenbank & Anleitung

Optische Zeichenerkennung (OCR): Maschinelles Sehen

OCR ist der komplexe maschinelle Bildverarbeitungsprozess, bei dem die geometrischen Formen von Pixeln in einem Bild analysiert und in bearbeitbare, durchsuchbare Textzeichenfolgen übersetzt werden.

Das Hochladen vertraulicher medizinischer Unterlagen oder Finanzrechnungen in Cloud-OCR-Engines stellt einen schwerwiegenden Datenverstoß dar. Dieses Tool nutzt Tesseract.js (einen WebAssembly-Port der OCR-Engine von Google), um das neuronale Netzwerk vollständig clientseitig auszuführen.

Formel & Berechnungsmethode

Textdaten = Bildbinarisierung ➔ Zeichensegmentierung ➔ Mustervergleich im neuronalen Netzwerk

Die OCR-Engine kann keine Farben lesen. Zunächst wird das Bild in ein kontrastreiches Schwarzweißbild umgewandelt. Anschließend segmentiert es die Pixel in einzelne Blöcke (Zeichen) und vergleicht diese Formen mit einer umfangreichen trainierten Schriftartendatenbank.

Best Practices & Tipps

  • Kontrast ist Trumpf: Die OCR-Engine schlägt fehl, wenn sie den Text nicht vom Hintergrund unterscheiden kann. Verarbeiten Sie das Bild immer vor, indem Sie den Kontrast erhöhen und die Schatten reduzieren, bevor Sie die Extraktion durchführen.
  • Stellen Sie eine hohe Auflösung sicher: Wenn ein Bild winzig und stark verpixelt ist, kann das neuronale Netzwerk die geometrischen Kurven der Buchstaben nicht erkennen. Stellen Sie sicher, dass der Text groß und klar ist.
  • Vorsicht bei der Handschrift: Standard-OCR-Engines sind auf streng typografische Schriftarten (wie Arial oder Times New Roman) trainiert. Kursive Handschrift ist unglaublich chaotisch und führt fast immer zu massiven Übertragungsfehlern.

Häufig gestellte Fragen

Warum hat die OCR absoluten Unsinn ausgegeben?
Wenn Sie ein komplexes Bild mit starkem Hintergrundrauschen, Wasserzeichen oder in einem starken Winkel geschriebenem Text eingeben, interpretiert der Segmentierungsalgorithmus die zufälligen Pixel fälschlicherweise als Buchstaben.
Unterstützt dieses Tool mehrere Sprachen?
Ja. Die Tesseract-Engine verwendet unterschiedliche Sprachtrainingsdatenmodelle. Sie müssen die richtige Sprache auswählen (z. B. Spanisch oder Deutsch), damit die Engine nach bestimmten Zeichen mit Akzent suchen kann.
Wie läuft die KI offline?
Der Browser lädt das hochkomprimierte mathematische Sprachmodell (die „.traineddata“-Datei) direkt in den lokalen Cache herunter, sodass Ihre eigene CPU die Matrixberechnungen verarbeiten kann.