Optische Zeichenerkennung (OCR): Maschinelles Sehen
OCR ist der komplexe maschinelle Bildverarbeitungsprozess, bei dem die geometrischen Formen von Pixeln in einem Bild analysiert und in bearbeitbare, durchsuchbare Textzeichenfolgen übersetzt werden.
Das Hochladen vertraulicher medizinischer Unterlagen oder Finanzrechnungen in Cloud-OCR-Engines stellt einen schwerwiegenden Datenverstoß dar. Dieses Tool nutzt Tesseract.js (einen WebAssembly-Port der OCR-Engine von Google), um das neuronale Netzwerk vollständig clientseitig auszuführen.
Formel & Berechnungsmethode
Textdaten = Bildbinarisierung ➔ Zeichensegmentierung ➔ Mustervergleich im neuronalen Netzwerk
Die OCR-Engine kann keine Farben lesen. Zunächst wird das Bild in ein kontrastreiches Schwarzweißbild umgewandelt. Anschließend segmentiert es die Pixel in einzelne Blöcke (Zeichen) und vergleicht diese Formen mit einer umfangreichen trainierten Schriftartendatenbank.
Best Practices & Tipps
- Kontrast ist Trumpf: Die OCR-Engine schlägt fehl, wenn sie den Text nicht vom Hintergrund unterscheiden kann. Verarbeiten Sie das Bild immer vor, indem Sie den Kontrast erhöhen und die Schatten reduzieren, bevor Sie die Extraktion durchführen.
- Stellen Sie eine hohe Auflösung sicher: Wenn ein Bild winzig und stark verpixelt ist, kann das neuronale Netzwerk die geometrischen Kurven der Buchstaben nicht erkennen. Stellen Sie sicher, dass der Text groß und klar ist.
- Vorsicht bei der Handschrift: Standard-OCR-Engines sind auf streng typografische Schriftarten (wie Arial oder Times New Roman) trainiert. Kursive Handschrift ist unglaublich chaotisch und führt fast immer zu massiven Übertragungsfehlern.