PDF-Extraktion: Rasterisierung und Textanalyse
PDF-Konvertierung handelt es sich um die Dekodierung des komplexen internen Objektbaums eines PDF-Dokuments, um Rohtextzeichenfolgen zu extrahieren oder die Vektorseiten als flache Rasterbilder (JPG/PNG) darzustellen.
Das Hochladen vertraulicher Unternehmensdokumente in Cloud-Extraktoren verstößt gegen Datenschutzgesetze. Dieses Tool nutzt Mozillas PDF.js, um das Dokument sicher im clientseitigen Speicher Ihres Browsers zu analysieren und darzustellen.
Formel & Berechnungsmethode
Extraktion = Dekodieren (Binärer Stream) ➔ Analysieren (Schriftteilmengen) ➔ Rendern (Canvas-Kontext)
Um ein Bild zu extrahieren, muss der Browser als virtueller Drucker fungieren. Es liest die PDF-Zeichenbefehle und malt die Vektoren und Schriftarten mathematisch auf eine unsichtbare HTML5-Leinwand, die dann als JPEG exportiert wird.
Best Practices & Tipps
- Stellen Sie eine hohe DPI für den Druck ein: Wenn Sie eine PDF-Datei für den professionellen Druck in ein JPEG konvertieren, müssen Sie die Leinwand mit mindestens 300 DPI (Dots Per Inch) rendern. Das Rendern mit Standard-Webauflösung von 72 DPI sieht auf dem Papier furchtbar pixelig aus.
- Textgrenzen verstehen: PDF-Text ist nicht wie ein Word-Dokument strukturiert; Es handelt sich lediglich um Zeichen, die an genauen X/Y-Koordinaten platziert sind. Das Extrahieren von Text führt oft zu seltsamen Zeilenumbrüchen, da das PDF kein Konzept für „Absätze“ hat.
- Vorsicht bei gescannten PDFs: Wenn es sich bei einer PDF nur um ein gescanntes Foto eines Blattes Papier handelt, findet der Textextraktor keinen Text. Es wird nur ein einziges riesiges Bild angezeigt.