Scan-PDF durchsuchbar machen
Gescannte deutsche oder englische Seiten erkennen und einen positionierten Suchtext ergänzen.
Dein Tool wird vorbereitet …
So funktioniert’s
- PDF auswählen oder das synthetische zweiseitige Beispiel mit einer gescannten und einer bereits auslesbaren Seite laden.
- Deutsch, Englisch oder beide Sprachen sowie Seitenbereich und Auflösung wählen. Seitlich liegende Scans in den Erkennungseinstellungen im Uhrzeigersinn ausrichten.
- Den angezeigten Download der lokalen Engine und Sprachdateien bestätigen und die gewählten Seiten erkennen. Seiten mit vorhandenem Text erhalten keinen doppelten Layer.
- Erkannte Wörter und Lesereihenfolge mit der Quelle vergleichen. Namen, Beträge, Umlaute und Spalten können falsch sein; unsichere Wörter werden gezählt. Bei Bedarf andere Sprache oder Ausrichtung versuchen.
- Prüfung bestätigen, durchsuchbares PDF erstellen, tatsächliche Exportvorschau kontrollieren und herunterladen. Zurücksetzen oder Abbrechen löscht den aktuellen Vorgang und das erzeugte Ergebnis.
Der synthetische Scan enthält „Hello Zurich: 42 green folders.“ und „Grüsse aus Zürich: Öl, Käse, Äpfel.“ Die deutsche Erkennung kann diese Umlaute erkennen; die Genauigkeit hängt weiterhin vom gewählten Modell ab. Seite 2 enthält bereits auslesbaren Text und muss übersprungen werden, wobei ihr ursprünglicher Text genau einmal erhalten bleibt.
Details & Grenzen
Bis 25 MiB Ein-/Ausgabe und 100 Seiten; 60 Sekunden pro Vorgang. Signierte PDFs, XFA, eingebettete Dateien und aktive Dokumentaktionen werden abgewiesen. Geprüftes JPEG und ungefilterte/Flate-Bilder werden innerhalb entpackter Ressourcengrenzen unterstützt; Inline-Bilder, JPEG 2000, JBIG2 und CCITT nicht. Keine PDF/A-, PDF/UA- oder Signaturgültigkeits-Zertifizierung. Höchstens 10 OCR-Seiten, 6 Megapixel je Bild, 8’192 Pixel je Kante, 20’000 erkannte Wörter und 200’000 Zeichen. Erkennung mit 150 oder 200 dpi innerhalb der Pixelgrenzen. Seiten mit bereits vorhandenem Text werden übersprungen, auch gemischte Text-/Scan-Seiten. Die Downloadgrösse der gewählten Engine-/Sprachdateien wird vor deiner Bestätigung angezeigt. Zeichen ausserhalb des unterstützten Unicode-Layers werden abgewiesen statt still ausgelassen.
Verändert OCR den Scan oder garantiert es richtigen Text und Barrierefreiheit?
Die sichtbaren Quellseiten bleiben erhalten. OCR ergänzt einen unsichtbaren Unicode-Textlayer mit positionierten Wortboxen; Erkennung und Lesereihenfolge können Fehler enthalten. Der Ablauf verspricht weder zeichengenaue Markierung noch automatische Spracherkennung, OCR einzelner Scanbereiche auf bereits texttragenden Seiten, barrierefreie Dokumentstruktur oder PDF/A-Konformität. Die Ausrichtungskorrektur gilt nur für die Erkennung und dreht die exportierte Seite nicht.