VitaliWeb Tools

PDF-Text mit lesbaren Absätzen kopieren

Quelltext und Seitenpositionen prüfen, die Lesereihenfolge korrigieren und die Bereinigung vor dem Kopieren oder TXT-/Markdown-Export kontrollieren.

Verarbeitung auf deinem GerätKostenlos · Ohne Konto

Dein Tool wird vorbereitet …

So funktioniert’s

  1. PDF auswählen oder ablegen, alternativ die synthetischen Lernnotizen laden.
  2. Lesereihenfolge vorschlagen und die Quellvorschau prüfen. Einzelne Zeilen umsortieren und Überschriften, Listen oder geschützte Code-/Tabellenzeilen festlegen.
  3. Absatzverbindung und optional wiederholte Randtexte wählen. Jeden harten Trennstrich einzeln bestätigen; echte Bindestrichwörter bleiben standardmässig erhalten.
  4. Bereinigte Vorschau mit Original und Änderungsprotokoll vergleichen. Bis zu fünf letzte Änderungen können rückgängig gemacht werden.
  5. Geprüften Text kopieren oder TXT/Markdown vorbereiten. Erzeugte Bytes werden vor dem Download als UTF-8 erneut gelesen und verglichen.

Das dreiseitige Beispiel enthält deutsche Spalten mit Datenver- / arbeitung, das echte Bindestrichwort E-Mail-Konto, englische Absätze, Listen, Code und wiederholte Randtexte. Bestätige nur die Datenver-Trennung; Code und echte Bindestriche müssen bleiben.

Details & Grenzen

Nur auslesbarer Text; keine OCR. Bis 25 MiB, 100 Seiten, 50.000 Fragmente und 2 Millionen Textzeichen. Jeder Worker-Vorgang hat eine Grenze von 60 Sekunden. Komplexe Kompression und ungewöhnlich grosse entpackte Inhalte können abgewiesen werden. Textexport bis 16 MiB. Spalten, Absätze und Randwiederholungen sind Heuristiken; Tabellen, Code und gedrehter Text benötigen Kontrolle. Eingebettete Bilder: ungefilterte/Flate-Pixel oder geprüftes JPEG, bis 8.192 px je Kante. Inline-Bilder, JPEG 2000, JBIG2, CCITT und ungewöhnliche JPEG-Varianten werden nicht unterstützt.

Werden jede Spalte, Tabelle und gescannte Seite zuverlässig rekonstruiert?

Nein. Lesereihenfolge und Bereinigung sind kontrollierbare Vorschläge. Sortiere Zeilen um und schütze komplexe Inhalte manuell. Seiten ohne auslesbaren Text werden separat genannt; Scans und Buchstaben als Pfade gelten nicht als erfolgreiche Textextraktion.