Was extrahiert wird
Das Tool liest die auswählbare Textschicht und trennt Seiten. Pixel werden nicht analysiert und nichts an OCR gesendet.
Reine Scans bleiben leer, sofern sie keine vorhandene unsichtbare OCR-Schicht besitzen.
Ablauf
PDF wählen, all oder Seiten angeben und Text extrahieren. Der echte Text steht vor den Zählwerten.
Reihenfolge und Umbrüche prüfen, alles kopieren oder als UTF-8-TXT laden. Änderungen verwerfen das alte Ergebnis.
Beispiele und Reihenfolge
1,3-4 aus fünf Seiten erzeugt drei Abschnitte. Zweispaltige Texte können wegen koordinatenbasierter Speicherung vermischt erscheinen.
Tabellen verlieren Linien und Spalten; Seitengrenzen und vorhandene Zeilenenden bleiben.
Einsatz
Geeignet für Notizen, Suche, Barrierefreiheitsprüfung und Editor-Import. Wichtige Zitate mit dem Original vergleichen.
TXT enthält keine Schriften, Links, Bilder, Formulare oder Geometrie. Die PDF wird nicht verändert.
Grenzen
Verschlüsselte, beschädigte oder ungewöhnlich kodierte PDFs können scheitern. Einen kleineren Bereich testen.
Kein OCR für Scans, Fotos oder Handschrift. Beim Schließen wird die Datei verworfen.
Häufige Fragen
Leere Ausgabe bedeutet oft Bildseiten. Lesereihenfolge folgt der PDF-Struktur. Tabellenlayout bleibt in TXT nicht erhalten. Bereiche und Seitenlabels werden unterstützt.