抽出対象
選択可能な文字レイヤーを読み、ページ別に分けます。画像の画素解析やOCRサービスへの送信はしません。
写真・スキャンだけのページは、既存OCR文字層がなければ空になります。
手順
PDFを選び、allまたはページを指定して抽出します。実際の文字が集計値より先に表示されます。
順序・改行を確認して全文コピーまたはUTF-8 TXT保存を使います。指定変更で古い結果は消えます。
例と読み順
5ページで1,3-4なら3区分です。2段組は座標配置のため読み順が混ざる場合があります。
表の線や列はTXTに残らず、提供されるページ境界と改行のみ保持します。
用途
メモ、検索、アクセシビリティ確認、編集ソフト移行に使えます。重要な引用は原本と照合します。
フォント、リンク、画像、フォーム、レイアウトは残らず、原本PDFは変更しません。
制限
暗号化・破損・特殊な文字マップでは失敗や欠字があります。小さい範囲で確認します。
スキャン・写真・手書きのOCRは行いません。タブを閉じると選択内容は破棄されます。
よくある質問
空なら画像ページの可能性があります。読み順はPDF内部構造によります。TXTは表配置を保持しません。範囲指定とページラベルに対応します。