本文へ移動

PDFをテキストに変換

PDFをアップロードせず、保存済みの文字レイヤーをページ別に取り出します。

PDFとページ

ブラウザー内で処理します。

PDFはこのタブ内だけで処理します。上限100 MB。

all または 1-3,5 の形式。

抽出テキスト

PDFを選び、文字レイヤーを抽出してください。

抽出対象

選択可能な文字レイヤーを読み、ページ別に分けます。画像の画素解析やOCRサービスへの送信はしません。

写真・スキャンだけのページは、既存OCR文字層がなければ空になります。

手順

PDFを選び、allまたはページを指定して抽出します。実際の文字が集計値より先に表示されます。

順序・改行を確認して全文コピーまたはUTF-8 TXT保存を使います。指定変更で古い結果は消えます。

例と読み順

5ページで1,3-4なら3区分です。2段組は座標配置のため読み順が混ざる場合があります。

表の線や列はTXTに残らず、提供されるページ境界と改行のみ保持します。

用途

メモ、検索、アクセシビリティ確認、編集ソフト移行に使えます。重要な引用は原本と照合します。

フォント、リンク、画像、フォーム、レイアウトは残らず、原本PDFは変更しません。

制限

暗号化・破損・特殊な文字マップでは失敗や欠字があります。小さい範囲で確認します。

スキャン・写真・手書きのOCRは行いません。タブを閉じると選択内容は破棄されます。

よくある質問

空なら画像ページの可能性があります。読み順はPDF内部構造によります。TXTは表配置を保持しません。範囲指定とページラベルに対応します。