全文検索の下ごしらえ
数百ページのマニュアルから文字を取り出して TXT として保存し、エディターでキーワードを検索します。
Guide
PDF からテキストを抽出は、PDF に格納された文字レイヤーをそのまま取り出し、コピーも検索もできるプレーンテキストにするツールです。読み取るのは PDF に実際に存在する文字オブジェクトで、認識処理は行いません。文字型の PDF(Word から書き出したもの、Web ページを印刷したもの)は完全に抽出でき、画像しかないスキャン資料には文字レイヤーがないため「テキストを抽出できませんでした」と表示されます。
更新日 2026-09-093 min read
PDF からテキストを抽出は、PDF に格納された文字レイヤーをそのまま取り出し、コピーも検索もできるプレーンテキストにするツールです。読み取るのは PDF に実際に存在する文字オブジェクトで、認識処理は行いません。文字型の PDF(Word から書き出したもの、Web ページを印刷したもの)は完全に抽出でき、画像しかないスキャン資料には文字レイヤーがないため「テキストを抽出できませんでした」と表示されます。
出力はレイアウトの再現ではなく、PDF 内部の記述順に連結したテキストです。検索、集計、ほかの場所への貼り付けには向きますが、編集できる Word 原稿として使うのには向きません。
<original-name>_テキスト.txt を保存します。| 入力 | 出力 | 説明 |
|---|---|---|
Word から書き出した 3 ページの説明書、区切り線をオン |
各ページの先頭に「━━━ 1 ページ ━━━」「━━━ 2 ページ ━━━」…が 1 行ずつ入り、ページ間は空行 1 つ |
ページ番号は現在の並びでの番号 |
スマートフォンで撮影して作った PDF |
「テキストを抽出できませんでした。この PDF はスキャン(画像)の可能性があります。OCR ツールをお試しください」と表示 |
「PDF の文字認識」を使ってください |
4 ページ目だけを選択、区切り線をオフ |
4 ページ目のプレーンテキストのみ。見出し行はなし |
そのまま貼り付けるのに向く |
数百ページのマニュアルから文字を取り出して TXT として保存し、エディターでキーワードを検索します。
ビューアーで 1 行ずつドラッグするのは面倒なので、ページごと取り出してからコピーします。
抽出結果が空なら文字レイヤーがない証拠で、OCR の工程が必要です。
抽出結果を文字数カウントツールに貼り付けます。
PDF は各テキストブロックの絶対位置を記録するだけで、読む順番は記録していません。段組みや表のレイアウトでは、内部の記述順と見た目の順番が一致しないことがよくあります。そのようなファイルはページごとに抽出して手で並べ直すことをおすすめします。
できます。開くパスワードを入力すれば抽出できます。この処理は文字レイヤーを読むだけなので、回転やページ削除のように先にパスワードを外す必要はありません。
フォントに正しい Unicode 対応付けがないことを示しており、文字レイヤー自体が読めない状態です。そのページを画像に変換してから「PDF の文字認識」で読み直す方法があります。
文字レイヤーはブラウザ内の PDF レンダリングエンジンで解析され、ファイルも抽出結果もアップロードされません。
更新日 2026-09-09
ページごとに文字を抽出し、コピーまたは TXT でダウンロード
すべての処理はブラウザーのローカルで完結し、ファイルはサーバーに送信されません