掃描合同可搜索
整本掃描合同做成可搜索 PDF,以後 Ctrl+F 找條款、複製條文,看起來還是原件。
使用指南
PDF 文字識別用於處理「打開後文字選不中」的掃描件或圖片型 PDF:每頁先渲染成 300 dpi 圖像,交給瀏覽器內的 tesseract 引擎識別,然後導出三種結果——保留原頁面畫面、疊加不可見文字層的「可搜索 PDF」,按「—— 第 n 頁 ——」分隔的 TXT,或每頁一組段落、頁間帶分頁符的 DOCX。
更新於 2026-09-09约 4 分钟读完
PDF 文字識別用於處理「打開後文字選不中」的掃描件或圖片型 PDF:每頁先渲染成 300 dpi 圖像,交給瀏覽器內的 tesseract 引擎識別,然後導出三種結果——保留原頁面畫面、疊加不可見文字層的「可搜索 PDF」,按「—— 第 n 頁 ——」分隔的 TXT,或每頁一組段落、頁間帶分頁符的 DOCX。
PDF 本身有文字層(能選中、能 Ctrl+F)就不需要 OCR:「PDF 轉 Word」或「PDF 提取文本」直接讀取文字層,更快也更準。只有一張張圖片時,請用「圖片文字識別」。
| 輸入 | 輸出 | 説明 |
|---|---|---|
12 页扫描合同.pdf |
扫描合同_可搜索.pdf,提示「嵌入 2 340 个词」 |
外觀與原文件一致,多了可選中的文字 |
同一文件下载 TXT |
「—— 第 1 页 ——」… 分段纯文本 |
編輯框裏的修改會寫入 TXT |
文字型(非扫描)PDF |
也能识别,但比直接提取慢很多 |
建議改用「PDF 轉 Word」 |
整本掃描合同做成可搜索 PDF,以後 Ctrl+F 找條款、複製條文,看起來還是原件。
掃描的舊報告、論文識別成 TXT 或 DOCX,在 Word 裏重新編輯。
手機拍的多頁文件先用「掃描件增強」合成 PDF,再來這裏識別成可搜索版本。
外觀完全一樣,都是原來的掃描畫面;區別是頁面上多了一層不可見文字,閲讀器可以選中、複製、搜索,屏幕閲讀器也能朗讀。
文字層要嵌入中文字形,工具使用內置的 Noto Sans SC 字體(約 10 MB),首次從本站下載並緩存,之後顯示「中文字體已緩存在本地」。生成的 PDF 只包含用到的字形子集。
不會。「取消識別」後已識別頁面保留,可直接下載 TXT / DOCX / 可搜索 PDF,只是內容只到已完成的那一頁。
PDF 的渲染與文字識別全部在瀏覽器本地進行,頁面內容不會上傳。識別引擎與簡中/英文語言包由本站自託管,首次使用需下載;繁體中文、日文語言包來自 tesseract.js 默認公共 CDN;生成可搜索 PDF 首次需從本站下載 Noto Sans SC 字體(約 10 MB)並緩存。以上請求只獲取引擎、語言包和字體文件,不包含你的文檔。
更新於 2026-09-09
掃描件 PDF 逐頁 OCR,可輸出可搜索 PDF(隱形文字層)、TXT、DOCX
此工具尚未完整翻譯,部分內容使用源文或回退語言。
適用於掃描件、圖片型 PDF;逐頁渲染為 300dpi 圖像後識別,可輸出可搜索 PDF / TXT / DOCX