扫描合同可搜索
整本扫描合同做成可搜索 PDF,以后 Ctrl+F 找条款、复制条文,看起来还是原件。
使用指南
PDF 文字识别用于处理「打开后文字选不中」的扫描件或图片型 PDF:每页先渲染成 300 dpi 图像,交给浏览器内的 tesseract 引擎识别,然后导出三种结果——保留原页面画面、叠加不可见文字层的「可搜索 PDF」,按「—— 第 n 页 ——」分隔的 TXT,或每页一组段落、页间带分页符的 DOCX。
更新于 2026-09-09约 4 分钟读完
PDF 文字识别用于处理「打开后文字选不中」的扫描件或图片型 PDF:每页先渲染成 300 dpi 图像,交给浏览器内的 tesseract 引擎识别,然后导出三种结果——保留原页面画面、叠加不可见文字层的「可搜索 PDF」,按「—— 第 n 页 ——」分隔的 TXT,或每页一组段落、页间带分页符的 DOCX。
PDF 本身有文字层(能选中、能 Ctrl+F)就不需要 OCR:「PDF 转 Word」或「PDF 提取文本」直接读取文字层,更快也更准。只有一张张图片时,请用「图片文字识别」。
| 输入 | 输出 | 说明 |
|---|---|---|
12 页扫描合同.pdf |
扫描合同_可搜索.pdf,提示「嵌入 2 340 个词」 |
外观与原文件一致,多了可选中的文字 |
同一文件下载 TXT |
「—— 第 1 页 ——」… 分段纯文本 |
编辑框里的修改会写入 TXT |
文字型(非扫描)PDF |
也能识别,但比直接提取慢很多 |
建议改用「PDF 转 Word」 |
整本扫描合同做成可搜索 PDF,以后 Ctrl+F 找条款、复制条文,看起来还是原件。
扫描的旧报告、论文识别成 TXT 或 DOCX,在 Word 里重新编辑。
手机拍的多页文件先用「扫描件增强」合成 PDF,再来这里识别成可搜索版本。
外观完全一样,都是原来的扫描画面;区别是页面上多了一层不可见文字,阅读器可以选中、复制、搜索,屏幕阅读器也能朗读。
文字层要嵌入中文字形,工具使用内置的 Noto Sans SC 字体(约 10 MB),首次从本站下载并缓存,之后显示「中文字体已缓存在本地」。生成的 PDF 只包含用到的字形子集。
不会。「取消识别」后已识别页面保留,可直接下载 TXT / DOCX / 可搜索 PDF,只是内容只到已完成的那一页。
PDF 的渲染与文字识别全部在浏览器本地进行,页面内容不会上传。识别引擎与简中/英文语言包由本站自托管,首次使用需下载;繁体中文、日文语言包来自 tesseract.js 默认公共 CDN;生成可搜索 PDF 首次需从本站下载 Noto Sans SC 字体(约 10 MB)并缓存。以上请求只获取引擎、语言包和字体文件,不包含你的文档。
更新于 2026-09-09
扫描件 PDF 逐页 OCR,可输出可搜索 PDF(隐形文字层)、TXT、DOCX
适用于扫描件、图片型 PDF;逐页渲染为 300dpi 图像后识别,可输出可搜索 PDF / TXT / DOCX