改一份只有 PDF 的文稿
别人发来的 PDF 通知转成 .docx 后直接改文字重新发。
使用指南
PDF 转 Word 用于把带文字层的 PDF 变成可在 Word / WPS 里继续编辑的 .docx:读取每页文字坐标,把同一行的字块拼成行,再依据行距突然放大、字号变化、首行缩进三种信号把行合并成段落,每段保留近似字号与是否加粗。目标是「把文字连同段落结构拿出来」,不是复刻版面。
更新于 2026-09-09约 3 分钟读完
PDF 转 Word 用于把带文字层的 PDF 变成可在 Word / WPS 里继续编辑的 .docx:读取每页文字坐标,把同一行的字块拼成行,再依据行距突然放大、字号变化、首行缩进三种信号把行合并成段落,每段保留近似字号与是否加粗。目标是「把文字连同段落结构拿出来」,不是复刻版面。
它目前是 Beta(测试阶段),分段规则还在调整。与「PDF 提取文本」的区别是输出 .docx 并尽量分好段;与「PDF 文字识别」的区别是完全不做 OCR——扫描件在这里几乎提取不到文字,页面会提示并提供「转到 PDF 文字识别」按钮。
| 输入 | 输出 | 说明 |
|---|---|---|
20 页单栏论文 PDF(文字型) |
论文.docx:标题段加粗、正文分段、页间分页符 |
单栏正文效果最好 |
双栏排版的期刊页 |
左右两栏的行按高度交错混在一起 |
分栏是已知短板 |
扫描件 PDF |
提示可能是扫描件 + 「转到 PDF 文字识别」 |
字符数 < 30 触发 |
别人发来的 PDF 通知转成 .docx 后直接改文字重新发。
论文、报告的大段文字放进自己的 Word,转出后复制比从阅读器复制少断行。
先看能提取多少字,字数极少就说明是扫描件,按提示转去 OCR。
当前版本只处理文字层,图片、表格线与版面元素不会写入 .docx。表格数据请用「PDF 转 Excel」,图片请用「PDF 提取图片」。
分段靠行距、字号和缩进推断,行距特别紧或排版特殊的 PDF 会误判。可先关闭「按原 PDF 分页」,再在 Word 里用查找替换合并段落。
这里直接读文字层,快且字符准确,适合文字型 PDF;「PDF 文字识别」对页面图像做 OCR,适合扫描件,速度慢且可能有识别错误。
PDF 在浏览器本地解析、提取文字并生成 .docx,文件内容不会上传到任何服务器;关闭页面后数据即从内存释放。
更新于 2026-09-09
提取 PDF 文字与基本段落生成 .docx;不保留复杂排版
提取文字内容与基本段落结构生成 .docx;不保留复杂排版(图片、分栏、页眉页脚等)