改一份只有 PDF 的文稿
別人發來的 PDF 通知轉成 .docx 後直接改文字重新發。
使用指南
PDF 轉 Word 用於把帶文字層的 PDF 變成可在 Word / WPS 裏繼續編輯的 .docx:讀取每頁文字座標,把同一行的字塊拼成行,再依據行距突然放大、字號變化、首行縮進三種信號把行合併成段落,每段保留近似字號與是否加粗。目標是「把文字連同段落結構拿出來」,不是復刻版面。
更新於 2026-09-09约 3 分钟读完
PDF 轉 Word 用於把帶文字層的 PDF 變成可在 Word / WPS 裏繼續編輯的 .docx:讀取每頁文字座標,把同一行的字塊拼成行,再依據行距突然放大、字號變化、首行縮進三種信號把行合併成段落,每段保留近似字號與是否加粗。目標是「把文字連同段落結構拿出來」,不是復刻版面。
它目前是 Beta(測試階段),分段規則還在調整。與「PDF 提取文本」的區別是輸出 .docx 並儘量分好段;與「PDF 文字識別」的區別是完全不做 OCR——掃描件在這裏幾乎提取不到文字,頁面會提示並提供「轉到 PDF 文字識別」按鈕。
| 輸入 | 輸出 | 説明 |
|---|---|---|
20 页单栏论文 PDF(文字型) |
论文.docx:标题段加粗、正文分段、页间分页符 |
單欄正文效果最好 |
双栏排版的期刊页 |
左右两栏的行按高度交错混在一起 |
分欄是已知短板 |
扫描件 PDF |
提示可能是扫描件 + 「转到 PDF 文字识别」 |
字符數 < 30 觸發 |
別人發來的 PDF 通知轉成 .docx 後直接改文字重新發。
論文、報告的大段文字放進自己的 Word,轉出後複製比從閲讀器複製少斷行。
先看能提取多少字,字數極少就説明是掃描件,按提示轉去 OCR。
當前版本只處理文字層,圖片、表格線與版面元素不會寫入 .docx。表格數據請用「PDF 轉 Excel」,圖片請用「PDF 提取圖片」。
分段靠行距、字號和縮進推斷,行距特別緊或排版特殊的 PDF 會誤判。可先關閉「按原 PDF 分頁」,再在 Word 裏用查找替換合併段落。
這裏直接讀文字層,快且字符準確,適合文字型 PDF;「PDF 文字識別」對頁面圖像做 OCR,適合掃描件,速度慢且可能有識別錯誤。
PDF 在瀏覽器本地解析、提取文字並生成 .docx,文件內容不會上傳到任何服務器;關閉頁面後數據即從內存釋放。
更新於 2026-09-09
提取 PDF 文字與基本段落生成 .docx;不保留複雜排版
此工具尚未完整翻譯,部分內容使用源文或回退語言。
提取文字內容與基本段落結構生成 .docx;不保留複雜排版(圖片、分欄、頁眉頁腳等)