PDF 转 TXT
把 PDF 里的文字逐页提取出来,按原排版还原成行与段落,可导出 TXT、Markdown 或 Word 文档;支持页码范围、换行合并与逐页打包,全程在浏览器本地完成,文件不上传。
选择 PDF 文件
点击选择或拖拽 PDF 到此处单个文件 ≤ 50MB,最多 300 页,文件不会上传到服务器
提取设置
输出格式
排版还原方式
按坐标还原会参考每个字的位置,能还原分栏与对齐;内容流顺序只按 PDF 内部书写次序,适合坐标错乱的 PDF。
换行处理
PDF 里的一行常常是被自动折断的。合并中文行只处理中文相接的情况;合并成段落会把整页连成一整段,英文之间自动补空格。
分页标记
留空表示全部页。支持逗号分隔、连续区间与开放式尾段。
提取结果
上传 PDF 后,这里会显示提取出的文字
使用说明
- 上传 PDF(点击或拖拽),首屏默认已载入一份示例 PDF,无需点击即可看到效果。
- 需要哪几页就填页码范围,例如 1-3,5,8- 表示第 1 到 3 页、第 5 页以及第 8 页到最后一页。
- 中文 PDF 常常一行被折断成多行,把「换行处理」切成「合并中文行」即可连成完整句子。
- 「按坐标还原」适合带分栏、表格的版式;遇到坐标错乱的 PDF 可切换成「按内容流顺序」。
- 导出 Word 时生成的是 Word 可直接打开的 .doc 文件,段落与换行都会保留;扫描件没有文字层,需要先做 OCR。