PDF 转文字
字取出来,文档留在原地
…
- 1
把 PDF 拖进来
文件从磁盘读出来,不会被送到任何地方。对一份合同、一张工资单或者一份体检报告来说,这就是全部重点。
- 2
它读每一页
一篇十五页的论文大约十分之一秒。多栏排版会被还原成阅读顺序,而不是左右交错。直接从 PDF 里复制粘贴之所以难读,多半就是栽在这里。
- 3
复制或下载
纯文本,.txt 文件。如果你想留住标题和表格,「PDF 转 Markdown」是同一次读取,只是把结构保留下来。
FAQ
- 我的文档会被上传吗?
- 不会。读取的是一小段在这个页面里运行的代码,跑在你自己的机器上,没有任何请求把文档带到别处。想看的话打开网络面板,然后拖一个文件进来。
- 为什么我的 PDF 什么都没读出来?
- 因为它基本上是扫描件。扫描出来的一页是文字的照片,而照片里没有可以取出的文字,不管你看得多清楚。页面会直接告诉你,而不是丢给你一个空文件;这种情况该用「图片转文字」,那个工具看的是图,然后认出字母。
- 为什么阅读器里直接复制粘贴的效果比这里差?
- 主要是分栏。PDF 只记录每段文字在页面上的位置,不记录该按什么顺序读,所以两栏的页面直接复制出来就是左栏第一行、右栏第一行这样交替。这个工具会把分栏判断出来,再按顺序拼回去。
- 有一部分出来是乱码,为什么?
- 这份文档嵌了字体,却没说清每个字形对应哪个字符。到那一步字母就只是图形了,光靠文件本身谁也还原不出文字。绕过去的办法是交给「图片转文字」,让它去认那些形状。
- 有大小限制吗?
- 没有写死的限制。干活的是你自己的机器,几百页也很快,所以上限是你的浏览器能装下多少,而不是我们挑的一个数字。