扫描版 PDF 能提取文字吗?
能。检测到这份 PDF 没有文字层(常见于扫描件)时,会自动切换到 OCR 识别,不需要你自己判断或换一个工具——只是这一步比普通提取慢一些(逐页识别),准确率也不如有文字层时的直接提取,重要内容建议核对一遍。
为什么这份 PDF 明明看得到文字,却提取不出来?
除了扫描件,还有一种常见情况:PDF 保存时把文字「转换成了曲线/矢量图形」(常见于设计软件导出的证件、海报、表单类 PDF)——这样做通常是为了避免读者电脑没装对应字体导致显示错乱,但代价是 PDF 文件里从此不再包含「这是什么字」这个信息,只剩下一堆线条和填色。这种情况下,不只是我们这个工具,包括 Adobe Acrobat 在内的任何工具,用鼠标选中这部分文字都会发现选不中——不是软件的问题,是这份 PDF 本身已经不含文字数据了。好在这个工具检测到没有文字层就会自动改用 OCR,而 OCR 是按视觉识别的,不管原因是扫描件还是转曲线,都能一样处理。
提取出来的文字会保留原来的排版吗?
只保留基本的换行,不保留字体、字号、颜色、表格结构这些排版信息——这个工具的定位是「把文字内容拿出来」,不是「把 PDF 转成可编辑的 Word 文档」。如果需要保留完整排版去编辑,建议用专门的 PDF 转 Word 工具。
PDF 会上传到服务器吗?
不会。文字提取全程在你的浏览器本地完成,PDF 文件内容不会发送到任何服务器,关掉页面就什么都不会留下。