在GekiPDF把扫描件直接转成Word,打开后会发现每页都是一张图,光标点上去只能选中整块,没法改字。原因很简单:扫描件本身只是照片,里面没有真正的文字数据。我们的 OCR(光学字符识别) 工具能在 PDF 上叠加一层可搜索的文字层,之后再用「PDF转Word」导出,就能得到可编辑的文本。整个过程在自己服务器完成,不上传第三方。
操作分两步:先把扫描 PDF 放进 ocr-pdf 工具,选择简体中文或英文等语言(支持繁体),输出时建议用 200-300 DPI 的输入文件,识别最准;然后拿处理后的 PDF 去「PDF转Word」。单个文件最大 50 MB,每小时每个 IP 可用 40 次,文件会在 1小时 后自动删除。
常见问题
为什么我用别的工具转出的 Word 全是图片?
因为源 PDF 没有文字层。普通转换只是把每一页当成一张大图贴进 Word,所以无法选中或修改文字。必须先做 OCR 加上文字层。
我的扫描件特别模糊,OCR 能识别吗?
建议输入文件保持在 200-300 DPI。如果原始分辨率太低(比如手机拍的 A4 纸),识别率会明显下降。我们用的是 Tesseract 引擎,对清晰印刷体效果最好。
OCR 之后文件会变大吗?
文字层本身很小,通常只增加几十 KB。但如果你原文件是高清扫描图,体积主要由图片决定。你可以先用压缩工具把图片压到合理大小(比如从16.9MB降到1.5MB约需1秒),再做 OCR。
用完整工具操作
Open OCR 识别 for all options, or jump straight to another step below.