GekiPDF

OCR 识别 —— 给扫描件加隐形文字层,可搜索可复制

给扫描件加隐形文字层,可搜索可复制

    文件在我们的服务器上处理,1 小时后自动删除。

    OCR 会在页面图像之上叠加一层隐形文字,PDF 外观不变,但从此可以搜索、复制、被 AI 读取。 干净 300 DPI 扫描件英文识别准确率可达 99%+。

    怎么ocr 识别

    1. 上传扫描 PDF。
    2. 选语言(英文 / 中文简繁 / 中英混排)。
    3. 开始处理(约 1 秒/页)。
    4. 下载可搜索的 PDF。

    参数一览

    免费额度单文件最大 50 MB,每 IP 每小时 40 次
    处理位置我们自己的服务器(不调用第三方 API)
    文件留存1 小时后自动删除
    费用免费,无需注册

    常见问题

    识别后外观会变吗?

    不会,文字层不可见。

    中文手写能识别吗?

    印刷体可靠;手写体准确率有限,重要内容请人工复核。

    多久能出结果?

    约 1 秒/页,16 页扫描件约 14 秒。

    扫描件 OCR 中文识别用什么?

    Tesseract 加 chi_sim(简体)/chi_tra(繁体)语言包,也是 GekiPDF 用的方案;中英混排选 eng+chi_sim,一页清晰印刷体大约 1 秒。

    OCR 会改变 PDF 的样子吗?

    不会。OCR 在图片后面加一层看不见的文字层,外观完全一样,但变得可搜索、可复制。

    用到这个工具的指南