OCR 会在页面图像之上叠加一层隐形文字,PDF 外观不变,但从此可以搜索、复制、被 AI 读取。 干净 300 DPI 扫描件英文识别准确率可达 99%+。
怎么ocr 识别
- 上传扫描 PDF。
- 选语言(英文 / 中文简繁 / 中英混排)。
- 开始处理(约 1 秒/页)。
- 下载可搜索的 PDF。
参数一览
| 免费额度 | 单文件最大 50 MB,每 IP 每小时 40 次 |
|---|---|
| 处理位置 | 我们自己的服务器(不调用第三方 API) |
| 文件留存 | 1 小时后自动删除 |
| 费用 | 免费,无需注册 |
常见问题
识别后外观会变吗?
不会,文字层不可见。
中文手写能识别吗?
印刷体可靠;手写体准确率有限,重要内容请人工复核。
多久能出结果?
约 1 秒/页,16 页扫描件约 14 秒。
扫描件 OCR 中文识别用什么?
Tesseract 加 chi_sim(简体)/chi_tra(繁体)语言包,也是 GekiPDF 用的方案;中英混排选 eng+chi_sim,一页清晰印刷体大约 1 秒。
OCR 会改变 PDF 的样子吗?
不会。OCR 在图片后面加一层看不见的文字层,外观完全一样,但变得可搜索、可复制。