PDF 转文本输出 UTF-8 纯文本,不做版式还原,适合检索、翻译、喂给大模型。 如果结果是空的,说明该 PDF 是扫描件,没有文字层。
怎么pdf 转文本
- 上传 PDF。
- 开始处理。
- 下载 .txt。
- 扫描件请先用 OCR 生成文字层。
参数一览
| 免费额度 | 单文件最大 50 MB,每 IP 每小时 40 次 |
|---|---|
| 处理位置 | 我们自己的服务器(不调用第三方 API) |
| 文件留存 | 1 小时后自动删除 |
| 费用 | 免费,无需注册 |
常见问题
提取出来是空的?
该 PDF 是扫描件。先做 OCR。
表格会怎么处理?
会变成空格分隔的文本行;需要表格结构请用 PDF 转 Word。
会保留换行吗?
保留段落级换行,不保留精确坐标。
扫描件转文字为什么是空的?
因为扫描件是图片、没有文字层。先跑一次 OCR 再转文本;页面已经写明这一点,不会悄悄给你一个空文件。