GekiPDF

PDF 转文本 —— 提取纯文本,方便喂给脚本或 AI

提取纯文本,方便喂给脚本或 AI

    文件在我们的服务器上处理,1 小时后自动删除。

    PDF 转文本输出 UTF-8 纯文本,不做版式还原,适合检索、翻译、喂给大模型。 如果结果是空的,说明该 PDF 是扫描件,没有文字层。

    怎么pdf 转文本

    1. 上传 PDF。
    2. 开始处理。
    3. 下载 .txt。
    4. 扫描件请先用 OCR 生成文字层。

    参数一览

    免费额度单文件最大 50 MB,每 IP 每小时 40 次
    处理位置我们自己的服务器(不调用第三方 API)
    文件留存1 小时后自动删除
    费用免费,无需注册

    常见问题

    提取出来是空的?

    该 PDF 是扫描件。先做 OCR。

    表格会怎么处理?

    会变成空格分隔的文本行;需要表格结构请用 PDF 转 Word。

    会保留换行吗?

    保留段落级换行,不保留精确坐标。

    扫描件转文字为什么是空的?

    因为扫描件是图片、没有文字层。先跑一次 OCR 再转文本;页面已经写明这一点,不会悄悄给你一个空文件。

    用到这个工具的指南