研究人员与学生
从 PDF 中提取引文、数据和参考文献,无需重新键入。
从任意 PDF 中提取干净、可编辑的纯文本——包括通过 OCR 处理的扫描文件。
从数字版 PDF 中提取可选中文本,或在 PDF 为扫描件时使用 OCR。
挑一个示例,或说明要提取全部文字,还是仅特定页面。
从 PDF 中提取引文、数据和参考文献,无需重新键入。
提取文本,用于脚本、搜索或数据管道。
把锁定或扫描的 PDF 中的文字复制到邮件和文档里。
如果 PDF 是扫描件,请说明,好让 Happycapy 采用 OCR 而非直接提取。
“第 1 到 3 页”可只从你需要的部分提取文字。
可以要求保留分段,让输出更易读。
可以要求干净的 .txt 输出,或保留标题等轻量结构。
模糊的扫描件可能会有小错误——快速检查一下会有帮助。
一次从多份 PDF 中提取文字,分别保存为独立文件。
了解 PDF 转文本的输出质量、后续检查和下载预期。
对于原生/数字版 PDF,文本提取通常近乎完美(准确率 95%–100%),且速度即时。对于需要 OCR 处理的扫描版 PDF,根据扫描质量、字体清晰度和语言的不同,字符准确率通常在 85%–98% 之间——也就是说,一页 1000 字的内容仍可能存在 5–20 个错误。
示例:一份 48 页的扫描版研究报告(12 MB 的 PDF),采用清晰的 300 DPI 黑白扫描,提取后生成约 42 KB 的 .txt 文件,耗时约 20–40 秒,字符准确率约为 96%——脚注和带连字符的单词偶尔会出现误读。
直接在浏览器中粘贴或上传你的 PDF——提取过程在云端运行,因此在开始之前无需桌面软件、插件或账号设置。