OCR — 文本提取
从数字 PDF 中提取文本,或对扫描图片进行光学字符识别。
将 PDF 拖放到此处,或点击选择
PDF 最大支持 100 MB
从数字 PDF 中提取文本,或对扫描图片进行光学字符识别。
将 PDF 拖放到此处,或点击选择
PDF 最大支持 100 MB
一份扫描页面其实只是一张照片:您的 PDF 阅读器看到的是图像,而非文字。OCR PDF(光学字符识别)读取那张图像,辨认出每一个字母,并把它变成真实、可选中、可搜索的文本。正是它让一份冻结的文档重新焕发生机。
这一步改变了日常工作。文本被识别后,您可以复制一段话、在整个文件中搜索一个词,并在无需重新键入的情况下再利用一份纸质文档。这正是您从扫描的 PDF 中提取文本的原因:旧合同、邮寄收到的发票、填好的表单和数字化的档案终于变得可用。
结果首先取决于扫描的质量。一份清晰、端正、高对比度、以 300 dpi 或更高分辨率扫描的文档能带来可靠的识别。也务必选择正确的语言,因为它引导着字符和重音符号的解读方式。然而,手写体仍然不可靠:OCR 是为印刷文字而设计的。
文本提取出来后,您可根据目标选择下一个工具。要得到一份完全可编辑的文档,请用 pdf-to-word;要直接调整文件,请用 edit;而要更改格式,就交给 convert。
关于隐私,没有什么复杂的:无需注册,您的文件在处理后会自动删除。您的文档仅用于生成您的文本,别无他用。
上传
将您的 PDF 文件上传到拖放区域(或直接拖放)。
设置
从数字 PDF 中提取文本,或对扫描图片进行光学字符识别。
下载
一键下载生成的文档——您的文件在处理后会自动删除。