OCR — 文本提取

从数字 PDF 中提取文本,或对扫描图片进行光学字符识别。

100% 免费
无需注册
文件自动删除
安全处理

什么是 OCR PDF,为什么您需要它?

一份扫描页面其实只是一张照片:您的 PDF 阅读器看到的是图像,而非文字。OCR PDF(光学字符识别)读取那张图像,辨认出每一个字母,并把它变成真实、可选中、可搜索的文本。正是它让一份冻结的文档重新焕发生机。

这一步改变了日常工作。文本被识别后,您可以复制一段话、在整个文件中搜索一个词,并在无需重新键入的情况下再利用一份纸质文档。这正是您从扫描的 PDF 中提取文本的原因:旧合同、邮寄收到的发票、填好的表单和数字化的档案终于变得可用。

什么会影响准确度,以及接下来做什么

结果首先取决于扫描的质量。一份清晰、端正、高对比度、以 300 dpi 或更高分辨率扫描的文档能带来可靠的识别。也务必选择正确的语言,因为它引导着字符和重音符号的解读方式。然而,手写体仍然不可靠:OCR 是为印刷文字而设计的。

文本提取出来后,您可根据目标选择下一个工具。要得到一份完全可编辑的文档,请用 pdf-to-word;要直接调整文件,请用 edit;而要更改格式,就交给 convert。

关于隐私,没有什么复杂的:无需注册,您的文件在处理后会自动删除。您的文档仅用于生成您的文本,别无他用。

如何OCR — 文本提取

  1. 1

    上传

    将您的 PDF 文件上传到拖放区域(或直接拖放)。

  2. 2

    设置

    从数字 PDF 中提取文本,或对扫描图片进行光学字符识别。

  3. 3

    下载

    一键下载生成的文档——您的文件在处理后会自动删除。

相关 PDF 工具