OCR — テキスト抽出

デジタルPDFからテキストを抽出するか、スキャン画像に対して光学文字認識を実行します。

100% 無料
登録不要
ファイルを自動削除
安全な処理

OCR PDF とは何か、なぜ必要か?

スキャンされたページは、実際にはただの写真です。PDF リーダーは言葉ではなく画像を見ています。OCR PDF(光学文字認識)はその画像を読み取り、各文字を識別して、本物の、選択可能で検索可能なテキストに変えます。凍りついた文書を再び息づかせるものです。

このステップは日々の作業を変えます。テキストが認識されれば、一節をコピーしたり、ファイル全体から単語を検索したり、紙の文書を打ち直さずに再利用したりできます。これこそが、スキャンした PDF からテキストを抽出する理由です。古い契約書、郵送されてきた請求書、記入済みのフォーム、デジタル化されたアーカイブが、ついに使えるようになります。

精度を左右するもの、そして次に来るもの

結果は何よりもスキャンの品質に左右されます。鮮明でまっすぐ、コントラストの高い文書を 300 dpi 以上でスキャンすれば、信頼できる認識が得られます。正しい言語を選ぶことも忘れないでください。文字やアクセント記号の解釈の仕方を導くからです。ただし手書き文字は依然として信頼できません。OCR は印刷されたテキスト向けに作られています。

テキストが抽出できたら、目的に応じて次のツールを選びます。完全に編集可能な文書には pdf-to-word を使い、ファイルを直接調整するには edit を使い、形式を変えるには convert に任せます。

プライバシーについて、複雑なことは何もありません。登録は不要で、ファイルは処理後に自動的に削除されます。あなたの文書はテキストを生成するためだけに使われ、それ以上のことはありません。

OCR — テキスト抽出の方法

  1. 1

    アップロード

    PDF ファイルをドロップエリアにアップロードします(またはドラッグ&ドロップします)。

  2. 2

    設定

    デジタルPDFからテキストを抽出するか、スキャン画像に対して光学文字認識を実行します。

  3. 3

    ダウンロード

    生成された文書をワンクリックでダウンロードします。ファイルは処理後に自動的に削除されます。

関連する PDF ツール