OCR — テキスト抽出
デジタルPDFからテキストを抽出するか、スキャン画像に対して光学文字認識を実行します。
ここにPDFをドロップするか、クリックして選択
PDFの上限: 100 MB
デジタルPDFからテキストを抽出するか、スキャン画像に対して光学文字認識を実行します。
ここにPDFをドロップするか、クリックして選択
PDFの上限: 100 MB
スキャンされたページは、実際にはただの写真です。PDF リーダーは言葉ではなく画像を見ています。OCR PDF(光学文字認識)はその画像を読み取り、各文字を識別して、本物の、選択可能で検索可能なテキストに変えます。凍りついた文書を再び息づかせるものです。
このステップは日々の作業を変えます。テキストが認識されれば、一節をコピーしたり、ファイル全体から単語を検索したり、紙の文書を打ち直さずに再利用したりできます。これこそが、スキャンした PDF からテキストを抽出する理由です。古い契約書、郵送されてきた請求書、記入済みのフォーム、デジタル化されたアーカイブが、ついに使えるようになります。
結果は何よりもスキャンの品質に左右されます。鮮明でまっすぐ、コントラストの高い文書を 300 dpi 以上でスキャンすれば、信頼できる認識が得られます。正しい言語を選ぶことも忘れないでください。文字やアクセント記号の解釈の仕方を導くからです。ただし手書き文字は依然として信頼できません。OCR は印刷されたテキスト向けに作られています。
テキストが抽出できたら、目的に応じて次のツールを選びます。完全に編集可能な文書には pdf-to-word を使い、ファイルを直接調整するには edit を使い、形式を変えるには convert に任せます。
プライバシーについて、複雑なことは何もありません。登録は不要で、ファイルは処理後に自動的に削除されます。あなたの文書はテキストを生成するためだけに使われ、それ以上のことはありません。
アップロード
PDF ファイルをドロップエリアにアップロードします(またはドラッグ&ドロップします)。
設定
デジタルPDFからテキストを抽出するか、スキャン画像に対して光学文字認識を実行します。
ダウンロード
生成された文書をワンクリックでダウンロードします。ファイルは処理後に自動的に削除されます。