[PR] 記事内に広告が含まれています

AcrobatでスキャンしたPDFをOCRで文字認識する方法|検索・コピー可能にする

Acrobat/Reader

AcrobatでスキャンしたPDFをOCRで文字認識する方法|検索・コピー可能にする

スキャナーで取り込んだPDFは、画面上に文字が見えていても、実際にはページ全体が画像になっていることがあります。

画像として保存された文字は、そのままでは検索したり、ドラッグしてコピーしたりできません。

AcrobatのOCR機能を使うと、画像内の文字を認識し、検索やコピーが可能なテキスト情報をPDFに追加できます。

この記事では、AcrobatでスキャンしたPDFをOCR処理する方法と、文字を正しく認識できない場合の対処法を紹介します。

 

  1. OCRとは
  2. PDFにOCRが必要か確認する方法
  3. AcrobatでスキャンしたPDFをOCR処理する方法
    1. 1.OCRを実行するPDFを開く
    2. 2.「スキャンとOCR」を開く
    3. 3.「このファイル内」を選択する
    4. 4.ページ範囲と文書の言語を設定する
    5. 5.必要に応じてOCRの設定を確認する
    6. 6.「テキストを認識」を実行する
  4. OCR後に検索・コピーできるか確認する方法
    1. PDF内の文字を検索する
    2. PDF内の文字をコピーする
  5. 複数のPDFをまとめてOCR処理する方法
  6. OCRの文字認識精度を上げる方法
    1. 文書の言語を「日本語」に設定する
    2. 傾きや上下の向きを直す
    3. 十分な解像度でスキャンする
    4. 汚れや影を減らす
    5. 活字と手書き文字を分けて考える
  7. AcrobatでOCRを実行できない場合の対処法
    1. 「このページにはレンダリング可能なテキストが含まれています」と表示される
    2. 「スキャンとOCR」や「テキストを認識」が見つからない
    3. 保護されたPDFでOCRを実行できない
    4. OCRを実行しても検索できない
    5. 文字は選択できるがコピーできない
  8. Acrobat Readerしかない場合に無料でOCRする方法
  9. OCRを実行するときの注意点
    1. OCRの認識結果は必ず確認する
    2. 元のPDFを残しておく
    3. 検索可能にすることと文章を編集することは異なる
  10. よくある質問
    1. OCRを実行するとPDFの見た目は変わりますか
    2. OCRを実行したPDFは保存が必要ですか
    3. スマートフォンでもOCRできますか
    4. 手書きの文字も認識できますか
  11. まとめ

OCRとは

OCRとは「Optical Character Recognition」の略で、日本語では光学文字認識と呼ばれる技術です。

紙の書類や画像に写っている文字を解析し、パソコンで扱えるテキストデータに変換します。

スキャンしたPDFにOCRを実行すると、元の画像を残したまま、検索可能なテキストレイヤーが追加されます。

そのため、見た目を大きく変えずに、文書内検索、文字の選択、コピー、ハイライトなどができるようになります。

 

PDFにOCRが必要か確認する方法

まず、PDF内の文章をマウスでドラッグしてみてください。

文字単位で選択できず、ページ全体が一枚の画像として選択される場合は、OCRが実行されていない可能性があります。

Windowsでは「Ctrl」キーと「F」キー、Macでは「Command」キーと「F」キーを押し、PDF内に確実に書かれている単語を検索する方法でも確認できます。

検索結果が0件になり、文字も選択できない場合は、OCRを実行することで検索やコピーが可能になる可能性があります。

ただし、文字を選択できるのにコピーだけができない場合は、OCRではなくPDFのセキュリティ設定でコピーが制限されていることがあります。

 

AcrobatでスキャンしたPDFをOCR処理する方法

ここでは、Acrobatのデスクトップアプリで、すでに作成されているPDFにOCRを実行する手順を説明します。

OCRを実行する前に、念のため元のPDFを複製し、バックアップを残しておくと安心です。

 

1.OCRを実行するPDFを開く

Acrobatを起動し、文字認識したいスキャン済みのPDFを開きます。

複数ページのPDFでも、必要なページだけを指定して処理できます。

 

2.「スキャンとOCR」を開く

画面上部または左側にある「すべてのツール」を選択します。

ツールの一覧から「スキャンとOCR」を選択します。

画面構成によっては、ツール一覧をスクロールすると「スキャンとOCR」が表示されます。

 

3.「このファイル内」を選択する

「テキストを認識」の項目にある「このファイル内」を選択します。

現在開いているPDFを対象に、ページ範囲や言語を指定するための設定が表示されます。

 

4.ページ範囲と文書の言語を設定する

PDF全体を文字認識する場合は、すべてのページを処理する設定を選びます。

一部のページだけにOCRを実行したい場合は、現在のページやページ範囲を指定します。

日本語の書類を処理する場合は、文書の言語を「日本語」に設定してください。

文書の言語が正しくないと、漢字やひらがな、カタカナの認識精度が下がりやすくなります。

 

5.必要に応じてOCRの設定を確認する

「設定」が表示されている場合は、選択して出力方法などを確認します。

検索やコピーを主な目的とする場合は、元のページ画像を保ちながらテキスト情報を追加する出力方法が扱いやすいです。

使用しているAcrobatのバージョンによって、表示される設定名や選択肢が異なることがあります。

 

6.「テキストを認識」を実行する

設定内容を確認し、「テキストを認識」を選択します。

ページ数や画像の解像度によっては、処理が完了するまで時間がかかることがあります。

処理が終わったらPDFを保存します。

元のファイルを残したい場合は、「別名で保存」を使ってOCR処理後のPDFを別ファイルとして保存してください。

 

OCR後に検索・コピーできるか確認する方法

 

PDF内の文字を検索する

Windowsでは「Ctrl」キーと「F」キー、Macでは「Command」キーと「F」キーを押します。

PDF内に書かれている単語を入力し、該当する文字が強調表示されればOCRは機能しています。

固有名詞や数字だけでなく、本文中に何度か登場する一般的な単語でも確認すると認識状態を判断しやすくなります。

 

PDF内の文字をコピーする

選択ツールで文章をドラッグし、文字単位で選択できるか確認します。

選択した文字を右クリックして「コピー」を選ぶか、Windowsでは「Ctrl」キーと「C」キー、Macでは「Command」キーと「C」キーを押します。

メモ帳やWordなどに貼り付け、文字化けや誤認識がないか確認してください。

検索できてもコピーした文章に誤りが含まれることがあるため、重要な文書では必ず内容を見直しましょう。

 

複数のPDFをまとめてOCR処理する方法

Acrobat Proでは、複数のスキャン済みPDFをまとめてOCR処理できます。

「すべてのツール」から「スキャンとOCR」を開き、「複数のファイル内」を選択します。

「ファイルを追加」で処理したいPDFを指定し、保存先のフォルダーやファイル名の設定を確認します。

文書の言語などを指定して実行すると、検索可能になったPDFが指定したフォルダーに保存されます。

大量のファイルを処理する場合は、最初に数ファイルだけで認識結果と保存先を確認してから、残りを実行するのがおすすめです。

 

OCRの文字認識精度を上げる方法

OCRは便利な機能ですが、元の画像が不鮮明だと誤認識が増えます。

次の点を確認すると、文字認識の精度を改善できることがあります。

 

文書の言語を「日本語」に設定する

日本語の書類では、OCRの文書言語を必ず「日本語」に設定します。

英語に設定したまま日本語を認識させると、似た形の文字や記号に置き換わりやすくなります。

 

傾きや上下の向きを直す

ページが斜めになっていたり、上下が逆になっていたりすると、文字を正しく認識しにくくなります。

OCRを実行する前にページの向きを直し、必要に応じて「画像を補正」や傾き補正を利用してください。

 

十分な解像度でスキャンする

文字中心の一般的な書類は、カラーまたはグレースケールなら300dpi程度を目安にスキャンすると、画質とファイルサイズのバランスを取りやすくなります。

白黒で細かい文字を読み取る場合は、600dpi程度が認識精度の向上に役立つことがあります。

低解像度の画像を後から拡大しても、失われた文字の細部は復元されないため、可能であれば原稿から再スキャンしてください。

 

汚れや影を減らす

紙の汚れ、裏写り、折り目、綴じ部分の影などは、文字として誤認識される原因になります。

背景除去やテキストのシャープ化を使い、文字と背景の差をはっきりさせると改善することがあります。

補正を強くしすぎると細い文字まで消えることがあるため、処理後のページを拡大して確認してください。

 

活字と手書き文字を分けて考える

印刷された活字に比べ、手書き文字、かすれた文字、装飾書体、縦書きと横書きが混在する紙面は誤認識が増えやすくなります。

特に氏名、住所、金額、日付、型番などの重要な情報は、OCR結果を目視で確認してください。

 

AcrobatでOCRを実行できない場合の対処法

 

「このページにはレンダリング可能なテキストが含まれています」と表示される

このエラーは、PDF内にすでに編集可能なテキストが含まれているときに表示されることがあります。

画像だけのページとテキストを含むページが混在している場合は、OCRが必要なページだけを指定して処理してください。

すでに文字を検索・選択できるページには、基本的にOCRをかけ直す必要はありません。

どうしても画像として作り直してOCRを再実行する必要がある場合は、PDFをTIFFなどの画像形式に書き出してからPDFへ戻す方法があります。

ただし、画像への変換によって画質、ファイルサイズ、注釈、リンクなどに影響が出る可能性があるため、必ずコピーしたファイルで試してください。

 

「スキャンとOCR」や「テキストを認識」が見つからない

デスクトップ版でスキャンした文書を検索可能なPDFに変換する機能は、主にAcrobat Proで利用します。

無料のAcrobat Readerを使用している場合は、OCRの実行項目が表示されないことがあります。

Acrobat Proを使用しているのに見つからない場合は、「すべてのツール」を開き、ツール一覧をスクロールして確認してください。

Acrobatを最新版に更新して再起動することも有効です。

 

保護されたPDFでOCRを実行できない

パスワードや権限制限が設定されたPDFでは、OCRや編集を実行できない場合があります。

文書を変更する権限がある場合に限り、正しいパスワードを使って保護を解除してからOCRを実行してください。

他人が作成したPDFの制限を、許可なく回避してはいけません。

 

OCRを実行しても検索できない

最初に、OCR実行後のPDFを保存しているか確認します。

次に、文書の言語が「日本語」になっているか、対象ページの範囲が正しいかを確認してください。

一部の文字だけ検索できない場合は、その文字が別の漢字や記号として誤認識されている可能性があります。

別の単語で検索し、文字をコピーして実際に認識された内容を確認してください。

認識結果が悪い場合は、元の原稿を高い解像度で再スキャンし、傾きや背景を補正してからOCRをやり直します。

 

文字は選択できるがコピーできない

OCRが正常でも、PDFの作成者がコピーを禁止している場合は文字をコピーできません。

Acrobatで文書のプロパティを開き、セキュリティの概要にある「内容のコピー」が許可されているか確認してください。

コピーが許可されていない場合は、文書の作成者や管理者に制限のないPDFを依頼してください。

 

Acrobat Readerしかない場合に無料でOCRする方法

Acrobat Proを利用していない場合は、ブラウザーで使用できるAcrobatオンラインのOCRツールを利用する方法があります。

PDFをアップロードすると自動的に文字認識が行われ、検索やコピーが可能なPDFをダウンロードできます。

ソフトをインストールせずに使えるため、一時的にOCRが必要な場合に便利です。

ただし、オンラインサービスではファイルをサーバーへ送信して処理します。

個人情報、契約書、社外秘資料などを扱う場合は、勤務先の規則や文書の取り扱いルールを確認し、必要に応じてパソコン内で処理できるAcrobat Proを使用してください。

 

OCRを実行するときの注意点

 

OCRの認識結果は必ず確認する

OCRは元画像を解析して文字を推測するため、認識結果が必ず正しいとは限りません。

「0」と「O」、「1」と「I」、「口」と「ロ」など、形が似た文字は誤認識されることがあります。

コピーした文章を再利用する場合は、原本と照合してから使用してください。

 

元のPDFを残しておく

OCRや画像補正を実行すると、ファイルサイズやページの見え方が変わる場合があります。

処理前のPDFを残し、OCR後のファイルは別名で保存する方法が安全です。

 

検索可能にすることと文章を編集することは異なる

OCRによって文字を検索・コピーできるようになっても、Wordのように自由に文章を編集できるとは限りません。

文字の修正や書式の変更まで行う場合は、Acrobat ProのPDF編集機能を使用します。

複雑なレイアウトや表がある文書では、Wordなどへ書き出したときに配置が崩れることがあります。

 

よくある質問

 

OCRを実行するとPDFの見た目は変わりますか

検索可能なテキストレイヤーを追加する出力方法では、通常は元のスキャン画像を保ったまま文字情報が追加されます。

ただし、画像補正や圧縮の設定によっては、色、鮮明さ、ファイルサイズが変わることがあります。

 

OCRを実行したPDFは保存が必要ですか

OCRで追加した文字情報を残すには、処理後にPDFを保存する必要があります。

元のPDFを残したい場合は、別名で保存してください。

 

スマートフォンでもOCRできますか

AcrobatのモバイルアプリやAcrobatオンラインのOCRツールを利用すれば、スマートフォンから処理できる場合があります。

モバイルアプリの一部機能はサブスクリプションが必要です。

 

手書きの文字も認識できますか

手書き文字も認識される場合がありますが、印刷された活字より精度は下がりやすくなります。

崩し字、薄い鉛筆書き、文字同士が重なっている箇所などは、正しく認識できないことがあります。

 

まとめ

スキャンしたPDFで文字を検索・コピーできない場合は、ページが画像として保存されている可能性があります。

Acrobat Proで「すべてのツール」から「スキャンとOCR」を開き、「このファイル内」を選択するとOCRを実行できます。

日本語の文書では言語を「日本語」に設定し、処理後は検索とコピーの両方を試して認識結果を確認してください。

認識精度が低い場合は、ページの傾き、解像度、背景の汚れ、文字の鮮明さを見直すと改善することがあります。

重要な文書では元のPDFを残し、OCRによる誤認識がないか原本と照合してから利用しましょう。

タイトルとURLをコピーしました