PDFテキストの抽出
PDFの文字をページごとのテキストに抽出してください。結果をコピーするかTXT形式で保存してください。スキャン時の写真のOCRは含まれません。
ファイルはブラウザで処理されます。元データは保持され、再読み込みすると処理が初期化されます。
結果
入力後、結果を確認してください。
結果を共有
ツールリンクと結果テキストを一緒に共有します。結果にはURLを入れません。以下の内容を確認して共有してください。
使用方法と処理基準
PDF内のテキストオブジェクトをページごとの本文に抽出する作業です。
実際の例
1、3-4を入力すると、1ページ・3ページ・4ページをそれぞれページの分割線と共に抽出します。文字のないページも表示されるため、スキャン結果や空のページを確認できます。
よくある質問
スキャンしたPDFや写真から文字も抽出されますか?
このツールはPDFテキスト情報を読みながらOCRを実行しません。スキャン写真のみのページでは文字が見つからなかったと表示します。文字が見えるが結果が空の場合はOCRツールが必要かもしれません。
抽出したテキストの行番号や表が元と異なる理由は何ですか?
PDFの文字の配置順序と位置を利用して、改行や空白を推定します。マルチ編集、表、縦書き、特殊フォントでは読み上げ順序や文字が異なる可能性があります。最大200万文字まで抽出し、重要な内容は元の文書と比較してください。
計算基準と参考資料
- Mozilla PDF.js — PDFプレビュー
ブラウザのページ読み込みとキャンバスミラーレイアウト