PDFテキストの抽出

PDFの文字をページごとのテキストに抽出してください。結果をコピーするかTXT形式で保存してください。スキャン時の写真のOCRは含まれません。

PDFテキストの抽出入力

PDF 1部 · 50MB·200ページ以下

選択可能な文字があるPDF用です。スキャン写真にはOCRは実行されません。

PDFのサポート範囲

暗号化・フォーム・署名フィールドがあるPDFはサポートされません。テキストは最大200万文字です。マルチページ文書・表・縦書きの読み順やスペースは原文と異なる場合があります。

ファイルはブラウザで処理されます。元データは保持され、再読み込みすると処理が初期化されます。

結果

入力後、結果を確認してください。

結果を共有

ツールリンクと結果テキストを一緒に共有します。結果にはURLを入れません。以下の内容を確認して共有してください。

使用方法と処理基準

PDF内のテキストオブジェクトをページごとの本文に抽出する作業です。

実際の例

1、3-4を入力すると、1ページ・3ページ・4ページをそれぞれページの分割線と共に抽出します。文字のないページも表示されるため、スキャン結果や空のページを確認できます。

よくある質問

スキャンしたPDFや写真から文字も抽出されますか?

このツールはPDFテキスト情報を読みながらOCRを実行しません。スキャン写真のみのページでは文字が見つからなかったと表示します。文字が見えるが結果が空の場合はOCRツールが必要かもしれません。

抽出したテキストの行番号や表が元と異なる理由は何ですか?

PDFの文字の配置順序と位置を利用して、改行や空白を推定します。マルチ編集、表、縦書き、特殊フォントでは読み上げ順序や文字が異なる可能性があります。最大200万文字まで抽出し、重要な内容は元の文書と比較してください。

計算基準と参考資料

計算基準の確認: · 計算・検証原則 · エラー報告