レポート本文をページ別TXTに整理
通常のコピーで行・列の順番が崩れる資料をページ区切り付きTXTとして保存します。
035 · PDF
PDF内部のテキストレイヤーと実際の埋め込み画像をページ別に抽出し、TXT・個別画像・ZIPで保存できます。
HOW TO USE
PDFファイルを選択します。
テキスト・画像・テキスト+画像の抽出モードを選びます。
すべて・選択・指定範囲から処理ページを決めます。
抽出を実行し、ページ別テキストと埋め込み画像を確認します。
テキストはTXT、画像は個別またはZIP、両方はtext/images構成のZIPで保存します。
USE CASES
通常のコピーで行・列の順番が崩れる資料をページ区切り付きTXTとして保存します。
ページ全体をJPG化せず、PDF内部で使用されるラスター画像オブジェクトをページ・連番で分離します。
テキストと画像を/text・/imagesに分け、ページ関係を保ったファイル名でまとめます。
EXPERT POST
テキストPDFは文字情報を内部オブジェクトとして持つためPDF.jsのAPIで読み取れます。画像だけのスキャンPDFにはテキストレイヤーがない場合があり、035はその状態を案内してOCRを勝手に実行しません。
段組み、表、浮動テキスト、複雑なフォントでは内部text itemの順番が人の読み順と一致しないことがあります。空白と改行を保守的に整え、完全なレイアウト復元は約束しません。
027は表示されるPDFページ全体を画像に変換します。035はページキャプチャではなくPDFの演算子と画像オブジェクトをたどって埋め込みラスター画像を探します。
DCTDecodeのJPEGは元の圧縮streamをJPGのまま抽出して再エンコードを避けます。フィルター・マスク・色空間などで元streamを安全に保持できない他のラスター画像のみdecoded PNG fallbackで保存します。
PDF内部には写真だけでなく、小さなアイコン・マスク・装飾断片・繰り返しロゴが多数含まれることがあります。初期値の主要画像では保守的なサイズ・マスク・重複基準を使い、すべての画像では正常にデコードできたオブジェクトを可能な限り確認できます。
同一bitmapは主要画像とすべての画像の両方で自動除外し、結果数とZIP容量を抑えます。サイズや実際のピクセル内容が異なる画像は別結果として保持します。
大量のテキスト・bitmap・Blobを同時に保持するとモバイルでメモリが急増します。ページごとに処理して不要なpage objectを解放する流れが適しています。
page-001-image-001.pngのように桁をそろえるとファイル一覧でも順番を保てます。textとimagesを分けると自動処理にも再利用しやすくなります。
IMPORTANT NOTES
FAQ
すでにテキストレイヤーがある場合は可能です。画像だけのスキャンはOCRが必要で、035は自動OCRを行いません。
ページ全体のスクリーンショットではなく埋め込みラスター画像を抽出します。PDF構造によっては元streamではなくdecoded PNG fallbackになります。
いいえ。ページ全体の画像変換は027 PDF画像変換ツールの役割です。
はい。すべて、チェック選択、1-3,5,8のような指定範囲を使用できます。
初期値の主要画像では極小の装飾オブジェクトやマスクを隠します。すべての画像に切り替えると正常にデコードできた小さいリソースも確認できます。
PDFと抽出結果はサーバーへ送信・保存せず、現在のブラウザ内で処理します。