FIXLGSTOOLBOX
PDFツール

035 · PDF

PDFテキスト・画像抽出ツール

PDF内部のテキストレイヤーと実際の埋め込み画像をページ別に抽出し、TXT・個別画像・ZIPで保存できます。

LOCALPDFと抽出結果はサーバーへ送信・保存せず、現在のブラウザ内で処理します。
LOCALPDF・抽出テキスト・画像はサーバーへ送信・保存せず、現在のブラウザ内で処理します。
PDFファイルをドロップまたは選択PDF 1件 · テキストレイヤーと実際の埋め込みラスター画像を抽出します。サービス上限: PDF 1件 · 50MB · 200ページ · 画像500件から警告 · 1,000件で安全停止

NEXT WORK

次の作業

RELATED TOOLS

関連ツール

HOW TO USE

使い方

  1. 01

    PDFファイルを選択します。

  2. 02

    テキスト・画像・テキスト+画像の抽出モードを選びます。

  3. 03

    すべて・選択・指定範囲から処理ページを決めます。

  4. 04

    抽出を実行し、ページ別テキストと埋め込み画像を確認します。

  5. 05

    テキストはTXT、画像は個別またはZIP、両方はtext/images構成のZIPで保存します。

USE CASES

活用例

01

レポート本文をページ別TXTに整理

通常のコピーで行・列の順番が崩れる資料をページ区切り付きTXTとして保存します。

02

PDF内の写真だけをまとめる

ページ全体をJPG化せず、PDF内部で使用されるラスター画像オブジェクトをページ・連番で分離します。

03

抽出資料を1つのZIPで共有

テキストと画像を/text・/imagesに分け、ページ関係を保ったファイル名でまとめます。

EXPERT POST

PDFテキストと埋め込み画像を正しく抽出する基準

テキストレイヤー、読み順、PDF画像オブジェクト、PNG fallback、重複画像、スキャンPDFとOCRの違いを理解するための実践基準です。

テキスト抽出とOCRは同じではありません

テキストPDFは文字情報を内部オブジェクトとして持つためPDF.jsのAPIで読み取れます。画像だけのスキャンPDFにはテキストレイヤーがない場合があり、035はその状態を案内してOCRを勝手に実行しません。

見た目の読み順と内部保存順は異なる場合があります

段組み、表、浮動テキスト、複雑なフォントでは内部text itemの順番が人の読み順と一致しないことがあります。空白と改行を保守的に整え、完全なレイアウト復元は約束しません。

画像抽出とページ全体レンダリングを分けます

027は表示されるPDFページ全体を画像に変換します。035はページキャプチャではなくPDFの演算子と画像オブジェクトをたどって埋め込みラスター画像を探します。

元のencoded streamを常にそのまま保存できるわけではありません

DCTDecodeのJPEGは元の圧縮streamをJPGのまま抽出して再エンコードを避けます。フィルター・マスク・色空間などで元streamを安全に保持できない他のラスター画像のみdecoded PNG fallbackで保存します。

主要画像とすべての画像を分けて表示します

PDF内部には写真だけでなく、小さなアイコン・マスク・装飾断片・繰り返しロゴが多数含まれることがあります。初期値の主要画像では保守的なサイズ・マスク・重複基準を使い、すべての画像では正常にデコードできたオブジェクトを可能な限り確認できます。

繰り返しXObjectは自動で重複除外します

同一bitmapは主要画像とすべての画像の両方で自動除外し、結果数とZIP容量を抑えます。サイズや実際のピクセル内容が異なる画像は別結果として保持します。

大きいPDFはページ順処理が安全です

大量のテキスト・bitmap・Blobを同時に保持するとモバイルでメモリが急増します。ページごとに処理して不要なpage objectを解放する流れが適しています。

ZIP構造と決定的ファイル名が後処理を助けます

page-001-image-001.pngのように桁をそろえるとファイル一覧でも順番を保てます。textとimagesを分けると自動処理にも再利用しやすくなります。

IMPORTANT NOTES

注意事項

PDFと抽出結果はサーバーへ送信・保存せず、現在のブラウザ内で処理します。

FAQ

よくある質問

01スキャンPDFから文字を抽出できますか?+

すでにテキストレイヤーがある場合は可能です。画像だけのスキャンはOCRが必要で、035は自動OCRを行いません。

02PDF内の元写真だけを抽出しますか?+

ページ全体のスクリーンショットではなく埋め込みラスター画像を抽出します。PDF構造によっては元streamではなくdecoded PNG fallbackになります。

03PDF全ページをJPGにできますか?+

いいえ。ページ全体の画像変換は027 PDF画像変換ツールの役割です。

04特定ページだけ抽出できますか?+

はい。すべて、チェック選択、1-3,5,8のような指定範囲を使用できます。

05小さいアイコンも出ますか?+

初期値の主要画像では極小の装飾オブジェクトやマスクを隠します。すべての画像に切り替えると正常にデコードできた小さいリソースも確認できます。

PDFと抽出結果はサーバーへ送信・保存せず、現在のブラウザ内で処理します。