FIXLGSTOOLBOX
PDF 도구

035 · PDF

PDF 텍스트·이미지 추출기

PDF 내부의 텍스트 레이어와 실제 임베디드 이미지를 페이지별로 분리해 TXT·개별 이미지·ZIP으로 저장하세요.

LOCALPDF와 추출 결과는 서버로 전송하거나 저장하지 않고 현재 브라우저에서 처리합니다.
LOCALPDF·추출 텍스트·이미지는 서버로 전송하거나 저장하지 않고 현재 브라우저에서 처리됩니다.
PDF 파일을 놓거나 선택하세요PDF 1개 · 텍스트 레이어와 실제 임베디드 이미지를 추출합니다.서비스 한도: PDF 1개 · 50MB · 200페이지 · 이미지 500개부터 경고 · 1,000개 안전 중단

NEXT WORK

다음 작업

RELATED TOOLS

관련 도구

HOW TO USE

사용 방법

  1. 01

    PDF 파일을 선택합니다.

  2. 02

    텍스트·이미지·텍스트+이미지 중 추출 모드를 선택합니다.

  3. 03

    전체·선택·사용자 지정으로 처리할 페이지 범위를 정합니다.

  4. 04

    추출을 실행하고 페이지별 텍스트와 임베디드 이미지 결과를 확인합니다.

  5. 05

    텍스트는 TXT, 이미지는 개별 파일 또는 ZIP, 둘 다는 text/images 구조의 ZIP으로 저장합니다.

USE CASES

활용 예시

01

보고서 텍스트를 페이지별 TXT로 정리

복사하면 줄 순서가 흔들리는 보고서 PDF를 페이지 번호 구분자와 함께 TXT로 저장해 후처리 기준을 명확하게 만듭니다.

02

PDF 속 사진만 따로 모으기

페이지 전체를 JPG로 캡처하지 않고 PDF 내부에서 사용된 raster image object를 찾아 페이지·순번 기준 파일명으로 분리합니다.

03

자료 전체를 한 ZIP으로 전달

텍스트와 이미지가 모두 필요한 문서는 /text와 /images 구조로 묶어 원본 페이지 관계를 유지한 채 전달할 수 있습니다.

EXPERT POST

PDF 이미지 추출 기준

텍스트 레이어, 읽기 순서, PDF 이미지 객체, PNG fallback, 중복 이미지, 스캔 PDF와 OCR의 차이까지 결과를 해석할 때 필요한 실전 기준입니다.

텍스트 추출과 OCR은 같은 기능이 아닙니다

텍스트 PDF에는 글자 정보가 PDF 내부 객체로 저장되어 있어 PDF.js의 텍스트 API로 바로 읽을 수 있습니다. 반대로 스캔 PDF는 페이지가 사진 한 장처럼 저장되어 텍스트 레이어가 없을 수 있습니다. 035는 이 경우 임의로 OCR을 실행하지 않고 텍스트가 없다는 사실을 안내합니다.

PDF의 보이는 순서와 내부 저장 순서는 다를 수 있습니다

다단 편집, 표, 떠 있는 텍스트 상자, 복잡한 폰트가 있는 PDF는 내부 text item 순서가 사람이 읽는 순서와 완전히 같지 않을 수 있습니다. 따라서 이 도구는 공백과 줄바꿈을 보수적으로 정리하며 완전한 레이아웃 재구성을 약속하지 않습니다.

이미지 추출은 페이지 전체 렌더링과 구분해야 합니다

027 PDF 이미지 변환기는 사용자가 보는 페이지 전체를 JPG·PNG 픽셀 이미지로 만듭니다. 035는 페이지 캡처를 만드는 대신 PDF 연산자와 이미지 객체를 따라 실제 embedded raster image를 찾습니다.

원본 encoded stream을
항상 그대로 꺼낼 수 있는 것은 아닙니다

PDF 내부 이미지는 필터, 마스크, 색공간, soft mask와 함께 저장될 수 있습니다. 공개 API에서 원본 stream을 안정적으로 보존하기 어려운 객체는 PDF.js가 해석한 bitmap을 PNG로 저장하고 결과에 fallback임을 표시하는 편이 잘못된 원본 형식을 약속하는 것보다 안전합니다.

주요 이미지와 모든 이미지를 구분합니다

PDF 내부에는 사진뿐 아니라 작은 아이콘·마스크·장식 조각·반복 로고가 매우 많이 들어갈 수 있습니다. 기본값은 보수적인 크기·마스크·중복 기준으로 주요 이미지를 보여주고, 모든 이미지 모드에서는 정상 디코딩된 객체를 가능한 한 모두 확인할 수 있습니다.

반복 XObject는 전체 모드에서 다시 확인할 수 있습니다

기본 주요 이미지 보기에서는 동일 bitmap 중복을 숨겨 결과를 정리합니다. 모든 이미지 모드로 바꾸면 페이지별 반복 객체까지 다시 확인할 수 있습니다.

대용량 PDF는 페이지 순차 처리가 안전합니다

텍스트와 여러 이미지 blob을 한꺼번에 만들어 두면 모바일 메모리가 급격히 늘 수 있습니다. 페이지를 순서대로 처리하고 각 페이지가 끝난 뒤 불필요한 page object를 정리하는 흐름이 브라우저 로컬 도구에 적합합니다.

ZIP 구조와 파일명은 후처리 품질에 영향을 줍니다

page-001-image-001.png처럼 고정 자릿수 파일명을 사용하면 파일 탐색기에서도 페이지 순서가 유지됩니다. text와 images 폴더를 분리하면 자동화나 문서 정리 작업에서 재사용하기도 쉽습니다.

IMPORTANT NOTES

주의사항

PDF와 추출 결과는 서버로 전송하거나 저장하지 않고 현재 브라우저에서 처리합니다.

FAQ

자주 묻는 질문

01스캔 PDF도 글자를 추출할 수 있나요?+

텍스트 레이어가 있는 스캔 PDF라면 가능합니다. 이미지로만 된 스캔 문서는 OCR이 필요하며 035는 OCR을 자동 실행하지 않습니다.

02PDF 안의 사진 원본만 꺼내나요?+

페이지 전체 캡처가 아니라 PDF 내부 raster image object를 추출합니다. 다만 PDF 저장 방식에 따라 원본 encoded stream 대신 decoded PNG fallback으로 저장될 수 있습니다.

03PDF 페이지 전체를 JPG로 만들 수 있나요?+

아니요. 페이지 전체 이미지 변환은 027 PDF 이미지 변환기의 역할입니다.

04특정 페이지만 추출할 수 있나요?+

예. 전체, 체크 선택, 1-3,5,8 같은 사용자 지정 범위를 사용할 수 있습니다.

05작은 아이콘도 결과에 나오나요?+

기본 주요 이미지 보기에서는 아주 작은 장식 객체와 마스크를 숨깁니다. 모든 이미지로 전환하면 정상 디코딩된 작은 객체도 확인할 수 있습니다.

PDF와 추출 결과는 서버로 전송하거나 저장하지 않고 현재 브라우저에서 처리합니다.