사용 방법
- ① PDF 파일을 선택합니다(드래그앤드롭도 가능).
- ② 필요하면 페이지 범위를 지정합니다. '1-3,5'처럼 쉼표로 나열하고 하이픈으로 구간을 적으며, 비워 두면 전체 페이지에서 추출합니다.
- ③ '페이지 구분 표시'를 켜면 결과에 페이지마다 구분선과 페이지 번호가 들어가 긴 문서에서 위치를 찾기 쉽습니다.
- ④ '텍스트 추출'을 누르면 결과 칸에 글자가 나옵니다. '복사'로 클립보드에 담거나 '.txt 다운로드'로 파일로 저장하세요.
PDF 텍스트 추출의 원리 — 텍스트 레이어란?
워드·한글·파워포인트 등에서 내보낸 일반 PDF에는 눈에 보이는 모양과 별도로, 글자 코드와 좌표를 담은 텍스트 레이어가 들어 있습니다. PDF 뷰어에서 글자를 드래그해 복사할 수 있는 것도 이 레이어 덕분입니다. 이 도구는 텍스트 레이어에서 글자 조각들을 읽고 각 조각의 좌표를 분석해 같은 줄에 있던 글자를 한 줄로 다시 묶어 줍니다. 다만 PDF는 문장·문단 개념 없이 조각 단위로 저장되기 때문에, 다단(2단 이상) 편집이나 복잡한 표가 있는 문서에서는 읽는 순서나 줄바꿈이 원본 배치와 다르게 나올 수 있습니다.
스캔 PDF는 왜 추출되지 않나요?
복합기로 스캔하거나 사진을 찍어 만든 PDF는 각 페이지가 통째로 이미지로만 저장되어 있고 텍스트 레이어가 없습니다. 사람 눈에는 글자로 보여도 컴퓨터에는 픽셀 덩어리일 뿐이라 이 도구로는 추출할 내용이 없습니다. 이런 문서에서 글자를 얻으려면 이미지 속 글자 모양을 인식해 문자로 바꾸는 OCR(광학 문자 인식) 과정이 별도로 필요합니다. 추출 결과가 거의 비어 있다는 안내가 나온다면 스캔본일 가능성이 높습니다. 내 문서가 어느 쪽인지 헷갈릴 때는 PDF 뷰어에서 글자가 드래그로 선택되는지 확인해 보세요. 선택이 되면 이 도구로 추출할 수 있습니다.
개인정보·보안 — 파일이 업로드되지 않습니다
PDF를 읽고 텍스트를 뽑는 전 과정이 페이지에 포함된 자바스크립트 라이브러리로 사용자의 브라우저 안에서만 이루어집니다. 문서가 서버로 전송되거나 저장되지 않으므로 계약서·논문 초안·사내 문서처럼 외부에 올리기 곤란한 파일도 안심하고 사용할 수 있습니다. 페이지를 닫으면 불러온 내용과 추출 결과는 모두 사라집니다.
활용 사례
- 번역 준비 — PDF 논문·매뉴얼의 본문을 뽑아 번역기에 붙여 넣습니다.
- 인용·발췌 — 보고서 작성 시 참고 문헌의 필요한 구절만 텍스트로 가져옵니다.
- 데이터 정리 — 공고문·안내문 PDF의 내용을 메모장이나 스프레드시트로 옮겨 정리합니다.
- 검색 가능한 보관 — 자주 찾는 문서의 본문을 .txt로 저장해 두면 파일 내용 검색이 쉬워집니다.
추출한 글자 수·단어 수를 확인하려면 글자수 세기, 페이지를 텍스트가 아닌 그림으로 만들고 싶다면 PDF를 이미지로, 문서에서 필요한 페이지만 떼어내려면 PDF 나누기를 함께 사용해 보세요.
자주 묻는 질문
스캔한 PDF에서도 텍스트가 추출되나요?
스캔본이나 사진으로 만든 PDF는 글자가 이미지로만 들어 있어 텍스트가 추출되지 않을 수 있습니다. 이런 문서는 글자를 인식하는 OCR 과정이 따로 필요합니다. 워드·한글 등에서 만든 일반 문서 PDF에서 가장 잘 동작합니다.
추출한 텍스트를 저장할 수 있나요?
결과를 복사 버튼으로 클립보드에 담거나 .txt 파일로 내려받을 수 있습니다. 페이지 구분 표시 옵션을 켜면 페이지마다 구분선과 페이지 번호가 들어갑니다.
파일이 서버에 업로드되나요?
아니요. PDF를 읽고 텍스트를 뽑는 모든 과정이 사용자의 브라우저 안에서만 이루어지며 파일이 인터넷으로 전송되지 않습니다.
특정 페이지에서만 추출할 수 있나요?
네. 페이지 범위 칸에 '1-3,5'처럼 쉼표와 하이픈으로 원하는 페이지를 지정할 수 있습니다. 비워 두면 전체 페이지에서 추출합니다.
추출된 글자의 줄바꿈이나 순서가 원본과 다른 이유는 무엇인가요?
PDF는 글자를 문장 단위가 아니라 좌표에 놓인 조각 단위로 저장합니다. 이 도구는 글자 조각의 위치를 분석해 줄을 재구성하지만, 다단 편집이나 표가 복잡한 문서에서는 순서와 줄바꿈이 원본 배치와 달라질 수 있습니다.