PDF 텍스트 추출, 스캔본까지 무료로 하는 법(OCR)
PDF에서 글자가 복사되지 않는다면 대부분 스캔으로 만든 이미지 PDF입니다. 이런 파일은 OCR(광학 문자 인식)을 거쳐야 텍스트를 뽑을 수 있고, 구글 드라이브나 원노트를 쓰면 무료로 할 수 있습니다.
이 글에서는 먼저 내 PDF가 텍스트 PDF인지 이미지 PDF인지 구분하는 법을 설명합니다. 이어서 두 경우에 맞는 추출 방법과 한글 인식률을 높이는 요령을 차례로 정리합니다.
먼저 확인할 것: 텍스트 PDF인가, 이미지 PDF인가
PDF는 겉보기에 똑같아도 속 구조가 두 가지로 나뉩니다. 워드나 한글에서 저장한 PDF는 글자 정보가 그대로 들어 있는 텍스트 PDF입니다. 종이를 스캐너나 스마트폰으로 찍어 만든 PDF는 페이지 전체가 사진 한 장인 이미지 PDF입니다.
아래 방법 중 하나만 해 봐도 금방 구분할 수 있습니다.
- 드래그해 보기: PDF 뷰어에서 문장을 마우스로 드래그합니다. 글자 단위로 파랗게 선택되면 텍스트 PDF이고, 선택이 안 되거나 페이지 전체가 네모로 잡히면 이미지 PDF입니다.
- 검색해 보기: Ctrl+F(맥은 Command+F)로 본문에 분명히 있는 단어를 검색합니다. 결과가 하나도 없으면 이미지 PDF일 가능성이 큽니다.
- 확대해 보기: 크게 확대했을 때 글자 가장자리가 뭉개지거나 종이 질감, 기울어짐이 보이면 스캔본입니다.
한 파일 안에 두 종류가 섞인 경우도 있습니다. 앞부분은 워드로 만들고 뒤에 서명한 스캔 페이지를 붙인 계약서가 대표적입니다. 이럴 때는 페이지마다 확인하는 편이 좋습니다.
텍스트 PDF라면 OCR 없이 바로 추출합니다
텍스트 PDF는 이미 글자 정보가 들어 있으므로 OCR이 필요 없습니다. 전체 선택(Ctrl+A) 후 복사해도 되지만, 줄바꿈이 어긋나거나 여러 페이지를 다룰 때는 번거롭습니다.
설치 없이 바로 하려면 PDF 텍스트 추출 무료 온라인 도구를 쓰면 됩니다. 파일을 올리면 본문 텍스트만 뽑아 주므로 복사·붙여넣기보다 정리가 쉽습니다. OCR을 거치지 않으니 오타가 생기지 않는다는 점도 장점입니다.
반대로 이 방법으로 결과가 비어 있거나 거의 나오지 않는다면, 그 파일은 이미지 PDF라는 뜻입니다. 아래 OCR 방법으로 넘어가면 됩니다.
방법 1: 구글 드라이브로 스캔 PDF OCR 하기
구글 드라이브에는 PDF나 이미지를 구글 문서로 열 때 자동으로 글자를 인식하는 기능이 있습니다. 구글 계정만 있으면 무료이고, 한글도 인식합니다.
- 웹 브라우저에서 구글 드라이브에 로그인합니다.
- 스캔한 PDF 파일을 드라이브로 끌어다 놓아 업로드합니다.
- 업로드한 파일을 마우스 오른쪽 버튼으로 누르고 연결 앱 → Google 문서를 선택합니다.
- 잠시 뒤 새 구글 문서가 열립니다. 위쪽에는 원본 이미지가, 아래쪽에는 인식된 텍스트가 들어 있습니다.
- 텍스트를 확인하고 고친 뒤 복사하거나, 파일 → 다운로드에서 워드(.docx)나 텍스트(.txt)로 저장합니다.
구글 드라이브 OCR의 한계
- 파일 크기와 페이지 수에 제한이 있어 두꺼운 스캔본은 일부만 변환되거나 실패할 수 있습니다. 이럴 때는 PDF를 몇 페이지씩 나눠 올리는 편이 안정적입니다. 정확한 제한은 구글 문서 고객센터에서 최신 기준을 확인하세요.
- 표, 다단 편집, 글상자 배치는 거의 유지되지 않고 일반 문단으로 풀어집니다.
- 개인정보가 담긴 문서는 클라우드에 올라간다는 점을 감안하고, 작업 후 필요 없으면 파일을 지우는 것이 좋습니다.
방법 2: 원노트로 이미지 속 글자 복사하기
Microsoft OneNote는 메모 앱이지만, 노트에 붙인 그림에서 글자를 읽어 내는 기능이 있습니다. 한두 페이지짜리 스캔본이나 캡처 이미지에서 문단만 빨리 뽑을 때 편합니다.
- 원노트에서 새 페이지를 엽니다.
- 삽입 메뉴에서 그림을 넣거나, PDF를 파일 인쇄물(Printout) 형태로 삽입합니다.
- 삽입된 이미지를 마우스 오른쪽 버튼으로 누르고 그림에서 텍스트 복사를 선택합니다. 인쇄물로 넣은 PDF라면 현재 페이지 또는 전체 페이지의 텍스트를 복사하는 메뉴가 나옵니다.
- 메모장이나 문서 편집기에 붙여 넣고 결과를 확인합니다.
이 기능은 Windows용 원노트에서 가장 온전하게 제공되며, 버전과 운영체제에 따라 메뉴 이름이나 지원 여부가 다를 수 있습니다. 한글 인식이 이상하다면 이미지에 대한 텍스트 인식 언어가 한국어로 되어 있는지 확인해 보세요. 최신 지원 범위는 원노트 공식 페이지에서 확인하세요.
상황별 방법 비교
| 구분 | 온라인 텍스트 추출 도구 | 구글 드라이브 | 원노트 |
|---|---|---|---|
| 적합한 파일 | 텍스트 PDF | 이미지 PDF, 사진 | 이미지, 짧은 스캔본 |
| OCR 여부 | 필요 없음 | 자동 OCR | 그림 단위 OCR |
| 설치 | 필요 없음 | 필요 없음(웹) | 앱 필요 |
| 여러 페이지 처리 | 편리 | 나눠 올리면 안정적 | 인쇄물 삽입 시 가능 |
| 결과 저장 | 텍스트 복사 | docx, txt 등 | 복사 후 붙여넣기 |
정리하면, 글자가 선택되는 PDF는 텍스트 추출 도구로 끝내고, 선택되지 않는 스캔본은 구글 드라이브를 먼저 써 보는 순서가 가장 무난합니다. 스마트폰으로 찍은 사진 한두 장이라면 Google 렌즈나 아이폰의 라이브 텍스트 같은 기본 기능도 쓸 만합니다.
한글 OCR 정확도를 높이는 요령
한글은 받침과 자모 조합 때문에 영어보다 OCR 오류가 잦습니다. 결과는 원본 품질에 크게 좌우되므로, 스캔 단계부터 신경 쓰면 수정 시간이 줄어듭니다.
- 해상도: 스캔할 때 300dpi 정도로 설정하는 것이 일반적인 권장값입니다. 너무 낮으면 받침이 뭉개지고, 너무 높으면 파일이 커져 업로드 제한에 걸리기 쉽습니다.
- 기울기와 그림자: 페이지가 비뚤어지거나 책 가운데가 휘어 그림자가 지면 인식률이 크게 떨어집니다. 스마트폰으로 찍는다면 문서 스캔 모드를 쓰는 편이 낫습니다.
- 흑백 대비: 컬러보다 흑백·회색조로 스캔하고 대비를 올리면 글자 경계가 또렷해집니다.
- 복잡한 편집 피하기: 세로쓰기, 다단, 표 안의 작은 글씨, 손글씨는 인식이 불안정합니다. 필요한 부분만 잘라서 따로 인식시키면 결과가 좋아집니다.
- 자주 틀리는 글자 점검: 숫자 0과 ㅇ, 1과 l·I, ‘ㅁ’과 ‘ㅇ’, 띄어쓰기 누락, 문장 중간 줄바꿈이 흔한 오류입니다. 숫자와 고유명사는 원본과 꼭 대조하세요.
한자가 섞인 옛 문서나 고어는 무료 도구로는 한계가 뚜렷합니다. 이런 문서는 OCR 결과를 초안으로만 쓰고 직접 검수하는 것을 전제로 작업하는 편이 현실적입니다.
자주 묻는 질문
PDF 텍스트 추출을 했는데 글자가 깨져서 나옵니다.
텍스트 PDF인데도 깨진다면 PDF 안의 글꼴 정보가 특수하게 저장된 경우일 수 있습니다. 이때는 오히려 구글 드라이브 OCR로 이미지처럼 인식시키면 제대로 읽히는 경우가 있습니다.
OCR 후 원본 서식(표, 글꼴)도 그대로 유지되나요?
무료 방법에서는 대부분 유지되지 않습니다. 텍스트 내용만 뽑는다고 생각하고, 표는 결과를 보고 직접 다시 만드는 편이 빠릅니다.
스캔 PDF를 글자 검색이 되는 PDF로 바꿀 수 있나요?
가능합니다. 구글 드라이브에서 변환한 구글 문서를 다시 PDF로 내려받으면 검색·복사가 되는 PDF가 됩니다. 다만 원본 스캔 이미지 모양은 그대로 남지 않을 수 있습니다.
손글씨도 추출할 수 있나요?
또박또박 쓴 글씨는 어느 정도 인식되지만, 흘려 쓴 한글 손글씨는 오류가 많습니다. 결과를 반드시 원본과 비교해 확인하세요.
정리
PDF 텍스트 추출이 안 될 때는 먼저 드래그와 검색으로 텍스트 PDF인지 이미지 PDF인지 확인합니다. 텍스트 PDF는 온라인 추출 도구로 바로 뽑고, 스캔본은 구글 드라이브의 Google 문서 변환이나 원노트의 그림에서 텍스트 복사로 OCR을 하면 됩니다. 한글 인식률은 원본 해상도, 기울기, 대비에 크게 좌우되므로 스캔 품질부터 챙기고, 숫자와 고유명사는 꼭 원본과 대조하세요.