콘텐츠로 건너뛰기
100% 로컬 · 업로드 0 KBPDF 압축

검색 가능한 PDF 만드는 방법

🔒 파일은 기기에서 떠나지 않습니다. 모든 처리는 브라우저에서 로컬로 이루어집니다.

스캔 PDF는 종이의 사진입니다 — 파일에 텍스트가 없고 픽셀만 있습니다. 검색, 선택, 복사 또는 스크린 리더 사용을 할 수 없습니다. 검색 가능하게 만드는 것은 OCR(광학 문자 인식)을 실행하여 이미지 뒤에 텍스트 레이어를 추가하는 것입니다. 이 가이드는 세 가지 OCR 출력 유형, 이를 잘 수행하는 로컬 도구, 그리고 IXPDF가 오늘 브라우저에서 OCR을 하지 않는 이유를 다룹니다.

IXPDF는 오늘 브라우저에서 OCR을 할 수 없습니다
브라우저용 OCR 엔진(Tesseract.js, OCRad.js)이 존재하지만, 실제 스캔에서 정확도가 출시할 수 있을 만큼 신뢰할 수 없습니다. 흔한 글꼴을 오인식하고, 다중 열 레이아웃에 어려움을 겪으며, 검색과 접근성에 텍스트가 없는 것보다 나쁜 텍스트를 생성합니다. 조용히 잘못된 텍스트를 반환하는 도구를 출시하지 않을 것입니다 (AGENTS.md §16). 이는 Research Required로 표시됩니다. 아래 도구는 기기에서 로컬로 실행되며 파일을 업로드하지 않습니다.

세 가지 OCR 출력 유형

OCR 도구는 세 가지 다른 출력 유형을 생성할 수 있습니다. 어느 것을 원하는지는 결과로 무엇을 할 것인지에 달려 있습니다.

1. 검색 가능 PDF (이미지 + 보이지 않는 텍스트)

가장 흔하고 일반적으로 올바른 선택. 원본 페이지 이미지가 그대로 보입니다 — 레이아웃, 서명, 도장, 손글씨가 이전과 정확히 같이 나타납니다. 이미지 뒤에 OCR이 인식된 문자로 보이지 않는 텍스트 레이어를 추가합니다. 검색, 선택, 복사 및 스크린 리더 사용이 가능합니다; 화면에 보이는 것은 원본 스캔입니다. Adobe Acrobat, Tesseract 및 ABBYY가 기본으로 생성하는 것입니다.

적합: 원본 외형이 중요한 스캔 문서 보관(계약서, 영수증, 서명된 편지).

2. 텍스트만 PDF (인식된 텍스트, 이미지 없음)

OCR이 이미지를 완전히 인식된 텍스트로 대체합니다. 결과는 작고, 완전히 선택 가능하며, 일반 텍스트 PDF처럼 보입니다 — 하지만 원본 레이아웃은 근사이며, OCR이 인식하지 못한 콘텐츠(서명, 도장, 손글씨)는 사라졌습니다.

적합: 텍스트만 필요하고 원본 외형이 중요하지 않을 때 (예: 스캔된 편지의 본문을 지식 베이스용 검색 가능 파일로 추출).

3. 이중 레이어 PDF (이미지 + 텍스트, 둘 다 보임)

덜 흔한 형식으로, 원본 이미지와 인식된 텍스트를 나란히 보여주거나, 이미지를 희미하게 하고 그 위에 텍스트를 겹쳐 보여줍니다. 법적 및 보관 흐름에서 검토자가 인식 오류를 감지하기 위해 OCR 출력을 원본과 비교해야 할 때 사용됩니다. ABBYY FineReader와 Adobe Acrobat Pro가 지원합니다.

적합: 법적 교정, 보관 품질 관리, OCR 정확도를 원본과 비교해야 하는 모든 흐름.

로컬 OCR 도구

아래의 각 도구는 기기에서 실행됩니다. 어느 것도 문서를 업로드하지 않습니다. 이것은 중요합니다: 스캔된 계약서, 의료 기록 또는 세금 양식은 "무료 온라인 OCR" 서비스로 보내지 않아야 합니다 — 그 시점에서 콘텐츠가 누군가의 서버에 있습니다.

1. Adobe Acrobat Pro (유료, 황금 표준)

스캔 PDF를 열고, 도구 > 스캔 및 OCR > 텍스트 인식 > 이 파일 에서. 언어와 출력 유형을 선택하세요(검색 가능 이미지가 기본이며 일반적으로 올바름). Acrobat의 OCR은 실제 스캔에서 가장 정확하고, 다중 열 레이아웃을 잘 처리하며, 잘못 인식된 단어를 인라인으로 교정할 수 있습니다. 단점은 비용입니다 — Acrobat Pro는 구독입니다.

2. Tesseract (무료, 오픈소스, 명령줄)

가장 정확한 무료 OCR 엔진. Tesseract GitHub 프로젝트에서 또는 패키지 관리자(brew install tesseract macOS,apt install tesseract-ocr Linux)에서 설치하세요. 그 후:

tesseract input.pdf output -l eng pdf

이는 output.pdf를 원본 이미지와 보이지 않는 영어 텍스트 레이어가 있는 검색 가능 PDF로 생성합니다. Tesseract는 복잡한 레이아웃에서 Acrobat만큼 정확하지 않지만, 깨끗한 단일 열 스캔에서 훌륭합니다. 100개 이상의 언어를 지원합니다 — 혼합 영어/프랑스어 문서의 경우 -l eng+fra를 전달하세요.

3. macOS의 Preview Live Text (무료, macOS 12+)

macOS Monterey 이상에서 Preview는 시스템의 Live Text 기능을 통해 스캔 PDF 및 이미지의 텍스트를 인식할 수 있습니다. Preview에서 PDF를 열면 텍스트를 직접 선택, 복사 및 검색할 수 있습니다 — macOS가 즉석에서 텍스트 레이어를 추가합니다. 검색 가능 버전을 저장하려면 파일 > PDF로 내보내기. Live Text는 빠르고 영어 문서에서 정확하지만 Tesseract에 비해 언어 지원이 제한적입니다.

4. ABBYY FineReader (유료, 고정밀)

어려운 스캔 — 손글씨, 저대비, 혼합 글꼴, 다중 열 레이아웃 — 에서 고정밀로 알려진 상용 OCR 도구. 검증을 위한 이중 레이어 출력을 지원합니다. Tesseract가 충분히 정확하지 않고 Acrobat Pro 구독을 정당화할 수 없을 때 사용하세요. FineReader는 일회성 구매이지 구독이 아닙니다.

단계별: Tesseract로 검색 가능 PDF 만들기

  1. Tesseract 설치. macOS에서 brew install tesseract. Linux에서 apt install tesseract-ocr. Windows에서 Tesseract GitHub 프로젝트에서 설치 프로그램을 다운로드하세요.
  2. 언어 데이터 설치. 영어가 기본으로 포함됩니다. 다른 언어의 경우 해당 언어 팩을 설치하세요 (예: macOS에서 brew install tesseract-lang).
  3. 터미널 열기. 스캔 PDF가 있는 폴더로 이동하세요.
  4. OCR 실행.tesseract input.pdf output -l eng pdf
  5. 결과 확인. output.pdf를 열고, 이미지에서 보이는 단어를 검색하고 문단을 선택해 보세요. 검색과 선택이 작동하면 텍스트 레이어가 있습니다.
  6. 교정. OCR은 실수를 합니다. 문단을 텍스트 편집기에 복사하여 이미지와 비교하세요. 텍스트를 신뢰할 계획이라면 중요한 오인식을 원본 문서에서 교정하세요.

OCR 정확도: 기대할 것

OCR 정확도는 거의 전적으로 원본 이미지 품질에 달려 있습니다. 일반 글꼴(Arial, Times New Roman)로 인쇄된 페이지의 깨끗한 300 DPI 스캔은 98–99% 문자 정확도로 인식됩니다. 장식 글꼴의 복사된 페이지의 150 DPI 스캔은 90% 이하로 떨어질 수 있습니다 — 10글자당 1글자 오류로, 검색과 복사-붙여넣기를 망치기에 충분합니다.

정확도를 해치는 것: 저해상도(200 DPI 미만), 기울어짐(각도진 스캔 페이지), 노이즈(더러운 스캐너 유리의 얼룩), 혼합 글꼴, 손글씨, 다중 열 레이아웃, 표, 색 배경 위의 텍스트. 스캔에 이 중 하나라도 있으면 주의 깊게 교정할 것으로 기대하세요.

흔한 실수

  • 민감한 문서에 무료 온라인 OCR 서비스 사용. 파일이 서버로 업로드됩니다. 로컬 도구 — Tesseract, Acrobat 또는 macOS Live Text — 를 사용하세요.
  • 교정 없이 OCR 출력 신뢰. OCR은 실수를 합니다. 계약서, 인용구 또는 데이터베이스에 텍스트를 복사한다면 각 단어를 이미지와 대조하여 확인하세요.
  • 원본 외형이 필요한데 텍스트만 출력 선택. 텍스트만 OCR은 이미지를 버립니다. 서명, 도장 또는 레이아웃이 중요하면 검색 가능 PDF 출력을 대신 사용하세요.
  • 이미 텍스트가 있는 PDF에 OCR 실행. 파일에 이미 텍스트 레이어가 있다면(Ctrl+F로 테스트) OCR이 불필요하며 기존 텍스트를 저하할 수 있습니다. 파일이 정말 OCR이 필요한지 확인하려면PDF에서 텍스트를 선택할 수 없는 이유를 참조하세요.
  • 언어 팩 생략. Tesseract는 영어를 기본으로 사용합니다. 영어 모델로 프랑스어 문서를 OCR하면 쓰레기가 나옵니다. 항상 올바른 언어로-l을 전달하세요.

검색 가능 PDF의 메타데이터 편집하세요

OCR이 텍스트 레이어를 추가한 후, IXPDF의 메타데이터 편집 도구로 제목, 저자, 주제, 키워드를 설정하세요 — 브라우저에서 로컬로, 업로드 없이.

메타데이터 편집 열기