PDF에서 텍스트를 선택할 수 없는 이유는?
PDF에서 텍스트를 선택할 수 없으면 — 클릭하고 끌어도 아무것도 강조되지 않으면 — 텍스트가 파일의 콘텐츠 흐름에 없습니다. 이는 일반적으로 네 가지 중 하나를 의미합니다: PDF가 스캔된 이미지, 텍스트가 내보내기 시 이미지로 구워짐, 파일이 텍스트 층을 잃는 방식으로 평평해짐, 또는 글꽴 인코딩이 깨짐. 처음 세 가지의 수정은 OCR입니다. 이 가이드는 어느 원인이 적용되는지 구별하고 무엇을 할지 설명합니다.
4가지 일반적인 원인
1. PDF가 스캔됨(이미지 전용)
가장 일반적인 원인. 스캔된 문서는 종이의 사진입니다 — 각 페이지가 큰 이미지입니다. 콘텐츠 흐름에 텍스트가 없어 선택할 것이 없습니다. 스캐너는 기본적으로 이미지 전용 PDF를 생성합니다 — 스캐너 소프트웨어의 «검색 가능 PDF» 옵션이 OCR로 스캔에 텍스트 층을 추가하는 것입니다.
확인 방법: 400%로 확대하세요. 텍스트가 픽셀화되면(글자 모양 주변에 들쭉거리는 가장자리가 보이면) 이미지입니다. 실제 텍스트는 글꽴 윤곽에서 렌더링되므로 아무 확대에서도 선명합니다. Ctrl+F /Cmd+F도 시도하세요 — 검색이 분명히 보이는 단어를 찾지 못하면 파일에 텍스트 층이 없습니다.
수정: OCR을 실행하여 검색 가능한 텍스트 층을 추가하세요. 로컬에서 수행하는 도구는 PDF를 검색 가능하게 만드는 방법을 참조하세요.
2. 텍스트가 이미지로 구워짐
일부 애플리케이션은 텍스트가 레스터화된 PDF를 내보냅니다 — 소스가 실제 텍스트였어도 픽셀로 변환되어 이미지로 박힙니다. 이는 모든 것을 레스터화하는 «Print to PDF» 드라이버, 텍스트를 배경 이미지에 평평하게 하는 프레젠테이션 내보내기, 그리고 모든 콘텐츠를 이미지로 변환하는 «평평하게 하기» 단계를 거친 PDF에서 발생합니다.
확인 방법: 스캔과 같이 — 400%로 확대하고 픽셀화를 찾습니다. 파일이 원래 실제 텍스트 PDF였을 수 있습니다 — 레스터화는 내보내기 시 발생했습니다.
수정: 소스 애플리케이션에서 텍스트를 텍스트로 보존하여(레스터화하지 않고) 다시 내보냅니다. 소스가 없으면, 기존 파일에서 OCR을 실행하세요.
3. PDF가 평평해짐
평평하게 하기는 양식 필드, 주석 및 때로는 텍스트를 정적 콘텐츠로 변환합니다. 일부 평평화 작업은 텍스트 층을 보존하지만, 다른 것은 모든 것을 레스터화합니다. 평평화 단계가 레스터화했으면, 결과는 이미지 전용이며 선택 불가능합니다.
확인 방법: 다시 확대 테스트. 텍스트가 400%에서 여전히 선명하지만 선택할 수 없으면, 평평화가 텍스트를 윤곽(벡터 모양)으로 보존한 것입니다 — 드물지만 가능. 픽셀화되었으면, 평평화가 레스터화한 것입니다.
수정: 텍스트 층을 보존하는 도구로 다시 평평하게 하거나, 소스에서 다시 내보냅니다. 텍스트 보존 평평화와 레스터화 평평화의 차이는 PDF 평평하게 하는 방법을 참조하세요.
4. 글꽴 인코딩 깨짐(ToUnicode 누락)
가장 드문 원인. 텍스트는 콘텐츠 흐름에 있고 올바르게 렌더링되지만, 글꽴의 ToUnicode 매핑이 누락되거나 잘못되었습니다. 뷰어는 글리프를 표시할 수 있지만(글꽴 윤곽이 있음) 선택, 복사 또는 검색을 위해 Unicode 문자로 다시 매핑할 수 없습니다. 텍스트가 보이지만 선택할 수 없습니다.
확인 방법: 텍스트가 아무 확대에서도 선명합니다(이미지가 아닌 실제 텍스트) 하지만 선택하거나 복사할 수 없습니다. 검색도 실패합니다. 오래된 CAD 도구나 틈새 내보내기가 생성한 PDF에서 일반적입니다.
수정: 소스에서 올바른 Unicode 매핑으로 다시 내보냅니다. 소스가 없으면, OCR을 실행하세요 — 올바른 Unicode로 새 텍스트 층을 추가하여 깨진 것을 대체합니다.
빠른 진단 체크리스트
- 단어 선택을 시도하세요. 단어 위로 클릭하고 끕니다. 아무것도 강조되지 않으면 텍스트가 콘텐츠 흐름에 없습니다.
- 400%로 확대하세요. 텍스트가 픽셀화되면 이미지입니다(스캔, 레스터화 또는 이미지로 평평해짐). 선명하면 실제 텍스트이지만 인코딩이 깨진 것입니다.
- 검색을 시도하세요(Ctrl+F / Cmd+F). 검색이 보이는 단어를 찾지 못하면 파일에 검색 가능한 텍스트 층이 없습니다.
- 파일 크기를 확인하세요. 스캔된 PDF는 일반적으로 큽니다(페이지당 전체 페이지 이미지). 선택 불가능한 텍스트가 있는 작은 파일은 인코딩 깨짐 경우일 가능성이 더 높습니다.
- 필요하면 OCR을 적용하세요. 로컬 OCR 도구로 검색 가능한 텍스트 층을 추가하세요.
지금 실행할 수 있는 빠른 테스트
PDF가 스캔된 문서에서 생성되었으면, 텍스트 추출이 빈 값을 반환합니다. IXPDF의 PDF to Text 도구를 시도하세요 — 파일을 놓고, 실행하고, 결과를 검사하세요. 추출된 텍스트가 비어 있으면, PDF가 스캔됨(또는 레스터화됨)이며 텍스트를 선택 가능하게 하려면 OCR(광학 문자 인식)이 필요합니다 — 신뢰할 수 있는 로컬 OCR 옵션은 PDF를 검색 가능하게 만드는 방법을 참조하세요. 도구가 텍스트를반환하지만 원본 PDF에서 여전히 선택할 수 없으면, 원인은 글꽴 인코딩 깨짐(위 원인 4)일 가능성이 높습니다 — 텍스트 층은 있지만, 뷰어가 글리프를 Unicode로 다시 매핑할 수 없습니다.
OCR이 수정인 이유(단순한 우회가 아닌)
스캔, 레스터화 및 인코딩 깨짐 PDF의 경우, OCR이 유일한 수정입니다 — 복구할 원본 텍스트가 없습니다. OCR은 이미지를 분석하고, 글자 모양을 인식하고, PDF에 새 텍스트 층을 씁니다. 결과는 «검색 가능 PDF»입니다: 원본 이미지는 여전히 보이므로(레이아웃과 서명이 보존됨) 인식된 텍스트가 선택, 복사 및 검색을 위해 보이지 않는 층으로 뒤에 배치됩니다.
OCR 품질이 결과 품질을 결정합니다. 현대 OCR 엔진(Tesseract 5, ABBYY FineReader, Adobe Acrobat의 OCR)은 일반 글꽴의 깨끗한 300 DPI 스캔에서 좋습니다. 손글씨, 저해상도 스캔, 장식 글꽴 및 텍스트와 이미지가 섞인 다중 열 레이아웃에서 어려워합니다. 인식된 텍스트를 신뢰하기 전에 항상 교정하세요.
일반적인 실수
- PDF가 «암호화됨» 또는 «보호됨»이라고 가정. 선택 불가능한 텍스트는 거의 보안 기능이 아닙니다. 일반적으로 스캔된 파일입니다. Acrobat Reader에서 열어 확인하세요 — File > Properties > Security에 제한이 나열되지 않으면 파일이 보호되지 않은 것입니다.
- 민감 문서에 무료 온라인 OCR 서비스 사용. 파일이 서버에 업로드됩니다. 로컬 도구를 사용하세요 — Tesseract, Acrobat 또는 macOS Live Text.
- 교정 없이 OCR 출력 신뢰. OCR은 잘못 해석합니다. 계약이나 인용에 텍스트를 복사하면, 각 단어를 이미지와 대조하여 확인하세요.
- 다시 내보내기 대신 다시 스캔. 소스 문서(Word, PowerPoint, InDesign)가 있으면, PDF로 다시 내보내세요 — 텍스트가 실제이며 선택 가능합니다. 다시 스캔은 최후의 수단입니다.
PDF를 검색 가능하게 만드세요
IXPDF는 오늘 브라우저에서 OCR을 할 수 없습니다 — 정확도가 게시하기에 충분히 좋지 않습니다. 파일을 업로드하지 않고 기기에서 실행되는 신뢰할 수 있는 로컬 OCR 도구는 가이드를 참조하세요.
OCR 옵션에 대해 더 알아보기