Saltar al contenido
100 % local · 0 KB subidosComprimir PDF

Cómo hacer que un PDF sea searchable

🔒 Tus archivos nunca salen de tu dispositivo. Todo el procesamiento ocurre localmente en tu navegador.

Un PDF escaneado es una fotografía de papel — no hay texto en el archivo, solo píxeles. No puedes buscar, seleccionar, copiar ni usar un lector de pantalla en él. Hacerlo searchable significa ejecutar OCR (reconocimiento óptico de caracteres) para añadir una capa de texto que se sitúa tras la imagen. Esta guía cubre los tres tipos de salida de OCR, las herramientas locales que lo hacen bien y por qué IXPDF no hace OCR en el navegador hoy.

IXPDF no puede hacer OCR en el navegador hoy
Existen motores OCR para navegador (Tesseract.js, OCRad.js), pero su precisión en escaneos reales no es lo bastante fiable para enviarlos. Malinterpretan fuentes comunes, luchan con diseños multicolumna y producen texto peor que ningún texto para búsqueda y accesibilidad. No enviaremos una herramienta que devuelva silenciosamente texto erróneo (AGENTS.md §16). Está marcado como Investigación requerida. Las herramientas siguientes se ejecutan localmente en tu máquina y no suben tu archivo.

Los tres tipos de salida de OCR

Las herramientas OCR pueden producir tres tipos distintos de salida. La que quieras depende de qué harás con el resultado.

1. PDF searchable (imagen + texto invisible)

La más común y normalmente la opción correcta. La imagen de página original sigue visible — el diseño, las firmas, los sellos, la escritura manual se ven exactamente igual. Tras la imagen, OCR añade una capa de texto invisible con los caracteres reconocidos. Puedes buscar, seleccionar, copiar y usar un lector de pantalla; lo que ves en pantalla es el escaneo original. Esto es lo que producen Adobe Acrobat, Tesseract y ABBYY por defecto.

Mejor para: archivar documentos escaneados donde la apariencia original importa (contratos, recibos, cartas firmadas).

2. PDF de solo texto (texto reconocizado, sin imagen)

OCR sustituye la imagen completamente por el texto reconocido. El resultado es pequeño, totalmente seleccionable y parece un PDF de texto normal — pero el diseño original es aproximado, y cualquier contenido que OCR no pudo reconocer (firmas, sellos, escritura manual) desaparece.

Mejor para: cuando solo necesitas el texto y la apariencia original no importa (p. ej., extraer el cuerpo de una carta escaneada a un archivo searchable para una base de conocimiento).

3. PDF de capa dual (imagen + texto, ambos visibles)

Un formato menos común que muestra tanto la imagen original como el texto reconocizado lado a lado, o superpone el texto sobre la imagen con la imagen difuminada. Se usa en flujos legales y de archivo donde los revisores necesitan comparar la salida de OCR con el original para detectar errores de reconocimiento. ABBYY FineReader y Adobe Acrobat Pro lo soportan.

Mejor para: revisión legal, control de calidad de archivo, cualquier flujo donde la precisión de OCR deba verificarse contra la fuente.

Herramientas OCR locales

Todas las herramientas siguientes se ejecutan en tu máquina. Ninguna sube tu documento. Eso importa: un contrato escaneado, historial médico o formulario fiscal no debería enviarse a un servicio «OCR online gratuito» — en ese punto el contenido está en el servidor de otra persona.

1. Adobe Acrobat Pro (de pago, el patrón oro)

Abre el PDF escaneado, luego Herramientas > Escanear y OCR > Reconocer texto > En este archivo. Elige el idioma y el tipo de salida (Imagen searchable es el predeterminado y normalmente correcto). El OCR de Acrobat es el más preciso en escaneos reales, gestiona bien diseños multicolumna y te permite corregir palabras mal reconocidas inline. El inconveniente es el coste — Acrobat Pro es una suscripción.

2. Tesseract (gratuito, open source, línea de comandos)

El motor OCR gratuito más preciso. Instala desdeel proyecto GitHub de Tesseract o tu gestor de paquetes (brew install tesseract en macOS,apt install tesseract-ocr en Linux). Luego:

tesseract input.pdf output -l eng pdf

Esto produce output.pdf como un PDF searchable con la imagen original y una capa de texto inglés invisible. Tesseract no es tan preciso como Acrobat en diseños complejos pero es excelente en escaneos limpios de columna única. Soporta más de 100 idiomas — pasa-l eng+fra para documentos mixtos inglés/francés.

3. Live Text de Preview en macOS (gratuito, macOS 12+)

En macOS Monterey y posteriores, Preview puede reconocer texto en PDFs escaneados e imágenes usando la función Live Text del sistema. Abre el PDF en Preview y puedes seleccionar, copiar y buscar texto directamente — macOS añade la capa de texto al vuelo. Para guardar la versión searchable, Archivo > Exportar como PDF. Live Text es rápido y preciso en documentos en inglés pero limitado en soporte de idiomas comparado con Tesseract.

4. ABBYY FineReader (de pago, alta precisión)

Una herramienta OCR comercial conocida por su alta precisión en escaneos difíciles — escritura manual, bajo contraste, fuentes mixtas, diseños multicolumna. Soporta salida de capa dual para verificación. Úsalo cuando Tesseract no es lo bastante preciso y no puedes justificar la suscripción de Acrobat Pro. FineReader es compra única, no suscripción.

Paso a paso: hacer un PDF searchable con Tesseract

  1. Instala Tesseract. En macOS,brew install tesseract. En Linux,apt install tesseract-ocr. En Windows, descarga el instalador desde el proyecto GitHub de Tesseract.
  2. Instala los datos de idioma. El inglés se incluye por defecto. Para otros idiomas, instala el paquete de idioma correspondiente (p. ej., brew install tesseract-lang en macOS).
  3. Abre una terminal. Navega a la carpeta que contiene el PDF escaneado.
  4. Ejecuta OCR.tesseract input.pdf output -l eng pdf
  5. Comprueba el resultado. Abre output.pdf, busca una palabra que veas en la imagen e intenta seleccionar un párrafo. Si la búsqueda y la selección funcionan, la capa de texto está en su sitio.
  6. Revisa. OCR comete errores. Copia un párrafo a un editor de texto y compáralo con la imagen. Corrige cualquier mal reconocimiento crítico en el documento de origen si vas a fiarte del texto.

Precisión de OCR: qué esperar

La precisión de OCR depende casi enteramente de la calidad de la imagen de origen. Un escaneo limpio a 300 DPI de una página impresa en una fuente común (Arial, Times New Roman) se reconocerá con un 98–99 % de precisión de caracteres. Un escaneo a 150 DPI de una página fotocopiada con una fuente decorativa puede caer al 90 % o menos — eso es 1 carácter erróneo de cada 10, suficiente para romper la búsqueda y el copiar-pegar.

Cosas que perjudican la precisión: baja resolución (por debajo de 200 DPI), inclinación (páginas escaneadas en ángulo), ruido (motas de un cristal de escáner sucio), fuentes mixtas, escritura manual, diseños multicolumna, tablas y texto sobre fondos de color. Si tu escaneo tiene alguno de estos, espera tener que revisar con cuidado.

Errores comunes

  • Usar un servicio OCR online gratuito para un documento sensible. El archivo se sube a un servidor. Usa una herramienta local — Tesseract, Acrobat o Live Text de macOS.
  • Confiar en la salida de OCR sin revisar. OCR comete errores. Si copias texto a un contrato, una cita o una base de datos, verifica cada palabra contra la imagen.
  • Elegir salida de solo texto cuando necesitas la apariencia original. El OCR de solo texto descarta la imagen. Si las firmas, sellos o el diseño importan, usa salida de PDF searchable en su lugar.
  • Aplicar OCR a un PDF que ya tiene texto. Si el archivo ya tiene una capa de texto (prueba con Ctrl+F), OCR es innecesario y puede degradar el texto existente. Ver¿Por qué no puedo seleccionar texto en un PDF? para confirmar que el archivo realmente necesita OCR.
  • Omitir el paquete de idioma. Tesseract usa inglés por defecto. Aplicar OCR a un documento francés con el modelo de inglés produce basura. Pasa siempre -l con el idioma correcto.

Edita los metadatos de tu PDF searchable

Una vez que OCR ha añadido una capa de texto, usa la herramienta Editar metadatos de IXPDF para definir el título, autor, asunto y palabras clave — en local en tu navegador, sin subida.

Abrir Editar metadatos