1. Inicio
  2. Documentos
  3. Guías
  4. Artículos
  5. Uso de herramientas específicas para OCR con Python: pdf2image y doctr

Uso de herramientas específicas para OCR con Python: pdf2image y doctr

La extracción de texto de documentos escaneados es una tarea común que se puede abordar eficientemente usando herramientas como pdf2image y doctr en Python. Aquí te presento una guía para instalar, configurar y utilizar estas herramientas desde la terminal de Anaconda Prompt.

Instalación y configuración de herramientas

Instalación de pdf2image

  1. Instalación de pdf2image con pip. Asegúrate de tener el entorno adecuado activado y luego instala pdf2image ejecutando el comando:
pip install pdf2image
  1. Instalación de Dependencias Externas
    • Poppler: pdf2image requiere Poppler para convertir archivos PDF a imágenes.
      • Descargar Poppler: Visita Poppler for Windows y descarga el paquete binario.
      • Añadir pdftoppm al PATH mediante:
set PATH=C:\ruta\a\poppler\bin;%PATH%
  1. Verificar la Instalación. Verifica que puedes importar pdf2image:
python -c "from pdf2image import convert_from_path"

En este articulo abordamos algunos problemas comunes al ejecutar scripts de Python.

Instalación de doctr

  1. Instalación de doctr. Instala doctr para la OCR utilizando:
pip install python-doctr
  1. Verificación de doctr. Importa y verifica doctr con:
python -c "from doctr.io import DocumentFile"

Uso de pdf2image y doctr para OCR

Convertir PDFs a imágenes con pdf2image

  1. Convertir un PDF a Imágenes. Usa pdf2image para convertir un archivo PDF en imágenes:
from pdf2image import convert_from_path 
images = convert_from_path('documento.pdf', dpi=300) 
for i, image in enumerate(images): image.save(f'image_page_{i}.png')

Extraer texto de imágenes con doctr

  1. Cargar Imagen y Realizar OCR. Usa doctr para extraer texto de imágenes generadas:
from doctr.io import DocumentFilefrom doctr.models import ocr_predictor 
# Cargar documentodoc = DocumentFile.from_images(["image_page_0.png"]) 
# Inicializar modelo OCR 
model = ocr_predictor(pretrained=True)

# Realizar OCRresult = model(doc) 
# Imprimir el texto extraídofor page in result.pages: print(page.get_text())

pdf2image y doctr son herramientas interesante para la conversión y extracción de texto en documentos. A través de esta guía, has aprendido cómo instalarlas y utilizarlas eficientemente desde un entorno de Anaconda.

¿Cómo podemos ayudarte?