¿Puede un LLM sustituir a un OCR?

¿Puede un LLM sustituir a un OCR?

¿Puede un LLM sustituir a un OCR? La respuesta corta es, SI* Hoy os traigo una prueba de concepto que he hecho, usar un modelo con propósito específico entre…

✍️

¿Puede un LLM sustituir a un OCR?

La respuesta corta es, SI*

Hoy os traigo una prueba de concepto que he hecho, usar un modelo con propósito específico entrenado para extraer texto de imagenes, como si fuera un OCR. El modelo usado es #qwen de Alibaba Cloud en particular Qwen2-VL-2B-OCR.

Las soluciones OCR de toda la vida, bien sean servicios en nubes públicas como Google Cloud Vision o AWS Textract, o bien mediante el clásico repo opensource como Tesseract , están diseñadas específicamente para extraer texto de imágenes. Suelen ser muy óptimos y baratos.

Pero... ¿Es mejor usar un modelo de IA o un OCR? Realmente dependerá del 💲 presupuesto 💲 de tú proyecto.

En resumen es más rápido extraer texto de una factura usando un modelo de IA, pero es más caro.

En el vídeo se ve lo bien que funciona un modelo de 2B como si fuera un OCR.

Si queréis el código de la aplicación hecha en gradio, comentad "OCR".

*dependerá mucho del presupuesto del que dispongas y el modelo que elijas.

Prompt óptimo: "Extract all text from image without miss anything".

#OCR #IA #qwenVL Gradio #cloud #alibaba

Ver post original en LinkedIn
¿Te ha resultado útil?

Cada semana publico sobre IA, cloud y arquitectura tecnológica en LinkedIn.
Más de 4.000 profesionales ya lo siguen.

Seguir en LinkedIn