Poco hablamos de la calidad de los datos últimamente...
De esta imagen no estructurada podemos extraer datos semi-estructurados…
y poco se habla de la librería LangExtract
🏂 ...Pero cómo?
Pipeline: Imagen → OCR → Texto → LangExtract → JSON
- La imagen solo muestra pixeles así que los datos son no estructurados
- Si aplicamos un OCR obtenemos texto pero de una forma semi-estructurada por ejemplo Speed: 23 km/h
- Al aplicar la librería LangExtract extraemos un JSON estructurado donde defines un esquema y la librería te devuelve los datos siempre con la misma forma + trazabilidad (de qué fragmento salió cada valor)
- YA TIENES UN JSON ESTRUCTURADO
Por qué usar langextract y en que contextos puede beneficiarte?
- Esquema fijo, el modelo entrega siempre los mismos campos (adiós sorpresas en producción).
- Trazabilidad, cada dato apunta al trozo exacto del texto es decir, es fácilmente auditable (auditoría en 1 click)
- Menos alucinaciones, extracción controlada y anclada al texto (no inventa valores) como puede pasar en los OCR directamente.
- Escala y documentos largos, trocea y paraleliza sin perder contexto.
🟢 Funciona con los maravillosos LLMs o incluso local (con ollama), es decir, si estás trabajando con datos no estructurados o semi estructurados y diferentes agentes, es un MUST utilizar este librería.