Poco hablamos de la calidad de los datos últimamente...

Poco hablamos de la calidad de los datos últimamente...

Poco hablamos de la calidad de los datos últimamente... De esta imagen no estructurada podemos extraer datos semi-estructurados… y poco se habla de la librer…

✍️

Poco hablamos de la calidad de los datos últimamente...

De esta imagen no estructurada podemos extraer datos semi-estructurados…

y poco se habla de la librería LangExtract

🏂 ...Pero cómo?

Pipeline: Imagen → OCR → Texto → LangExtract → JSON

  • La imagen solo muestra pixeles así que los datos son no estructurados
  • Si aplicamos un OCR obtenemos texto pero de una forma semi-estructurada por ejemplo Speed: 23 km/h
  • Al aplicar la librería LangExtract extraemos un JSON estructurado donde defines un esquema y la librería te devuelve los datos siempre con la misma forma + trazabilidad (de qué fragmento salió cada valor)
  • YA TIENES UN JSON ESTRUCTURADO

Por qué usar langextract y en que contextos puede beneficiarte?

  • Esquema fijo, el modelo entrega siempre los mismos campos (adiós sorpresas en producción).
  • Trazabilidad, cada dato apunta al trozo exacto del texto es decir, es fácilmente auditable (auditoría en 1 click)
  • Menos alucinaciones, extracción controlada y anclada al texto (no inventa valores) como puede pasar en los OCR directamente.
  • Escala y documentos largos, trocea y paraleliza sin perder contexto.

🟢 Funciona con los maravillosos LLMs o incluso local (con ollama), es decir, si estás trabajando con datos no estructurados o semi estructurados y diferentes agentes, es un MUST utilizar este librería.

Ver post original en LinkedIn
¿Te ha resultado útil?

Cada semana publico sobre IA, cloud y arquitectura tecnológica en LinkedIn.
Más de 4.000 profesionales ya lo siguen.

Seguir en LinkedIn