🧠 Cómo estructuré un proyecto de IA para analizar el #BOE de forma eficiente
Estoy desarrollando un proyecto personal para validar ideas sobre control de costes usando un modelo de IA con una base de conocimiento extensa.
El reto: Crear un asistente experto en el BOE (Boletín Oficial del Estado) que permita consultar su inmenso contenido de forma rápida y precisa. La complejidad: procesar +2M de documentos históricos de manera eficiente y barata.
Mi estrategia en 4 fases:
1️⃣ Extracción y estructuración de datos
1.1. Desarrollé un sistema de scraping para https://lnkd.in/dhRgyaAB
1.2. Organización en base de datos relacional con esta estructura:
I. Disposiciones generales
II. Autoridades y personal
III. Otras disposiciones
IV. Administración de Justicia
V. Anuncios (con subclasificaciones A/B/C)
1.3. Almacenamiento en crudo de pdf + metadatos estructurados
2️⃣ Procesamiento de contenido
2.1. Uso de LangChain para embeddings y procesamiento de texto/imágenes
2.2. Base de datos vectorial con Pinecone
2.3. Faltaría por hacer un modelado de relaciones de los diferentes temas que toca el BOE.
3️⃣ Infraestructura de IA en proveedor de cloud público, en mi caso para este proyecto estoy usando Alibaba Cloud
3.1. Endpoint propio para inferencias (en lugar de APIs públicas) + seguridad.
3.2. Control de costes + posibilidad de fine-tuning futuro
3.3. Arquitectura escalable
4️⃣ Interfaz de usuario
4.1. Frontend en React con búsqueda semántica
4.2. Comprobación de cualquier texto del BOE y referencia al documento original o documentos.
5️⃣ Para un futuro.
5.1. Entrenamiento específico algún modelo específico que tenga conocimiento en temas legales, administrativo y todo lo que tenga que ver con ellos.
Os dejo el primer diagrama de arquitectura que hice.
#IA #BOE #bigdata #legaltech