Sistema propioNormativa, jurisprudencia y conocimiento jurídico

BOE Legal: convertir fuentes oficiales y sus cambios en un corpus consultable y trazable

Sistema propio que ingiere fuentes oficiales, conserva snapshots y versiones, reconcilia relaciones jurídicas y prepara búsqueda léxica, semántica e híbrida con referencias verificables.

Qué demuestra

Las fuentes oficiales avanzan por estados verificables desde la ingesta hasta la recuperación, manteniendo identidad, versión y procedencia.

Tipo: Motor de conocimiento jurídicoAlcance: Ingesta BOE, snapshots, consolidación, versiones, relaciones, CENDOJ, OCR, búsqueda híbrida, embeddings y citasAño: 2026

El problema

Qué estaba ocurriendo antes

Un buscador semántico montado directamente sobre textos descargados puede mezclar versiones, perder procedencia o generar respuestas sobre documentos incompletos. A escala, ingesta, OCR, duplicados, historial, jurisprudencia y reintentos se convierten en parte del problema de negocio.

La dificultad de trabajar con normativa no es solo encontrar una norma. También importa saber qué versión se ha ingerido, conservar el original, reconstruir unidades y cambios, relacionar artículos con otras fuentes y distinguir qué documentación está suficientemente preparada para entrar en un sistema de recuperación.

La solución

Qué se construyó y qué cambió

Construir primero un corpus identificable y versionado; añadir recuperación semántica solo después.

  • Arquitectura documentada con Next.js, worker Node y PostgreSQL como fuente de verdad.
  • Flujo BOE diario con snapshots, hashes, parser versionado y jobs de enriquecimiento.
  • Pipeline BOE–CENDOJ con descarga PDF, extracción, OCR y embeddings por unidad.
  • Controles de seguridad sobre URLs externas, timeouts, tamaños y exposición de errores.

Antes y después

Qué trabajo dejó de hacerse a mano

Antes

  • Documentos oficiales accesibles, pero difíciles de convertir en un corpus coherente para consulta avanzada.
  • Riesgo de mezclar texto original, consolidado, histórico y jurisprudencia sin una identidad estable.
  • PDF judiciales que podían necesitar extracción u OCR antes de ser utilizables.
  • Un sistema semántico podía vectorizar contenido antes de comprobar su preparación y procedencia.

Después

  • Cada documento y asset conserva identidad, snapshot, hash y fase de procesamiento.
  • Unidades, versiones y relaciones jurídicas quedan estructuradas antes de la recuperación.
  • Los PDF judiciales siguen un pipeline explícito de descarga, extracción, OCR y finalización.
  • Los embeddings se generan sobre unidades procesadas dentro de un flujo auditable.

Cómo funciona

Cómo se resolvió paso a paso

BOE Legal separa adquisición, persistencia, parsing, enriquecimiento y recuperación. Los documentos se identifican mediante snapshots y hashes; los trabajos largos se ejecutan en workers; la jurisprudencia BOE–CENDOJ se procesa por fases; y la preparación para embeddings depende del estado real del corpus, no solo de que exista texto.

El motor procesa sumarios y documentos individuales del BOE, legislación consolidada, unidades y versiones; vincula jurisprudencia CENDOJ, descarga y extrae PDF, recurre a OCR cuando hace falta, genera embeddings y expone consultas jurídicas. PostgreSQL conserva documentos, snapshots, relaciones, assets, extracciones, jobs y auditoría como fuente de verdad.

01

Ingesta oficial

Se descargan sumarios y documentos del BOE, se validan y se persisten snapshots identificables.

02

Estructura y versiones

El parser transforma documentos en unidades, conserva consolidación e historial y registra relaciones.

03

Jurisprudencia y OCR

Las referencias CENDOJ se descargan y procesan por fases, usando OCR solo cuando la extracción nativa no es suficiente.

04

Recuperación

Las unidades preparadas pueden entrar en embeddings y búsqueda avanzada conservando sus referencias.

Control

Qué sigue dependiendo de una persona

La herramienta facilita búsqueda y preparación de fuentes; no sustituye la interpretación jurídica del caso concreto.

Interpretación

Qué acredita esta prueba

El corpus puede consultarse sin ocultar de dónde procede cada pieza ni confundir una fuente descargada con una fuente lista para recuperación. La arquitectura permite ampliar búsqueda y generación sobre documentos identificables, versionados y procesados por estados.

Aplicación a otros procesos

Qué partes de este enfoque pueden reutilizarse

Fuente antes que respuesta

La recuperación es más fiable cuando identidad, versión y procedencia del documento se resuelven antes de generar una explicación.

Procesamiento por estados

Descarga, parsing, OCR, relaciones y embeddings deben poder fallar o reintentarse de forma independiente sin ocultar el estado real.

Trazabilidad a escala

Hashes, snapshots, jobs y auditoría permiten saber qué se procesó, con qué versión y qué queda pendiente.

Sistema propio

Sistema técnico desarrollado como capacidad reutilizable

La prueba está en el sistema construido, su arquitectura y el problema técnico que resuelve. El valor para una empresa está en adaptar ese patrón a sus datos y procesos.

Qué se muestra públicamente

  • Arquitectura y flujo funcional.
  • Problema técnico resuelto.
  • Componentes reutilizables.
  • Aplicaciones posibles en otros procesos.

Tecnología

Piezas utilizadas en este caso

Next.jsNode.jsPostgreSQLpgvectorPDF.jsOCREmbeddings

La selección técnica es consecuencia del proceso, el nivel de riesgo, los datos disponibles y la forma de mantener el sistema.

Aplicación a tu empresa

¿Tienes un proceso que se atasca por el mismo motivo?

Describe qué información entra, qué trabajo se repite y quién toma la decisión final. El análisis inicial permite comprobar si este enfoque encaja antes de construir.

Analizar un proceso parecido