Infraestructura documental

Del archivo al expediente consultable: cómo RuleX procesa documentos

Cómo RuleX convierte adjuntos en Markdown canónico, aplica OCR por lotes, guarda contexto en D1 y reutiliza documentos en Chat, Casos y Canvas.

13 min de lecturaEquipo RuleX · 20 de agosto de 2026
Memoria documental
50 MBlímite actual
convertir
indexar
reutilizar

La capacidad futura de 1 GB requiere otra capa de ingestión.

Respuesta corta

¿Cómo convierte RuleX un archivo en contexto?

RuleX convierte cada documento en una representación Markdown canónica, la fragmenta y la persiste para poder recuperarla en Chat, Casos y Canvas. El pipeline separa conversión, OCR, indexación y análisis, procesa lotes en paralelo y mantiene el texto original como contexto reutilizable.

La transformación

Un PDF no es todavía conocimiento de un expediente.

Un archivo puede tener páginas, tablas, firmas, encabezados, imágenes y texto escaneado. Antes de preguntarle algo a una IA hay que convertir ese material en una representación que el sistema pueda conservar, recuperar y volver a citar.

Pipeline documental

El expediente deja de ser un archivo muerto

etapas con estado
01

Archivo

PDF · DOCX · imagen

02

Markdown

texto canónico

03

OCR

páginas escaneadas

04

D1 + FTS5

memoria recuperable

05

Trabajo

Chat · Casos · Canvas

reutilizablefallo aisladotexto trazable

El pipeline

Qué ocurre después de subir un documento.

  1. 1Validar y descifrarEl servidor recibe el archivo, valida su tipo y tamaño y conserva los bytes solo durante el flujo que corresponda.
  2. 2Convertir a MarkdownLos documentos textuales pasan por la conversión canónica; la estructura se conserva como texto con encabezados y secciones.
  3. 3Aplicar OCRLas páginas escaneadas se identifican y se procesan por lotes con Gemini y fallback de Cloudflare cuando corresponde.
  4. 4Crear memoriaEl texto se cuenta, se fragmenta y se guarda con metadata, páginas, calidad y estado en las tablas documentales.
  5. 5Seleccionar contextoUna pregunta puntual puede recuperar fragmentos vecinos; una tarea amplia puede usar el documento completo o un map/reduce controlado.
  6. 6ReutilizarEl mismo Markdown puede alimentar Chat, Casos, Canvas, investigación y generación de entregables sin reconvertir el archivo.

Por qué importa

La memoria documental evita empezar de cero en cada turno.

Cuando el texto canónico queda guardado, la conversación puede volver al documento sin obligar al abogado a pegarlo de nuevo. El caso puede reutilizar la misma fuente y Canvas puede trabajar sobre el contexto documental disponible.

Una fuente canónica

El texto de trabajo no depende de un resumen improvisado del modelo.

Una memoria recuperable

Los fragmentos, páginas y metadata quedan disponibles para futuras operaciones.

Varios destinos

Chat, Casos y Canvas pueden usar el mismo documento sin crear copias conceptuales.

OCR y documentos largos

El procesamiento paralelo reduce el tiempo sin ocultar los fallos.

Los lotes de OCR y los chunks de documentos largos pueden procesarse en paralelo. Cada resultado mantiene su estado y un fallo individual no tiene que tumbar todo el expediente. Esa decisión mejora la experiencia, pero también hace visible qué parte necesita reintento o revisión.

Trabajo por lotes

Un expediente, varias unidades de procesamiento

01Páginas digitales → conversión directa
02Páginas escaneadas → OCR visual
03Lotes independientes → resultados aislados
04Documento listo → chunks y búsqueda

Límite actual

La honestidad también es parte de la infraestructura.

La carga automática actual de Chat y Casos admite hasta 50 MB por archivo. Eso permite describir el pipeline real sin convertir un objetivo futuro en una promesa presente.

50 MB

límite automático actual por archivo

D1

memoria documental persistente del flujo nuevo

FTS5

búsqueda lexical de documentos de usuario

Para expedientes de 1 GB harán falta carga multipart reanudable, procesamiento incremental, checksum, deduplicación y una cola de trabajo. Es un camino de producto, no una capacidad que debamos atribuirle hoy a RuleX.

Explora RuleX

Lleva esta idea al producto

Preguntas frecuentes

Respuestas rápidas sobre RuleX

¿Cómo procesa RuleX un PDF jurídico?

RuleX valida y descifra el archivo, detecta páginas escaneadas, convierte el contenido a Markdown, aplica OCR cuando hace falta, cuenta tokens, crea fragmentos y guarda la representación recuperable en D1. Luego Chat, Casos o Canvas pueden usar ese contexto.

¿RuleX guarda el texto del documento?

El pipeline nuevo guarda el Markdown canónico y sus fragmentos en el almacenamiento documental de la aplicación. El archivo del proveedor de IA es efímero; el contexto documental persistente permite reutilizar el contenido sin volver a procesar el original en cada turno.

¿Cuál es el tamaño máximo actual de un archivo?

La carga automática actual de Chat y Casos admite hasta 50 MB por archivo. La arquitectura futura para expedientes mayores requiere carga multipart, procesamiento incremental y reintentos por lote; no debe confundirse el roadmap con la capacidad disponible hoy.

¿El OCR garantiza que no se pierda ningún carácter?

No debe prometerse una garantía absoluta. RuleX aplica puertas de calidad, fallbacks, procesamiento por lotes y avisos de error para reducir pérdidas, pero los documentos escaneados deben revisarse cuando la exactitud literal sea crítica.

Prueba el flujo

La arquitectura importa cuando mejora una tarea real.

Explora las características de RuleX, revisa la seguridad y lleva esta idea a un expediente, una investigación o un documento que necesites trabajar.

Fuentes y alcance

Este artículo combina documentación pública de RuleX, observación del código actual y fuentes oficiales externas. Las capacidades de producto pueden cambiar; la fecha de publicación y las limitaciones indicadas forman parte del alcance de esta pieza.

Serie RuleX

Expedientes con IA: Markdown, OCR y memoria en RuleX | RuleX