RuleX
Infraestructura documental

Del archivo al expediente consultable: cómo RuleX procesa documentos

Cómo RuleX convierte adjuntos en Markdown canónico, aplica OCR por lotes, guarda contexto en D1 y reutiliza documentos en Chat, Casos y Canvas.

13 min de lecturaEquipo RuleX · 20 de agosto de 2026
Memoria documental
50 MBlímite actual
convertir
indexar
reutilizar

El límite automático actual es 50 MB por archivo.

Respuesta corta

¿Cómo convierte RuleX un archivo en contexto?

RuleX convierte cada documento en una representación Markdown canónica, la fragmenta y la persiste para poder recuperarla en Chat, Casos y Canvas. El pipeline separa conversión, OCR, indexación y análisis, procesa lotes en paralelo y mantiene el texto original como contexto reutilizable.

La transformación

Un PDF no es todavía conocimiento de un expediente.

Un archivo puede tener páginas, tablas, firmas, encabezados, imágenes y texto escaneado. Antes de preguntarle algo a una IA hay que convertir ese material en una representación que el sistema pueda conservar, recuperar y volver a citar.

Pipeline documental

El expediente deja de ser un archivo muerto

etapas con estado
01

Archivo

PDF · DOCX · imagen

02

Markdown

texto canónico

03

OCR

páginas escaneadas

04

D1 + FTS5

memoria recuperable

05

Trabajo

Chat · Casos · Canvas

reutilizablefallo aisladotexto trazable

El pipeline

Qué ocurre después de subir un documento.

  1. 1Validar y descifrarEl servidor recibe el archivo, valida su tipo y tamaño y conserva los bytes solo durante el flujo que corresponda.
  2. 2Convertir a MarkdownLos documentos textuales pasan por la conversión canónica; la estructura se conserva como texto con encabezados y secciones.
  3. 3Aplicar OCRLas páginas escaneadas se identifican y se procesan por lotes con un motor visual especializado y fallback de Cloudflare cuando corresponde.
  4. 4Crear memoriaEl texto se cuenta, se fragmenta y se guarda con metadata, páginas, calidad y estado en las tablas documentales.
  5. 5Seleccionar contextoUna pregunta puntual puede recuperar fragmentos vecinos; una tarea amplia puede usar el documento completo o un map/reduce controlado.
  6. 6ReutilizarEl mismo Markdown puede alimentar Chat, Casos, Canvas, investigación y generación de entregables sin reconvertir el archivo.

Por qué importa

La memoria documental evita empezar de cero en cada turno.

Cuando el texto canónico queda guardado, la conversación puede volver al documento sin obligar al abogado a pegarlo de nuevo. El caso puede reutilizar la misma fuente y Canvas puede trabajar sobre el contexto documental disponible.

Una fuente canónica

El texto de trabajo no depende de un resumen improvisado del modelo.

Una memoria recuperable

Los fragmentos, páginas y metadata quedan disponibles para futuras operaciones.

Varios destinos

Chat, Casos y Canvas pueden usar el mismo documento sin crear copias conceptuales.

OCR y documentos largos

El procesamiento paralelo reduce el tiempo sin ocultar los fallos.

Los lotes de OCR y los chunks de documentos largos pueden procesarse en paralelo. Cada resultado mantiene su estado y un fallo individual no tiene que tumbar todo el expediente. Esa decisión mejora la experiencia, pero también hace visible qué parte necesita reintento o revisión.

Trabajo por lotes

Un expediente, varias unidades de procesamiento

01Páginas digitales → conversión directa
02Páginas escaneadas → OCR visual
03Lotes independientes → resultados aislados
04Documento listo → chunks y búsqueda

Límite actual

La honestidad también es parte de la infraestructura.

La carga automática actual de Chat y Casos admite hasta 50 MB por archivo. Eso permite describir el pipeline real sin convertir un objetivo futuro en una promesa presente.

50 MB

límite automático actual por archivo

D1

memoria documental persistente del flujo nuevo

FTS5

búsqueda lexical de documentos de usuario

Para expedientes de 1 GB harán falta carga multipart reanudable, procesamiento incremental, checksum, deduplicación y una cola de trabajo. Es un camino de producto, no una capacidad que debamos atribuirle hoy a RuleX.

Explora RuleX

Lleva esta idea al producto

Preguntas frecuentes

Respuestas rápidas sobre RuleX

¿Cómo procesa RuleX un PDF jurídico?

RuleX valida y descifra el archivo, detecta páginas escaneadas, convierte el contenido a Markdown, aplica OCR cuando hace falta, cuenta tokens, crea fragmentos y guarda la representación recuperable en D1. Luego Chat, Casos o Canvas pueden usar ese contexto.

¿RuleX guarda el texto del documento?

El pipeline nuevo guarda el Markdown canónico y sus fragmentos en el almacenamiento documental de la aplicación. El archivo del proveedor de IA es efímero; el contexto documental persistente permite reutilizar el contenido sin volver a procesar el original en cada turno.

¿Cuál es el tamaño máximo de un archivo?

Chat y Casos admiten archivos de hasta 50 MB cada uno, y el expediente entra por lotes: son los cientos de folios de un caso real, no una página suelta. La carga masiva de la operación B2B sube archivos de hasta 5 GB por bloques, con barra de progreso.

¿El OCR garantiza que no se pierda ningún carácter?

RuleX aplica puertas de calidad, fallbacks, procesamiento por lotes y avisos de error sobre cada documento escaneado, y avisa cuando la lectura de una página quedó por debajo del umbral. En un escaneo donde la exactitud literal sea crítica, esa señal es la que le dice al abogado qué página abrir.

Prueba el flujo

La arquitectura importa cuando mejora una tarea real.

Explora las características de RuleX, revisa la seguridad y lleva esta idea a un expediente, una investigación o un documento que necesites trabajar.

Fuentes y alcance

Este artículo combina documentación pública de RuleX, observación del código actual y fuentes oficiales externas. Las capacidades de producto pueden cambiar; la fecha de publicación y las limitaciones indicadas forman parte del alcance de esta pieza.

Serie RuleX