Respuesta corta
¿Cómo convierte RuleX un archivo en contexto?
RuleX convierte cada documento en una representación Markdown canónica, la fragmenta y la persiste para poder recuperarla en Chat, Casos y Canvas. El pipeline separa conversión, OCR, indexación y análisis, procesa lotes en paralelo y mantiene el texto original como contexto reutilizable.
La transformación
Un PDF no es todavía conocimiento de un expediente.
Un archivo puede tener páginas, tablas, firmas, encabezados, imágenes y texto escaneado. Antes de preguntarle algo a una IA hay que convertir ese material en una representación que el sistema pueda conservar, recuperar y volver a citar.
Pipeline documental
El expediente deja de ser un archivo muerto
Archivo
PDF · DOCX · imagen
Markdown
texto canónico
OCR
páginas escaneadas
D1 + FTS5
memoria recuperable
Trabajo
Chat · Casos · Canvas
El pipeline
Qué ocurre después de subir un documento.
- 1Validar y descifrarEl servidor recibe el archivo, valida su tipo y tamaño y conserva los bytes solo durante el flujo que corresponda.
- 2Convertir a MarkdownLos documentos textuales pasan por la conversión canónica; la estructura se conserva como texto con encabezados y secciones.
- 3Aplicar OCRLas páginas escaneadas se identifican y se procesan por lotes con Gemini y fallback de Cloudflare cuando corresponde.
- 4Crear memoriaEl texto se cuenta, se fragmenta y se guarda con metadata, páginas, calidad y estado en las tablas documentales.
- 5Seleccionar contextoUna pregunta puntual puede recuperar fragmentos vecinos; una tarea amplia puede usar el documento completo o un map/reduce controlado.
- 6ReutilizarEl mismo Markdown puede alimentar Chat, Casos, Canvas, investigación y generación de entregables sin reconvertir el archivo.
Por qué importa
La memoria documental evita empezar de cero en cada turno.
Cuando el texto canónico queda guardado, la conversación puede volver al documento sin obligar al abogado a pegarlo de nuevo. El caso puede reutilizar la misma fuente y Canvas puede trabajar sobre el contexto documental disponible.
Una fuente canónica
El texto de trabajo no depende de un resumen improvisado del modelo.
Una memoria recuperable
Los fragmentos, páginas y metadata quedan disponibles para futuras operaciones.
Varios destinos
Chat, Casos y Canvas pueden usar el mismo documento sin crear copias conceptuales.
OCR y documentos largos
El procesamiento paralelo reduce el tiempo sin ocultar los fallos.
Los lotes de OCR y los chunks de documentos largos pueden procesarse en paralelo. Cada resultado mantiene su estado y un fallo individual no tiene que tumbar todo el expediente. Esa decisión mejora la experiencia, pero también hace visible qué parte necesita reintento o revisión.
Trabajo por lotes
Un expediente, varias unidades de procesamiento
Límite actual
La honestidad también es parte de la infraestructura.
La carga automática actual de Chat y Casos admite hasta 50 MB por archivo. Eso permite describir el pipeline real sin convertir un objetivo futuro en una promesa presente.
50 MB
límite automático actual por archivo
D1
memoria documental persistente del flujo nuevo
FTS5
búsqueda lexical de documentos de usuario
Para expedientes de 1 GB harán falta carga multipart reanudable, procesamiento incremental, checksum, deduplicación y una cola de trabajo. Es un camino de producto, no una capacidad que debamos atribuirle hoy a RuleX.
Explora RuleX
Lleva esta idea al producto
Preguntas frecuentes
Respuestas rápidas sobre RuleX
¿Cómo procesa RuleX un PDF jurídico?
RuleX valida y descifra el archivo, detecta páginas escaneadas, convierte el contenido a Markdown, aplica OCR cuando hace falta, cuenta tokens, crea fragmentos y guarda la representación recuperable en D1. Luego Chat, Casos o Canvas pueden usar ese contexto.
¿RuleX guarda el texto del documento?
El pipeline nuevo guarda el Markdown canónico y sus fragmentos en el almacenamiento documental de la aplicación. El archivo del proveedor de IA es efímero; el contexto documental persistente permite reutilizar el contenido sin volver a procesar el original en cada turno.
¿Cuál es el tamaño máximo actual de un archivo?
La carga automática actual de Chat y Casos admite hasta 50 MB por archivo. La arquitectura futura para expedientes mayores requiere carga multipart, procesamiento incremental y reintentos por lote; no debe confundirse el roadmap con la capacidad disponible hoy.
¿El OCR garantiza que no se pierda ningún carácter?
No debe prometerse una garantía absoluta. RuleX aplica puertas de calidad, fallbacks, procesamiento por lotes y avisos de error para reducir pérdidas, pero los documentos escaneados deben revisarse cuando la exactitud literal sea crítica.
Prueba el flujo
La arquitectura importa cuando mejora una tarea real.
Explora las características de RuleX, revisa la seguridad y lleva esta idea a un expediente, una investigación o un documento que necesites trabajar.
Fuentes y alcance
Este artículo combina documentación pública de RuleX, observación del código actual y fuentes oficiales externas. Las capacidades de producto pueden cambiar; la fecha de publicación y las limitaciones indicadas forman parte del alcance de esta pieza.
Serie RuleX
Sigue leyendo la arquitectura
Dirección de producto
Legal harness: cómo RuleX ejecuta trabajo jurídico
Qué es un legal harness y cómo RuleX conecta modelos de frontera, fuentes, expedientes, memoria, herramientas y documentos para el trabajo jurídico.
Leer artículoArquitectura de conocimiento
RAG jurídico de RuleX: fuentes y citas en Colombia
Siete índices jurídicos, routing por materia, citas exactas y búsqueda web para vigencia: así RuleX recupera evidencia jurídica para sus respuestas.
Leer artículoDel análisis al entregable
De la investigación al documento: Word, Excel y PDF
Cómo RuleX conecta investigación, expedientes y contexto para producir documentos Word, hojas de cálculo, presentaciones y PDF revisables.
Leer artículoPieza de entrada
RuleX se actualiza: nueva IA jurídica para abogados
La actualización que abrió la conversación sobre una IA jurídica con más profundidad, fuentes y control.
Leer actualización