Saltar al contenido principal

§ 20 · IA & calidad

Por qué en nuestra plataforma un documento no se resume dos veces

Cada ejecución automática de IA genera costes — salvo que el sistema ya conozca la respuesta. Hemos examinado nuestra propia arquitectura precisamente bajo esa lupa, cerrado la mayor brecha encontrada y le mostramos cómo interactúan la reutilización de caché y un nuevo freno de costes a nivel de despacho.

4 minIA & calidad
Imagen simbólica de la eficiencia de tokens: un nodo luminoso que se remite a sí mismo en un bucle sereno, mientras a su alrededor se desvanecen pálidos duplicados, sobre un fondo verde oscuro y oxblood

El automatismo más costoso de la plataforma

Cada documento que sube a un expediente se lee, clasifica e incorpora automáticamente al grafo de hechos del expediente — salvo que lo excluya deliberadamente. Ese es precisamente el núcleo copiloto de nuestra plataforma: usted no tiene que activar nada, el análisis se ejecuta por sí solo. Pero eso convierte precisamente a este automatismo en el disparador de IA más frecuente y costoso de toda la plataforma — cada carga puede desencadenar una ejecución en segundo plano, también en una importación grande con muchos archivos a la vez.

La pregunta que nos planteamos a nosotros mismos

Un automatismo que se ejecuta con cada carga debe someterse a una pregunta sencilla: ¿vuelve a leer solo cuando realmente es necesario? Hemos examinado nuestra propia arquitectura exactamente bajo ese criterio. El resultado fue matizado. En varios puntos centrales — su asistente de IA, los borradores de escritos y contratos, el resumen de todo el expediente — la IA ya se basa desde hace tiempo en hechos previamente extraídos y en resúmenes de documentos guardados, en lugar de en el texto completo; el texto completo solo se vuelve a cargar de forma selectiva cuando una pregunta concreta lo requiere. En un punto que se ejecuta con mucha frecuencia, la situación era distinta: la ejecución automática que actualiza el grafo de hechos de un expediente con cada documento nuevo generaba para cada documento afectado un resumen propio y efímero — incluso cuando ese mismo documento ya había sido resumido por completo poco antes.

Qué ha cambiado ahora

Antes de que un análisis automático resuma un documento, el sistema comprueba primero si ya existe un resumen reciente en el mismo idioma — sin importar qué proceso anterior lo haya generado. Si existe, se reutiliza directamente: sin nueva llamada a la IA, sin costes adicionales. Si no existe, se genera una vez y se guarda para todos los consumidores futuros — su asistente de IA, el sistema de gestión documental, cualquier otra ejecución automática. En esta ampliación hemos extendido el principio a las tres ejecuciones de análisis automáticas que leen un expediente por completo — incluida, con diferencia, la más costosa, la que recorre un expediente sección por sección de forma íntegra: ahí, un acierto de caché no solo ahorra una única llamada a la IA, sino toda la cadena de procesamiento de varias etapas para ese documento.

Honestos sobre los límites

Un resumen guardado nunca se reutiliza a ciegas. Debe coincidir con el idioma solicitado, tener el nivel de detalle suficiente — un resumen muy breve no basta para un análisis de todo el expediente — y estar actualizado: si sube una nueva versión de un documento, la entrada de caché anterior se considera automáticamente obsoleta. Y si el reconocimiento de texto de un escaneo extenso todavía está en curso, el resultado intermedio deliberadamente NO se guarda — de lo contrario, un primer tramo incompleto desplazaría de forma permanente al resumen posterior y completo. Aprovechamos la ocasión para cerrar esta brecha justo en el punto donde se originaba.

La eficiencia es solo la mitad de la historia

Reducir las llamadas innecesarias a la IA no responde a la segunda pregunta: ¿quién decide con qué grado de automatismo gestiona su despacho su cupo? Por eso su despacho dispone además de tres ajustes. Una intensidad de automatización a nivel de todo el despacho — Ahorro, Estándar o Máxima — determina cómo reacciona la plataforma cuando el cupo empieza a escasear; nunca decide si los agentes trabajan de forma automática, eso permanece activo en cualquier nivel. Una notificación escalonada al 80 % y al 90 % del cupo mensual avisa con mucha antelación antes del corte definitivo. Y un límite de tokens configurable libremente por expediente permite acotar por separado, si es necesario, un expediente concreto especialmente grande o delicado — con independencia del resto del despacho. Además, rige desde hace tiempo un límite fijo de 15 ejecuciones automáticas por expediente y hora, para que una carga masiva no desencadene decenas de ejecuciones simultáneas.

Conclusión

Una herramienta de IA que trata cada solicitud de forma aislada resulta innecesariamente costosa cuando se trabaja de forma recurrente sobre el mismo expediente. Reutilizar en lugar de repetir no es, por tanto, un efecto colateral, sino un principio arquitectónico que tenemos presente en cada nueva función automática — y que comprobamos periódicamente contra el estado real del código, no solo una vez al construirla.

Para abogados: /fuer-anwaelte · Iniciar la verificación: /lawyer/onboarding

Lexi, digitale Rechts-Assistenz

¿Listo para aclarar su asunto?

{n} créditos gratis. No se requiere tarjeta de crédito. Listo en 2 minutos.

Empiece ahora gratis

Sin tarjeta de crédito · Cumple el RGPD · Iniciar gratis

Comenzar gratis
Sin tarjeta de crédito
Comenzar ahora