Vada al contenuto principale

§ 20 · IA & qualità

Perché da noi un documento non viene mai riassunto due volte

Ogni esecuzione automatica dell'IA genera costi — a meno che il sistema non conosca già la risposta. Abbiamo passato al setaccio la nostra architettura proprio da questo punto di vista, colmato la lacuna più grande trovata e mostriamo come il riutilizzo della cache e un nuovo freno ai costi a livello di studio si combinano tra loro.

4 minIA & qualità
Immagine simbolica per l'efficienza dei token: un nodo luminoso che si richiama a sé stesso in un anello quieto, mentre pallidi duplicati sfumano tutt'intorno, su sfondo verde scuro-oxblood

L'automatismo più costoso della piattaforma

Ogni documento che carica in un fascicolo viene — salvo esclusione deliberata — letto, classificato e inserito automaticamente nel grafo dei fatti del fascicolo. È proprio questo il cuore da copilota della nostra piattaforma: Lei non deve avviare nulla, l'analisi parte da sé. Ma proprio per questo, questo singolo automatismo è anche il trigger IA più frequente e più costoso dell'intera piattaforma — ogni caricamento può innescare un'esecuzione in background, anche in caso di un'importazione più corposa con molti file contemporaneamente.

La domanda che ci siamo posti noi stessi

Un automatismo che gira a ogni caricamento deve accettare una domanda semplice: rilegge da capo solo quando è davvero necessario? Abbiamo passato al setaccio la nostra architettura proprio da questo punto di vista. Il risultato è stato articolato. In diversi punti centrali — il Suo assistente IA, le bozze di atti e di contratti, la sintesi dell'intero fascicolo — l'IA si basa già da tempo sui fatti già estratti e sulle sintesi di documento salvate, invece che sul testo integrale; il testo integrale viene ricaricato solo in modo mirato, quando una domanda concreta lo richiede. In un punto che gira con grande frequenza, però, non era così: l'esecuzione automatica che aggiorna il grafo dei fatti di un fascicolo a ogni nuovo documento generava, per ciascun documento coinvolto, una propria sintesi provvisoria — anche quando proprio quel documento era già stato riassunto integralmente poco prima.

Come funziona ora

Prima che un'analisi automatica riassuma un documento, il sistema verifica innanzitutto se esiste già una sintesi recente e nella stessa lingua — indipendentemente da quale processo precedente l'abbia generata. Se esiste, viene ripresa direttamente: nessuna nuova chiamata all'IA, nessun costo aggiuntivo. Se non esiste, viene generata una sola volta e salvata per tutti i futuri utilizzatori — il Suo assistente IA, il sistema di gestione documentale, ogni ulteriore esecuzione automatica. In questa fase di sviluppo abbiamo esteso il principio a tutte e tre le esecuzioni di analisi automatica che leggono un fascicolo per intero — compresa quella di gran lunga più onerosa, che elabora un fascicolo sezione per sezione: lì un riscontro nella cache non fa risparmiare soltanto una singola chiamata all'IA, ma l'intera catena di elaborazione a più fasi per quel documento.

Onestà sui limiti

Una sintesi salvata non viene mai riutilizzata alla cieca. Deve corrispondere alla lingua richiesta, essere sufficientemente dettagliata — una sintesi molto breve non basta per un'analisi dell'intero fascicolo — ed essere aggiornata: se carica una nuova versione di un documento, la voce di cache precedente viene considerata automaticamente obsoleta. E se per una scansione corposa è ancora in corso il riconoscimento del testo, il risultato intermedio NON viene deliberatamente salvato — altrimenti una prima tranche incompleta soppianterebbe in modo permanente la sintesi completa successiva. Abbiamo colto l'occasione per colmare questa lacuna esattamente nel punto in cui era nata.

L'efficienza è solo metà della storia

Meno chiamate IA superflue non risponde alla seconda domanda: chi decide con quale automatismo il Suo studio legale gestisce la propria quota? Per questo il Suo studio legale dispone di tre leve aggiuntive. Un'intensità di automazione a livello di studio — parsimoniosa, standard o massima — stabilisce come reagisce la piattaforma quando la quota si fa scarsa; non decide mai se gli agenti lavorano in automatico, che resta attivo a ogni livello. Una notifica scaglionata all'80 % e al 90 % della quota mensile avvisa con largo anticipo prima dello stop definitivo. E un tetto di token liberamente impostabile per fascicolo consente, se necessario, di limitare separatamente un singolo fascicolo particolarmente grande o delicato — indipendentemente dal resto dello studio. A completamento, da tempo vale un limite fisso di 15 esecuzioni automatiche per fascicolo e per ora, affinché un caricamento massivo non inneschi decine di esecuzioni simultanee.

Conclusione

Uno strumento IA che tratta ogni richiesta in modo isolato diventa inutilmente costoso quando si lavora ripetutamente sullo stesso fascicolo. Il riutilizzo anziché la ripetizione non è quindi un effetto collaterale, bensì un principio architetturale che teniamo presente per ogni nuova funzione automatica — e che verifichiamo regolarmente rispetto allo stato reale del codice, non solo una volta al momento della costruzione.

Per gli avvocati: /fuer-anwaelte · Avviare la verifica: /lawyer/onboarding

Lexi, digitale Rechts-Assistenz

Pronto a chiarire la Sua pratica?

{n} crediti gratis. Non è richiesta carta di credito. Pronto tra 2 minuti.

Inizia ora gratuitamente

Nessuna carta di credito richiesta · Conforme al GDPR · Inizia gratuitamente

Inizia gratuitamente
Nessuna carta di credito
Inizia