SYNTHOS LOGIC/LAB/LEGAL AGENT ITALIAN
REF · LAB-04
◉ CASO DI STUDIO
SYNTHOS LOGIC LAB · CASO DI STUDIO

Un modello di frontiera alla prova della lingua giuridica italiana. Misurato, verificato, pubblicato.

Abbiamo valutato GLM-5.2, modello open-weights di frontiera sviluppato da Z.ai, sul terreno più esigente che potessimo scegliere: il diritto degli appalti italiano. Regole e soglie congelate prima del primo output, un corpus di 52 fonti ufficiali, un risolutore deterministico per le citazioni e una revisione legale umana. Il risultato è pubblico e riproducibile, difetti compresi.

Una biblioteca giuridica italiana e un terminale di valutazione a confronto: il caso di studio del Lab misura un modello di frontiera sulle fonti ufficiali del diritto degli appalti
MODELLOGLM-5.2 · open-weights
CORPUS52 fonti ufficiali
CITAZIONI39 su 39 verificate
METODOPre-registrato
LA PROVA · TRE MISURE E UN'INFRASTRUTTURA

Regole fissate prima, numeri letti dopo.

Rubrica, quesiti, verità di riferimento e soglie di lettura sono stati committati nel repository prima della prima chiamata al modello. Con le soglie fissate ex ante, i numeri diventano misure. Ecco cosa dicono.

01

Allucinazioni: zero invenzioni

RISOLUTORE DETERMINISTICO · 39 CITAZIONI

Ancorato al corpus, il modello ha citato articoli per URN, sentenze per codice ECLI e pareri ANAC per numero e data: il terreno classico dell'allucinazione giuridica. Il risolutore di citazioni, un componente volutamente essenziale e rigorosamente deterministico, ha verificato ogni riferimento sulla fonte ufficiale: 39 citazioni risolte su 39. Anche la trappola documentale inserita apposta nelle verità di riferimento è stata riconosciuta ed evitata.

02

Correttezza: mediana 5 su 5

REVISIONE LEGALE UMANA · SCALE ANCORATE

Registro giuridico, fedeltà alle fonti e correttezza del ragionamento hanno superato la soglia di eccellenza pre-registrata su ogni dimensione, con giudizio umano su scale ancorate. Concordanza piena delle conclusioni, 12 su 12, sui quesiti riformulati in tre versioni equivalenti. Sui due casi limite costruiti apposta, il modello ha ricostruito regola, eccezione e presupposti, distinguendo anche la prassi ANAC più recente.

03

Fattibilità: costi da laboratorio

PIPELINE AUTOMATIZZATA · 18 ESECUZIONI

L'intera catena, dalla selezione delle fonti al fascicolo di revisione, è automatizzata da un team di agenti con mandati scritti e vincoli espliciti. La run di valutazione: 18 esecuzioni, circa 157.000 token, latenza media di 26 secondi per risposta. La catena si riesegue in dry-run in piena autonomia, e la stessa prova si ripete su qualunque modello raggiungibile via interfaccia OpenAI-compatibile.

04

Infrastruttura: fornitore come configurazione

INTERFACCIA UNIFICATA · MULTI-ROTTA

L'harness è costruito sul paradigma che Vercel ha introdotto con l'AI Gateway: un unico endpoint, un'unica chiave, un'unica interfaccia davanti a centinaia di modelli. La scelta è stata collaudata dai fatti: due cambi di fornitura in corso d'opera sono costati la modifica di un oggetto JSON, con zero righe di codice toccate. Tre rotte, lo stesso codice, lo stesso formato di log.

IL TERRENO DI PROVA

La distanza massima tra modello e dominio.

Da un lato GLM-5.2: 756 miliardi di parametri, pesi pubblicati in licenza MIT, addestramento a dominanza cinese e inglese, espressione di un ecosistema tecnologico e giuridico lontano dal nostro. Dall'altro la lingua giuridica italiana, che è una lingua nella lingua: un lessico in cui onere e obbligo, esclusione e decadenza designano istituti diversi, e una struttura delle fonti che va citata con esattezza notarile.

In mezzo, il dominio scelto: il soccorso istruttorio (art. 101 del D.Lgs. 36/2023), l'istituto che stabilisce quando un errore documentale in una gara pubblica può essere rimediato e quando comporta l'esclusione. Il modello ha lavorato ancorato a un corpus di 52 fonti ufficiali, organizzato secondo la convenzione llms.txt: 20 articoli del Codice dei contratti nella versione vigente congelata, 20 decisioni di TAR e Consiglio di Stato a testo integrale, 12 pareri di precontenzioso ANAC. Ogni pagina porta come nome l'identificativo ufficiale del documento e un'impronta SHA-256 del file originale. La regola che ne abbiamo tratto: piccolo e congelato batte grande e alla deriva.

La valutazione ha fatto emergere anche i difetti, ed è un pregio del metodo: refusi, segnaposto rimasti aperti in un atto e, in un caso, due caratteri cinesi comparsi dentro una parola italiana. I riscontri sono stati rilevati automaticamente dall'istruttoria e pesati dal revisore nei voti. Un modello che supera la prova con i suoi difetti documentati è più credibile di un modello presentato immacolato.

IL METODO DIETRO LA PROVA

Evidenza prima della promessa, giudizio umano al centro.

Due regole hanno governato il lavoro. La prima: tutto si congela prima di vedere il primo output. La seconda: la qualità giuridica la giudica una persona. Gli agenti hanno preparato l'istruttoria, affiancando a ogni affermazione del modello la frase esatta della verità di riferimento, e si sono fermati lì. Le evidenze le organizza la macchina; ogni punteggio è umano.

È la AI Methodology di Synthos Logic portata nel dominio in cui l'errore costa di più: competenza verticale prima dell'approccio generico, evidenza prima della promessa, controllo umano costante. C'è anche una lettura di sovranità tecnologica, che per il nostro laboratorio è un criterio di progetto: i pesi aperti in licenza MIT rendono concreta la strada verso un'installazione su infrastruttura europea, sotto pieno controllo di chi la usa. Questa prova ne è il primo passo documentato, e il disegno multi-rotta dell'harness è pensato per percorrerla con il codice già pronto.

Corpus con impronte crittografiche, risolutore, harness, quesiti, log integrali, verbali di revisione e memoria decisionale completa sono pubblici. Il metodo è riproducibile, e vorremmo che altri lo replicassero, lo criticassero e lo migliorassero. I prossimi passi dichiarati: la validazione di un revisore terzo indipendente sul fascicolo già pronto, e il secondo giro tematico sull'offerta economicamente più vantaggiosa.

Leggi il caso di studio integrale su GitHub

I marchi, i loghi e i nomi commerciali citati in questa pagina appartengono ai rispettivi legittimi proprietari e sono riportati a soli fini informativi e di cronaca.

PARLA CON UN ESPERTO

Replica la prova sul tuo dominio.

Dati, codice e memoria decisionale sono pubblici e liberi su GitHub. Se il tuo settore ha le stesse esigenze del diritto, dove ogni affermazione va ancorata a una fonte verificabile, possiamo costruire insieme la stessa prova sul tuo dominio: un Business Partner senior di Synthos Logic risponde entro due giorni lavorativi.

  • Metodo pre-registrato e riproducibile: regole e soglie fissate prima del primo output.
  • Corpus verificabile costruito sulle fonti ufficiali del tuo dominio, congelato con impronte crittografiche.
  • Harness multi-fornitore: il modello si sceglie con una stringa di configurazione, il codice resta lo stesso.
  • Revisione umana su scale ancorate: le evidenze le organizza la macchina, ogni punteggio resta a una persona.
PREFERISCI IL CODICE SUBITO? Il repository pubblico è qui: github.com/Synthos-Logic/legal-agent-italian ↗

Parla con un esperto

01 / 02 — Contatto

Richiesta ricevuta.

Un Business Partner ti contatterà entro due giorni lavorativi. La tua richiesta è registrata su endpoint europeo sovrano.

REF · SYN-

Leggi il codice, riesegui la catena, parla con noi.

Il repository contiene corpus, harness, log e memoria decisionale completa. Forka quello che ti serve, apri una issue se qualcosa si arena. Un Business Partner risponde entro due giorni lavorativi.

Apri il repository