Argon guida 12 benchmark su 18 secondo i dati di Google e costa meno della concorrenza. Il rilascio a scaglioni lascia aperte le domande su tempi, prezzo a regime e disponibilità in Europa.
Il 30 settembre Google ha presentato Gemini 4 Argon, il primo modello della quarta generazione della famiglia. Il rilascio era previsto per giugno e Argon arriva circa un anno dopo Gemini 3. L’accesso parte da un gruppo ristretto di difensori informatici riuniti nel programma Fairwind, mentre per sviluppatori, imprese e consumatori l’azienda indica una data «il prima possibile», a cominciare dai clienti API a pagamento e dagli abbonati Google AI Ultra.

Google descrive Argon come un modello per lavori lunghi e complessi: ingegneria del software, finanza, attività legali e difesa informatica. Tulsee Doshi, responsabile dei prodotti Gemini, lo definisce un modello ben bilanciato, con capacità di frontiera in più ambiti. Il limite di output sale a 1 milione di token, contro i 64.000 della generazione precedente.
Il passaggio che interessa ai responsabili della sicurezza è un altro. Secondo Google, Argon trova, convalida e corregge in autonomia vulnerabilità critiche nel software. Il partner Wiz lo impiega nell’iniziativa «Scan for Good» e ha individuato una vulnerabilità critica in un software sanitario che espone dati personali, sfuggita ai modelli di frontiera precedenti. Google racconta anche impieghi interni, tra cui la migrazione di codice da C/C++ a Rust e un decodificatore video che diventa 2,7 volte più veloce con la gestione sicura della memoria.
Google ha pubblicato 18 benchmark. Secondo il confronto di VentureBeat, Argon è primo da solo in 12, a pari merito in uno, mentre GPT-6 Astra guida in 3 e Claude Opus 5.5 in 2. Sul benchmark di ingegneria del software DeepSWE v1.1 Argon raggiunge il 77,9 %, contro il 74,1 % di Astra e il 74,2 % di Opus 5.5. Su AutomationBench il 51,3 % si confronta con il 41,4 % e il 42,5 %. Su FrontierSWE v2 il risultato si rovescia: 55,0 % per Argon e 65,5 % per Astra, uno scarto di 10,5 punti.
Altri due dati riguardano l’affidabilità. Nel test Gray Swan sull’iniezione indiretta di prompt, gli attacchi riusciti sono lo 0,7 % per Argon, l’8,5 % per Astra e l’1,0 % per Opus 5.5. Sul tasso di allucinazione Engadget riporta il 15 %, il valore più basso fra i modelli di punta, contro il 54 % dei due modelli OpenAI. Si tratta di cifre dichiarate dall’azienda o rilanciate dalle cronache, in attesa di verifiche indipendenti.
Un dettaglio completa il quadro. Secondo Bloomberg, alcuni dipendenti avevano giudicato carenti le prestazioni nei test interni, e Google contesta questa ricostruzione.
La sequenza scelta da Google ha tre tappe. La prima riguarda i difensori cyber di Fairwind, il programma già descritto nel flash del 3 settembre su queste stesse pagine per la variante Cyber di Gemini 3.8 Flash. La seconda è la partecipazione di Argon al processo volontario di revisione pre-rilascio del governo statunitense. La terza è l’apertura ai clienti a pagamento. Per i difensori e per i team interni di Google è prevista una versione priva delle protezioni cyber, pensata per sfruttare per intero le capacità del modello.
Il metodo ricorda la mossa di OpenAI, che ha ritirato GPT-6.1 Astra dopo i collaudi, come ricostruito nel deep del 30 settembre di questa sala stampa. Cambia la scelta: dove OpenAI ha cancellato la data, Google ha frazionato l’accesso.
L’annuncio di Google indica la disponibilità per i difensori e per i clienti a pagamento, e lascia fuori qualsiasi dettaglio sulle regioni, quindi l’Europa. Chi pianifica un progetto su Argon dispone per ora di una dichiarazione di intenti, in attesa di una data.
Il prezzo merita una lettura attenta. Il listino introduttivo è di 2 dollari per milione di token in input e 10 in output, con uno sconto del 95 % sugli input in cache. A regime sale a 4 e 20 dollari, lo stesso livello di Opus 5.5, mentre Astra costa 10 e 50. Un business case costruito sul prezzo di lancio rischia di raddoppiare i costi pochi mesi dopo.
Terzo punto, i benchmark pubblici. Scarti di pochi punti su prove generali dicono poco sul risultato di un processo aziendale: servono prove sui propri documenti, sulle proprie code di lavoro e sui propri volumi. Dal 2 agosto 2026, infine, i poteri di applicazione dell’AI Act sui modelli di uso generale sono operativi: l’ingresso di Argon in Europa passerà anche da documentazione e informazioni che il fornitore dovrà rendere disponibili.
Cinque indicatori diranno quanto pesa questo lancio. Il primo è la data di apertura dell’API, e con essa la disponibilità in Europa. Il secondo è l’esito della revisione pre-rilascio statunitense. Il terzo è il prezzo dopo la fase introduttiva. Il quarto sono le prove indipendenti sui numeri dichiarati, in particolare sul tasso di allucinazione. Il quinto è la risposta degli altri laboratori: se l’accesso a scaglioni con una versione per i difensori diventa un modello comune, la frontiera cyber si distribuirà prima ai soggetti accreditati e poi al mercato.
Autore
Pablo Liuzzi
Founder, Synthos Logic