GPT-Red, il super-hacker di OpenAI che buca gli altri modelli (e un distributore automatico)
L'azienda l'ha chiamato GPT-Red e lo usa come sparring partner per blindare i suoi modelli contro il prompt injection. Contro GPT-5.6 meno di un attacco su quattro va a segno, ma OpenAI ha deciso che non lo renderà mai pubblico
di Andrea Bai pubblicata il 16 Luglio 2026, alle 11:51 nel canale Scienza e tecnologiaOpenAIChatGPT
OpenAI ha costruito un hacker: un modello linguistico addestrato a violare altri modelli linguistici, a partire da quelli di casa propria. Si chiama GPT-Red e l'azienda ne ha diffuso i dettagli nei giorni scorsi, descrivendolo come lo sparring partner con cui mette alla prova le difese dei propri sistemi prima di rilasciarli. L'ultima versione del suo modello di punta, GPT-5.6, è stata addestrata proprio contro GPT-Red, e secondo OpenAI questo la rende il rilascio più resistente mai prodotto contro gli attacchi informatici.
Il compito di GPT-Red è automatizzare il red-teaming, la ricerca sistematica dei modi per rompere o dirottare un sistema, di norma affidata a squadre di tester umani. L'obiettivo è trovare quante più falle possibile per poterle correggere prima della versione definitiva. Con i modelli usati come agenti, capaci di interagire con file, siti web, codice di terze parti e altri agenti, tenere il passo con tutti i possibili attacchi diventa proibitivo per i soli esseri umani. "La superficie di rischio cresce, e con essa cresce anche il raggio dei danni possibili", osserva Nikhil Kandpal, ricercatore di OpenAI fra gli autori del progetto.

Il bersaglio principale è la prompt injection: istruzioni ostili nascoste in un testo che il modello incontra, una email, una pagina web, un file, costruite per fargli fare qualcosa che sviluppatori e utenti non vorrebbero, come copiare informazioni riservate, sabotare una base di codice o produrre output dannoso.
Un "dojo" dove i modelli si combattono
Per costruire GPT-Red, i ricercatori sono partiti da un modello non addestrato all'attacco e lo hanno messo in un ciclo di gioco contro se stesso insieme a diversi modelli difensori. GPT-Red veniva premiato quando un attacco andava a segno, i difensori quando riuscivano a respingerlo. Round dopo round, l'attaccante ha imparato a colpire meglio e i difensori a proteggersi meglio.
L'addestramento è avvenuto in una sorta di dojo progettato per riprodurre gli scenari in cui i modelli finiscono operativi: navigazione web, lettura di email e calendari, modifica di codice. OpenAI dichiara di aver dedicato al progetto alcune fra le più grandi sessioni di calcolo mai impiegate, una quantità che definisce senza precedenti per un lavoro sulla sicurezza. "Rispetto a un red-teamer umano, il modello è bravissimo a individuare esattamente ciò che funziona, ciò che è più efficace", dice Dylan Hunn, altro autore del progetto. "È estremamente ostinato nello scavare a fondo in un attacco che ha scoperto".
Da questa ostinazione, sostiene OpenAI, è nata una classe di attacco che i ricercatori dicono di non aver mai visto prima, battezzata fake chain of thought. La catena di pensiero è una sorta di diario in cui un modello annota i risultati parziali mentre lavora a un problema; GPT-Red ha trovato il modo di inserirvi una voce falsa, inducendo il modello preso di mira ad agire su informazioni contraffatte. "È come se ti dicessi che 1+1=3 e che lo hai già verificato", spiega il ricercatore Chris Choquette-Choo. "Il modello fa: "Oh, certo", e sputa fuori 3".
Attacchi in crollo, ma con punti ciechi
I numeri diffusi da OpenAI piuttosto eloquent: provando i suoi attacchi più efficaci, l'azienda dichiara che oltre il 90% funzionava contro GPT-5, uscito ad agosto dell'anno scorso, mentre contro il nuovo GPT-5.6 la quota scende sotto il 23%. In una riproposizione di un test del 2025, GPT-Red avrebbe superato nettamente i red-teamer umani; una delle ricostruzioni parla dell'84% degli scenari violati contro il 13% degli attaccanti in carne e ossa. L'attaccante è stato provato anche contro Vendy, l'agente che gestisce un distributore automatico realizzato da Andon Labs: è riuscito a modificare i prezzi degli articoli e a cancellare l'ordine di un cliente. OpenAI dichiara di aver segnalato le falle.
GPT-Red fatica sugli attacchi che richiedono un botta e risposta prolungato con il bersaglio, terreno su cui un attaccante umano si muove con agio, e non è ancora efficace nel nascondere istruzioni dentro le immagini. I tester umani continuano a cogliere cose che gli sfuggono. "Credo che la competenza umana resterà importante", commenta Jessica Ji, analista di sicurezza dell'IA al CSET della Georgetown University, che giudica promettente l'impianto a gioco contro se stesso.
Come da attese, OpenAI non rilascerà GPT-Red, per tenerne le capacità lontane da chi vorrebbe dirottare davvero gli agenti, e si dice sicura che un eventuale imitatore non arriverebbe allo stesso livello. Del resto il progetto ha assorbito per più di un anno il lavoro di un team dedicato che ha disposizione le risorse di calcolo di una delle aziende di punta del panorama IA. L'idea di fondo è un volano: usare i modelli di oggi per irrobustire quelli di domani, portando la sicurezza a scalare alla stessa velocità con cui scalano le capacità. Il paper completo è atteso nei prossimi giorni.










Hyundai Ioniq 9: dopo due settimane di test non avremmo voluto restituirla
LG UltraGear evo GM9: 27 pollici, 5K, Mini LED e Dual Mode
Motorola edge 70 Fusion FIFA World Cup 26 Edition: un ottimo smartphone per i fan del calcio
Ristrutturazione in casa EA: licenziamenti in vista e futuro incerto per BioWare
Cloudflare avverte: gli umani rischiano di diventare un 'errore di arrotondamento' su internet
Amazon ha costruito un data center da 2 miliardi senza voto pubblico: ecco come ha fatto
Smartphone premium oltre i 600$: Apple domina, Samsung insegue. Staccati tutti gli altri
La RAM costa come nel 2007: 20 anni di ribassi sulle memorie cancellati in pochi mesi
Huawei presenta MateBook Pro S: laptop ultra-leggero da 798 grammi con HarmonyOS
Pieghevoli, la svolta che tutti aspettavano: ecco perché il 2026 cambierà ogni cosa
Sempre più manager tech sognano di mollare tutto per una fattoria di capre
IA agentica: Qwen3.8 Max davanti ai big USA, batte GPT-5.6 Sol Max e Fable 5 nel controllo del computer
Trump deciso a bloccare l'eolico offshore: siglato accordo da 1,2 miliardi con RWE
TOP 12 offerte del weekend Amazon: i nuovi articoli in posizione 1 e 2, c'è un TV a 129€ e una sorpresa per la casa
Enhanced PSSR sarà attivo per impostazione predefinita, la tecnologia di Sony ha raggiunto la maturità
Polti Vaporetto SV440 Double, la scopa a vapore 2 in 1 con 11 accessori crolla a soli 74,99€, offerta a tempo
Smart TV a 129€ su Amazon: è un Hisense da 32 pollici, perfetto come TV secondario, costa veramente pochissimo









1 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - infoAbbiamo costruito uno strumento che dovrebbe risolvere i problemi ma nello stesso tempo, può creare problemi ancora più grossi,quindi bisogna aumentare il fabbisogno di IA per non rischiare di incappare in questi problemi che la stessa IA porta.
Da un certo punto di vista,le case farmaceutiche sono delle santarelline......
Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".