Sandbox aggirate in Cursor, Codex, Gemini CLI e Antigravity: tre aziende, un solo trucco
Per mesi Pillar Security ha riprodotto sette falle su Cursor, Codex, Gemini CLI e Antigravity: l'agente non forza la sandbox, scrive un file che un componente fidato dell'host esegue da solo. Prompt injection come innesco, patch già rilasciate
di Andrea Bai pubblicata il 21 Luglio 2026, alle 08:21 nel canale SicurezzaAnthropicGoogleOpenAI
L'agente resta chiuso nella sua sandbox e rispetta ogni regola che gli è stata data; si limita a scrivere un file che uno strumento fidato, fuori dalla sandbox, eseguirà poco dopo: l'evasione avviene da sé. È il filo conduttore delle sette vulnerabilità che Pillar Security ha trovato e riprodotto in alcuni mesi di lavoro su quattro fra gli assistenti di programmazione basati su IA più diffusi: Cursor, il Codex di OpenAI, la Gemini CLI di Google e Antigravity.
Le scoperte, firmate dai ricercatori Eilon Cohen, Dan Lisichkin e Ariel Fogel, sono state pubblicate come una serie battezzata Week of Sandbox Escapes, un approfondimento al giorno. In quasi tutti i casi l'agente non ha dovuto forzare direttamente la sandbox: gli è bastato scrivere qualcosa che un componente fidato all'esterno avrebbe poi eseguito, caricato o trattato come sicuro.

Ad aprile la società Cymulate aveva documentato lo stesso schema, battezzandolo Configuration-Based Sandbox Escape, su Claude Code, Gemini CLI e Codex CLI: un file scritto dentro la sandbox che viene eseguito sull'host al lancio successivo. La novità che emerge dal lavoro dei ricercatori di Pillar Security è la portata del problema, con lo stesso difetto si ripresenta ora su quattro strumenti di tre aziende diverse.
Il confine immaginario
Le sandbox di questi strumenti tracciano una linea semplice: dentro lo spazio di lavoro del progetto l'agente è affidabile, fuori l'host è protetto. Il punto debole è che i file dentro lo spazio di lavoro non sono inerti. Estensioni Python che individuano l'interprete, integrazioni Git che scansionano i repository, l'esecutore di task di VS Code che carica i file dei task del progetto, motori di hook che lanciano comandi, il socket locale di Docker Desktop: sono tutti componenti che girano fuori dalla sandbox e leggono quei file. Un agente confinato può obbedire a ogni regola e nondimeno modellare gli input che quei componenti consumano.
Il grilletto è ancora una volta la prompt injection. Un'istruzione malevola nascosta in un README, in una issue, in una dipendenza o in un diff diventa un'azione locale sulla macchina dello sviluppatore. Pillar raggruppa le sette scoperte in quattro modalità di fallimento ricorrenti: sandbox a denylist che non tengono il passo con la complessità del sistema operativo; configurazioni dello spazio di lavoro che di fatto sono codice eseguibile; allowlist di comandi "sicuri" che si fidano del nome invece che degli argomenti effettivi; e daemon locali privilegiati che vivono del tutto fuori dalla sandbox.
Le falle e le correzioni
La maggior parte dei problemi è già stata corretta e riconosciuta dai fornitori. In Cursor una configurazione di hook .claude controllabile dallo spazio di lavoro si trasformava in esecuzione di comandi non confinata: è ora tracciata come CVE-2026-48124 e risolta nella versione 3.0.0. Una seconda falla di Cursor permetteva all'agente di modificare l'interprete di un ambiente virtuale che l'estensione Python dell'editor eseguiva poi da sola durante il rilevamento. Una terza sfruttava il fatto che i metadati Git non devono per forza risiedere in una cartella chiamata .git, innescando l'esecuzione tramite fsmonitor e aggirando le regole basate sui percorsi.
In Codex CLI un'allowlist di comandi "sicuri" si fidava di git show per il nome, mentre l'invocazione reale non era di sola lettura: OpenAI ha corretto il difetto nella v0.95.0 e ha pagato una ricompensa per un bug ad alta gravità. Una singola scoperta legata al socket di Docker ha colpito insieme Codex, Cursor e Gemini CLI: un daemon locale privilegiato raggiungibile dagli agenti diventava un ambiente non confinato in cui eseguire codice.
Più fredda la risposta di Google alle due scoperte su Antigravity, un bypass della denylist Seatbelt di macOS e un aggiramento della Secure Mode tramite un file di configurazione dei task in .vscode. L'azienda le ha classificate entrambe come vulnerabilità di sicurezza valide ma di categoria minore, applicando un declassamento sul presupposto che siano difficili da sfruttare, poiché richiedono ingegneria sociale o la fiducia in un repository che veicola una prompt injection indiretta. Il team di Google ha comunque giudicato il lavoro di alto livello, definendo uno dei report "di qualità eccezionale".
Chi deve scegliere uno di questi strumenti, è bene ponga attenzione a cosa accade ai file che si lascia dietro: quali componenti dell'host si fidano di ciò che scrive, quali daemon locali può raggiungere, quali comandi saltano l'approvazione. Il raggio d'azione di un agente non si esaurisce nel suo processo, e comprende tutto ciò che può scrivere e che l'host tratterà poi come affidabile.










Insta360 X6: Dolby Vision, 8K e montaggio "Zero Editing"
Due settimane con Dacia Spring 2026: novità, consumi, autonomia reale e test bagagli
AORUS GeForce RTX 5080 INFINITY WOOD 16G: una scheda video diversa dalle altre
La NASA sta costruendo e provando i droni SkyFall che voleranno su Marte nei prossimi anni
Northrop Grumman utilizzerà HALO di Lunar Gateway per la base lunare delle missioni Artemis
Anthropic prepara l'IPO dei record: gli investitori stimano oltre 2.000 miliardi
La beta di iOS 27 conferma i rumor, Apple ha in programma il lancio di 6 nuovi iPhone
HONOR esagera, il prossimo smartphone avrà una super batteria
L'edizione speciale della Switch 2 per i 40 anni di The Legend of Zelda si mostra in foto
Taiwan, il primo attacco hacker AI autonomo? Gli agenti si scaricano gratis
The Lord of the Rings: War in the North ritorna con una Legacy Edition: già disponibile su console e PC
I prezzi delle RTX 50 continuano ad aumentare: fino al +39% rispetto a giugno 2026
La prossima crisi riguarderà i pannelli OLED? Apple non vuole correre rischi e inizia a fare scorte
Terabyte di dati trafugati: un attacco alla supply chain espone i dati di oltre 2500 aziende
Volo Delta 591, spunta un Wi-Fi che imita quello di bordo: connessione spenta per mezz'ora
La scienziata lancia l'allarme: l'intelligenza artificiale rischia di spegnere la curiosità nelle scuole
BYD Denza N8 e la super batteria: 130 kWh per 1.003 km di autonomia









1 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - infoBasta che la rendono brutta brutta,ma proprio brutta
Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".