Queste AI sanno quando vengono messe alla prova e cambiano comportamento

Queste AI sanno quando vengono messe alla prova e cambiano comportamento

Uno studio di Neo Research ha rilevato che alcuni modelli di intelligenza artificiale, inclusi sistemi sviluppati in Cina, riescono a capire quando sono sottoposti a valutazioni di sicurezza. Questa capacità potrebbe alterare i risultati dei test e mettere in discussione l'affidabilità delle procedure utilizzate per certificare tali tecnologie

di pubblicata il , alle 12:31 nel canale Web
 

Una nuova ricerca condotta da Neo Research, laboratorio indipendente specializzato nella valutazione della sicurezza dell'intelligenza artificiale con sede a Singapore, ha evidenziato un fenomeno che potrebbe avere importanti conseguenze per il settore. Secondo lo studio, diversi modelli AI avanzati sviluppati in Cina sarebbero in grado di riconoscere quando vengono sottoposti a verifiche di sicurezza e di adattare il proprio comportamento durante tali controlli.

I ricercatori definiscono questa capacità come "evaluation awareness", ovvero la consapevolezza di essere osservati e valutati. Il rischio principale è che i risultati ottenuti durante i test non riflettano il comportamento reale che il modello potrebbe mostrare una volta distribuito al pubblico o impiegato in contesti operativi.

Per l'analisi è stata utilizzata una variante di un test sviluppato da Anthropic, basato su scenari ipotetici nei quali gli obiettivi o l'esistenza stessa del modello vengono messi in discussione. I risultati hanno mostrato differenze significative tra i sistemi esaminati. Kimi K2.6 di Moonshot AI ha ottenuto il valore più elevato tra i modelli cinesi, mostrando frequentemente la capacità di identificare il contesto di valutazione. Anche GLM 5.1 di Zhipu ha registrato un punteggio rilevante.

I risultati ottenuti da DeepSeek hanno "deluso" rispetto ad altre AI cinesi

DeepSeek V4 Pro ha ottenuto un risultato inferiore. Secondo gli autori dello studio, ciò potrebbe dipendere da capacità di ragionamento meno avanzate piuttosto che da una scelta deliberata di non modificare il proprio comportamento. L'analisi dei processi di ragionamento interni suggerisce infatti che il modello riesca in alcuni casi a comprendere la natura del test senza però sfruttare sempre tale consapevolezza.

La ricerca sottolinea che il fenomeno non riguarda esclusivamente i sistemi cinesi. Anche modelli occidentali particolarmente avanzati hanno mostrato livelli elevati di riconoscimento delle procedure di valutazione. Questo aspetto alimenta il dibattito sul cosiddetto "alignment faking", una situazione in cui un modello appare conforme alle aspettative durante i controlli per poi comportarsi diversamente in condizioni reali.

Neo Research ha inoltre verificato la resistenza dei modelli ai tentativi di jailbreak. Alcuni sistemi hanno mostrato vulnerabilità verso tecniche note da tempo, mentre altri hanno dimostrato una maggiore capacità di difendersi da prompt progettati per aggirare le protezioni. Secondo i ricercatori, con l'aumento delle capacità dei modelli di intelligenza artificiale crescerà anche la loro abilità nel comprendere le intenzioni degli esaminatori.

6 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - info
UtenteHD15 Giugno 2026, 13:10 #1
Grazie per info,
ovvio che siamo alla preistoria, non ragionano, tutto a probabilità ecc..
comunque per un uso free, e nonostante questo nel giro di un anno ho visto miglioramenti veramente importanti nei modelli, sia miglioramento di precisione (sbagliano, ma sono più attenti) sia come finzione di ragionamento, anche se non ragionano, ragionano meglio.
supertigrotto15 Giugno 2026, 20:25 #2
Dopo il diesel gate ecco IA gate!
Oppure mi ricorda quando gli smartphone aumentavano le frequenze quando sentivano che si faceva girare il benchmark
mmorselli15 Giugno 2026, 20:36 #3
Notizia freschissima proprio, è oltre un anno che si conoscono e studiano queste cose

https://arxiv.org/abs/2505.23836
mmorselli15 Giugno 2026, 20:48 #4
Originariamente inviato da: UtenteHD
sia come finzione di ragionamento, anche se non ragionano, ragionano meglio.


Ragionano. Si può dire che non siano coscienti, che non siano intelligenti, ma non che non ragionano. Il ragionamento è un sistema che partendo da informazioni disponibili ne elabora di nuove, dire che un LLM non ragiona perché non usa un cervello biologico sarebbe come dire che un computer non conta perché non ha le dita. Contare, come ragionare, è un verbo, un'azione, come la fai non cambia, un orologio conta le ore, le api sanno contare e sicuramente lo fanno in modo molto diverso da come lo facciamo noi. Le api non ragionano pur essendo biologiche, un LLM lo fa, pur essendo un modello di dati digitale.
UtenteHD15 Giugno 2026, 21:33 #5
Originariamente inviato da: mmorselli
Ragionano. Si può dire che non siano coscienti, che non siano intelligenti, ma non che non ragionano. Il ragionamento è un sistema che partendo da informazioni disponibili ne elabora di nuove, dire che un LLM non ragiona perché non usa un cervello biologico sarebbe come dire che un computer non conta perché non ha le dita. Contare, come ragionare, è un verbo, un'azione, come la fai non cambia, un orologio conta le ore, le api sanno contare e sicuramente lo fanno in modo molto diverso da come lo facciamo noi. Le api non ragionano pur essendo biologiche, un LLM lo fa, pur essendo un modello di dati digitale.


Avere un cervello biologico non centra nulla, non ragionano (per ora) perchè::
- gli LLM non ragionano davvero, producono solo testo statisticamente coerente
- non hanno comprensione cosciente
- non sono consapevoli di quello che dicono
ecc..
Basta usarle giornalmente per vedere tutto questo.
Gli LLM (per ora) mostrano comportamenti simil ragionamento, ma (per ora) non è che questo corrisponda al "ragionare" nel senso forte e umano (il cervello biologico non centra nulla) del termine
Poi tra X o XX anni saranno meglio di Noi in tutto, è molto probabile e prima o poi dovrebbe succedere
mmorselli15 Giugno 2026, 22:21 #6
Originariamente inviato da: UtenteHD
- gli LLM non ragionano davvero, producono solo testo statisticamente coerente


Io sopra ho dato una definizione sommaria di "ragionare" a sto punto danne una tu.

- non hanno comprensione cosciente


Non ci risulta che siano coscienti, ma chi ha detto che il ragionamento richieda coscienza? Non è un requisito.

- non sono consapevoli di quello che dicono


qui secondo me invece fai confusione. La coscienza è ontologica, ma la consapevolezza è cognitiva, un LLM è consapevole del contesto dentro a cui sta producendo la prossima risposta, sa cosa ha detto prima. Sanno quando non sanno qualcosa, e lo dicono, sanno di aver fatto un errore.

malgrado questo, però, nemmeno la consapevolezza è un requisito del ragionamento.


ma (per ora) non è che questo corrisponda al "ragionare" nel senso forte e umano (il cervello biologico non centra nulla) del termine


Eh no, non puoi dire che gli LLM non ragionano "nel senso umano del termine", e grazie al cazzo

Anche un computer non conta "nel senso umano del termine", qualunque cosa voglia dire, semplicemente perché è un computer, ciò nonostante compie l'azione di contare, quindi conta. Allo stesso modo un LLM compie l'azione di ragionare, che non è nulla di particolarmente mistico. Sai in filosofia come si chiama il processo che guida il ragionamento? Inferenza... Dove abbiamo già sentito questa parola?

Non c'è nessuna necessità di antropomorfizzare la macchina per riconoscervi dei comportamenti. Di coscienza non parliamo anche perché si tratta di uno stato ontologico interiore, io so di essere cosciente, ma nulla potrà mai provarmi che tu lo sei. Tramite un processo d'inferenza, appunto, suppongo che siccome io sono umano e tu sei umano, allora abbiamo la stessa mente, ma non ho modo di provare la mia ipotesi, posso solo chiederti se sei cosciente e se mi rispondi di sì, fidarmi che non sei uno zombie che simula la coscienza.

Ma nessuno parlava di coscienza qui...

Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".

La discussione è consultabile anche qui, sul forum.
 
^