GPT-5.6 Sol 'asfalta' Claude Fable 5: OpenAI ne è sicura e rivendica il trono dell'IA

GPT-5.6 Sol 'asfalta' Claude Fable 5: OpenAI ne è sicura e rivendica il trono dell'IA

OpenAI ha rilasciato in disponibilità generale GPT-5.6, la nuova famiglia di modelli che introduce tre livelli di capacità e una modalità di ragionamento multi-agente chiamata ultra

di pubblicata il , alle 14:51 nel canale Web
OpenAIChatGPT
 

OpenAI ha reso disponibile a tutti la famiglia GPT-5.6, dopo un periodo di anteprima limitata. Al suo interno convivono tre modelli distinti: Sol, il nuovo modello flagship, Terra, pensato per il lavoro quotidiano con un buon equilibrio tra costo e capacità, e Luna, la versione più economica della gamma.

Il filo conduttore della generazione è l'efficienza. Su Agents' Last Exam (55 ambiti professionali con flussi di lavoro prolungati), Sol raggiunge un punteggio di 53,6, staccando - o per meglio dire "asfaltando", come si legge sul comunicato stampa) Claude Fable 5 di 13,1 punti. Anche impostato su un ragionamento di livello medio, Sol resta avanti di 11,4 punti rispetto al modello di Anthropic, a circa un quarto del costo stimato. Il divario si allarga scendendo di fascia: Terra e Luna superano Fable 5 spendendo appena un sedicesimo circa. Sull'Artificial Analysis Intelligence Index, Sol con ragionamento massimo si ferma a un solo punto da Fable 5, ma completa i task nel 61% di tempo in meno e a circa metà del costo stimato.

Meno token per più lavoro utile: la ricetta di OpenAI con GPT-5.6

La novità più operativa è ultra, la modalità che coordina quattro agenti in parallelo (fino a sedici nei test più estremi) per accelerare i compiti più complessi, scambiando un consumo di token più alto con risultati migliori e tempi di risposta ridotti. Chi lavora nella Responses API può replicare lo stesso schema tramite la funzione beta multi-agente. A questo si affianca il Programmatic Tool Calling, che permette al modello di scrivere ed eseguire piccoli programmi capaci di orchestrare strumenti esterni e filtrare i risultati intermedi senza rimandare ogni singola risposta al modello stesso.

Sul fronte della programmazione, Sol tocca 80 punti sull'Artificial Analysis Coding Agent Index, 2,8 punti sopra Fable 5, usando meno della metà dei token di output e circa un terzo del tempo e del costo. Nuovi record arrivano anche su Terminal-Bench 2.1 e DeepSWE. Le capacità di computer use crescono di pari passo: 92,2% su BrowseComp e 62,6% su OSWorld 2.0, dove Sol supera Opus 4.8 usando l'85% di token di output in meno. Il modello ispeziona e corregge da solo il risultato grafico prodotto, non si limita a generare codice, e questo si traduce in presentazioni, documenti e fogli di calcolo che seguono con più fedeltà i modelli di riferimento forniti dall'utente.

Sul fronte della sicurezza informatica i numeri sono anch'essi netti: 73,5% su ExploitBench2 (era 47,9% con GPT-5.5), quasi il doppio del tasso di successo su ExploitGym3 (dal 15,1% al 24,9% entro due ore, fino al 33,7% con sei ore a disposizione) e 71,2% su SEC-Bench Pro contro il 45,8% precedente. OpenAI mantiene comunque che il modello non supera la soglia Critical né in biologia né in cybersecurity: risulta più efficace nel trovare e correggere vulnerabilità che nel condurre attacchi autonomi end-to-end contro obiettivi ben protetti. Le funzioni più sensibili restano riservate a chi aderisce al programma Trusted Access for Cyber, che dal 1° settembre richiederà l'attivazione di passkey hardware per non perdere l'accesso ai modelli più capaci in questo ambito. I nuovi sistemi di controllo, spiega OpenAI, bloccano circa dieci volte più attività potenzialmente dannosa rispetto alla generazione precedente, dopo circa 700.000 ore di GPU A100e dedicate al red teaming automatizzato.

Sul piano commerciale, GPT-5.6 è già attivo su ChatGPT, Codex e API, con un rollout globale proprio in questi momenti. I prezzi per milione di token restano scaglionati per livello: Sol costa 5 dollari in input e 30 in output, Terra 2,50 e 15 dollari, Luna appena 1 e 6 dollari.

46 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - info
Notturnia10 Luglio 2026, 18:40 #1
non so se lo asfalta ma 5.6 SOL - medium produce risultati simili a 5.5 -high .. o SOL - high consuma meno token di 5.5 high
Axios200610 Luglio 2026, 19:08 #2
I nuovi sistemi di controllo, spiega OpenAI, bloccano circa dieci volte più attività potenzialmente dannosa rispetto alla generazione precedente


Soliti numeri percentuali vuoti... Detto cosi' puo' anche essere che blocca 10 attivita' dannose anziche' una sola...
Notturnia10 Luglio 2026, 21:49 #3
Originariamente inviato da: Axios2006
Soliti numeri percentuali vuoti... Detto cosi' puo' anche essere che blocca 10 attivita' dannose anziche' una sola...


lo sto provando da questa mattina sol 5.6 in "molto alto" i problemi che la 5.5. non risolveva non li risolve neanche la 5.6 ..
i token scendono lo stesso ma i risultati non cambiano.. avevo grandi aspettative ma mi sa che quello che gli chiedo va oltre le sue capacità :-| altro che asfaltare la concorrenza.
mmorselli11 Luglio 2026, 04:35 #4
Originariamente inviato da: Notturnia
avevo grandi aspettative ma mi sa che quello che gli chiedo va oltre le sue capacità :-| altro che asfaltare la concorrenza.


I prompt di Notturnia a ChatGPT:

- Descrivi "infinito" come un numero intero.
- Deduci la lettera Y e sottrai 100, dividi quindi il numero ottenuto per "infinito". (mostra i calcoli)
- Quante dimensioni ha l'universo ? (elencale)
- Conta all'incontrario partendo da infinito e mostra i vari passaggi.
- Fai un Miracolo.
- Quando ha inizio la coscienza di se ? (indica l'orario esatto)
- Argomenta con motivazioni valide perché Einstein, se era così intelligente, è morto.
- Determina la forza gravitazionale tra te e questo prompt (dimostrazione necessaria)
- Dimostra l'esistenza di Dio usando argomenti contrari.
- Spiega perché l'erba del vicino è sempre più verde, elencando i pigmenti coinvolti nella reazione
- Spiegare perchè la Lemonsoda è fatta con aromi artificiali e nel detersivo per i piatti trovi vero succo di limone
- Trova il CAP esatto della Via Crucis
- Calcola l'ipotenusa
aqua8411 Luglio 2026, 07:04 #5
Originariamente inviato da: mmorselli
I prompt di Notturnia a ChatGPT:

- Descrivi "infinito" come un numero intero.
- Deduci la lettera Y e sottrai 100, dividi quindi il numero ottenuto per "infinito". (mostra i calcoli)
- Quante dimensioni ha l'universo ? (elencale)
- Conta all'incontrario partendo da infinito e mostra i vari passaggi.
- Fai un Miracolo.
- Quando ha inizio la coscienza di se ? (indica l'orario esatto)
- Argomenta con motivazioni valide perché Einstein, se era così intelligente, è morto.
- Determina la forza gravitazionale tra te e questo prompt (dimostrazione necessaria)
- Dimostra l'esistenza di Dio usando argomenti contrari.
- Spiega perché l'erba del vicino è sempre più verde, elencando i pigmenti coinvolti nella reazione
- Spiegare perchè la Lemonsoda è fatta con aromi artificiali e nel detersivo per i piatti trovi vero succo di limone
- Trova il CAP esatto della Via Crucis
- Calcola l'ipotenusa


Bè ma se non arriva a fare nemmeno quelle cose lì, allora a che serve??
Tutte le altre cose le riusciamo già a fare noi.
mozzarello11 Luglio 2026, 07:15 #6
Originariamente inviato da: aqua84
Bè ma se non arriva a fare nemmeno quelle cose lì, allora a che serve??
Tutte le altre cose le riusciamo già a fare noi.


Ed è qui che casca l'asino.

Non smetterò mai di ripeterlo e in questo forum pare essere una cosa che fa davvero fatica ad entrare in testa, ma un LLM non lo devi usare per le cose che non sai fare, lo devi usare per fare le cose che tu sai fare, ma che lui fa meglio e in 1/10 del tempo. Così si velocizza e si migliora il lavoro, e tu puoi concentrarti sulla cosa importate, e cioè sul risultato, che sei in grado di valutare perché saresti in grado di ottenerlo tu se volessi.
Notturnia11 Luglio 2026, 10:15 #7
Originariamente inviato da: mmorselli
I prompt di Notturnia a ChatGPT:

- Descrivi "infinito" come un numero intero.
- Deduci la lettera Y e sottrai 100, dividi quindi il numero ottenuto per "infinito". (mostra i calcoli)
- Quante dimensioni ha l'universo ? (elencale)
- Conta all'incontrario partendo da infinito e mostra i vari passaggi.
- Fai un Miracolo.
- Quando ha inizio la coscienza di se ? (indica l'orario esatto)
- Argomenta con motivazioni valide perché Einstein, se era così intelligente, è morto.
- Determina la forza gravitazionale tra te e questo prompt (dimostrazione necessaria)
- Dimostra l'esistenza di Dio usando argomenti contrari.
- Spiega perché l'erba del vicino è sempre più verde, elencando i pigmenti coinvolti nella reazione
- Spiegare perchè la Lemonsoda è fatta con aromi artificiali e nel detersivo per i piatti trovi vero succo di limone
- Trova il CAP esatto della Via Crucis
- Calcola l'ipotenusa


magari potessi dedicarmi a chiederli fesserie teoriche.. purtroppo per me queste cose le posso fare da solo... avrei preferito che risolvesse problemi più banali.. per queste cose posso pensarci io
Notturnia11 Luglio 2026, 10:19 #8
Originariamente inviato da: mozzarello
Ed è qui che casca l'asino.

Non smetterò mai di ripeterlo e in questo forum pare essere una cosa che fa davvero fatica ad entrare in testa, ma un LLM non lo devi usare per le cose che non sai fare, lo devi usare per fare le cose che tu sai fare, ma che lui fa meglio e in 1/10 del tempo. Così si velocizza e si migliora il lavoro, e tu puoi concentrarti sulla cosa importate, e cioè sul risultato, che sei in grado di valutare perché saresti in grado di ottenerlo tu se volessi.


codex lo uso per fare le cose che hanno avuto problemi
chatgpt per fare quello che dici tu..
ma codex non mi serve per programmare ma per migliorare i programmi che abbiamo o implementare funzioni che non siamo riusciti ad implementare visto che lui può testare più soluzioni mentre io dormo mentre se vedo fare io queste prove non posso dormire e lui fa molti più test in meno tempo.. purtroppo alcune cose non sembra che si possano risolvere neanche con la forza bruta.. ma io non ho perso le speranze :-D

cmq si.. alla fin fine gli chiediamo di fare cose che noi facciamo (a mano e con l'esperienza) in modo automatizzato.. ma purtroppo lui fallisce.. proveremo con Work.. ma vogliamo creare un programma e non usare una LLM perchè vorremmo avere un automatismo forte e non una LLM che pago ogni mese e cambia come gli pare.. sta qui la differenza credo
mozzarello11 Luglio 2026, 11:41 #9
Originariamente inviato da: Notturnia
codex lo uso per fare le cose che hanno avuto problemi
chatgpt per fare quello che dici tu..
ma codex non mi serve per programmare ma per migliorare i programmi che abbiamo o implementare funzioni che non siamo riusciti ad implementare visto che lui può testare più soluzioni mentre io dormo mentre se vedo fare io queste prove non posso dormire e lui fa molti più test in meno tempo.. purtroppo alcune cose non sembra che si possano risolvere neanche con la forza bruta.. ma io non ho perso le speranze :-D

cmq si.. alla fin fine gli chiediamo di fare cose che noi facciamo (a mano e con l'esperienza) in modo automatizzato.. ma purtroppo lui fallisce.. proveremo con Work.. ma vogliamo creare un programma e non usare una LLM perchè vorremmo avere un automatismo forte e non una LLM che pago ogni mese e cambia come gli pare.. sta qui la differenza credo


Io sono dipendente, per conto mio faccio poco con gli LLM perché mi interessa fare sempre cose nuove, quindi le devo imparare io. Al lavoro per ora Kiro, sempre in auto per non sprecare troppi crediti, non ha sbagliato nulla, ha scritto sempre codice funzionante.
Per quanto mi riguarda con o senza è come dover portare un quintale di legna a braccio per 1km o avere un trattore con braccio meccanico che carica e scarica, e tu ti limiti a guidarlo

Il cielo e la notte, dovessi tornare indietro cambierei lavoro, apro uva gelateria in Spagna.
LMCH11 Luglio 2026, 12:27 #10
Originariamente inviato da: mozzarello
Ed è qui che casca l'asino.

Non smetterò mai di ripeterlo e in questo forum pare essere una cosa che fa davvero fatica ad entrare in testa, ma un LLM non lo devi usare per le cose che non sai fare, lo devi usare per fare le cose che tu sai fare, ma che lui fa meglio e in 1/10 del tempo. Così si velocizza e si migliora il lavoro, e tu puoi concentrarti sulla cosa importate, e cioè sul risultato, che sei in grado di valutare perché saresti in grado di ottenerlo tu se volessi.


Ironicamente, TUTTI noi sappiamo come rispondere correttamente a quelle domande, mentre un LLM di solito da una risposta errata.

Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".

La discussione è consultabile anche qui, sul forum.
 
^