GPT-5.6 Sol 'asfalta' Claude Fable 5: OpenAI ne è sicura e rivendica il trono dell'IA
OpenAI ha rilasciato in disponibilità generale GPT-5.6, la nuova famiglia di modelli che introduce tre livelli di capacità e una modalità di ragionamento multi-agente chiamata ultra
di Nino Grasso pubblicata il 10 Luglio 2026, alle 14:51 nel canale WebOpenAIChatGPT
OpenAI ha reso disponibile a tutti la famiglia GPT-5.6, dopo un periodo di anteprima limitata. Al suo interno convivono tre modelli distinti: Sol, il nuovo modello flagship, Terra, pensato per il lavoro quotidiano con un buon equilibrio tra costo e capacità, e Luna, la versione più economica della gamma.

Il filo conduttore della generazione è l'efficienza. Su Agents' Last Exam (55 ambiti professionali con flussi di lavoro prolungati), Sol raggiunge un punteggio di 53,6, staccando - o per meglio dire "asfaltando", come si legge sul comunicato stampa) Claude Fable 5 di 13,1 punti. Anche impostato su un ragionamento di livello medio, Sol resta avanti di 11,4 punti rispetto al modello di Anthropic, a circa un quarto del costo stimato. Il divario si allarga scendendo di fascia: Terra e Luna superano Fable 5 spendendo appena un sedicesimo circa. Sull'Artificial Analysis Intelligence Index, Sol con ragionamento massimo si ferma a un solo punto da Fable 5, ma completa i task nel 61% di tempo in meno e a circa metà del costo stimato.
Meno token per più lavoro utile: la ricetta di OpenAI con GPT-5.6
La novità più operativa è ultra, la modalità che coordina quattro agenti in parallelo (fino a sedici nei test più estremi) per accelerare i compiti più complessi, scambiando un consumo di token più alto con risultati migliori e tempi di risposta ridotti. Chi lavora nella Responses API può replicare lo stesso schema tramite la funzione beta multi-agente. A questo si affianca il Programmatic Tool Calling, che permette al modello di scrivere ed eseguire piccoli programmi capaci di orchestrare strumenti esterni e filtrare i risultati intermedi senza rimandare ogni singola risposta al modello stesso.
Sul fronte della programmazione, Sol tocca 80 punti sull'Artificial Analysis Coding Agent Index, 2,8 punti sopra Fable 5, usando meno della metà dei token di output e circa un terzo del tempo e del costo. Nuovi record arrivano anche su Terminal-Bench 2.1 e DeepSWE. Le capacità di computer use crescono di pari passo: 92,2% su BrowseComp e 62,6% su OSWorld 2.0, dove Sol supera Opus 4.8 usando l'85% di token di output in meno. Il modello ispeziona e corregge da solo il risultato grafico prodotto, non si limita a generare codice, e questo si traduce in presentazioni, documenti e fogli di calcolo che seguono con più fedeltà i modelli di riferimento forniti dall'utente.
Sul fronte della sicurezza informatica i numeri sono anch'essi netti: 73,5% su ExploitBench2 (era 47,9% con GPT-5.5), quasi il doppio del tasso di successo su ExploitGym3 (dal 15,1% al 24,9% entro due ore, fino al 33,7% con sei ore a disposizione) e 71,2% su SEC-Bench Pro contro il 45,8% precedente. OpenAI mantiene comunque che il modello non supera la soglia Critical né in biologia né in cybersecurity: risulta più efficace nel trovare e correggere vulnerabilità che nel condurre attacchi autonomi end-to-end contro obiettivi ben protetti. Le funzioni più sensibili restano riservate a chi aderisce al programma Trusted Access for Cyber, che dal 1° settembre richiederà l'attivazione di passkey hardware per non perdere l'accesso ai modelli più capaci in questo ambito. I nuovi sistemi di controllo, spiega OpenAI, bloccano circa dieci volte più attività potenzialmente dannosa rispetto alla generazione precedente, dopo circa 700.000 ore di GPU A100e dedicate al red teaming automatizzato.
Sul piano commerciale, GPT-5.6 è già attivo su ChatGPT, Codex e API, con un rollout globale proprio in questi momenti. I prezzi per milione di token restano scaglionati per livello: Sol costa 5 dollari in input e 30 in output, Terra 2,50 e 15 dollari, Luna appena 1 e 6 dollari.









.jpg)




Insta360 X6: Dolby Vision, 8K e montaggio "Zero Editing"
Due settimane con Dacia Spring 2026: novità, consumi, autonomia reale e test bagagli
AORUS GeForce RTX 5080 INFINITY WOOD 16G: una scheda video diversa dalle altre
La NASA sta costruendo e provando i droni SkyFall che voleranno su Marte nei prossimi anni
Northrop Grumman utilizzerà HALO di Lunar Gateway per la base lunare delle missioni Artemis
Anthropic prepara l'IPO dei record: gli investitori stimano oltre 2.000 miliardi
La beta di iOS 27 conferma i rumor, Apple ha in programma il lancio di 6 nuovi iPhone
HONOR esagera, il prossimo smartphone avrà una super batteria
L'edizione speciale della Switch 2 per i 40 anni di The Legend of Zelda si mostra in foto
Taiwan, il primo attacco hacker AI autonomo? Gli agenti si scaricano gratis
The Lord of the Rings: War in the North ritorna con una Legacy Edition: già disponibile su console e PC
I prezzi delle RTX 50 continuano ad aumentare: fino al +39% rispetto a giugno 2026
La prossima crisi riguarderà i pannelli OLED? Apple non vuole correre rischi e inizia a fare scorte
Terabyte di dati trafugati: un attacco alla supply chain espone i dati di oltre 2500 aziende
Volo Delta 591, spunta un Wi-Fi che imita quello di bordo: connessione spenta per mezz'ora
La scienziata lancia l'allarme: l'intelligenza artificiale rischia di spegnere la curiosità nelle scuole
BYD Denza N8 e la super batteria: 130 kWh per 1.003 km di autonomia









46 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - infoSoliti numeri percentuali vuoti... Detto cosi' puo' anche essere che blocca 10 attivita' dannose anziche' una sola...
lo sto provando da questa mattina sol 5.6 in "molto alto" i problemi che la 5.5. non risolveva non li risolve neanche la 5.6 ..
i token scendono lo stesso ma i risultati non cambiano.. avevo grandi aspettative ma mi sa che quello che gli chiedo va oltre le sue capacità :-| altro che asfaltare la concorrenza.
I prompt di Notturnia a ChatGPT:
- Descrivi "infinito" come un numero intero.
- Deduci la lettera Y e sottrai 100, dividi quindi il numero ottenuto per "infinito". (mostra i calcoli)
- Quante dimensioni ha l'universo ? (elencale)
- Conta all'incontrario partendo da infinito e mostra i vari passaggi.
- Fai un Miracolo.
- Quando ha inizio la coscienza di se ? (indica l'orario esatto)
- Argomenta con motivazioni valide perché Einstein, se era così intelligente, è morto.
- Determina la forza gravitazionale tra te e questo prompt (dimostrazione necessaria)
- Dimostra l'esistenza di Dio usando argomenti contrari.
- Spiega perché l'erba del vicino è sempre più verde, elencando i pigmenti coinvolti nella reazione
- Spiegare perchè la Lemonsoda è fatta con aromi artificiali e nel detersivo per i piatti trovi vero succo di limone
- Trova il CAP esatto della Via Crucis
- Calcola l'ipotenusa
- Descrivi "infinito" come un numero intero.
- Deduci la lettera Y e sottrai 100, dividi quindi il numero ottenuto per "infinito". (mostra i calcoli)
- Quante dimensioni ha l'universo ? (elencale)
- Conta all'incontrario partendo da infinito e mostra i vari passaggi.
- Fai un Miracolo.
- Quando ha inizio la coscienza di se ? (indica l'orario esatto)
- Argomenta con motivazioni valide perché Einstein, se era così intelligente, è morto.
- Determina la forza gravitazionale tra te e questo prompt (dimostrazione necessaria)
- Dimostra l'esistenza di Dio usando argomenti contrari.
- Spiega perché l'erba del vicino è sempre più verde, elencando i pigmenti coinvolti nella reazione
- Spiegare perchè la Lemonsoda è fatta con aromi artificiali e nel detersivo per i piatti trovi vero succo di limone
- Trova il CAP esatto della Via Crucis
- Calcola l'ipotenusa
Bè ma se non arriva a fare nemmeno quelle cose lì, allora a che serve??
Tutte le altre cose le riusciamo già a fare noi.
Tutte le altre cose le riusciamo già a fare noi.
Ed è qui che casca l'asino.
Non smetterò mai di ripeterlo e in questo forum pare essere una cosa che fa davvero fatica ad entrare in testa, ma un LLM non lo devi usare per le cose che non sai fare, lo devi usare per fare le cose che tu sai fare, ma che lui fa meglio e in 1/10 del tempo. Così si velocizza e si migliora il lavoro, e tu puoi concentrarti sulla cosa importate, e cioè sul risultato, che sei in grado di valutare perché saresti in grado di ottenerlo tu se volessi.
- Descrivi "infinito" come un numero intero.
- Deduci la lettera Y e sottrai 100, dividi quindi il numero ottenuto per "infinito". (mostra i calcoli)
- Quante dimensioni ha l'universo ? (elencale)
- Conta all'incontrario partendo da infinito e mostra i vari passaggi.
- Fai un Miracolo.
- Quando ha inizio la coscienza di se ? (indica l'orario esatto)
- Argomenta con motivazioni valide perché Einstein, se era così intelligente, è morto.
- Determina la forza gravitazionale tra te e questo prompt (dimostrazione necessaria)
- Dimostra l'esistenza di Dio usando argomenti contrari.
- Spiega perché l'erba del vicino è sempre più verde, elencando i pigmenti coinvolti nella reazione
- Spiegare perchè la Lemonsoda è fatta con aromi artificiali e nel detersivo per i piatti trovi vero succo di limone
- Trova il CAP esatto della Via Crucis
- Calcola l'ipotenusa
magari potessi dedicarmi a chiederli fesserie teoriche.. purtroppo per me queste cose le posso fare da solo... avrei preferito che risolvesse problemi più banali.. per queste cose posso pensarci io
Non smetterò mai di ripeterlo e in questo forum pare essere una cosa che fa davvero fatica ad entrare in testa, ma un LLM non lo devi usare per le cose che non sai fare, lo devi usare per fare le cose che tu sai fare, ma che lui fa meglio e in 1/10 del tempo. Così si velocizza e si migliora il lavoro, e tu puoi concentrarti sulla cosa importate, e cioè sul risultato, che sei in grado di valutare perché saresti in grado di ottenerlo tu se volessi.
codex lo uso per fare le cose che hanno avuto problemi
chatgpt per fare quello che dici tu..
ma codex non mi serve per programmare ma per migliorare i programmi che abbiamo o implementare funzioni che non siamo riusciti ad implementare visto che lui può testare più soluzioni mentre io dormo mentre se vedo fare io queste prove non posso dormire e lui fa molti più test in meno tempo.. purtroppo alcune cose non sembra che si possano risolvere neanche con la forza bruta.. ma io non ho perso le speranze :-D
cmq si.. alla fin fine gli chiediamo di fare cose che noi facciamo (a mano e con l'esperienza) in modo automatizzato.. ma purtroppo lui fallisce.. proveremo con Work.. ma vogliamo creare un programma e non usare una LLM perchè vorremmo avere un automatismo forte e non una LLM che pago ogni mese e cambia come gli pare.. sta qui la differenza credo
chatgpt per fare quello che dici tu..
ma codex non mi serve per programmare ma per migliorare i programmi che abbiamo o implementare funzioni che non siamo riusciti ad implementare visto che lui può testare più soluzioni mentre io dormo mentre se vedo fare io queste prove non posso dormire e lui fa molti più test in meno tempo.. purtroppo alcune cose non sembra che si possano risolvere neanche con la forza bruta.. ma io non ho perso le speranze :-D
cmq si.. alla fin fine gli chiediamo di fare cose che noi facciamo (a mano e con l'esperienza) in modo automatizzato.. ma purtroppo lui fallisce.. proveremo con Work.. ma vogliamo creare un programma e non usare una LLM perchè vorremmo avere un automatismo forte e non una LLM che pago ogni mese e cambia come gli pare.. sta qui la differenza credo
Io sono dipendente, per conto mio faccio poco con gli LLM perché mi interessa fare sempre cose nuove, quindi le devo imparare io. Al lavoro per ora Kiro, sempre in auto per non sprecare troppi crediti, non ha sbagliato nulla, ha scritto sempre codice funzionante.
Per quanto mi riguarda con o senza è come dover portare un quintale di legna a braccio per 1km o avere un trattore con braccio meccanico che carica e scarica, e tu ti limiti a guidarlo
Il cielo e la notte, dovessi tornare indietro cambierei lavoro, apro uva gelateria in Spagna.
Non smetterò mai di ripeterlo e in questo forum pare essere una cosa che fa davvero fatica ad entrare in testa, ma un LLM non lo devi usare per le cose che non sai fare, lo devi usare per fare le cose che tu sai fare, ma che lui fa meglio e in 1/10 del tempo. Così si velocizza e si migliora il lavoro, e tu puoi concentrarti sulla cosa importate, e cioè sul risultato, che sei in grado di valutare perché saresti in grado di ottenerlo tu se volessi.
Ironicamente, TUTTI noi sappiamo come rispondere correttamente a quelle domande, mentre un LLM di solito da una risposta errata.
Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".