Bonsai 27B gira su smartphone: è il primo modello da 27 miliardi di parametri per mobile
PrismML ha annunciato Bonsai 27B, un modello basato su Qwen3.6 27B compresso fino a pesare 3,9 GB nella versione più estrema, abbastanza leggero da girare interamente su un iPhone 17 Pro mantenendo capacità di ragionamento, visione e chiamate a strumenti
di Nino Grasso pubblicata il 15 Luglio 2026, alle 12:31 nel canale TelefoniaPrismML ha annunciato Bonsai 27B, nuovo modello di punta della famiglia Bonsai basato su Qwen3.6 27B. È il primo modello della sua classe di capacità, 27 miliardi di parametri, a girare su uno smartphone. Il problema che l'azienda dice di aver risolto è puramente dimensionale. Un modello da 27B occupa circa 54 GB in precisione a 16 bit, e anche una compressione a 4 bit resta sopra i 18 GB: troppo per qualsiasi telefono e per buona parte dei laptop in commercio.
Bonsai 27B arriva in due varianti. La prima, Ternary Bonsai 27B, usa pesi ternari (-1, 0, +1) con scaling FP16 a gruppi, per una densità effettiva di 1,71 bit per peso e un ingombro di 5,9 GB: è la versione orientata alla qualità, pensata per girare su un normale laptop mantenendo l'intero set di capacità di ragionamento, tool-calling e comportamento agentico.
La seconda, 1-bit Bonsai 27B, spinge la compressione ai pesi binari (-1, +1), sempre con lo stesso scaling a gruppi, arrivando a 1,125 bit effettivi per peso e a soli 3,9 GB di peso complessivo. È la variante costruita per stare nel budget di memoria di un iPhone 17 Pro, ed è la prima a portare un modello di classe 27B su un telefono.
Bonsai 27B funziona in locale su smartphone, e ha 27 miliardi di parametri
La compressione a basso numero di bit, spiega l'azienda, attraversa l'intera rete: rete linguistica, embedding, attenzione, MLP e testa LM, senza scorciatoie a precisione più alta in nessun punto. Entrambe le varianti restano multimodali, con la parte visiva compressa a 4 bit per continuare a leggere screenshot, documenti e input da fotocamera. Il contesto arriva a 262.000 token, con supporto alla decodifica speculativa per accelerare la generazione senza perdita di qualità. I pesi del modello sono disponibili da oggi con licenza Apache 2.0.
Su una batteria di 15 benchmark che copre conoscenza, ragionamento, matematica, programmazione, instruction following, tool calling e visione (valutati in modalità di ragionamento estesa), Ternary Bonsai 27B mantiene il 95% delle prestazioni del modello a piena precisione, mentre 1-bit Bonsai 27B si ferma al 90%.
Guardando le singole categorie invece delle medie, matematica e programmazione risultano quasi intatte, e il tool calling resta a pochi punti dal modello originale, proprio le capacità su cui si regge un flusso di lavoro agentico. PrismML sostiene che la build a bassa precisione più aggressiva ottenibile in modo convenzionale sullo stesso modello di base ottiene punteggi nettamente inferiori a 1-bit Bonsai 27B, pur occupando 2,5 volte più memoria.
In termini di velocità, l'azienda dichiara fino a 163 token al secondo in 1-bit e 134 token al secondo in ternario su una NVIDIA GeForce RTX 5090, mentre su un Mac con chip M5 Max si scende a 87 token al secondo in 1-bit e 58 in ternario.
Il vincolo reale, però, non è la dimensione del file quanto la memoria realmente disponibile: un iPhone con 12 GB di RAM concede circa 6 GB alle app, budget che il modello deve condividere con cache KV e attivazioni. Nessuna build convenzionale di un modello da 27B si avvicina a quella soglia; a circa 4 GB, 1-bit Bonsai 27B è la prima a rientrarci con margine operativo, il che spiega la scelta di offrire due varianti distinte invece di una compressione unica.
PrismML (l'avete già sentita qui) rivendica questi risultati come continuazione di un percorso già avviato con i precedenti modelli della famiglia Bonsai, a 1 bit e ternari, e li lega a un argomento più ampio: l'esecuzione locale di agenti capaci di svolgere compiti prolungati, senza che ogni passaggio intermedio, screenshot o documento privato debba transitare sui server di un provider cloud. Il modello nasce da un team di ricercatori del Caltech, con il sostegno di Khosla Ventures, Cerberus e Google, e il supporto di Samsung.











Insta360 X6: Dolby Vision, 8K e montaggio "Zero Editing"
Due settimane con Dacia Spring 2026: novità, consumi, autonomia reale e test bagagli
AORUS GeForce RTX 5080 INFINITY WOOD 16G: una scheda video diversa dalle altre
La NASA sta costruendo e provando i droni SkyFall che voleranno su Marte nei prossimi anni
Northrop Grumman utilizzerà HALO di Lunar Gateway per la base lunare delle missioni Artemis
Anthropic prepara l'IPO dei record: gli investitori stimano oltre 2.000 miliardi
La beta di iOS 27 conferma i rumor, Apple ha in programma il lancio di 6 nuovi iPhone
HONOR esagera, il prossimo smartphone avrà una super batteria
L'edizione speciale della Switch 2 per i 40 anni di The Legend of Zelda si mostra in foto
Taiwan, il primo attacco hacker AI autonomo? Gli agenti si scaricano gratis
The Lord of the Rings: War in the North ritorna con una Legacy Edition: già disponibile su console e PC
I prezzi delle RTX 50 continuano ad aumentare: fino al +39% rispetto a giugno 2026
La prossima crisi riguarderà i pannelli OLED? Apple non vuole correre rischi e inizia a fare scorte
Terabyte di dati trafugati: un attacco alla supply chain espone i dati di oltre 2500 aziende
Volo Delta 591, spunta un Wi-Fi che imita quello di bordo: connessione spenta per mezz'ora
La scienziata lancia l'allarme: l'intelligenza artificiale rischia di spegnere la curiosità nelle scuole
BYD Denza N8 e la super batteria: 130 kWh per 1.003 km di autonomia









9 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - infosì però magari non quella "general purpose", ma addestrata su compiti specifici...
Meglio ancora se addestrata per compiti specifici, c'è una ditta di cyber security molto famosa che ha un modello locale da 8B per assistere gli analisti, praticamente gira su una GPU con 8GB di vram.
esatto: fa una cosa (per dire), ma la fa bene
https://chat.qwen.ai/
https://chat.qwen.ai/
Io, un modello personalizzato uncensored da 9B.
Bisogna vedere, secondo me si ma non ho approfondito l'argomento.
Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".