Bonsai 27B gira su smartphone: è il primo modello da 27 miliardi di parametri per mobile

Bonsai 27B gira su smartphone: è il primo modello da 27 miliardi di parametri per mobile

PrismML ha annunciato Bonsai 27B, un modello basato su Qwen3.6 27B compresso fino a pesare 3,9 GB nella versione più estrema, abbastanza leggero da girare interamente su un iPhone 17 Pro mantenendo capacità di ragionamento, visione e chiamate a strumenti

di pubblicata il , alle 12:31 nel canale Telefonia
 

PrismML ha annunciato Bonsai 27B, nuovo modello di punta della famiglia Bonsai basato su Qwen3.6 27B. È il primo modello della sua classe di capacità, 27 miliardi di parametri, a girare su uno smartphone. Il problema che l'azienda dice di aver risolto è puramente dimensionale. Un modello da 27B occupa circa 54 GB in precisione a 16 bit, e anche una compressione a 4 bit resta sopra i 18 GB: troppo per qualsiasi telefono e per buona parte dei laptop in commercio.

Bonsai 27B arriva in due varianti. La prima, Ternary Bonsai 27B, usa pesi ternari (-1, 0, +1) con scaling FP16 a gruppi, per una densità effettiva di 1,71 bit per peso e un ingombro di 5,9 GB: è la versione orientata alla qualità, pensata per girare su un normale laptop mantenendo l'intero set di capacità di ragionamento, tool-calling e comportamento agentico.

La seconda, 1-bit Bonsai 27B, spinge la compressione ai pesi binari (-1, +1), sempre con lo stesso scaling a gruppi, arrivando a 1,125 bit effettivi per peso e a soli 3,9 GB di peso complessivo. È la variante costruita per stare nel budget di memoria di un iPhone 17 Pro, ed è la prima a portare un modello di classe 27B su un telefono.

Bonsai 27B funziona in locale su smartphone, e ha 27 miliardi di parametri

La compressione a basso numero di bit, spiega l'azienda, attraversa l'intera rete: rete linguistica, embedding, attenzione, MLP e testa LM, senza scorciatoie a precisione più alta in nessun punto. Entrambe le varianti restano multimodali, con la parte visiva compressa a 4 bit per continuare a leggere screenshot, documenti e input da fotocamera. Il contesto arriva a 262.000 token, con supporto alla decodifica speculativa per accelerare la generazione senza perdita di qualità. I pesi del modello sono disponibili da oggi con licenza Apache 2.0.

Su una batteria di 15 benchmark che copre conoscenza, ragionamento, matematica, programmazione, instruction following, tool calling e visione (valutati in modalità di ragionamento estesa), Ternary Bonsai 27B mantiene il 95% delle prestazioni del modello a piena precisione, mentre 1-bit Bonsai 27B si ferma al 90%.

Guardando le singole categorie invece delle medie, matematica e programmazione risultano quasi intatte, e il tool calling resta a pochi punti dal modello originale, proprio le capacità su cui si regge un flusso di lavoro agentico. PrismML sostiene che la build a bassa precisione più aggressiva ottenibile in modo convenzionale sullo stesso modello di base ottiene punteggi nettamente inferiori a 1-bit Bonsai 27B, pur occupando 2,5 volte più memoria.

In termini di velocità, l'azienda dichiara fino a 163 token al secondo in 1-bit e 134 token al secondo in ternario su una NVIDIA GeForce RTX 5090, mentre su un Mac con chip M5 Max si scende a 87 token al secondo in 1-bit e 58 in ternario.

Il vincolo reale, però, non è la dimensione del file quanto la memoria realmente disponibile: un iPhone con 12 GB di RAM concede circa 6 GB alle app, budget che il modello deve condividere con cache KV e attivazioni. Nessuna build convenzionale di un modello da 27B si avvicina a quella soglia; a circa 4 GB, 1-bit Bonsai 27B è la prima a rientrarci con margine operativo, il che spiega la scelta di offrire due varianti distinte invece di una compressione unica.

PrismML (l'avete già sentita qui) rivendica questi risultati come continuazione di un percorso già avviato con i precedenti modelli della famiglia Bonsai, a 1 bit e ternari, e li lega a un argomento più ampio: l'esecuzione locale di agenti capaci di svolgere compiti prolungati, senza che ogni passaggio intermedio, screenshot o documento privato debba transitare sui server di un provider cloud. Il modello nasce da un team di ricercatori del Caltech, con il sostegno di Khosla Ventures, Cerberus e Google, e il supporto di Samsung.

9 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - info
bonzoxxx15 Luglio 2026, 14:48 #1
Molto bene, lo dico da tempo che il futuro sarà anche e soprattutto AI locale.
Paganetor15 Luglio 2026, 15:04 #2
Originariamente inviato da: bonzoxxx
Molto bene, lo dico da tempo che il futuro sarà anche e soprattutto AI locale.


sì però magari non quella "general purpose", ma addestrata su compiti specifici...
bonzoxxx15 Luglio 2026, 15:13 #3
Originariamente inviato da: Paganetor
sì però magari non quella "general purpose", ma addestrata su compiti specifici...


Meglio ancora se addestrata per compiti specifici, c'è una ditta di cyber security molto famosa che ha un modello locale da 8B per assistere gli analisti, praticamente gira su una GPU con 8GB di vram.
TorettoMilano15 Luglio 2026, 15:13 #4
ma tanto in europa apple non lo metterá
Paganetor15 Luglio 2026, 15:16 #5
Originariamente inviato da: bonzoxxx
Meglio ancora se addestrata per compiti specifici, c'è una ditta di cyber security molto famosa che ha un modello locale da 8B per assistere gli analisti, praticamente gira su una GPU con 8GB di vram.


esatto: fa una cosa (per dire), ma la fa bene
Sandro kensan15 Luglio 2026, 22:43 #6
Ma chi è che usa Qwen attivamente?

https://chat.qwen.ai/
sbudellaman15 Luglio 2026, 22:52 #7
riuscirebbe a girare anche sulla mia 5700 xt amd con 8gb di vram? Oppure gli smartphone l'hanno già superata?
bonzoxxx16 Luglio 2026, 01:03 #8
Originariamente inviato da: Sandro kensan
Ma chi è che usa Qwen attivamente?

https://chat.qwen.ai/


Io, un modello personalizzato uncensored da 9B.
bonzoxxx16 Luglio 2026, 01:03 #9
Originariamente inviato da: sbudellaman
riuscirebbe a girare anche sulla mia 5700 xt amd con 8gb di vram? Oppure gli smartphone l'hanno già superata?


Bisogna vedere, secondo me si ma non ho approfondito l'argomento.

Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".

La discussione è consultabile anche qui, sul forum.
 
^