Bonsai 27B gira su smartphone: è il primo modello da 27 miliardi di parametri per mobile
PrismML ha annunciato Bonsai 27B, un modello basato su Qwen3.6 27B compresso fino a pesare 3,9 GB nella versione più estrema, abbastanza leggero da girare interamente su un iPhone 17 Pro mantenendo capacità di ragionamento, visione e chiamate a strumenti
di Nino Grasso pubblicata il 15 Luglio 2026, alle 12:31 nel canale TelefoniaPrismML ha annunciato Bonsai 27B, nuovo modello di punta della famiglia Bonsai basato su Qwen3.6 27B. È il primo modello della sua classe di capacità, 27 miliardi di parametri, a girare su uno smartphone. Il problema che l'azienda dice di aver risolto è puramente dimensionale. Un modello da 27B occupa circa 54 GB in precisione a 16 bit, e anche una compressione a 4 bit resta sopra i 18 GB: troppo per qualsiasi telefono e per buona parte dei laptop in commercio.
Bonsai 27B arriva in due varianti. La prima, Ternary Bonsai 27B, usa pesi ternari (-1, 0, +1) con scaling FP16 a gruppi, per una densità effettiva di 1,71 bit per peso e un ingombro di 5,9 GB: è la versione orientata alla qualità, pensata per girare su un normale laptop mantenendo l'intero set di capacità di ragionamento, tool-calling e comportamento agentico.
La seconda, 1-bit Bonsai 27B, spinge la compressione ai pesi binari (-1, +1), sempre con lo stesso scaling a gruppi, arrivando a 1,125 bit effettivi per peso e a soli 3,9 GB di peso complessivo. È la variante costruita per stare nel budget di memoria di un iPhone 17 Pro, ed è la prima a portare un modello di classe 27B su un telefono.
Bonsai 27B funziona in locale su smartphone, e ha 27 miliardi di parametri
La compressione a basso numero di bit, spiega l'azienda, attraversa l'intera rete: rete linguistica, embedding, attenzione, MLP e testa LM, senza scorciatoie a precisione più alta in nessun punto. Entrambe le varianti restano multimodali, con la parte visiva compressa a 4 bit per continuare a leggere screenshot, documenti e input da fotocamera. Il contesto arriva a 262.000 token, con supporto alla decodifica speculativa per accelerare la generazione senza perdita di qualità. I pesi del modello sono disponibili da oggi con licenza Apache 2.0.
Su una batteria di 15 benchmark che copre conoscenza, ragionamento, matematica, programmazione, instruction following, tool calling e visione (valutati in modalità di ragionamento estesa), Ternary Bonsai 27B mantiene il 95% delle prestazioni del modello a piena precisione, mentre 1-bit Bonsai 27B si ferma al 90%.
Guardando le singole categorie invece delle medie, matematica e programmazione risultano quasi intatte, e il tool calling resta a pochi punti dal modello originale, proprio le capacità su cui si regge un flusso di lavoro agentico. PrismML sostiene che la build a bassa precisione più aggressiva ottenibile in modo convenzionale sullo stesso modello di base ottiene punteggi nettamente inferiori a 1-bit Bonsai 27B, pur occupando 2,5 volte più memoria.
In termini di velocità, l'azienda dichiara fino a 163 token al secondo in 1-bit e 134 token al secondo in ternario su una NVIDIA GeForce RTX 5090, mentre su un Mac con chip M5 Max si scende a 87 token al secondo in 1-bit e 58 in ternario.
Il vincolo reale, però, non è la dimensione del file quanto la memoria realmente disponibile: un iPhone con 12 GB di RAM concede circa 6 GB alle app, budget che il modello deve condividere con cache KV e attivazioni. Nessuna build convenzionale di un modello da 27B si avvicina a quella soglia; a circa 4 GB, 1-bit Bonsai 27B è la prima a rientrarci con margine operativo, il che spiega la scelta di offrire due varianti distinte invece di una compressione unica.
PrismML (l'avete già sentita qui) rivendica questi risultati come continuazione di un percorso già avviato con i precedenti modelli della famiglia Bonsai, a 1 bit e ternari, e li lega a un argomento più ampio: l'esecuzione locale di agenti capaci di svolgere compiti prolungati, senza che ogni passaggio intermedio, screenshot o documento privato debba transitare sui server di un provider cloud. Il modello nasce da un team di ricercatori del Caltech, con il sostegno di Khosla Ventures, Cerberus e Google, e il supporto di Samsung.











Hyundai Ioniq 9: dopo due settimane di test non avremmo voluto restituirla
LG UltraGear evo GM9: 27 pollici, 5K, Mini LED e Dual Mode
Motorola edge 70 Fusion FIFA World Cup 26 Edition: un ottimo smartphone per i fan del calcio
Ristrutturazione in casa EA: licenziamenti in vista e futuro incerto per BioWare
Cloudflare avverte: gli umani rischiano di diventare un 'errore di arrotondamento' su internet
Amazon ha costruito un data center da 2 miliardi senza voto pubblico: ecco come ha fatto
Smartphone premium oltre i 600$: Apple domina, Samsung insegue. Staccati tutti gli altri
La RAM costa come nel 2007: 20 anni di ribassi sulle memorie cancellati in pochi mesi
Huawei presenta MateBook Pro S: laptop ultra-leggero da 798 grammi con HarmonyOS
Pieghevoli, la svolta che tutti aspettavano: ecco perché il 2026 cambierà ogni cosa
Sempre più manager tech sognano di mollare tutto per una fattoria di capre
IA agentica: Qwen3.8 Max davanti ai big USA, batte GPT-5.6 Sol Max e Fable 5 nel controllo del computer
Trump deciso a bloccare l'eolico offshore: siglato accordo da 1,2 miliardi con RWE
TOP 12 offerte del weekend Amazon: i nuovi articoli in posizione 1 e 2, c'è un TV a 129€ e una sorpresa per la casa
Enhanced PSSR sarà attivo per impostazione predefinita, la tecnologia di Sony ha raggiunto la maturità
Polti Vaporetto SV440 Double, la scopa a vapore 2 in 1 con 11 accessori crolla a soli 74,99€, offerta a tempo
Smart TV a 129€ su Amazon: è un Hisense da 32 pollici, perfetto come TV secondario, costa veramente pochissimo









9 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - infosì però magari non quella "general purpose", ma addestrata su compiti specifici...
Meglio ancora se addestrata per compiti specifici, c'è una ditta di cyber security molto famosa che ha un modello locale da 8B per assistere gli analisti, praticamente gira su una GPU con 8GB di vram.
esatto: fa una cosa (per dire), ma la fa bene
https://chat.qwen.ai/
https://chat.qwen.ai/
Io, un modello personalizzato uncensored da 9B.
Bisogna vedere, secondo me si ma non ho approfondito l'argomento.
Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".