Redazione di Hardware Upg
30-06-2026, 11:31
Link alla notizia: https://www.hwupgrade.it/news/apple/qwen-36-27b-apre-una-nuova-era-per-l-ia-il-compromesso-ideale-fra-i-modelli-locali_155530.html
Qwen 3.6 27B si è affermato come un ottimo compromesso fra i modelli linguistici di grandi dimensioni (LLM) locali, superando le aspettative legate alle soluzioni eseguibili su hardware personale. La comunità tech ha riconosciuto unanimemente come questo modello "picchi" ben oltre il suo peso, guadagnandosi una solida reputazione nell'ambiente degli sviluppatori
Click sul link per visualizzare la notizia.
Ora, se solo le GPU con sufficienti quantitativi di memoria veloce fossero abbordabili per l'utente comune...
https://i.imgur.com/0waUDPkl.png
Ora, se solo le GPU con sufficienti quantitativi di memoria veloce fossero abbordabili per l'utente comune...
https://i.imgur.com/0waUDPkl.png
Scusami per capirci quando nell'immagine che hai postato scrive RAM non intende quella di sistema ma VRAM della GPU?!?
Perché GPU con 45GB di VRAM... ciaone. Se invece è RAM di sistema è comunque tanta ma ci si può avvicinare.
Scusami per capirci quando nell'immagine che hai postato scrive RAM non intende quella di sistema ma VRAM della GPU?!?
Perché GPU con 45GB di VRAM... ciaone. Se invece è RAM di sistema è comunque tanta ma ci si può avvicinare.
Se non hai un sistema con sufficienti quantità di "memoria unificata" veloce, l'alternativa (in realtà l'utilizzo ideale) è comprarsi una o più GPU di fascia alta per arrivare ad almeno quella quantità di memoria.
Le memorie DDR4/5 dual channel dei normali computer desktop non sono abbastanza veloci nella pratica per LLM di qualità sufficientemente elevata. Sistemi tipo NVidia DGX Spark o AMD Strix Halo, o gli Apple MacBook base con banda della memoria inferiore a 300GB/s non hanno prestazioni accettabili per seri usi agentici o coding, a mio parere (e occorre sempre spendere diverse migliaia di euro).
Detto questo, quel grafico là parla di modelli ad 8-bit. È possibile usarli a 4-bit usando circa la metà della memoria, ma più si scende con la precisione, più i modelli faranno errori in particolare con "finestre di contesto" lunghe. 8-bit è quasi lossless (con molte riserve).
Se non hai un sistema con sufficienti quantità di "memoria unificata" veloce, l'alternativa (in realtà l'utilizzo ideale) è comprarsi una o più GPU di fascia alta per arrivare ad almeno quella quantità di memoria.
Le memorie DDR4/5 dual channel dei normali computer desktop non sono abbastanza veloci nella pratica per LLM di qualità sufficientemente elevata. Sistemi tipo NVidia DGX Spark o AMD Strix Halo, o gli Apple MacBook base con banda della memoria inferiore a 300GB/s non hanno prestazioni accettabili per seri usi agentici o coding, a mio parere (e occorre sempre spendere diverse migliaia di euro).
Detto questo, quel grafico là parla di modelli ad 8-bit. È possibile usarli a 4-bit usando circa la metà della memoria, ma più si scende con la precisione, più i modelli faranno errori in particolare con "finestre di contesto" lunghe. 8-bit è quasi lossless (con molte riserve).
Capisco ma stante gli attuali prezzi così a braccio quello che mi costerebbe fare un serverino locale sufficientemente potente per usare una mia AI privata costerebbe talmente tanto che ci potrei pagare l'abbonamento alla migliore AI per forse 10 anni.
L'AI in locale sarà veramente interessante quando con un hardware che costi un prezzo accessibili si possa avere una AI completamente personalizzata che gira in locale.
Sarei disposto a spenderci anche un po'... ma rimanendo in ciò che è umanamente fattibile.
bonzoxxx
30-06-2026, 18:04
Bene, lo sto scaricando anche se non sarà per nulla veloce dato che andrà pesantemente sulla RAM di sistema.
vBulletin® v3.6.4, Copyright ©2000-2026, Jelsoft Enterprises Ltd.