View Full Version : ASUS Ascent GX10 visto da vicino: il supercomputer AI con cuore NVIDIA che sta sul tavolo
Redazione di Hardware Upg
19-06-2026, 09:31
Link alla notizia: https://www.hwupgrade.it/news/sistemi/asus-ascent-gx10-visto-da-vicino-il-supercomputer-ai-con-cuore-nvidia-che-sta-sul-tavolo_154498.html
L'ASUS Ascent GX10 è un supercomputer AI compatto alimentato dal superchip NVIDIA GB10 Grace Blackwell, cuore della piattaforma DGX Spark. Con 1 petaFLOP di prestazioni AI, 128 GB di memoria unificata CPU-GPU e supporto a modelli fino a 200 miliardi di parametri, porta il calcolo AI di livello professionale direttamente sulla scrivania. Pensato per sviluppatori, ricercatori e data scientist, include l'intero software stack NVIDIA preinstallato e supporta la scalabilità dual-node tramite ConnectX-7.
Click sul link per visualizzare la notizia.
bonzoxxx
19-06-2026, 09:51
Ora che ho accumulato un sacco di esperienza sul far girare i modelli in locale e leggendo questo articolo, posso confermare che la 5090 è al momento la soluzione più veloce per far girare modelli 30b, seguita dalla 4090, 5080 e 5070ti che è un ottimo compromesso prezzo/prestazioni per via dell'ottimizzazione FP4. Anche la 5060ti 16GB non va male.
DGX spark va bene se servono necessariamente modelli molto grandi che non stanno nei 32GB della 5090.
Tanto il futuro vedrà sempre più local llms, i costi dell'AI stanno salendo rapidamente e con gli agenti si rischia di sforare i 10k dollari/mese agilmente.
mmm.. capisco che è piccolo, compatto e certamente con ottima potenza.. ma sono pure 4000 euro per delle prestazioni effettive che non brillano per nulla se paragonate ad una WS con RTX 5090 che magari ne costa 5000 o 6000 ma va ben più del doppio..
bonzoxxx
19-06-2026, 12:27
mmm.. capisco che è piccolo, compatto e certamente con ottima potenza.. ma sono pure 4000 euro per delle prestazioni effettive che non brillano per nulla se paragonate ad una WS con RTX 5090 che magari ne costa 5000 o 6000 ma va ben più del doppio..
Assolutamente.
Ieri sera (notte) ho letto proprio un articolo a riguardo, molto ben fatto, in cui si paragonavano apple silicon e le varie GPU nvidia e amd, ebbene la maggior parte dei casi vede la 5090 come la soluzione definitiva, ad oggi, per gli LLM locali, seguita dalla 5080 e dalla 5070ti.
Usare LLM enormi con quantizzazione alta tipo FP8 e FP16 è utile in determinati casi specifici, ma anche solo per generare video una 5090 basta, magari 2.
Il punto è che molti, anche qui dove lavoro attualmente, pensano che un modello con più B sia migliore quando invece non è assolutamente vero, serve il modello giusto per l'utilizzo giusto e la quantizzazione giusta altrimenti si rischia di comprare 8 blackwell per poi sfruttarne il 10%.
Per avere un output decente di token serve memoria veloce, averne tanta ma lenta serve fino ad un certo punto.
virtualdj
20-06-2026, 14:04
la maggior parte dei casi vede la 5090 come la soluzione definitiva, ad oggi, per gli LLM locali
Ma se il modello non ci sta fisicamente dentro la VRAM della 5090 ci sono metodi per farlo girare comunque, più lentamente, o proprio non gira (quindi la memoria unificata serve)?
bonzoxxx
20-06-2026, 14:12
Ma se il modello non ci sta fisicamente dentro la VRAM della 5090 ci sono metodi per farlo girare comunque, più lentamente, o proprio non gira (quindi la memoria unificata serve)?
Fa offload sulla ram di sistema e il tutto si rallenta drammaticamente. La 5090 riesce a far girare dei modelli interessanti con i quali si riesce a fare molto soprattutto se servono tanti token veloci, ma se servono necessariamente modelli grandi serve RAM unificata, quindi SPARK, ryzen AI o un apple silicon, ma indipendentemente dai modelli i prezzi sono alti.
scusate però mi sembra si paragonino cose totalmente diverse, E' come confrontare un Auto o un Camion, dicendo che se devo portare un carico di 50kg l'auto va piu veloce ed è piu bella...ok..
Dire che la 5090 è la soluzione definitiva per far girare AI in locale è un affermazione che non ha molto senso.
si un modello piccolo posso farlo girare piu veloce su un pc con 5090, ma cose come un 30b al massimo ci entrano dentro quantizzati a 4bit, ma appunto parliamo di modelli piccoli e sacrificati, che possono essere utili per task semplici, o se usati per cose più complesse soggetti a forti allucinazioni.
cioè va bene usare la 5090 per fare dei test, per diletto a casa...ma per lavoro si spende dei soldi in più ma devo avere una cosa affidabile a livello di output, non ha senso arrabattarsi con il pc da gioco, con le versioni mini dei modelli.
Se uno vuole far girare cose serie, 96-128gb di memoria è un po il minimo..
Inoltre, su server con questa ram condivisa, ci sono progetti molto interessanti, tipo DS4 (Dwarf Star 4) sviluppato dal creatore di Redis, che permette, tramite ottimizzazioni e compressioni (quantizzazioni assimmetriche), di far girare, con pochissima perdita di capacita, modelli open weights, praticamente di semi-frontiera, come DeepSeek v4 flash (interamente in ram) o il pro (con streaming su ssd), parliamo di modelli originariamente da 284b e 1.6t, quindi macchine come queste o le macchine Apple con ram condivisa, danno proprio la possibilità di giocare ad un altro campionato..
scusate però mi sembra si paragonino cose totalmente diverse, E' come confrontare un Auto o un Camion, dicendo che se devo portare un carico di 50kg l'auto va piu veloce ed è piu bella...ok..
Dire che la 5090 è la soluzione definitiva per far girare AI in locale è un affermazione che non ha molto senso.
si un modello piccolo posso farlo girare piu veloce su un pc con 5090, ma cose come un 30b al massimo ci entrano dentro quantizzati a 4bit, ma appunto parliamo di modelli piccoli e sacrificati, che possono essere utili per task semplici, o se usati per cose più complesse soggetti a forti allucinazioni.
cioè va bene usare la 5090 per fare dei test, per diletto a casa...ma per lavoro si spende dei soldi in più ma devo avere una cosa affidabile a livello di output, non ha senso arrabattarsi con il pc da gioco, con le versioni mini dei modelli.
Se uno vuole far girare cose serie, 96-128gb di memoria è un po il minimo..
Inoltre, su server con questa ram condivisa, ci sono progetti molto interessanti (direi quasi rivoluzionari), tipo DS4 (Dwarf Star 4) sviluppato dal creatore di Redis, che permette, tramite ottimizzazioni e compressioni, di far girare, con pochissima perdita di capacita, modelli open weights, praticamente di semi-frontiera, come DeepSeek v4 flash (interamente in ram) o il pro (con streaming su ssd), parliamo di modelli da 284b e 1.6t, quindi macchine come queste o le macchine Apple con ram condivisa, danno proprio la possibilità di giocare ad un altro campionato..
Ho chiesto un po' di cose alla IA (varda te) proprio a proposito di cose tipo LMstudio ed IA locali ed il loro legame con l'hardware.
In pratica prima ancora della potenza di GPU e scondariamente della CPU è proprio fondamentale la memoria, più ce ne è a disposizione più puoi caricare e far girare modelli grandi e complessi.
Primissima tra tutti la memoria video della gpu che è velocissima, qualdo quella si riempie si usa anche la ram del sistema che è però molto meno performante.
Motivo questo che rende una memoria unificata molto adatta all'uso IA.
Ho allora chiesto quale sarebbe una config hardware furba per avere elevate prestazioni ma senza spendere un capitale:
La scelta più saggia con un budget attorno a "SOLI" 2500-3000 euro è quella di portarsi a casa una WS XEON classe E5 usata di alto livello (1200-1500 euro) con single o dual CPU e 96-128 gb ram per sfruttare anche feature tipo il quad channel sulle DDR ed accoppiarci un paio (o addirittura 3) di schede tesla P40 che vengono via a 300 euro ed hanno 24gb di vram l'una.
Configurazione di certo abbastanza energivora ma che ti consente di far girare con ottimi risultati modelli belli tosti.
Ho chiesto un po' di cose alla IA (varda te) proprio a proposito di cose tipo LMstudio ed IA locali ed il loro legame con l'hardware.
In pratica prima ancora della potenza di GPU e scondariamente della CPU è proprio fondamentale la memoria, più ce ne è a disposizione più puoi caricare e far girare modelli grandi e complessi.
Primissima tra tutti la memoria video della gpu che è velocissima, qualdo quella si riempie si usa anche la ram del sistema che è però molto meno performante.
Motivo questo che rende una memoria unificata molto adatta all'uso IA.
Ho allora chiesto quale sarebbe una config hardware furba per avere elevate prestazioni ma senza spendere un capitale:
La scelta più saggia con un budget attorno a "SOLI" 2500-3000 euro è quella di portarsi a casa una WS XEON classe E5 usata di alto livello (1200-1500 euro) con single o dual CPU e 96-128 gb ram per sfruttare anche feature tipo il quad channel sulle DDR ed accoppiarci un paio (o addirittura 3) di schede tesla P40 che vengono via a 300 euro ed hanno 24gb di vram l'una.
Configurazione di certo abbastanza energivora ma che ti consente di far girare con ottimi risultati modelli belli tosti.
no attenzione, la configurazione che dici non è una buona scelta.
la VRAM (o ram se è condivisa anche dalla gpu..se no non serve) è sicuramente la cosa piu importante, ed è il motivo per cui il server dell'articolo surclassa una 5090, ma non è la stessa cosa avere una grande ram da 72gb o 3 gpu con 24gb, il modello deve girare nella stessa VRAM, se deve uscire, hai lo stesso problema di degrado delle performance come quando sfori in ram, le p40 che oltretutto sono vecchie, lente e non supportano alcune features di calcolo, non supportano nemmeno NVlink (crea un bus ad alta velocita tra gpu), quindi la vram avrebbe come collo di bottiglia il bus PCIe...praticamente meglio la 5090 che almeno ha 32gb in una gpu e performance molto migliori.
spenderesti cifre simili al server dell'articolo, come ordine di grandezza, per avere una cosa che vale un ventesimo come performance su AI locale.
bonzoxxx
20-06-2026, 20:37
Ho chiesto un po' di cose alla IA (varda te) proprio a proposito di cose tipo LMstudio ed IA locali ed il loro legame con l'hardware.
In pratica prima ancora della potenza di GPU e scondariamente della CPU è proprio fondamentale la memoria, più ce ne è a disposizione più puoi caricare e far girare modelli grandi e complessi.
Primissima tra tutti la memoria video della gpu che è velocissima, qualdo quella si riempie si usa anche la ram del sistema che è però molto meno performante.
Motivo questo che rende una memoria unificata molto adatta all'uso IA.
Ho allora chiesto quale sarebbe una config hardware furba per avere elevate prestazioni ma senza spendere un capitale:
La scelta più saggia con un budget attorno a "SOLI" 2500-3000 euro è quella di portarsi a casa una WS XEON classe E5 usata di alto livello (1200-1500 euro) con single o dual CPU e 96-128 gb ram per sfruttare anche feature tipo il quad channel sulle DDR ed accoppiarci un paio (o addirittura 3) di schede tesla P40 che vengono via a 300 euro ed hanno 24gb di vram l'una.
Configurazione di certo abbastanza energivora ma che ti consente di far girare con ottimi risultati modelli belli tosti.
Se devi sperimentare senza spendere un capitale, vai di mac mini m4 o meglio M5: non sono veloci ma vanno bene per il prezzo che hanno.
Se hai budget, prendi una RTX 5060ti 16GB, oppure sali a una 5070ti sempre 16GB. Se riesci a trovare una 3090 non è male.
La ram di sistema deve essere almeno 32G, un buon SSD, una CPU media e stai a posto per avere una WS AI per sperimentare e cominciare a fare cose, io con la mia posso fare un po di tutto però a livello "tranquillo".
Conta tanto la velocità con cui i token vengono generati altrimenti ci si ritrova con un modello "super intelligente" ma lento come un 56K, non serve a nulla.
no attenzione, la configurazione che dici non è una buona scelta.
la VRAM (o ram se è condivisa anche dalla gpu..se no non serve) è sicuramente la cosa piu importante, ed è il motivo per cui il server dell'articolo surclassa una 5090, ma non è la stessa cosa avere una grande ram da 72gb o 3 gpu con 24gb, il modello deve girare nella stessa VRAM, se deve uscire, hai lo stesso problema di degrado delle performance come quando sfori in ram, le p40 che oltretutto sono vecchie, lente e non supportano alcune features di calcolo, non supportano nemmeno NVlink (crea un bus ad alta velocita tra gpu), quindi la vram avrebbe come collo di bottiglia il bus PCIe...praticamente meglio la 5090 che almeno ha 32gb in una gpu e performance molto migliori.
spenderesti cifre simili al server dell'articolo, come ordine di grandezza, per avere una cosa che vale un ventesimo come performance su AI locale.
Se devi sperimentare senza spendere un capitale, vai di mac mini m4 o meglio M5: non sono veloci ma vanno bene per il prezzo che hanno.
Se hai budget, prendi una RTX 5060ti 16GB, oppure sali a una 5070ti sempre 16GB. Se riesci a trovare una 3090 non è male.
La ram di sistema deve essere almeno 32G, un buon SSD, una CPU media e stai a posto per avere una WS AI per sperimentare e cominciare a fare cose, io con la mia posso fare un po di tutto però a livello "tranquillo".
Conta tanto la velocità con cui i token vengono generati altrimenti ci si ritrova con un modello "super intelligente" ma lento come un 56K, non serve a nulla.
Capisco, grazie per le precisazioni.
La mia è semplice curiosità comunque.. per l'uso che faccio della IA di certo non ho interesse ad avere un modello che giri in locale, volevo solo capire meglio!
bonzoxxx
21-06-2026, 10:54
Di nulla :)
vBulletin® v3.6.4, Copyright ©2000-2026, Jelsoft Enterprises Ltd.