View Full Version : Ho costruito un agente IA locale dentro un mini PC. Cronaca di tre giorni passati a farlo funzionare
Redazione di Hardware Upg
08-08-2026, 08:31
Link alla notizia: https://www.hwupgrade.it/news/scienza-tecnologia/ho-costruito-un-agente-ia-locale-dentro-un-mini-pc-cronaca-di-tre-giorni-passati-a-farlo-funzionare_157221.html
Per qualche giorno ho trasformato un ASUS NUC 16 Pro in un laboratorio di intelligenza artificiale casalinga: prima un modello gigantesco da 744 miliardi di parametri, poi uno più piccolo che gira sulla scheda grafica integrata, alla fine un agente vero e proprio a cui scrivo da Telegram e che mi apre le pagine, raccoglie le fonti e mi consegna un lavoro che posso controllare.
Click sul link per visualizzare la notizia.
Sandro kensan
08-08-2026, 09:26
Molto interessante, un lavorone e poi con questo caldo risolvere problemi è ancora più difficile.
bonzoxxx
08-08-2026, 09:59
Bravo Luciano, stesse cose che sto sperimentando io, pari pari.
Io uso un modello da 9B che gira sulla 3080 e faccio oltre 90 token/s.
Il tuo è più di un esperimento, è una prova tangibile che un modello abbastanza grande, e 27B è ottimo per usarlo con Hermes, è fattibile in casa.
Col 9B mi trovo bene, non è super intelligente ma va bene. Proverò Colibrì (che conoscevo ma non ho implementato) per vedere se riesco a superare il limite molto stringente dei 10GB di vram.
Bravo Luciano, stesse cose che sto sperimentando io, pari pari.
Io uso un modello da 9B che gira sulla 3080 e faccio oltre 90 token/s.
Il tuo è più di un esperimento, è una prova tangibile che un modello abbastanza grande, e 27B è ottimo per usarlo con Hermes, è fattibile in casa.
Col 9B mi trovo bene, non è super intelligente ma va bene. Proverò Colibrì (che conoscevo ma non ho implementato) per vedere se riesco a superare il limite molto stringente dei 10GB di vram.
Se hai poca VRAM conviene usare modelli MoE (Mixture of Experts), dove solo una parte dei parametri è coinvolta nella computazione per ogni token.
Io uso llama-cpp su Linux.
Tanto per dirti, con una 1060 6GB e 16 GB ram di sistema, riesco a far girare Gemma4 26B-A4B (QAT con quantizzazione Q4) sui 17/18 token/s (che in genere è più che sufficiente per la chat).
Su un sistema più decente con 5070 Ti Mobile 12gb e 64 gb di RAM, Qwen3.6 35B-A3B con quantizzazione IQ4_XS va intorno ai 90 token/s :D.
Colibrì è al momento un po' limitato nel supporto dei modelli e nell'accelerazione CUDA.
virtualdj
08-08-2026, 13:15
Grazie anche per l'articolo di questa settimane e buone ferie!
Non mollarci al ritorno, però, eh! Che è stata una grande idea il tuo ritorno su HWUpgrade in veste di articolista. :mano:
bonzoxxx
08-08-2026, 13:36
Se hai poca VRAM conviene usare modelli MoE (Mixture of Experts), dove solo una parte dei parametri è coinvolta nella computazione per ogni token.
Io uso llama-cpp su Linux.
Tanto per dirti, con una 1060 6GB e 16 GB ram di sistema, riesco a far girare Gemma4 26B-A4B (QAT con quantizzazione Q4) sui 17/18 token/s (che in genere è più che sufficiente per la chat).
Su un sistema più decente con 5070 Ti Mobile 12gb e 64 gb di RAM, Qwen3.6 35B-A3B con quantizzazione IQ4_XS va intorno ai 90 token/s :D.
Colibrì è al momento un po' limitato nel supporto dei modelli e nell'accelerazione CUDA.
Interessante, anche io uso llama-cpp ma su win11 ma si vede che il modello che ho usato ora non è MoE. Approfondisco. Ti ringrazio
Per i miei progetti casalinghi con AI locale, uso l'open source Unsloth studio (https://unsloth.ai/docs/new/studio): nonostante ancora in fase beta, è più comodo e completo di Ollama ma veloce come LLaMA_C++. Usa tutti i modelli in formato GGuFFnon e SafeTensors (Hugging Face), non fa solo inferenza ma anche finetuning (voce Train), tool coding e ricerche pre-integrate, varie ottimizzazioni di quantizzazione, community tecnicamente forte, documentazione molto buona.
Usando sotto unsloth anche modelli piccolini si possono ottenere già buone qualità delle risposte perché vanno oltre la risposta del modello base (che in casi di modelli piccoli e non specifici può non fornirtene alcuna) con l'apporto della web search (veramente buona la sintesi della risposta; le sue ricerche funzionano decisamente meglio di quelle di Ollama) e il tool coding.
Per una cosa che gira localmente (costo zero, privacy, meno spreco risorse, ecc.) e ancora in fase beta, lo trovo già molto buono.
NewEconomy
08-08-2026, 15:39
Avete provato LFM2.5 2.6B di LiquidAI?
Io lo sto trovando spettacolare
https://huggingface.co/collections/LiquidAI/lfm25
TorettoMilano
08-08-2026, 15:47
in pochi giorni hai sfornato due articoli di livello assoluto, complimenti luciano
mozzarello
08-08-2026, 18:42
Bell'articolo, io sono zero esperto di modelli locali, anche perché non ho bisogno di fargli fare nulla, quindi sarebbe al massimo uno sfizio, ma chiedo a chi li usa: il vantaggio rispetto al cloud è solo lato privacy o c'è altro?
NewEconomy
08-08-2026, 19:59
Bell'articolo, io sono zero esperto di modelli locali, anche perché non ho bisogno di fargli fare nulla, quindi sarebbe al massimo uno sfizio, ma chiedo a chi li usa: il vantaggio rispetto al cloud è solo lato privacy o c'è altro?
Principalmente si.. Una volta c’era anche il vantaggio economico, ma ultimamente con i prezzi enormemente scesi (vedasi DeepSeek V4 Flash aggiornato oppure Xiaomi MiMo) non è scontato sia conveniente l’inferenza locale (a patto di avere energia gratuita quello si).
In futuro probabilmente i prezzi torneranno a salire quindi sul lungo termine sono positivo…
Altro vantaggio è che puoi farci quello che vuoi con i modelli, non hanno inutili guardrail con la scusa safety
Sandro kensan
08-08-2026, 20:26
Bell'articolo, io sono zero esperto di modelli locali, anche perché non ho bisogno di fargli fare nulla, quindi sarebbe al massimo uno sfizio, ma chiedo a chi li usa: il vantaggio rispetto al cloud è solo lato privacy o c'è altro?
Anch'io non me ne intendo ma mi ha colpito la notizia seguente:
When we started the log analysis, we first used frontier models behind commercial APIs. This did not work: the analysis requires submitting large volumes of real attack commands, exploit payloads, and C2 artifacts, and these requests were blocked by the providers' safety guardrails, which cannot distinguish an incident responder from an attacker. We ran the forensic analysis instead on zai-org/GLM-5.2, an open-weight model, on our own infrastructure. This had a second benefit: no attacker data, and none of the credentials it referenced, left our environment.
In pratica durante il famoso attacco a Hugging face, per analizzare l'attacco e i danni subiti non è stato possibile usare i modelli americani e hanno dovuto usare quelli cinesi. Da notare che quelli cinesi possono essere modificati in quanto open source (open weight) e resi liberi da vincoli e quindi usati per lo scopo, quelli USA no.
Questo al di la e prima dell'esecuzione locale che viene un attimo dopo il fatto che i modelli siano liberi.
mozzarello
09-08-2026, 07:25
Principalmente si.. Una volta c’era anche il vantaggio economico, ma ultimamente con i prezzi enormemente scesi (vedasi DeepSeek V4 Flash aggiornato oppure Xiaomi MiMo) non è scontato sia conveniente l’inferenza locale (a patto di avere energia gratuita quello si).
In futuro probabilmente i prezzi torneranno a salire quindi sul lungo termine sono positivo…
Altro vantaggio è che puoi farci quello che vuoi con i modelli, non hanno inutili guardrail con la scusa safety
Ah quello sicuro, però io non ho ancora incontrato gurdarail al lavoro o in qualsiasi richiesta che non "diventasse" (per colpa dell'LLM spesso) NSFW, quindi per quello mi chiedevo se il problema fosse realmente solo di privacy, perché alla fine i costi diventano alti comunque, dato che devi avere un tuo "server" sempre acceso e connesso, se vuoi poterla interrogare da remoto, e i tempi son comunque molto più lunghi.
Un'azienda ha senso, per segreto industriale e altro, un privato forse è solo un esercizio di stile.
Anch'io non me ne intendo ma mi ha colpito la notizia seguente:
When we started the log analysis, we first used frontier models behind commercial APIs. This did not work: the analysis requires submitting large volumes of real attack commands, exploit payloads, and C2 artifacts, and these requests were blocked by the providers' safety guardrails, which cannot distinguish an incident responder from an attacker. We ran the forensic analysis instead on zai-org/GLM-5.2, an open-weight model, on our own infrastructure. This had a second benefit: no attacker data, and none of the credentials it referenced, left our environment.
In pratica durante il famoso attacco a Hugging face, per analizzare l'attacco e i danni subiti non è stato possibile usare i modelli americani e hanno dovuto usare quelli cinesi. Da notare che quelli cinesi possono essere modificati in quanto open source (open weight) e resi liberi da vincoli e quindi usati per lo scopo, quelli USA no.
Questo al di la e prima dell'esecuzione locale che viene un attimo dopo il fatto che i modelli siano liberi.
Sì, chiaro anche questo, se hai bisogno di fare qualcosa di particolare, meglio avere qualcosa di open e modificabile. E' poi il motivo per cui anche in Europa dovrebbero staccarsi dai modelli chiusi, ma vabbé che in Europa tutto il digitale lo abbiamo messo in mani americane. Non che cinesi siano migliori, per ora rilasciano modelli open weight perché è l'unico modo che hanno per contrastare i modello di frontiera americani, mica perché son buoni.
vBulletin® v3.6.4, Copyright ©2000-2026, Jelsoft Enterprises Ltd.