Crawler AI fuori controllo: il 98% del traffico web è falso e la Linux Foundation risponde così
La Linux Foundation ha lanciato un duro allarme contro i crawler automatizzati per l'addestramento dei modelli linguistici, rivelando che il traffico legittimo su git.kernel.org è crollato ad appena il 2% del totale complessivo
di Nino Grasso pubblicata il 31 Agosto 2026, alle 17:11 nel canale Sistemi OperativiLinux
La Linux Foundation ha denunciato pubblicamente l'impatto insostenibile dei web crawler automatizzati impiegati per addestrare modelli linguistici (LLM). I sistemi che gestiscono il repository ufficiale git.kernel.org si trovano a fronteggiare un assalto quotidiano di bot che ha ridotto il traffico legittimo a circa il 2% del totale. La quasi totalità delle risorse computazionali viene ormai assorbita dall'elaborazione di richieste generate da scraper indiscriminati.
Il direttore dell'infrastruttura IT dell'organizzazione, Konstantin Ryabitsev, ha spiegato che i server consumano più cicli CPU per generare pagine HTML destinate ai bot rispetto a qualsiasi altro accesso reale. In qualsiasi momento, distribuiti su 5 nodi geografici, ci sono 14 core CPU dedicati esclusivamente al rendering delle modifiche al codice. L'archivio del kernel Linux rappresenta una miniera d'oro per le aziende del settore AI, poiché garantisce uno storico di codice sorgente interamente scritto da programmatori umani, privo di contaminazioni da codice sintetico.
La struttura del portale amplifica il carico sui server. Il ramo principale linux.git conta circa 1,48 milioni di commit, a cui si affiancano circa 922 fork ospitati sulla medesima piattaforma. Se a livello di backend la memorizzazione degli oggetti risulta ottimizzata ed efficiente, l'interfaccia web permette di interrogare patch, diff e rami storici generando miliardi di combinazioni di indirizzi URL validi. Gli scraper scansionano metodicamente ogni variante duplicata, moltiplicando a dismisura le chiamate verso l'infrastruttura.
Dalle regole di blocco alle botnet residenziali
Il personale tecnico ha tentato inizialmente di arginare il fenomeno analizzando i registri di sistema per applicare blocchi tramite Fail2ban, ma gli scraper hanno risposto rapidamente modificando gli User-Agent per simulare browser standard e distribuendo le richieste su intere sottoreti di data center cloud. La situazione è degenerata quando i crawler hanno iniziato a sfruttare milioni di indirizzi IP residenziali e mobili, veicolati attraverso circuiti commerciali di monetizzazione integrati in dispositivi smart domestici, capaci di compiere solo quattro o cinque richieste per singolo IP prima di scomparire dai log.

Attualmente il portale riceve circa 6 milioni di richieste giornaliere per la visualizzazione casuale di singoli commit. Il meccanismo di verifica crittografica basato sul sistema Anubis riesce a respingere il 66% delle chiamate, ma il restante 33% impiega cicli di calcolo per superare la sfida e accedere ai dati. Per preservare la stabilità operativa dell'infrastruttura di git.kernel.org, l'amministrazione ha deciso di disattivare progressivamente diverse funzionalità dinamiche dell'interfaccia web anonima, lasciando invariata la disponibilità dei dati scaricabili via protocollo Git standard.











Insta360 Luna Ultra: la potenza del sensore da 1 pollice incontra la portabilità estrema
Marvel's Wolverine, la recensione: Logan torna protagonista in un'avventura brutale e intensa
DJI Romo 2: tante novità lo rendono un robot completo
Googlebook pronto al debutto: Google aprirà presto i preordini e svelerà nuovi dettagli sulla piattaforma Android
Guida all'acquisto: quale lavapavimenti Dreame Serie T scegliere
Google Maps su Android Auto introduce finalmente il tachimetro sempre visibile: ora funziona anche senza una destinazione impostata
AMD Ryzen 5 5500F: fino al 16% di prestazioni in più rispetto al Ryzen 5 5500, è una nuova CPU
L'ecosistema partner di Microsoft cresce a doppia cifra. L'IA traina la crescita
Oracle registra un boom nella divisione cloud. Ovviamente arrivano licenziamenti di massa
Amazon Prime Video sfida TikTok con le news in formato breve
L'uscita di Rayman Legends Retold è stata rinviata: Ubisoft prende tempo per rifinire ogni dettaglio del remake
Dazio UE sui pacchi extra UE, in Italia l'import crolla del 39%: 83 milioni di euro di gettito
La nuova lavatrice smart di Xiaomi ha tre cestelli e integra l'IA
Hai una PSP nel cassetto? Questo nuovo progetto la reinventa in un lettore musicale con FLAC e MP3
Oracle presenta Java 27 con diverse novità, a partire dalla crittografia post-quantistica
Il microscopio dell'EPFL vede più in piccolo di quanto la luce permetta
Volvo avvia la produzione dei nuovi camion elettrici: FH Aero arriva a 700 km









3 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - infoMa esiste questa roba? Pensavo fosse competenza delle botnet, non che ci fossero addirittura persone che monetizzano facendo da proxy per i bot
Questo del kernel è un caso molto particolare, ma è evidente che il web dovrà ristrutturarsi, il web basato sulla pubblicità è morto, l'HTML è un morto che cammina, i siti e i webserver vanno ripensati per servire direttamente del markdown, con un modello di business che per i siti di news è ancora tutto da capire.
Il problema non è tanto il contenuto generato ma la quantità di richieste.
Il markdown è leggerissimo e monolitico, già questo ti consente di allocare molta meno memoria per singola richiesta, poi non è una pagina web, e le pagine web quasi sempre sono pieni di immagini che servono solo a decorarla, css che servono a renderla bella, script che servono a creare animazioni ed interazioni cool... Tutta roba utile (si fa per dire) solo agli umani. Una tipica pagina web obbliga il browser a fare decine di richieste in parallelo.
Nota che ho scritto anche "questo del kernel è un caso molto particolare" perché sono pagine già molto leggere, con un solo css semplice e un js, il mio era un discorso più generale sul futuro del web nel momento in cui la maggioranza del traffico sia agentica. Non riguarda i siti con cui interagisco, come questo forum per esempio, ma se le news me le porta l'AI e non le vado più a leggere sul sito di news perché mai quel sito dovrebbe essere pieno di foto, banner, cta, rimandi ad altri articoli, ecc... ? Se l'auto usata me la cerca l'agente, fai un sito in cui l'agente possa cercare le sue cose agevolmente col minor dispendio di token (per me) possibile, così dirò al mio bot di preferire quel sito agli altri.
Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".