Crawler AI fuori controllo: il 98% del traffico web è falso e la Linux Foundation risponde così

Crawler AI fuori controllo: il 98% del traffico web è falso e la Linux Foundation risponde così

La Linux Foundation ha lanciato un duro allarme contro i crawler automatizzati per l'addestramento dei modelli linguistici, rivelando che il traffico legittimo su git.kernel.org è crollato ad appena il 2% del totale complessivo

di pubblicata il , alle 17:11 nel canale Sistemi Operativi
Linux
 

La Linux Foundation ha denunciato pubblicamente l'impatto insostenibile dei web crawler automatizzati impiegati per addestrare modelli linguistici (LLM). I sistemi che gestiscono il repository ufficiale git.kernel.org si trovano a fronteggiare un assalto quotidiano di bot che ha ridotto il traffico legittimo a circa il 2% del totale. La quasi totalità delle risorse computazionali viene ormai assorbita dall'elaborazione di richieste generate da scraper indiscriminati.

Il direttore dell'infrastruttura IT dell'organizzazione, Konstantin Ryabitsev, ha spiegato che i server consumano più cicli CPU per generare pagine HTML destinate ai bot rispetto a qualsiasi altro accesso reale. In qualsiasi momento, distribuiti su 5 nodi geografici, ci sono 14 core CPU dedicati esclusivamente al rendering delle modifiche al codice. L'archivio del kernel Linux rappresenta una miniera d'oro per le aziende del settore AI, poiché garantisce uno storico di codice sorgente interamente scritto da programmatori umani, privo di contaminazioni da codice sintetico.

La struttura del portale amplifica il carico sui server. Il ramo principale linux.git conta circa 1,48 milioni di commit, a cui si affiancano circa 922 fork ospitati sulla medesima piattaforma. Se a livello di backend la memorizzazione degli oggetti risulta ottimizzata ed efficiente, l'interfaccia web permette di interrogare patch, diff e rami storici generando miliardi di combinazioni di indirizzi URL validi. Gli scraper scansionano metodicamente ogni variante duplicata, moltiplicando a dismisura le chiamate verso l'infrastruttura.

Dalle regole di blocco alle botnet residenziali

Il personale tecnico ha tentato inizialmente di arginare il fenomeno analizzando i registri di sistema per applicare blocchi tramite Fail2ban, ma gli scraper hanno risposto rapidamente modificando gli User-Agent per simulare browser standard e distribuendo le richieste su intere sottoreti di data center cloud. La situazione è degenerata quando i crawler hanno iniziato a sfruttare milioni di indirizzi IP residenziali e mobili, veicolati attraverso circuiti commerciali di monetizzazione integrati in dispositivi smart domestici, capaci di compiere solo quattro o cinque richieste per singolo IP prima di scomparire dai log.

Attualmente il portale riceve circa 6 milioni di richieste giornaliere per la visualizzazione casuale di singoli commit. Il meccanismo di verifica crittografica basato sul sistema Anubis riesce a respingere il 66% delle chiamate, ma il restante 33% impiega cicli di calcolo per superare la sfida e accedere ai dati. Per preservare la stabilità operativa dell'infrastruttura di git.kernel.org, l'amministrazione ha deciso di disattivare progressivamente diverse funzionalità dinamiche dell'interfaccia web anonima, lasciando invariata la disponibilità dei dati scaricabili via protocollo Git standard.

3 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - info
mmorselli31 Agosto 2026, 17:34 #1
La situazione è degenerata quando i crawler hanno iniziato a sfruttare milioni di indirizzi IP residenziali e mobili, veicolati attraverso circuiti commerciali di monetizzazione integrati in dispositivi smart domestici


Ma esiste questa roba? Pensavo fosse competenza delle botnet, non che ci fossero addirittura persone che monetizzano facendo da proxy per i bot

Questo del kernel è un caso molto particolare, ma è evidente che il web dovrà ristrutturarsi, il web basato sulla pubblicità è morto, l'HTML è un morto che cammina, i siti e i webserver vanno ripensati per servire direttamente del markdown, con un modello di business che per i siti di news è ancora tutto da capire.
matsnake8631 Agosto 2026, 18:25 #2
E come potrebbe il markdown risolvere la cosa ?
Il problema non è tanto il contenuto generato ma la quantità di richieste.
mmorselli31 Agosto 2026, 19:45 #3
Originariamente inviato da: matsnake86
E come potrebbe il markdown risolvere la cosa ?


Il markdown è leggerissimo e monolitico, già questo ti consente di allocare molta meno memoria per singola richiesta, poi non è una pagina web, e le pagine web quasi sempre sono pieni di immagini che servono solo a decorarla, css che servono a renderla bella, script che servono a creare animazioni ed interazioni cool... Tutta roba utile (si fa per dire) solo agli umani. Una tipica pagina web obbliga il browser a fare decine di richieste in parallelo.

Nota che ho scritto anche "questo del kernel è un caso molto particolare" perché sono pagine già molto leggere, con un solo css semplice e un js, il mio era un discorso più generale sul futuro del web nel momento in cui la maggioranza del traffico sia agentica. Non riguarda i siti con cui interagisco, come questo forum per esempio, ma se le news me le porta l'AI e non le vado più a leggere sul sito di news perché mai quel sito dovrebbe essere pieno di foto, banner, cta, rimandi ad altri articoli, ecc... ? Se l'auto usata me la cerca l'agente, fai un sito in cui l'agente possa cercare le sue cose agevolmente col minor dispendio di token (per me) possibile, così dirò al mio bot di preferire quel sito agli altri.

Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".

La discussione è consultabile anche qui, sul forum.
 
^