Comprare vecchi libri per distruggerli: come le IA cercano testo non contaminato
ISBNdb vende ai laboratori IA libri stampati prima del 2022, gli unici garantiti privi di testo sintetico e delle trappole piazzate dagli autori. La scansione però distrugge i volumi, e i committenti restano protetti da NDA.
di Andrea Bai pubblicata il 23 Luglio 2026, alle 13:11 nel canale WebIl miglior materiale di addestramento per l'intelligenza artificiale è fermo su uno scaffale. La frase è di ISBNdb, il più grande database di libri al mondo e che oggi vende ai laboratori di IA un servizio di acquisizione all'ingrosso di volumi cartacei da scansionare. C'è un sinistro contrappasso: il settore che porta avanti la promessa di digitalizzare la conoscenza umana ora paga per rastrellarla e triturarla, un camion di libri alla volta.
Il dettaglio fondamentale, e che rappresenta il valore dell'operazione, è la data di stampa: un libro pubblicato prima del 2022 precede l'era dei grandi modelli linguistici, quindi non può contenere testo generato da un'IA. Il web aperto è ormai saturo di contenuti sintetici, prodotti dagli stessi modelli, e addestrarsi su quel materiale espone al cosiddetto model collapse.

Quando un modello viene addestrato sull'output di modelli precedenti, le sfumature linguistiche si appiattiscono, gli errori sistematici si sommano e ogni generazione risulta leggermente peggiore di quella prima. Una tiratura cartacea pre-2022 è invece un archivio umano fissato, che nessuno può riscrivere di nascosto a posteriori.
La corsa all'avvelenamento
Dietro la richiesta di carta pulita c'è una seconda ragione, ed è il fronte più interessante. Gli autori hanno iniziato a difendersi con tecniche di avvelenamento dei dati, il data poisoning: inserire nel testo caratteri che una persona legge normalmente ma che confondono un modello, sulla scia di strumenti come Nightshade nati per le immagini. L'idea è rendere l'opera dannosa per qualsiasi modello che la ingerisca, pur restando perfettamente leggibile per l'essere umano.
ISBNdb cita a supporto una ricerca interna di Anthropic secondo cui bastano da 250 a 500 documenti costruiti ad arte, in un corpus di migliaia di miliardi di token, per impiantare una backdoor funzionante in un modello. Non serve avvelenare ogni libro: ne basta un numero sorprendentemente piccolo. I titoli stampati prima del 2022, scritti quando questi strumenti non esistevano, aggirano il problema per definizione.
Ovviamente ISBNdb ha tutto l'interesse a rappresentare i dati del web come contaminati e i propri volumi come l'antidoto. Il model collapse e le tecniche di poisoning sono fenomeni reali, ma la loro effettiva portata sui grandi modelli resta piuttosto sfumata.
Il problema di immagine
ISBNdb non nasconde che scansionare questi volumi significa quasi sempre distruggerli. Gli operai tagliano il dorso, così le pagine sciolte scorrono nello scanner, più rapido ed economico dell'alternativa delicata. Per questo ISBNdb offre riservatezza ai clienti: NDA rigoroso su ogni incarico, recita il sito, e i nomi dei committenti non vengono mai rivelati.
Si tratta ovviamente di una squisita questione di marketing e immagine: un'azienda di IA che distrugge due milioni di libri non è qualcosa che genera simpatia. Meglio parlare di "preservazione digitale dei libri"...










Hyundai Ioniq 9: dopo due settimane di test non avremmo voluto restituirla
LG UltraGear evo GM9: 27 pollici, 5K, Mini LED e Dual Mode
Motorola edge 70 Fusion FIFA World Cup 26 Edition: un ottimo smartphone per i fan del calcio
Enhanced PSSR sarà attivo per impostazione predefinita, la tecnologia di Sony ha raggiunto la maturità
Polti Vaporetto SV440 Double, la scopa a vapore 2 in 1 con 11 accessori crolla a soli 74,99€, offerta a tempo
Smart TV a 129€ su Amazon: è un Hisense da 32 pollici, perfetto come TV secondario, costa veramente pochissimo
Proseguono le operazioni di ripristino dell'assetto del satellite LINK dedicato al salvataggio del telescopio spaziale Swift
Il razzo spaziale NASA SLS e la capsula Orion per la missione Artemis III stanno prendendo forma
Starship: il recupero di Ship 40 prosegue, non tutto sembra andare come sperato! SpaceX mostra nuove immagini
Prezzi iPhone 17 in aumento: gli ultimi rumor indicano un rincaro imminente
Edge segue Chrome: a rischio molte estensioni già da agosto, Manifest v3 diventa obbligatorio
Studi su batteri e archaea: la vita sulla Terra potrebbe essere nata due volte, non una sola
Claude Code, le diverse sessioni ora parlano tra loro: cos'è la comunicazione cross-session
I sistemi di sicurezza attuali non bastano più: OpenAI ferma i test sul modello Astra
iPhone, nuove indiscrezioni sul modello del ventennale: display fino a 7 pollici e super batteria
Le iconiche Sony WH-1000XM4 stanno per tornare in una versione più economica: best-buy in arrivo?
TV 55 pollici in offerta: Xiaomi 4K a 324€ o Philips Mini LED a 349€?









13 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - infoTu sai che dai tempi dell'invenzione della scrittura, i testi vengono riscritti e cambiati a piacimento?
Chiedi ai monaci cristiani quanti testi antichi hanno cambiato o distrutto durante il medioevo.
O quanti testi che potrebbero esser stati importanti e fondamentali per conoscere la storia sono finiti bruciati in qualche saccheggio o altro.
visto che tolgono il dorso, cioè dove le pagine sono tenute insieme,
questo per farle passare allo scanner, per acquisirle...
dovrebbero rilegarli, e comunque non sarebbe cosa facile o poco costosa,
comunque non si tratta certo di documenti storici, anche se alcuni testi possono avere un contributo collaterale, e presumo che non siano in copia unica,
la maggior parte presumo abbiano un valore letterario, documentale, ma non unico,
non ci potranno riscrivere la storia eliminando quegli esemplari in copia...
Chiedi ai monaci cristiani quanti testi antichi hanno cambiato o distrutto durante il medioevo.
O quanti testi che potrebbero esser stati importanti e fondamentali per conoscere la storia sono finiti bruciati in qualche saccheggio o altro.
Mal comune mezzo gaudio allora.
Vero, anche prima.
La distruzione di libri è sempre stata una merda, eccola di nuovo.
Tra l'altro fino a pochi anni fa la gente diceva che con l'arrivo del digitale, il cartaceo sarebbe diventato obsoleto, perché le informazioni in digitale sono più aggiornate, non occupano spazio fisico, non pesano, ecc... Adesso siamo al punto che qualsiasi informazione digitale e a rischio corruzione, distruzione e alterazione e il formato cartaceo è molto più sicuro, perché più difficilmente infettabile dall'AI.
Mi sa che le vecchie enciclopedie avranno una seconda giovinezza.
Detta così sembra una sorta di "crimine", semplicemente i monaci copiavano ciò che ritenevano utile dal loro punto di vista copiare, tutto qui.
Non ha senso aspettarsi che facessero qualcosa di diverso.
Prima del 2022 ci sono anche gli e-book, se scansionano i cartacei è perché gli costa meno, quindi il singolo libro deve costare pochissimo.
Non ha senso aspettarsi che facessero qualcosa di diverso.
Non tutti copiavano e basta. Alcune parti di testi sono stati cambiati per essere più "Cristianocentrici", più orotdossi.
Anche negli stessi vangeli.
Non ha senso aspettarsi che facessero qualcosa di diverso.
invece c'era il diktat centrale di distruggere rotoli-pergamene-e affini che contenessero scritti pagani e contenessero filosofia pagana
magari i copisti erano solo un ruolo nella catena smantellante
Devi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".