L’ultima novità è di poche settimane fa e viene dal Giappone. Nel paese del Sol Levante sta infatti succedendo una cosa curiosa: alcune librerie dell’usato hanno recentemente registrato vendite quintuplicate, con ordini da centinaia di volumi alla volta, tutti diretti allo stesso centro logistico nella prefettura di Okayama. Da lì, i pallet di libri partono verso gli Stati Uniti: oltre cinquanta tonnellate in totale, secondo le notizie raccolte dalle testate giornalistiche nipponiche. Nessuno ha ancora confermato chi sia il compratore finale, ma il percorso ricalca uno schema già noto altrove.
È lo stesso schema emerso in una causa giudiziaria che
sta facendo la storia: Bartz v. Anthropic. Gli atti del processo sono
stati resi noti dalla stampa americana e raccontano la storia di un’azienda che
ha comprato milioni di libri di seconda mano, li ha fatti smontare tagliando la
rilegatura, li ha fatti scansionare pagina per pagina sostanzialmente
distruggendoli, e infine li ha buttati al macero.
Quello di Anthropic non è l’unico caso. Un’inchiesta
della testata 404 Media ha seguito, grazie a un tracciatore nascosto in un lotto di
volumi rari, un processo analogo che ha portato un lotto di alcune centinaia di
libri comprato all’ingrosso fino a un magazzino Amazon vicino a Las Vegas,
dove, anche in questo caso, alcuni lavoratori avrebbero raccontato di aver
tagliato le rilegature, scansionato le pagine e gettato i resti.
La società non ha però confermato pubblicamente che i
file siano destinati all’addestramento dei suoi modelli, né ha chiarito quanti
libri siano coinvolti o quale criterio usi per selezionare i volumi. Amazon ha risposto che “acquista libri tramite i canali commerciali per
contribuire allo sviluppo e al miglioramento dei prodotti e dei servizi
utilizzati dai nostri clienti”.
Questo è uno dei punti comuni. Le aziende spesso non
negano l’acquisto dei libri, ma evitano di confermare pubblicamente il processo
completo: acquisto, scansione, uso nei dataset, distruzione e conservazione
delle versioni digitali ricavate. Segnalazioni di pratiche simili arrivano anche
da Regno Unito, Irlanda e altri Paesi europei.
Il filo che lega questi episodi è più interessante
della singola notizia e conduce in una direzione molto chiara: la guerra senza
quartiere in corso tra i colossi dell’intelligenza artificiale per ottenere la
supremazia sviluppando nuovi modelli di frontiera sempre più potenti.
Per anni la battaglia sui dati con cui si addestrano i
modelli linguistici ha riguardato soprattutto le persone: foto, conversazioni e
tutte le altre tracce digitali lasciate in rete. Oggi quel fronte si è spostato
sulla pagina stampata, perché i grandi archivi del web cominciano a scarseggiare e i libri restano un giacimento ancora relativamente
poco sfruttato.
Anthropic, per esempio, ha sostenuto che Claude viene addestrato su una combinazione di dati
disponibili pubblicamente sul web, dataset acquistati commercialmente e dati
prodotti dall’azienda. Ha anche dichiarato che acquistare libri è una pratica
ampiamente utilizzata nel settore dell’AI, e che nessuno dei suoi programmi di
acquisizione dati compra e distrugge “libri rari o antiquari”.
Questa dichiarazione è importante, ma va letta con
precisione. Non equivale a dire che Anthropic non abbia mai usato la cosiddetta
“scansione distruttiva”. Gli atti giudiziari del caso Bartz v. Anthropic
descrivono invece un programma chiamato Project Panama, nel quale copie cartacee venivano acquistate,
private della rilegatura, scansionate e poi scartate. La dichiarazione
aziendale insiste sulla categoria “rari o antiquari”, lasciando aperta la
questione di libri fuori catalogo, specialistici o difficili da reperire, ma
non formalmente classificati come antiquari.
Gli atti e le cause americane indicano che il problema
riguarda più aziende, non soltanto Anthropic. Meta avrebbe definito l’accesso a grandi quantità di dati librari “essenziale per
restare competitiva”. OpenAI è stata accusata di aver usato libri protetti da
diritto d’autore, e avrebbe riconosciuto di aver scaricato materiale da
piattaforme pirata come Library Genesis (LibGen) e Z-Library (spesso menzionate
insieme ad altre “shadow libraries” come Sci-Hub e Bibliotik), sostenendo di
averlo cancellato prima del lancio di ChatGPT. Questi elementi non provano però
che tutte le aziende citate abbiano adottato lo stesso sistema di acquisto,
taglio e distruzione fisica dei libri.
La distinzione è fondamentale: ci sono prove di una
corsa generale ai libri, ma non esiste ancora una prova pubblica uniforme che
ogni grande azienda abbia un “Project Panama” identico.
Materia prima pregiata
C’è un motivo se l’industria editoriale è entrata nel
mirino dei colossi dell’AI, e riguarda la qualità del lavoro umano
specializzato. In generale, un romanzo curato da un editor, un saggio storico,
un manuale specialistico offrono una scrittura di qualità superiore a gran
parte di quanto circola online, caratterizzata da testi e strutture coerenti e
corretti, frutto di anni di lavoro redazionale. A finire nella lista dei
desideri delle aziende sono soprattutto testi scritti prima che l’intelligenza
artificiale generativa cominciasse a riempire il web di contenuti sintetici,
quindi genuinamente umani.
Per un modello linguistico questa è la materia prima
più pregiata che esista perché evita del tutto il rischio del “collasso del modello” (model collapse), che si verifica invece
quando l’addestramento avviene con contenuti generati da un’altra AI (o da
versioni precedenti di se stessa). Questa forma di endogamia digitale (non a
caso chiamata anche, con una certa ironia, Habsburg AI,
l'”AI degli Asburgo”, dinastia nota per la sua endogamia) è un processo di
addestramento paragonabile a una fotocopia di una fotocopia: a ogni passaggio
il modello addestrato perde sfumature, dettagli rari e aderenza alla realtà,
accumulando errori e appiattendo le risposte.
La soluzione al “problema Asburgo” dell’AI è trovare
“materiale umano” fresco, meglio se verificato, com’è il caso dell’industria
editoriale pre-ChatGPT. E di questo materiale ne serve tanto.
I numeri danno l’idea della scala. Secondo Epoch AI, l’insieme del testo umano di qualità disponibile
online è un numero attorno ai trecentomila miliardi di token, con un
esaurimento previsto tra il 2026 e il 2032. Nello stesso periodo si è formato
un mercato delle licenze per dataset che vale già alcuni miliardi di dollari
l’anno. Anthropic, per esempio, nel 2026 ha pagato un miliardo e mezzo di
dollari per chiudere una causa legata a circa cinquecentomila libri scaricati
da archivi pirata.
Qui entra in gioco il diritto d’autore. Chi compra una
copia di un libro può rivenderla, prestarla o anche distruggerla senza chiedere
permesso a nessuno. È il principio che rende possibili le biblioteche e le
bancarelle dell’usato. Possedere il volume, però, non significa avere anche il
diritto di riprodurne liberamente il contenuto, per esempio digitalizzandolo
integralmente.
Sul versante opposto, va anche segnalato che la
distruzione dei libri è tutt’altro che un’anomalia: gli editori mandano da
sempre al macero le copie non vendute, restituite dai librai come parte del
“reso”, cioè dell’invenduto. Che è però un modo per chiudere una perdita
logistica, non per estrarne valore.
Lo scandalo del macero industriale
Quindi, la distruzione delle copie in sovrappiù c’è
sempre stata. Allora perché la vicenda dei libri usati comprati dai produttori
e poi distrutti diventa scandalosa? Il macero tradizionale elimina copie che
nessuno vuole più leggere. Le aziende di AI, invece, comprano deliberatamente
libri che sono sul mercato, che hanno ancora un valore informativo, ne assorbono
il contenuto e poi ne distruggono il supporto fisico, spesso senza che autori
ed editori vedano un euro. Se il volume era un’edizione rara, quel testo esce
per sempre dal mondo condiviso della lettura, ogni libro sparisce davvero solo
quando smettiamo di parlarne e di sfogliarlo.
Tuttavia, alcuni commentatori tecnologici e di
orientamento libertario sostengono che la scansione distruttiva venga
presentata in modo troppo apocalittico. Per esempio, Jack Nicastro, in un
commento ripreso dall’Information Technology and Innovation Foundation, argomenta che il procedimento può convertire rapidamente libri
fisici in testo ricercabile, aiutare a rispettare il copyright e ampliare
l’accesso alla conoscenza. Secondo questa lettura, il problema principale
sarebbe la trasparenza e non la distruzione materiale in sé.
La posizione della Commissione Europea è invece
opposta: lo scorso 16 settembre la Commissione ha dichiarato che la digitalizzazione di un libro fisico protetto è
un atto di riproduzione e che le eccezioni non coprono, nella sua
interpretazione, la digitalizzazione di opere originariamente fisiche.
Inoltre, l’European Writers Council ha condannato la scansione distruttiva di milioni di libri,
sostenendo che non si tratta soltanto di copyright, ma di rispetto per il
lavoro creativo e per il patrimonio culturale. Questa posizione considera il
libro non un semplice contenitore di token: un volume può avere valore come
oggetto, come esemplare raro, come testimonianza di una biblioteca, come testo
annotato o come unica copia ancora reperibile. Il PDF può salvare le parole, ma
non conserva integralmente la storia materiale del libro.
È difficile capire quale possa essere il punto di
vista corretto, soprattutto se l’obiettivo è di preservare la cultura di cui i
libri sono simbolo oltre che contenitori. Un’altra analisi pubblicata da Stanford difende la scansione distruttiva in linea di
principio: anche biblioteche e archivi possono smontare copie duplicate per
preservare il contenuto e renderlo studiabile. La condizione, però, è che la
procedura sia usata correttamente, su copie adeguate e dentro una politica di
conservazione responsabile.
Da un lato, digitalizzare una copia duplicata e
depositare il file in un archivio controllato può avere un valore conservativo.
Dall’altro, è facilmente dimostrabile che comprare indiscriminatamente migliaia
di libri fuori catalogo, tagliarli in modo irreversibile, non rendere pubblico
l’elenco dei titoli e usare il risultato per addestrare prodotti commerciali è
invece molto più problematico.
Europa e Stati Uniti: stessi libri, leggi diverse
Quello che Anthropic e le altre aziende stanno facendo
nasce, come detto, dal bisogno di dati freschi e dagli spazi lasciati dal
diritto vigente, soprattutto negli Stati Uniti: la legge per ora permette più
di quanto il senso comune sia disposto a concedere. Negli Stati Uniti il
giudice che ha istruito il caso Anthropic ha separato con cura i libri
scaricati da biblioteche pirata dai libri comprati legalmente e poi
scansionati. Ha ritenuto legittimo l’uso dei testi per addestrare i modelli e
la digitalizzazione delle copie acquistate, mentre ha escluso che il fair
use potesse giustificare l’acquisizione e la conservazione di libri
ottenuti da archivi pirata. Si tratta di una sentenza di merito legata a quella
singola fattispecie, ma è stata interpretata come un lasciapassare
generale.
Chi si oppone a questa interpretazione, autori ed
editori inclusi, nota però che il proprietario di una copia comprata legalmente
può altrettanto legalmente rivenderla o distruggerla, ma questo non gli concede
automaticamente il diritto di riprodurne il contenuto su scala industriale.
In Europa il quadro è più prudente e non ricalca
quello americano. Le eccezioni per l’estrazione di testi e dati previste dalla
normativa comunitaria permettono in alcuni casi di analizzare opere a cui si
abbia accesso lecito, ma gli autori possono riservarsi esplicitamente i diritti
per gli usi commerciali. Per questo le segnalazioni arrivate da librerie del
Regno Unito, dell’Irlanda e di almeno sette Paesi del continente (non risulta
ad oggi che l’Italia sia tra questi) mostrano che il fenomeno non è confinato
agli Stati Uniti. La conclusione di un tribunale californiano non si
trasferisce da sola nel diritto europeo: davanti a un giudice del Vecchio
continente il risultato con tutta probabilità sarebbe molto diverso.
Anthropic, peraltro, non è sola in questa corsa. Ci
sono Meta e OpenAI, probabilmente anche Amazon. Le aziende hanno fornito
dichiarazioni parziali: confermano acquisti commerciali o descrivono in modo
generale le fonti dei dati, ma raramente pubblicano liste complete dei libri,
procedure di conservazione, criteri per escludere opere rare e informazioni
verificabili sul percorso dei file. Nessuno di questi elementi dimostra infatti
che tutte le aziende seguano lo stesso protocollo di acquisto, taglio e
distruzione fisica, ma conferma che la caccia ai libri è un fenomeno parte di
un mercato ormai strutturato, non un’anomalia isolata.
Resta, sullo sfondo, un deficit di trasparenza che
accomuna quasi tutti i protagonisti della vicenda. In Giappone l’associazione
degli editori ha chiesto chiarimenti al grande distributore Nippan, il cui nome
compare negli atti del contenzioso americano, senza ottenere finora risposte
sulle singole transazioni.
Librai e artisti contro l’AI
Questa storia si inserisce in una vicenda più ampia
che da alcuni decenni vede contrapposta l’industria culturale alle
multinazionali tecnologiche. Dalle guerre a Napster alla fine degli anni Novanta fino agli scontri di
oggi fra artisti e colossi dello streaming, tutto ruota intorno alla
ridistribuzione dei profitti: artisti pagati pochi centesimi per ascolti che
generano fatturati miliardari.
È la stessa guerra che ha mandato in sciopero per 148 giorni gli sceneggiatori di Hollywood, preoccupati che l’AI
potesse scrivere al posto loro togliendo lavoro futuro (alla fine hanno
ottenuto la garanzia che nessun testo generato da un modello potesse valere
come materiale letterario), ma finora nessuno si era posto il problema, enorme,
della sostituzione anche fisica del libro in quanto strumento più antico e
potente per la trasmissione della cultura delle nostre società.
Adesso, il libro, oggetto apparentemente innocuo su
uno scaffale, è diventato il terreno di uno “scontro finale” tra chi crea e chi
addestra. Tuttavia, le storie che circolano online secondo le quali i grandi
dell’intelligenza artificiale “stanno distruggendo tutti i libri del mondo”,
“ogni volume giapponese finisce in Anthropic”, “tutte le aziende bruciano opere
uniche” vanno ridimensionate.
Il fenomeno non è una leggenda nata sui social. La
vera novità però è che la trasformazione del libro in materia prima industriale
per l’AI sta diventando abbastanza vasta da produrre effetti visibili nei
mercati dell’usato, nei rapporti fra editori e distributori e nel dibattito
sulla conservazione culturale.
Nessun commento:
Posta un commento