Microsoft ammette: lo scraping AI è il più grande furto di lavoro della storia
Contesto della causa
Il New York Times ha intentato una azione legale contro Microsoft e OpenAI sostenendo che le due aziende hanno utilizzato illegalmente contenuti protetti da copyright per addestrare i loro modelli di intelligenza artificiale generativa. Il caso, iniziato nel 2023, è stato alimentato da una serie di documenti interni che, fino al 17 settembre 2026, erano rimasti segreti.
Le ammissioni interne di Microsoft
Brent Hecht, direttore di Applied Science di Microsoft, ha scritto in un memo interno di gennaio 2023 che la pratica di “raschiare” il web per alimentare i modelli di linguaggio era “il più grande furto di lavoro della storia umana”. Il documento è stato pubblicato tra i filing giudiziari della causa e, una volta desecretato, ha confermato le preoccupazioni degli editori.
Dimensioni dei dataset coinvolti
Le cifre emergenti dai filing sono impressionanti e mostrano l’estensione del problema:
- OpenAI ha incluso nei propri dataset di mid‑training oltre 91 692 copie di articoli pubblicati dal New York Times, dal Daily News e dal Center for Investigative Reporting.
- Un dataset derivato da Common Crawl conteneva più di 2 milioni di documenti provenienti esclusivamente dal dominio nytimes.com.
- Gli articoli erano presenti nella loro interezza, copiati senza licenza né compenso per gli editori.
Impatto di Microsoft Copilot sull’editoria
Una presentazione interna di Microsoft del gennaio 2024, anch’essa firmata da Hecht, descriveva l’effetto di Microsoft Copilot sui siti di notizie come un “doom loop”. Il calo del traffico di referral verso le testate riduceva la disponibilità di dati sul web, indebolendo a sua volta le performance dei modelli AI. I dati mostrano che Copilot ha diminuito il tasso di click‑through verso il dominio del New York Times del 93 % rispetto alla ricerca tradizionale su Bing.
Dichiarazioni dei vertici aziendali
Il CEO Satya Nadella, in una deposizione, ha affermato che qualsiasi contenuto dietro paywall dovrebbe essere licenziato da chiunque voglia usarlo per addestrare modelli AI. Questa osservazione è ora usata dagli avvocati del Times per dimostrare la consapevolezza dell’azienda riguardo al problema.
Greg Brockman, cofondatore di OpenAI, è citato nei documenti per aver riconosciuto che i prodotti di intelligenza artificiale generativa sono “largamente sostitutivi” rispetto alle fonti originali e che questa tendenza si accentuerà con il miglioramento dei modelli.
La difesa basata sul fair use
Il nucleo della difesa di Microsoft e OpenAI è il principio americano del fair use, che permette usi non autorizzati di materiale protetto in certe circostanze, tra cui la trasformazione del contenuto originale. Tuttavia, le ammissioni interne di Hecht, che definiva il fair use una “presa in giro”, rischiano di smontare questa argomentazione.
Nel 2025, un giudice federale ha già deciso di consentire al caso di procedere nel merito, fissando una decisione sulla possibile ammissione al processo entro il 2027.
Possibili ripercussioni future
Le rivelazioni non si limitano a una singola disputa legale: rappresentano la prima volta che i vertici dell’industria AI mettono per iscritto una valutazione netta sulla natura delle proprie pratiche di raccolta dati. Se i giudici dovessero accettare queste testimonianze, si creerebbe un precedente difficile da aggirare per tutte le aziende che hanno addestrato modelli su testi raccolti dal web senza licenza.
Un eventuale verdetto sfavorevole potrebbe spingere le aziende a rinegoziare accordi di licenza con editori, a sviluppare dataset più trasparenti e a investire in meccanismi di compensazione per i creatori di contenuti. Inoltre, l’industria potrebbe vedere un cambiamento nella progettazione di prodotti AI, con maggiore attenzione alla sostenibilità economica dei fornitori di contenuti.
Conclusioni
Le evidenze emerse dal caso del New York Times hanno messo in luce la contraddizione tra l’enorme potenziale dell’intelligenza artificiale generativa e la vulnerabilità delle economie editoriali tradizionali. La definizione di Brent Hecht, descritta come “il più grande furto di lavoro della storia umana”, sintetizza la tensione tra innovazione tecnologica e diritti dei creatori. La prossima decisione giudiziaria, attesa entro il 2027, potrebbe ridefinire il modo in cui le aziende tecnologiche accedono e utilizzano i contenuti protetti da copyright, segnando una svolta cruciale per l’intero ecosistema digitale.