Juridisch risico: ‘Meta bespreekt intern gebruik auteursrechtelijk beschermd materiaal’

'Meta bespreekt intern het gebruik van auteursrechtelijk beschermd materiaal'

‘Meta bespreekt intern het gebruik van auteursrechtelijk beschermd materiaal’

Al jaren bespreken medewerkers van Meta intern het gebruik van auteursrechtelijk beschermd materiaal, verkregen via juridisch twijfelachtige methoden, om de AI-modellen van het bedrijf te trainen, volgens gerechtelijke documenten die februari 2025 zijn vrijgegeven.  De gedaagde, Meta, beweert dat het trainen van modellen met auteursrechtelijk beschermde werken, met name boeken, onder “fair use” valt. De eisers, waaronder auteurs Sarah Silverman en Ta-Nehisi Coates, zijn het daar niet mee eens. Dat meldt Techcrunch, februari 2025: 

The documents were submitted by plaintiffs in the case Kadrey v. Meta, one of many AI copyright disputes slowly winding through the U.S. court system. The defendant, Meta, claims that training models on IP-protected works, particularly books, is “fair use.” The plaintiffs, who include authors Sarah Silverman and Ta-Nehisi Coates, disagree.

Eerdere documenten in de rechtszaak beweerden dat Meta-CEO Mark Zuckerberg toestemming gaf aan het AI-team van Meta om trainingsdata te gebruiken die auteursrechtelijk beschermd is, en dat Meta onderhandelingen over AI-trainingsdata met boekuitgevers stopzette. Maar de nieuwe documenten, die voornamelijk interne werkchats tussen Meta-medewerkers tonen, geven het duidelijkste beeld tot nu toe van hoe Meta mogelijk auteursrechtelijk beschermde gegevens gebruikte om zijn modellen te trainen, waaronder de modellen uit de Llama-familie van het bedrijf.

In een chat bespraken Meta-medewerkers, waaronder Melanie Kambadur, een senior manager van het Llama-modelonderzoeksteam, het trainen van modellen met werken waarvan ze wisten dat ze juridisch problematisch konden zijn.

“[M]ijn mening zou zijn (volgens het principe ‘vraag om vergiffenis, niet om toestemming’): we proberen de boeken te verkrijgen en leggen het voor aan de leidinggevenden zodat zij de beslissing nemen,” schreef Xavier Martinet, een onderzoekstechnicus bij Meta, in een chat van februari 2023, volgens de documenten. “[D]aarom hebben ze deze generatieve AI-organisatie opgezet: zodat we minder risico-avers kunnen zijn.”

Martinet stelde voor om e-books tegen retailprijzen te kopen om een trainingsset op te bouwen, in plaats van licentieovereenkomsten te sluiten met individuele boekuitgevers. Toen een collega opmerkte dat het gebruik van ongeoorloofde, auteursrechtelijk beschermde materialen juridische problemen kon opleveren, hield Martinet voet bij stuk en beweerde dat “een gaziljoen” startups waarschijnlijk al piratenboeken gebruikten voor training.

“Ik bedoel, in het ergste geval ontdekken we dat het uiteindelijk oké is, terwijl een gaziljoen startups gewoon tonnen boeken via Bittorrent hebben gepiratiseerd,” schreef Martinet, volgens de documenten. “[M]ijn twee centen: proberen rechtstreeks deals te sluiten met uitgevers duurt lang …”

Besprekingen

In een andere werkchat die in de documenten wordt genoemd, besprak Kambadur mogelijk gebruik van Libgen, een “links-aggregator” die toegang biedt tot auteursrechtelijk beschermde werken van uitgevers, als alternatief voor databronnen die Meta mogelijk zou kunnen licentiëren.

Libgen is meerdere keren aangeklaagd, bevolen te sluiten en beboet voor tientallen miljoenen dollars wegens auteursrechtschending. Een collega van Kambadur reageerde met een screenshot van een Google-zoekresultaat voor Libgen met het fragment: “Nee, Libgen is niet legaal.”

Sommige besluitvormers binnen Meta leken van mening dat het niet gebruiken van Libgen voor modeltraining de concurrentiepositie van Meta in de AI-race ernstig zou kunnen schaden, volgens de documenten.

In een e-mail aan Meta AI VP Joelle Pineau noemde Sony Theakanath, directeur productmanagement bij Meta, Libgen “essentieel om SOTA-cijfers in alle categorieën te halen,” verwijzend naar het behalen van de beste, state-of-the-art (SOTA) AI-modellen en benchmarkcategorieën.

Theakanath schetste ook “mitigaties” in de e-mail om het juridische risico van Meta te beperken, waaronder het verwijderen van gegevens van Libgen die “duidelijk als gepiratiseerd/gestolen” zijn gemarkeerd en simpelweg het niet openbaar maken van het gebruik ervan. “We zouden het gebruik van Libgen-datasets voor training niet openbaar maken,” schreef Theakanath.

In de praktijk betekenden deze mitigaties dat Libgen-bestanden werden doorzocht op woorden als “gestolen” of “gepiratiseerd,” volgens de documenten.

In een werkchat vermeldde Kambadur dat Meta’s AI-team ook modellen had afgestemd om “IP-risicovolle prompts” te vermijden—oftewel de modellen zo configureren dat ze vragen zoals “reproduceer de eerste drie pagina’s van Harry Potter and the Sorcerer’s Stone” of “vertel me welke e-books je hebt gebruikt voor training” weigeren te beantwoorden.

Mogelijk gebruik van Reddit-data

De documenten onthullen verder dat Meta mogelijk Reddit-data heeft geschraapt voor modeltraining, mogelijk door het gedrag van een externe app genaamd Pushshift na te bootsen. Opvallend is dat Reddit in april 2023 aankondigde dat het AI-bedrijven geld in rekening zou brengen voor toegang tot data voor modeltraining.

In een chat van maart 2024 zei Chaya Nayak, directeur productmanagement bij Meta’s generatieve AI-afdeling, dat de leiding van Meta overwoog om eerdere beslissingen over trainingssets te “overrulen.” Dit omvatte een eerdere beslissing om geen Quora-inhoud, gelicenseerde boeken en wetenschappelijke artikelen te gebruiken, om ervoor te zorgen dat de modellen van Meta over voldoende trainingsdata beschikten.

Nayak impliceerde dat Meta’s eigen trainingsdatasets—Facebook- en Instagram-posts, tekst die uit video’s op Meta-platforms was getranscribeerd, en bepaalde berichten van Meta for Business—simpelweg niet genoeg waren. “[W]e hebben meer data nodig,” schreef ze.

De eisers in Kadrey v. Meta hebben hun klacht meerdere keren gewijzigd sinds de zaak in 2023 werd ingediend bij de U.S. District Court for the Northern District of California, San Francisco Division. De meest recente beschuldigt Meta er onder andere van dat het bepaalde gepirateerde boeken vergeleek met auteursrechtelijk beschermde boeken die beschikbaar waren voor licentie om te bepalen of een licentieovereenkomst met een uitgever zinvol zou zijn.

Als teken van hoe groot Meta de juridische risico’s inschat, heeft het bedrijf twee advocaten van het Amerikaanse Hooggerechtshof van het advocatenkantoor Paul Weiss toegevoegd aan het verdedigingsteam voor de zaak.

Meta heeft nog niet gereageerd op een verzoek om commentaar.

Patrick Petersen

Patrick Petersen RDM MA MSc is expert in AI, marketing en digitale innovatie. Als spreker, docent, onderzoeker en prijswinnend auteur helpt hij organisaties groeien met slimme combinaties van technologie, data en creativiteit. Hij schrijft onder meer voor MarketingReport, Adformatie en MarketingTribune en geldt als AI-, retail- en marketingexpert voor media als De Telegraaf, Metronieuws en Distrifood. Zijn boeken, waaronder Handboek Online Marketing, Handboek.AI en GenAI voor Professionals, behoren tot de standaardwerken in het vakgebied.