Meta onder vuur na onthulling trainen AI-chat met piratenbibliotheken

Meta onder vuur na onthulling trainen AI-chat met piratenbibliotheken

Meta onder vuur na onthulling trainen AI-chat met piratenbibliotheken

Begin 2025 gaf Meta toe een omstreden dataset te hebben gedownload via torrents. Het ging om LibGen, een online archief met tientallen miljoenen illegaal verspreide boeken. Lange tijd bleef onduidelijk hoe precies getorrent werd, maar sinds gisteren zijn voor het eerst ongecensureerde interne e-mails van Meta openbaar gemaakt. Die onthulden dat het bedrijf via de site Anna’s Archive “minstens 81,7 terabyte aan data heeft binnengehaald uit meerdere schaduw-bibliotheken, waaronder minstens 35,7 terabyte van Z-Library en LibGen”, volgens een verklaring van de eisende auteurs. Daarnaast zou Meta eerder al 80,6 terabyte van LibGen hebben gedownload. Zo meldt Arstechnica.com:

Emails discussing torrenting prove that Meta knew it was “illegal,” authors alleged. And Bashlykov’s warnings seemingly landed on deaf ears, with authors alleging that evidence showed Meta chose to instead hide its torrenting as best it could while downloading and seeding terabytes of data from multiple shadow libraries as recently as April 2024.

Bezorgdheid over verspreiding auteurswerken

Auteurs vroegen Meta om opheldering, vooral over het zogeheten “seeden” – het delen van bestanden via torrents – wat neerkomt op het actief verspreiden van auteursrechtelijk beschermd materiaal.

Meta weigerde mee te werken aan dat verzoek, nadat een rechter eerder de eis om inzage in de torrent- en seedgegevens afwees. Desondanks verzamelden de auteurs bewijs, waaronder interne berichten waarin medewerkers hun zorgen uitten.

In een e-mail uit april 2023 schreef Meta-ingenieur Nikolay Bashlykov: “Torrenten vanaf een zakelijke laptop voelt niet goed,” gevolgd door een glimlachende emoji. In hetzelfde bericht uitte hij zijn bezorgdheid over het gebruik van Meta’s IP-adressen om illegaal materiaal te downloaden via torrents.

Tegen september 2023 was de toon serieuzer geworden. Bashlykov schakelde de juridische afdeling in en wees erop dat torrentgebruik automatisch ook “seeden” betekent – oftewel het beschikbaar stellen van bestanden aan derden, wat juridisch risicovol is.

Meta zou seeding bewust verborgen hebben

Volgens de aanklacht probeerde Meta het seeden te verhullen door geen gebruik te maken van Facebook-servers. Dat zou het risico verkleinen dat iemand de herkomst van de downloads kon herleiden, aldus onderzoeker Frank Zhang. In berichten sprak hij over een “stealth mode”-aanpak. Ook zou Meta instellingen zo hebben aangepast dat er zo min mogelijk gezaaid werd, aldus projectmanager Michael Clark in een verklaring. Nu deze nieuwe informatie beschikbaar is, eisen de auteurs dat betrokken Meta-medewerkers opnieuw worden verhoord. Eerdere verklaringen zouden namelijk haaks staan op de nu openbaar gemaakte feiten.

Zo zou Mark Zuckerberg verklaard hebben niets te maken te hebben met het besluit om LibGen te gebruiken voor het trainen van AI-modellen. Maar interne berichten zouden laten zien dat het besluit na een escalatie naar Zuckerberg werd genomen.

Mark Zuckerberg, for example, claimed to have no involvement in decisions to use LibGen to train AI models. But unredacted messages show the “decision to use LibGen occurred” after “a prior escalation to MZ,” authors alleged.

Meta heeft nog niet gereageerd op verzoeken om commentaar. Het bedrijf houdt vol dat het gebruik van LibGen voor AI-training onder ‘fair use’ valt. In een eerder verzoek om de zaak te seponeren stelde Meta dat er geen bewijs is dat anderen via Meta toegang kregen tot auteurswerken via torrents.

Toch lijkt de onthulling Meta’s juridische positie te compliceren. Auteurs gebruiken de nieuwe informatie om hun centrale claim – dat Meta auteursrechten heeft geschonden door actief te verspreiden – kracht bij te zetten. Meta laat de seeding-beschuldiging voorlopig onbeantwoord en zegt de zaak later via een summary judgment te willen weerleggen.

Patrick Petersen

Patrick Petersen RDM MA MSc is expert in AI, marketing en digitale innovatie. Als spreker, docent, onderzoeker en prijswinnend auteur helpt hij organisaties groeien met slimme combinaties van technologie, data en creativiteit. Hij schrijft onder meer voor MarketingReport, Adformatie en MarketingTribune en geldt als AI-, retail- en marketingexpert voor media als De Telegraaf, Metronieuws en Distrifood. Zijn boeken, waaronder Handboek Online Marketing, Handboek.AI en GenAI voor Professionals, behoren tot de standaardwerken in het vakgebied.