Home

Google koopt gegevens van failliete luchtvaartmaatschappij om datahonger te stillen

De behoefte van techbedrijven aan teksten om AI-systemen te trainen is gigantisch. Uit alle hoeken leggen ze hun hand op data, van oude boeken tot e-mails van failliete bedrijven.

is techredacteur van de Volkskrant, gespecialiseerd in de impact van kunstmatige intelligentie op de maatschappij.

Google heeft voor tien miljoen dollar een deel van de inboedel van de failliete Amerikaanse budgetmaatschappij Spirit Airlines gekocht. Het gaat om zo’n 100 miljoen e-mails en 500 miljoen gesprekken op het platform Microsoft Teams.

Het is Google te doen om ‘het verbeteren van onze producten en AI-modellen’, zo verklaart een woordvoerder tegenover nieuwssite Axios. Net als concurrenten als OpenAI of Anthropic heeft Google een aanhoudende behoefte aan verse teksten om zijn AI-modellen te trainen. In hun streven naar steeds krachtiger en betere AI-systemen te maken zijn onvoorstelbare hoeveelheden trainingsmateriaal nodig.

Dat moeten teksten zijn die door mensen zijn geschreven, omdat het trainen op synthetische schrijfsels na elke nieuwe trainingsronde mindere resultaten geeft. Dit verschijnsel staat bekend onder de term ‘model collapse’.

Nu het internet steeds voller begint te raken met AI-slop, lopen de makers van de AI-modellen tegen het probleem aan dat ze niet zomaar fora of willekeurige websites kunnen leegtrekken voor het trainen, omdat ze daarmee vervuilde data binnenhengelen. Bestanden van voor 2022 (toen ChatGPT op de markt kwam) zijn daarom in trek.

Hetzelfde geldt voor boeken van voor die datum. Inmiddels bestaat er een levendige handel in tweedehands exemplaren. Techbedrijven trekken de boeken uit elkaar en scannen ze daarna pagina voor pagina in. Eenmaal gedigitaliseerd wachten de exemplaren een treurig einde: de papiervernietiger.

‘Boeken die oorlogen, branden en eeuwenlang gebruik hebben overleefd, worden versnipperd zodat een AI kan leren om betere marketingmails te schrijven’, constateerde de Britse auteur Sunny Singh cynisch op X.

“Books that survived wars, fires, and centuries of handling are being shredded so an AI can learn to write a better marketing email.” https://t.co/D46nSriAsZ

Boeken in bulk

De praktijk begon in ieder geval al in 2024. Het bekendste voorbeeld is Anthropic, dat miljoenen tweedehandsboeken aankocht. In de Verenigde Staten geldt dit als juridisch veilig: het gebruik van een bestaande online database met boeken is niet toegestaan, maar het trainen met aangekochte boeken wel.

Anthropic staat niet alleen; ook een bedrijf als ISBNdb helpt de AI-wereld met het aankopen in bulk van boeken, tot zelfs een miljoen exemplaren in één keer. Daar kunnen ook zeldzame boeken tussen zitten, zo blijkt deze week uit onderzoek van 404 Media.

Ook antiquariaten in Nederland merken de belangstelling. Zo kreeg de haarlemse boekhandelaar Pieter de Vries recent vanuit het buitenland een ongebruikelijke bestelling van 3000 Engelstalige boeken, netjes op ISBN-nummer gegroepeerd.

Vrolijk wordt hij er niet van, vertelt hij tegenover de Britse krant The Telegraph: ‘Het is een soort barbarij… zoals boekverbranding.’

Alles over tech vindt u hier.

Lees ook

Geselecteerd door de redactie

Lees hier alle artikelen over dit thema

Source: Volkskrant

Previous

Next