AI

AI-bedrijven kopen massaal oude papieren boeken

22 juli 2026 06:38 ⏱ 4 minuten leestijd Bron: news.slashdot.org
oude boeken AI-bedrijven kopen massaal oude papieren boeken

AI-bedrijven kopen massaal oude, papieren boeken op. Ze zoeken naar betrouwbare data om hun taalmodellen te trainen. Het bedrijf ISBNdb speelt hierbij een belangrijke rol. Dit bedrijf noemt zichzelf de grootste boekendatabase ter wereld. Op de eigen website stelt ISBNdb dat ‘de beste AI-trainingsdata ter wereld’ gewoon op de plank ligt. Het gaat specifiek om boeken die zijn gedrukt vóór 2022. Die boeken bevatten gegarandeerd geen tekst die door kunstmatige intelligentie is geschreven. Dat maakt ze uniek in een tijd waarin het internet overspoeld wordt met AI-gegenereerde teksten. ISBNdb biedt AI-bedrijven een dienst aan om deze boeken op grote schaal aan te schaffen. Het rapport is opgepikt door 404 Media, een onafhankelijk technologiemedium. Zij ontdekten hoe ISBNdb zich specifiek richt op grote techbedrijven die op zoek zijn naar schone data.

Volgens ISBNdb bieden boeken unieke voordelen ten opzichte van webteksten. De website omschrijft boeken als gecureerde, vakspecifieke menselijke kennis. Deze kennis is gestructureerd op een manier die geen enkele webcrawl kan evenaren. Boeken zijn dicht, geredigeerd en gezaghebbend, aldus het bedrijf. Dat maakt ze bijzonder geschikt om AI-modellen mee te trainen. Normale webdata is vaak rommelig en bevat veel ruis. Boeken zijn daarentegen al door redacteuren en uitgevers gecontroleerd. Daardoor is de kwaliteit van de tekst doorgaans veel hoger. Voor AI-bedrijven is dit een aantrekkelijke eigenschap. Zij willen modellen bouwen die feitelijk correcte antwoorden geven. Trainingsdata van lage kwaliteit leidt vaak tot zwakkere modellen. Daarom grijpen bedrijven steeds vaker terug naar oudere, analoge bronnen.

Het probleem waar ISBNdb op inspeelt heet ‘model collapse’. Dit fenomeen ontstaat wanneer AI-modellen worden getraind op AI-data. Zulke modellen worden daardoor steeds minder betrouwbaar. Ze maken meer fouten en verliezen aan nauwkeurigheid. Het internet raakt in hoog tempo gevuld met door AI geschreven inhoud. Deze vorm van inhoud wordt vaak ‘AI slop’ genoemd. Voor AI-bedrijven wordt het steeds moeilijker schone data te vinden. Iedere nieuwe scrape van het web bevat meer AI-gegenereerde tekst. Dit vormt een serieus risico voor toekomstige modellen. Boeken van vóór de opkomst van grote taalmodellen ontsnappen hieraan volledig. Ze zijn geschreven in wat ISBNdb de ‘pre-LLM-periode’ noemt. Daarom worden ze gezien als een schone, betrouwbare bron.

Er speelt nog een andere ontwikkeling mee. Sommige schrijvers verzetten zich tegen gebruik van hun werk voor AI-training. Zij kunnen tegenwoordig teksten schrijven die AI-modellen bewust saboteren. Deze vorm van digitaal verzet heet ook wel ‘poisoning’. Zulke teksten zijn ontworpen om modellen te manipuleren. Volgens ISBNdb zijn fysieke boeken van vóór 2022 hiertegen beschermd. Deze boeken zijn simpelweg geschreven voordat deze techniek bestond. Daardoor kunnen ze onmogelijk besmet zijn met sabotagepogingen. Dit maakt oude, gedrukte boeken extra waardevol voor bedrijven. Zij zoeken naar veilige en ongerepte trainingsdata. Het is een opvallend neveneffect van de opkomst van AI.

Deze ontwikkeling heeft ook gevolgen voor de tweedehands boekenmarkt. Antiquariaten en boekenveilingen kunnen ineens veel gevraagder worden. Grote hoeveelheden oude boeken vertegenwoordigen nu commerciële waarde. Dit was tien jaar geleden ondenkbaar voor de meeste boekhandelaren. Sommige uitgevers vragen zich af of zij hiervan kunnen profiteren. Auteurs ontvangen doorgaans geen extra vergoeding als hun boek wordt gescand. Dat kan in de toekomst leiden tot discussies over compensatie. Bibliotheken bewaren enorme collecties boeken uit de periode vóór 2022. Zulke collecties kunnen in theorie ook interessant zijn voor AI-bedrijven. Het is nog onduidelijk of instellingen hiervoor toestemming zouden geven. De opkomst van deze diensten zet een nieuwe markt in beweging.

ISBNdb benadrukt daarnaast de discretie van haar dienstverlening. Elk project begint met een juridisch bindende geheimhoudingsverklaring. Op de website staat dat klanten anoniem blijven. Ook de strategie en zoekdoelen van klanten blijven geheim. AI-bedrijven willen kennelijk niet bekend staan als grote boekenkopers. Volgens ISBNdb speelt hierbij ook een ‘optics problem’ mee. Het scannen van boeken gaat soms gepaard met vernietiging van originelen. Een kop als ‘AI-bedrijf vernietigt twee miljoen boeken’ wekt weinig sympathie op. Daarom houden bedrijven hun betrokkenheid het liefst verborgen. Deze aanpak roept vragen op over transparantie in de sector. Auteursrechten en dataherkomst liggen al langer onder een vergrootglas. Verschillende rechtszaken tegen AI-bedrijven gaan al over vergelijkbare kwesties.

Het verhaal laat zien hoe de jacht op trainingsdata verandert. AI-bedrijven zoeken niet langer alleen op het open internet. Ze kijken ook naar fysieke bronnen zoals bibliotheken en boekenwinkels. Oude boeken worden zo onverwacht waardevol in het AI-tijdperk. Tegelijk roept de geheimzinnigheid van deze handel vragen op. Het is onduidelijk welke bedrijven precies gebruikmaken van ISBNdb. Wel is duidelijk dat de vraag naar schone data blijft groeien. Zolang model collapse een risico blijft, blijven bedrijven op zoek naar ongerepte bronnen zoals boeken van vóór het AI-tijdperk.

Meer over AI