Door _R0N_: Veel van de gebruikte bronnen hebben nooit op het web gestaan vanwege de auteursrechten. Boeken zijn betrouwbaarder dan de data op het internet, dus alle boeken zijn van belang.
Ik was ergens anders een bericht tegengekomen (ik dacht in het Engels) waarin werd gesteld dat het om boeken ging die ouder waren dan een aantal jaar. Het gaat ze erom dat de boeken geen door AI gegenereerde inhoud bevatten, volledig door mensen zijn geschreven.
Een probleem met hoe de huidige AI-bedrijven AI aanpakken is dat momenteel een flink deel van de nieuwe inhoud van het internet door LLM's wordt gegenereerd. Als je LLM's traint met wat door LLM's gegenereerd is krijg je slechtere resultaten dan wanneer ze het traint met tekst die door mensen is geschreven. Ik ben alweer een poos terug tegengekomen dat de nieuwere modellen, al zijn ze in bepaalde opzichten krachtiger dan hun voorgangers, ook aanzienlijk meer hallucineren dan hun voorgangers.
Bedenk dat een LLM een soort statistisch model is van de tekst waarmee die is "getraind". Als je een LLM gebruikt zal die steeds op basis van de hele voorgaande dialoog, dus wat jij hebt geschreven, wat die zelf heeft geschreven, en wat het systeem onzichtbaar nog aan instructies en aanwijzingen heeft toegevoegd, telkens opnieuw een plausibel woord of woorddeel erbij genereren, waarbij het plausibel is in termen van de vastgelegde statistieken. Er wordt niet alleen het allerwaarschijnlijkste volgende woord of woorddeel gekozen, een randomizer zorgt voor variatie. Er komt geen inhoudelijk begrip aan dat generatieproces te pas, dat is schijn, dat zat in de trainingsdata en niet in het produceren van nieuwe tekst.
Wat sowieso misgaat is dat zo'n statistisch proces ook tekst kan produceren die onzin is, de hallucinaties. Men probeert dat er weer uit te filteren, maar het is inherent aan de eigenlijke LLM dat dat gebeurt, en men houdt het niet volledig tegen. Dat betekent dat als men doorgaat met het internet als trainingsmateriaal men ook die onzin als trainingsdata gebruikt. De hoeveelheid onzin neemt toe, de kans is veel groter dat onzin uit een goede basis wordt geproduceerd dan dat per ongeluk iets dat klopt uit onzin wordt geproduceerd. De kwaliteit van de data die men van het internet kan plukken gaat dus achteruit, en de kwaliteit van wat LLM's kunnen produceren daarmee ook.
Een ander punt is dat, zelfs als LLM's niet zouden hallucineren, ze hooguit kennis die al in de trainingsdata zat in andere woorden opnieuw presenteren. Een LLM voegt geen nieuwe kennis toe. Dat betekent dat als de LLM's steeds meer tekst aan het internet toevoegen (via degenen die het daarvoor gebruiken) dezelfde kennis in een groeiende hoeveelheid tekst wordt weergegeven. De informatiedichtheid van het geheel aan teksten op het internet neemt daardoor af. Dat betekent dat volgende generaties van LLM's trainen met die groeiende hoeveelheid tekst op het internet navenant meer verwerking kost maar inhoudelijk niets nieuws toevoegt. De manier waarop LLM's dingen onder woorden brengen betekent dat ze hun eigen stijl gaan versterken (die weer mede door die filterprocessen bepaald wordt), en dat ze een soort echokamer van wat nu in de aandacht staat kunnen worden doordat daar de meeste teksten over gegenereerd worden. Dat soort vertekeningen leveren een verschraling op, en de hallucinaties betekenen zoals al gezegd dat het percentage fouten erin toeneemt.
Kennelijk heeft dat inmiddels het punt bereikt dat het inmiddels duurder is om dat er nog uit te zien te filteren dan om papieren boeken te gaan inkopen en scannen waar het gegarandeerd niet in zit. Dat ze boeken na scannen willen vernietigen vind ik zeer zorgwekkend. Er zullen dertien-in-het-dozijn-exemplaren tussen zitten waarvoor het niet uitmaakt, maar een zeldzame eerste uitgave van iets moois verdient het om behouden blijven. En het zou wat zijn als niet alleen elektriciteit schaars wordt en geheugenmodules schreeuwend duur, maar dat ook tweedehandsboeken schaars gaan worden omdat AI ook dat nu op gaat slokken. Als dit op dezelfde manier uit de hand gaat lopen kunnen we nog mee gaan maken dat die leuke boekenruilkastjes die mensen overal buiten hebben staan leeggeplunderd gaan worden.
Het nadeel is dat je alleen boeken mag gebruiken waarvan de auteur 70 jaar geleden is overleden (eigenlijk 71 jaar). Alle informatie is dus oud en in sommige gevallen verouderd en het taalgebruik is veranderd.
Als AI-bedrijven zich daar iets van aan zouden trekken hadden ze het hele internet niet kunnen scannen op de manier waarop ze dat wel gedaan hebben.
Qua auteursrecht is dit trouwens een nieuwe situatie. Die AI-systemen reproduceren (ongelukjes daargelaten) typisch niet letterlijk wat erin is gegaan, en er lopen er zat rond die stellen dat ze daarmee in wezen niets anders doen dan hoe een mens opgedane kennis gebruikt. Maar wat je tegelijk ook ziet is dat bijvoorbeeld met LLM's gegenereerde samenvattingen van nieuws of iets anders ertoe leiden dat mensen het origineel niet eens meer bekijken. Dan kan je denk ik wel van plagiaat spreken, maar dat wordt al ingewikkelder om te beargumenteren als meerdere bronnen tot een nieuwe tekst worden verwerkt. Maar ook als het er niet goed in te passen is raakt het wel degelijk aan waar auteursrecht eigenlijk toe dient: zorgen dat degene die als mens iets produceert daar zelf baat bij heeft, in plaats dat een ander met de eer strijkt of met de verdienste aan de haal gaat. En dat is precies wat er wel aan het gebeuren is met LLM's. Mogelijk schenden ze door de nieuwe mogelijkheden niet de bestaande auteurswetten die niet op die nieuwe mogelijkheden berekend zijn, ze parasiteren wel op precies het soort manier waarvoor die auteursrechten ooit in het leven zijn geroepen.
Over de vraag van de topicstarter welke Nederlandse boeken dan gebruikt zouden moeten worden: dat ligt er maar net aan waar je de LLM voor traint. Moet die vragen over en samenvattingen van literatuur kunnen produceren dan voed je er literatuur aan. Moet die de vaderlandse geschiedenis kunnen weergeven dan voed je er boeken over de vaderlandse geschiedenis aan. Je stopt er de kennis in die eruit gehaald moet kunnen worden.