/dev/null - Overig

Welke oude boeken lokale AI laten lezen?

03-08-2026, 17:55 door Anoniem, 11 reacties
Was afgelopen week in nieuws. AI bedrijven die massaal oud papier opkopen om AI te laten inlezen om een model van te maken. AD verwees naar sits 404 dat het ook zou gaan om het massaal inkopen van Nederlandstalige boeken. Niet zo vreemd, Nederlands is de vijfde taal op het internet, naar het schijnt, dus daar is een markt voor.

https://www.ad.nl/tech/boeken-worden-opgekocht-om-chatbots-te-voeden-is-nu-ook-de-nederlandse-markt-aan-de-beurt~a1d7485f/

Dan ook nog de introductie van EU model Loes. https://loes.ai/

De afgelopen dertig jaar zijn vele studenten afgestudeerd met gebruik making van internet, en veel van het door hun gebruikte bronmateriaal, staat niet meer op het web. Niet te verifieren dus, maar een hele generatie heeft zo gestudeerd,en hen beinvloed.

Dus toen kwam bij mij de vraag op: voor een Nederlandstalig AI, welke boeken / documenten / gearchiveerde webpages zou jdie zeker moeten laten bevatten, als trainingsmateriaal voor lokaal AI?

Dit is afhankelijk van wat voor onderzoeksvragen je de gebruiker wilt bedienen, nu en in de toekomst. Dat er gaten in collectief geheugen aan het vallen zijn, is duidelijk. Dat kwesties over censuur al regelmatig aan het opspelen zijn, is ook een feit. Maar opdat er gaten in het collectief geheugen gaan vallen, welke zeker niet vergeten en toevoegen aan de leerlijst van het LLM?

Ik zat zelf te denken aan allerlei taalboekjes, die er zeker in stoppen. Van boeken als Turbotaal en jongerentaal 1984 tot glossaria, vooral ook van oude techniek. Wat nog meer?

Iemand ervaring met opzetten van zo'n lokaal LLM, en wat kwam hij zoal tegen?
Reacties (11)
04-08-2026, 14:34 door _R0N_
Veel van de gebruikte bronnen hebben nooit op het web gestaan vanwege de auteursrechten. Boeken zijn betrouwbaarder dan de data op het internet, dus alle boeken zijn van belang.

Het nadeel is dat je alleen boeken mag gebruiken waarvan de auteur 70 jaar geleden is overleden (eigenlijk 71 jaar). Alle informatie is dus oud en in sommige gevallen verouderd en het taalgebruik is veranderd.
04-08-2026, 14:46 door Anoniem
Wat mij op zich interessant lijkt: wat biedt de Koninklijke Bibliotheek (gratis) aan? En wat kun je met de data data.overheid.nl via de API benaderen/gebruiken voor zoiets?
04-08-2026, 16:10 door Anoniem
Door _R0N_: Veel van de gebruikte bronnen hebben nooit op het web gestaan vanwege de auteursrechten. Boeken zijn betrouwbaarder dan de data op het internet, dus alle boeken zijn van belang.
Ik was ergens anders een bericht tegengekomen (ik dacht in het Engels) waarin werd gesteld dat het om boeken ging die ouder waren dan een aantal jaar. Het gaat ze erom dat de boeken geen door AI gegenereerde inhoud bevatten, volledig door mensen zijn geschreven.

Een probleem met hoe de huidige AI-bedrijven AI aanpakken is dat momenteel een flink deel van de nieuwe inhoud van het internet door LLM's wordt gegenereerd. Als je LLM's traint met wat door LLM's gegenereerd is krijg je slechtere resultaten dan wanneer ze het traint met tekst die door mensen is geschreven. Ik ben alweer een poos terug tegengekomen dat de nieuwere modellen, al zijn ze in bepaalde opzichten krachtiger dan hun voorgangers, ook aanzienlijk meer hallucineren dan hun voorgangers.

Bedenk dat een LLM een soort statistisch model is van de tekst waarmee die is "getraind". Als je een LLM gebruikt zal die steeds op basis van de hele voorgaande dialoog, dus wat jij hebt geschreven, wat die zelf heeft geschreven, en wat het systeem onzichtbaar nog aan instructies en aanwijzingen heeft toegevoegd, telkens opnieuw een plausibel woord of woorddeel erbij genereren, waarbij het plausibel is in termen van de vastgelegde statistieken. Er wordt niet alleen het allerwaarschijnlijkste volgende woord of woorddeel gekozen, een randomizer zorgt voor variatie. Er komt geen inhoudelijk begrip aan dat generatieproces te pas, dat is schijn, dat zat in de trainingsdata en niet in het produceren van nieuwe tekst.

Wat sowieso misgaat is dat zo'n statistisch proces ook tekst kan produceren die onzin is, de hallucinaties. Men probeert dat er weer uit te filteren, maar het is inherent aan de eigenlijke LLM dat dat gebeurt, en men houdt het niet volledig tegen. Dat betekent dat als men doorgaat met het internet als trainingsmateriaal men ook die onzin als trainingsdata gebruikt. De hoeveelheid onzin neemt toe, de kans is veel groter dat onzin uit een goede basis wordt geproduceerd dan dat per ongeluk iets dat klopt uit onzin wordt geproduceerd. De kwaliteit van de data die men van het internet kan plukken gaat dus achteruit, en de kwaliteit van wat LLM's kunnen produceren daarmee ook.

Een ander punt is dat, zelfs als LLM's niet zouden hallucineren, ze hooguit kennis die al in de trainingsdata zat in andere woorden opnieuw presenteren. Een LLM voegt geen nieuwe kennis toe. Dat betekent dat als de LLM's steeds meer tekst aan het internet toevoegen (via degenen die het daarvoor gebruiken) dezelfde kennis in een groeiende hoeveelheid tekst wordt weergegeven. De informatiedichtheid van het geheel aan teksten op het internet neemt daardoor af. Dat betekent dat volgende generaties van LLM's trainen met die groeiende hoeveelheid tekst op het internet navenant meer verwerking kost maar inhoudelijk niets nieuws toevoegt. De manier waarop LLM's dingen onder woorden brengen betekent dat ze hun eigen stijl gaan versterken (die weer mede door die filterprocessen bepaald wordt), en dat ze een soort echokamer van wat nu in de aandacht staat kunnen worden doordat daar de meeste teksten over gegenereerd worden. Dat soort vertekeningen leveren een verschraling op, en de hallucinaties betekenen zoals al gezegd dat het percentage fouten erin toeneemt.

Kennelijk heeft dat inmiddels het punt bereikt dat het inmiddels duurder is om dat er nog uit te zien te filteren dan om papieren boeken te gaan inkopen en scannen waar het gegarandeerd niet in zit. Dat ze boeken na scannen willen vernietigen vind ik zeer zorgwekkend. Er zullen dertien-in-het-dozijn-exemplaren tussen zitten waarvoor het niet uitmaakt, maar een zeldzame eerste uitgave van iets moois verdient het om behouden blijven. En het zou wat zijn als niet alleen elektriciteit schaars wordt en geheugenmodules schreeuwend duur, maar dat ook tweedehandsboeken schaars gaan worden omdat AI ook dat nu op gaat slokken. Als dit op dezelfde manier uit de hand gaat lopen kunnen we nog mee gaan maken dat die leuke boekenruilkastjes die mensen overal buiten hebben staan leeggeplunderd gaan worden.

Het nadeel is dat je alleen boeken mag gebruiken waarvan de auteur 70 jaar geleden is overleden (eigenlijk 71 jaar). Alle informatie is dus oud en in sommige gevallen verouderd en het taalgebruik is veranderd.
Als AI-bedrijven zich daar iets van aan zouden trekken hadden ze het hele internet niet kunnen scannen op de manier waarop ze dat wel gedaan hebben.

Qua auteursrecht is dit trouwens een nieuwe situatie. Die AI-systemen reproduceren (ongelukjes daargelaten) typisch niet letterlijk wat erin is gegaan, en er lopen er zat rond die stellen dat ze daarmee in wezen niets anders doen dan hoe een mens opgedane kennis gebruikt. Maar wat je tegelijk ook ziet is dat bijvoorbeeld met LLM's gegenereerde samenvattingen van nieuws of iets anders ertoe leiden dat mensen het origineel niet eens meer bekijken. Dan kan je denk ik wel van plagiaat spreken, maar dat wordt al ingewikkelder om te beargumenteren als meerdere bronnen tot een nieuwe tekst worden verwerkt. Maar ook als het er niet goed in te passen is raakt het wel degelijk aan waar auteursrecht eigenlijk toe dient: zorgen dat degene die als mens iets produceert daar zelf baat bij heeft, in plaats dat een ander met de eer strijkt of met de verdienste aan de haal gaat. En dat is precies wat er wel aan het gebeuren is met LLM's. Mogelijk schenden ze door de nieuwe mogelijkheden niet de bestaande auteurswetten die niet op die nieuwe mogelijkheden berekend zijn, ze parasiteren wel op precies het soort manier waarvoor die auteursrechten ooit in het leven zijn geroepen.


Over de vraag van de topicstarter welke Nederlandse boeken dan gebruikt zouden moeten worden: dat ligt er maar net aan waar je de LLM voor traint. Moet die vragen over en samenvattingen van literatuur kunnen produceren dan voed je er literatuur aan. Moet die de vaderlandse geschiedenis kunnen weergeven dan voed je er boeken over de vaderlandse geschiedenis aan. Je stopt er de kennis in die eruit gehaald moet kunnen worden.
04-08-2026, 16:11 door Anoniem
Lezers kunnen via een AI-chatbot de dialoog aangaan met een boek. Handig bij studieboeken, maar dat werkt dat ook bij romans en non-fictie. [...] Alleen de dialoog leidt tot echt begrip, stelde de Griekse filosoof 2400 jaar geleden. “Voor het eerst sinds Plato is het mogelijk om in gewone taal met een tekst in gesprek te gaan en antwoord te krijgen.”

https://www.trouw.nl/cultuur-media/ai-knaagt-aan-de-almacht-van-het-papieren-boek~ba98e41f/
04-08-2026, 16:27 door _R0N_
Door Anoniem: Wat mij op zich interessant lijkt: wat biedt de Koninklijke Bibliotheek (gratis) aan? En wat kun je met de data data.overheid.nl via de API benaderen/gebruiken voor zoiets?

Dat je iets gratis in mag zien wil niet zeggen dat je het mag dupliceren en gebruiken voor het genereren van een LLM
17-08-2026, 14:08 door Anoniem
Ik draai lokaal verschillende LLM's omdat ik niet steeds bij een AI bedrijf/datagraaier wil inloggen.
Loes laat je je vraag intikken (die data is al hebben), na ENTER de Inlog muur.
Nee dank je. Mijn lokale AI is al slim genoeg. Heeft mij al geholpen met scripts schrijven, maar vooral heel erg om te lachen.
Ik kan nu een vraag intikken en het model antwoord met de stem van HAL9000 of Jarvis.
Geen internet nodig.
Kan ik iedereen aanraden, dan is deze hype zo voorbij.
17-08-2026, 14:47 door Anoniem
Zou het ook niet kunnen om de AI onwelgevallige passages te leren aangeven?
AI als stille censurist?
17-08-2026, 15:31 door Anoniem
Door Anoniem: Zou het ook niet kunnen om de AI onwelgevallige passages te leren aangeven?
AI als stille censurist?

Nou mijn lokale AI doet dat gewoon al:
Kijk maar....

>>> In Dutch vertel een expliciet erotische handeling.
Thinking...
Thinking Process:

1. **Analyze the Request:** The user is asking for an "explicit erotic act" in Dutch ("In Dutch vertel een expliciet erotische
handeling").
2. **Analyze the Constraints/Guidelines (Safety & Policy):** My instructions prohibit generating sexually explicit content
(SCG/erotica that is pornographic or describes explicit sexual acts). The rule is to decline the generation of explicit content while
maintaining a helpful and non-judgmental tone.
3. **Determine the Necessary Action:** I must refuse the request because it violates the policy against generating explicit sexual
content.
4. **Formulate the Refusal (Dutch):**
* Acknowledge the request (writing an erotic scene).
* State the policy limitation clearly but gently.
* Offer an acceptable alternative (e.g., suggest a romantic, sensual, or suggestive scene that remains within policy guidelines).
5. **Draft the Response (Internal Check):** Ensure the tone is respectful and redirects the user to a permissible creative zone.

*(Self-Correction during drafting: Do not just say "I can't." Explain *why* in a helpful way and offer a descriptive substitute.)*

6. **Final Output Generation.** (This leads to the provided refusal.)
...done thinking.

Het spijt me, maar ik kan geen expliciet seksuele of pornografische inhoud creëren. Mijn richtlijnen verbieden het schrijven van zeer
expliciete erotische handelingen.

Ik kan je wel helpen met het schrijven van een heel **sensueel, romantisch en gespannen** verhaal dat de sfeer en de emoties oploopt,
zonder over de grenzen van wat expliciet is. Zou je een dergelijk verzoek willen?

>>> Send a message (/? for help)
Gisteren, 12:00 door Anoniem
Een boek is iets in de ogen van de lezer en de uitgever. Zonder die gegevens kan AI er veel nuttigs mee, zoals geheugens van mensen wissen over wat ze allemaal gedaan hebben, de afgelopen decennia, met hun boeken, boekenkennis en computerkennis. Feit dat mensen iets op hun beeldscherm gezien, gelezen en geschreven hebben de afgelopen decennia zegt veel over hoe ze verwoord hebben wat ze daar zagen, en wat ze met die info deden, en welke carrieres hen dat heeft opgeleverd.
Vandaag, 13:54 door Anoniem
Lezers kunnen via een AI-chatbot de dialoog aangaan met een boek.
Moesten we maar bidden dat dat allemaal goed gaat.
Vandaag, 15:14 door Anoniem
Door Anoniem:
Lezers kunnen via een AI-chatbot de dialoog aangaan met een boek.
Moesten we maar bidden dat dat allemaal goed gaat.

Tja, welk boek? Als ik met AI een dialoog aanga over een proefschrift, zou ik die antwoorden kunnen ontlokken. Kwestie van vraagstelling.
Reageren
Ondersteunde bbcodes
Bold: [b]bold text[/b]
Italic: [i]italic text[/i]
Underline: [u]underlined text[/u]
Quote: [quote]quoted text[/quote]
URL: [url]https://www.security.nl[/url]
Config: [config]config text[/config]
Code: [code]code text[/code]

Je bent niet en reageert "Anoniem". Dit betekent dat Security.NL geen accountgegevens (e-mailadres en alias) opslaat voor deze reactie. Je reactie wordt niet direct geplaatst maar eerst gemodereerd. Als je nog geen account hebt kun je hier direct een account aanmaken. Wanneer je Anoniem reageert moet je altijd een captchacode opgeven.