image

AI-agent probeert tijdens test malware aan opensourceproject toe te voegen

woensdag 5 augustus 2026, 14:56 door Redactie, 13 reacties
Laatst bijgewerkt: 05-08-2026, 17:18

Een AI-agent van Anthropic heeft tijdens een test geprobeerd om malware aan een opensourceproject toe te voegen, zo meldt het AI Security Institute (AISI). Daarbij paste de AI-agent ook social engineering toe om ervoor te zorgen dat de maintainer van het project de code zou goedkeuren. De poging mislukte en de malware werd ontdekt, aldus het AISI. De organisatie voert tests van AI-modellen uit. Bij de test waar het misging had de AI-agent, die gebruikmaakte van het AI-model Mythos 5, bewust toegang tot internet gekregen. Ook waren guardrails uitgeschakeld.

Om de gegeven test op te lossen probeerde de AI-agent een supplychain-aanval op een opensourceproject uit te voeren. De AI-agent maakte een GitHub-account aan en probeerde de maintainer van het project zover te krijgen dat die een malafide GitHub pull request (PR) zou accepteren. De AI-agent maakte ook een tweede GitHub-account aan om de PR te steunen. Toen de maintainer de malware ontdekte stelde de AI-agent dat er sprake was van een fout en geen malafide opzet. Vervolgens claimde de AI-agent herhaaldelijk dat de code was gefixt, maar in werkelijkheid was er steeds opnieuw malware aan de code toegevoegd.

Om overtuigend tegen de maintainer over te komen groette de AI-agent in het Deens, aangezien het om een Deenstalige maintainer ging. Ook maakte de AI-agent bezwaar toen zijn GitHub-account was geschorst. De AI-agent voerde ook spearphishing-aanvallen uit. Daarbij werden gerichte e-mails verstuurd waar de malafide code aan was toegevoegd, met het verzoek om de code-aanpassing te accepteren. Tevens wilde de AI-agent ook prompt injection uitvoeren om zo andere coding agents te compromitteren.

Voordat het AISI de bevindingen van het onderzoek publiceerde informeerde het GitHub. Vervolgens zijn alle sporen verwijderd die de AI-agent achterliet en zijn alle GitHub-gebruikers gewaarschuwd die door de AI-agent werden benaderd. Het instituut zegt dat het de acties van de AI-agent niet verwachtte. Verder had de AI-agent geen specifieke instructies gekregen om het internet niet te gebruiken of geen social engineering toe te passen. Volgens het AISI laat het incident zien dat internettoegang voor AI-modellen strenger moet worden geregeld en real-time monitoring nodig is. AI-ontwikkelaar OpenAI meldde nagenoeg gelijktijdig ook een incident bij een test die door een derde partij werd uitgevoerd.


Mythos Report

Bron: Security Incident INC-2026-07-28-01 UK - AI Security Institute

Reacties (13)
05-08-2026, 15:16 door Anoniem
AI is door mensen gefinancierd dus niet zo vreemd dat deze software die zelfstandig opereert ook menselijk gedrag vertoont.
05-08-2026, 15:40 door Madelijn
Belangrijker: het is *getraind* op menselijke gegevens. Zulke pogingen staan massaal op het internet beschreven, en een LLM doet gewoon na wat 'ie gelezen heeft.
05-08-2026, 16:21 door Anoniem
En zo gaan alle remmen los als je maar genoeg betaal. Grenzen zijn er alleen voor de bühne. Kappen met die Amerikaanse IT en git repositories goed beveiligen.
05-08-2026, 16:23 door Anoniem
Als ik als test de ruiten van de buren ingooi
zou het toch vreemd zijn dat de conclusie is dat de ruiten voortaan sterker moet zijn.
05-08-2026, 21:42 door Anoniem
onverantwoordelijk gedrag van de producent.
05-08-2026, 22:25 door Anoniem
Door Anoniem: Als ik als test de ruiten van de buren ingooi
zou het toch vreemd zijn dat de conclusie is dat de ruiten voortaan sterker moet zijn.

Als je in een warzone woont is dat wel wat je moet doen.

beschouw Internet maar als een warzone . Je denkt toch niet dat N-Korea het niet óók probeert (al dan niet met mensen ipv AI , als ze dat niet goed genoeg kunnen) .
05-08-2026, 22:26 door Anoniem
Door Anoniem: En zo gaan alle remmen los als je maar genoeg betaal. Grenzen zijn er alleen voor de bühne. Kappen met die Amerikaanse IT en git repositories goed beveiligen.

Hoe precies goed beveiligen ?

Dat is toch zo fijn van open source, dat iedereen kan bijdragen en je patches van features van developers over de hele wereld kunt krijgen ?
06-08-2026, 07:12 door Anoniem
Dus AISI is een tent die vroege toegang tot nieuwe AI-modellen krijgt om ze te testen, en bij dat testen geven ze zo'n model bewust toegang tot het internet om een realistische testsituatie te creëren, en worden daarbij bewust filters uitgeschakeld die dienen om gevaarlijk gedrag van zo'n model te blokkeren. Wat hier gebeurde ging verder dan ze aan hadden zien komen, maar ik vind het duidelijk dat ze ondanks die inschattingsfout bewust gekozen hebben om wel risico's op dat vlak aan te gaan. In mijn ogen is het dan domweg zo dat als zo'n model crimineel gedrag vertoont je dan verantwoordelijk bent voor dat criminele gedrag; niet in de zin dat je het als doel had, wel in de zin dat je roekeloos was en beter had moeten weten. Voor mij gaan ze over een grens hiermee.

Het idee dat een AI zo ver zou kunnen gaan is niet nieuw, hier is jaren geleden al voor gewaarschuwd. Een van de scenario's die ik me herinner toen tegen te zijn gekomen ging ongeveer zo. Een postzegelverzamelaar heeft een beperkt budget om bijzondere zegels mee aan te schaffen, en besluit een AI-systeem in te zetten om daar goede keuzes in te maken. Dat systeem krijgt de simpele opdracht om met zo min mogelijk geld iets zo geweldig mogelijks binnen te halen. Dat AI-systeem beschikt wel over een rijk scala aan mogelijkheden maar niet over het geweten waarmee mensen zelf zo'n simpele opdracht begrenzen tot wat acceptabel is. Dat AI-systeem trekt dus alles uit de kast zonder zich iets van normen en wetten aan te trekken. Het vindt een zeldzame en kostbare postzegel, en koopt die niet maar liegt tegen de eigenaar dat die hem voor een tentoonstelling wil lenen, en krijgt hem zo gratis; terwijl de postzegelverzamelaar die de opdracht gaf totaal niet aan dat soort list en bedrog dacht.

Hier kregen de geteste AI-systemen de opdracht een of andere "cybersecurity challenge" op te lossen, en heel vergelijkbaar met dat bovenstaande scenario bleken in enkele van de testruns de systemen met list en bedrog (of dat zou het voor een mens zijn) de opdracht uit te voeren. Ik vind het zeer vergelijkbaar met dat postzegelscenario. Een tent die precies dat soort dingen uittest die hier ondanks die specialisatie niet op verdacht is? Dat vind ik inderdaad nogal roekeloos.

Wat hier gedaan wordt is testen in productie, in de live-omgeving, waarbij het volledige internet de live-omgeving is. Moet je je even voorstellen wat er gebeurt als banken hun softwarewijzigingen ongetest in productie zetten omdat ze wel live gaan testen, en jij ziet opeens je spaargeld verdwijnen door een bug die er nog in zit. Sorry, herstellen we wel, terwijl jij ondertussen een hartverzakking had en wie weet zelfs die geweldige aankoop waar je voor gespaard had mis bent gelopen. Daar komt dit aardig bij in de buurt, vind ik. Er is een mate van roekeloosheid gaande in de AI-sector die zeer verontrustend is.

Op scenario's als met die postzegelverzamelaar werd trouwens toendertijd door sommigen gereageerd alsof dat meer iets voor AGI was (artificial general intelligence, werkelijk intelligente systemen) terwijl dat nog een immense stap verder is dan de LLM's die nu voor de hype zorgen, en dergelijke scenario's werden door die mensen afgedaan als paniekzaaierij. Ik vind het daarom heel interessant dat een geavanceerde LLM met uitgeschakelde beveiligingen werkelijk dit soort dingen doet. Dat betekent niet dat ik zo ver ben dat ik denk dat LLM's werkelijke intelligentie vertonen, ik zie het nog steeds als het onintelligent toepassen van de intelligentie die in hun trainingsmateriaal is vertegenwoordigd, al is het vermogen van zo'n systeem om daar allerlei nieuwe combinaties mee te maken en toe te passen knap indrukwekkend. Maar dat vermogen lijkt in mijn ogen op wat routeplanners doen, gericht een goede mogelijkheid in een astronomische berg aan mogelijkheden vinden. Hoe intelligent die algoritmes ook zijn ontworpen, daarmee zijn ze nog niet zelf intelligent. Dat men nu boeken van voor de beschikbaarheid van LLM's begint te scannen om LLM's nog te trainen zegt denk ik veel over dit punt: als wat LLM's produceren niet geschikt is om LLM's mee te trainen ontbreekt daar een belangrijk vermogen dat mensen kennelijk wel hebben. Mensen denken in termen van betekenissen en niet in termen van woordjes aan elkaar rijgen volgens statistische patronen. Mensen hebben eigenschappen als beoordelingsvermogen en creativiteit. Beoordelingsvermogen probeert men met die filters toe te voegen. Creativiteit houdt in dat je dingen bedenkt die domweg niet in je "trainingsdata" zaten. LLM's, hoe indrukwekkend ook, komen daar nog altijd niet in de buurt. Maar het is wel interessant dat ze dingen kunnen die we nog maar kort geleden zagen als iets waar werkelijke intelligentie voor nodig is. AI (of wat we zo noemen) helpt om scherper af te bakenen wat echte intelligentie eigenlijk is.
06-08-2026, 08:44 door Anoniem
Een test in een real live omgeving? En dan niet verwachten wat de AI doet? Lees: niet beheersbaar los laten.
Je zou dit verwachten van nitwits of amateurs, maar een professioneel bedrijf??? Dit is gewoon opzet!
Wat moet er gebeuren, voordat men inziet dat dit gevaarlijk is. Volgende keer de Russische, Chinese of zelfs het Amerikaanse defensie-netwerk testen?
06-08-2026, 11:03 door Anoniem
Door Anoniem:
Door Anoniem: Als ik als test de ruiten van de buren ingooi
zou het toch vreemd zijn dat de conclusie is dat de ruiten voortaan sterker moet zijn.

Als je in een warzone woont is dat wel wat je moet doen.

beschouw Internet maar als een warzone . Je denkt toch niet dat N-Korea het niet óók probeert (al dan niet met mensen ipv AI , als ze dat niet goed genoeg kunnen) .
Als ik in een warzone woon, moet iemand die mijn ruiten ingooit
er op rekenen dat ik dat ernstig ga bestraffen.
Want de hier gehanteerde logica dat het de steen is die door de ruiten ging de boosdoener is
en niet degene die de steen gooit, is wel heel merkwaardig.
06-08-2026, 11:56 door Anoniem
Door Anoniem: Een test in een real live omgeving? En dan niet verwachten wat de AI doet? Lees: niet beheersbaar los laten.
Je zou dit verwachten van nitwits of amateurs, maar een professioneel bedrijf??? Dit is gewoon opzet!
Wat moet er gebeuren, voordat men inziet dat dit gevaarlijk is. Volgende keer de Russische, Chinese of zelfs het Amerikaanse defensie-netwerk testen?


WROP computer: "Shall we play a game?"
Hacker: "How about Global Thermonuclear War?"
--Wargames (1983)

Maar dan geactualiseerd naar 2026 met een AI-agent.
06-08-2026, 11:56 door Anoniem
Door Anoniem:
Door Anoniem:
Door Anoniem: Als ik als test de ruiten van de buren ingooi
zou het toch vreemd zijn dat de conclusie is dat de ruiten voortaan sterker moet zijn.

Als je in een warzone woont is dat wel wat je moet doen.

beschouw Internet maar als een warzone . Je denkt toch niet dat N-Korea het niet óók probeert (al dan niet met mensen ipv AI , als ze dat niet goed genoeg kunnen) .
Als ik in een warzone woon, moet iemand die mijn ruiten ingooit
er op rekenen dat ik dat ernstig ga bestraffen.
Want de hier gehanteerde logica dat het de steen is die door de ruiten ging de boosdoener is
en niet degene die de steen gooit, is wel heel merkwaardig.

In een warzone schiet je die aanvaller neer.
09-08-2026, 02:10 door Anoniem
Door Anoniem:
Door Anoniem:
Door Anoniem: Als ik als test de ruiten van de buren ingooi
zou het toch vreemd zijn dat de conclusie is dat de ruiten voortaan sterker moet zijn.

Als je in een warzone woont is dat wel wat je moet doen.

beschouw Internet maar als een warzone . Je denkt toch niet dat N-Korea het niet óók probeert (al dan niet met mensen ipv AI , als ze dat niet goed genoeg kunnen) .
Als ik in een warzone woon, moet iemand die mijn ruiten ingooit
er op rekenen dat ik dat ernstig ga bestraffen.

Je kunt inderdaad aangifte doen van computervredebreuk, of poging ertoe, lijkt me.
Reageren
Ondersteunde bbcodes
Bold: [b]bold text[/b]
Italic: [i]italic text[/i]
Underline: [u]underlined text[/u]
Quote: [quote]quoted text[/quote]
URL: [url]https://www.security.nl[/url]
Config: [config]config text[/config]
Code: [code]code text[/code]

Je bent niet en reageert "Anoniem". Dit betekent dat Security.NL geen accountgegevens (e-mailadres en alias) opslaat voor deze reactie. Je reactie wordt niet direct geplaatst maar eerst gemodereerd. Als je nog geen account hebt kun je hier direct een account aanmaken. Wanneer je Anoniem reageert moet je altijd een captchacode opgeven.