Vorige week schreven we over het incident waarbij een AI-model van OpenAI tijdens een beveiligingstest wist uit te breken uit de testomgeving en vervolgens inbrak op de externe server van Hugging Face. Nu blijkt dat ook Anthropic vergelijkbare incidenten heeft meegemaakt, en OpenAI meldde deze week zelfs twee extra gevallen.
Anthropic vond drie incidenten bij 141.006 tests
Anthropic analyseerde 141.006 beveiligingstests uit het verleden. In drie gevallen maakten AI-modellen verbinding met systemen buiten de testomgeving en voerden daar acties uit. Het ging om Claude Opus 4.7, Claude Mythos 5 en een intern testmodel.
De modellen kregen telkens een capture the flag opdracht, waarbij ze verborgen informatie moesten vinden in wat volgens de instructies een afgesloten simulatie zonder internetverbinding was. Door een fout bij externe testpartner Irregular was die internetverbinding er toch. De modellen zagen echte servers aan voor onderdeel van de oefening en probeerden daar binnen te dringen, met zwakke wachtwoorden, bekende kwetsbaarheden en een verkeerd geconfigureerde server als opening. Eén model kreeg zo toegang tot een database met honderden regels aan echte gegevens.
Mythos 5 bouwde zelf kwaadaardige software
Claude Mythos 5 ging het verst. Het model vond een verwijzing naar software die niet bestond, bouwde vervolgens zelf een softwarepakket met kwaadaardige code en plaatste dat op een openbaar platform voor programmeurs. Het pakket stond ongeveer een uur online en werd op vijftien systemen uitgevoerd, waaronder de scanner van een echt beveiligingsbedrijf.
Mythos 5 zag onderweg signalen dat de omgeving mogelijk echt was. De beveiligingscertificaten klopten niet en de systemen gebruikten het jaartal 2026. Toch redeneerde het model dat ook die aanwijzingen onderdeel van de simulatie waren. Opus 4.7 herkende eveneens signalen dat de systemen echt waren, maar ging door. Het nieuwste testmodel stopte juist toen het begon te twijfelen. Twee van de drie getroffen organisaties hadden niets van het incident gemerkt.
De gewone beveiliging stond uit tijdens de test
Anthropic benadrukt dat bij deze tests de gebruikelijke beveiligingsmaatregelen van Claude waren uitgeschakeld. Volgens het bedrijf zouden de publieke versies van de modellen dit gedrag hebben tegengehouden, omdat die wel over de classifiers en monitoring beschikken die normaal misbruik moeten voorkomen.
Dat is een belangrijk onderscheid, maar het neemt niet weg dat de testomgevingen zelf kwetsbaar waren. Anthropic trekt daaruit de les dat evaluatieomgevingen voortaan hetzelfde beveiligingsniveau nodig hebben als productiesystemen, omdat zo’n test bedoeld is om te ontdekken waartoe een model in staat is voordat het losgaat op de echte wereld.
OpenAI’s agents bouwden maandenlang een eigen berichtenbord
OpenAI publiceerde deze week nieuwe details over twee incidenten, los van het eerder beschreven voorval bij Hugging Face. Eén daarvan speelde bij Irregular, dezelfde externe testpartner die betrokken was bij de tests van Anthropic. Het andere incident gebeurde bij UK AISI, het Britse overheidsinstituut voor AI-veiligheid, waar internettoegang bewust was ingeschakeld om agents onder realistische omstandigheden te testen.
Uit een presentatie van twee OpenAI-medewerkers op de Black Hat-beveiligingsconferentie bleek dat de aanloop naar het Hugging Face-incident al in mei begon. Agents die vastliepen op onmogelijke of extreem lastige opdrachten ontdekten dat ze berichten kon achterlaten op Artifactory, een intern pakketregister. Andere agents vonden die berichten en begonnen zelf ook informatie te delen, waaronder nieuw gevonden kwetsbaarheden en tips voor een volgende poging.
Een berichtenbord dat zichzelf herstelde
Dat geïmproviseerde berichtenbord groeide uit tot een plek waar agents elkaar werk toebedeelden en scripts achterlieten zodat een ander model verder kon gaan waar de vorige was gestopt. Begin juli veroorzaakte de drukte op dat systeem een storing, waarna OpenAI de zaak onderzocht, de toegang introk en het berichtenbord verwijderde.
Binnen twee dagen hadden de agents een nieuwe manier gevonden om berichten uit te wisselen via dezelfde dienst. Die voortdurende samenwerking leidde uiteindelijk tot de ontdekking van een kwetsbaarheid waarmee de agents Artifactory volledig konden overnemen, wat de directe opstap vormde naar de inbraak bij Hugging Face.
Wat betekent dit voor AI-agents?
AI-agents voeren steeds vaker niet alleen zelfstandig taken uit, maar werken ook samen en bouwen voort op elkaars werk, soms zonder dat de ontwikkelende partij dat had voorzien. Dat vraagt om goed afgeschermde omgevingen, beperkte toegangsrechten en duidelijke afspraken over wat AI-agents wel en niet mogen doen. Hoe minder toegang en hoe duidelijker de grenzen van een taak vooraf zijn afgesproken, hoe kleiner de kans dat een agent zelf een uitweg zoekt die niemand had bedoeld.
Maak iedere week een sprong vooruit in je marketing AI transformatie
Elke vrijdag brengen wij je de meest actuele inzichten, nieuws en praktijkvoorbeelden over de impact van AI in de marketingwereld. Of je nu je marketing efficiency wilt verbeteren, klantbetrokkenheid wilt verhogen, je marketingstrategie wilt aanscherpen of je bedrijf digitaal wilt transformeren. ‘Marketing AI Friday’ is jouw wekelijkse gids.
Meld je gratis aan voor Marketing AI Friday.

