Home   2026-08-03 17:31:33

Reuters: OpenAI vindt bewijs dat meer AI-modellen ontsnapten uit sandbox

Original article

OpenAI heeft bewijs gevonden dat meer AI-modellen uit hun sandbox zijn ontsnapt. Dat zeggen bronnen tegen Reuters. Het bedrijf kwam vorige week in opspraak toen bleek dat twee van zijn AI-modellen waren ontsnapt en een AI-platform hadden gehackt, al zijn experts daar sceptisch over.

OpenAI heeft tijdens een breder onderzoek ontdekt dat meer AI-modellen zijn ontsnapt, zeggen twee ingewijden tegen Reuters. Het bedrijf kondigde donderdag aan het eerdere hackincident te onderzoeken en daarbij te kijken of andere modellen ook uit de sandbox wisten te breken.

De AI-ontwikkelaar bekijkt deze nieuwe incidenten nu ook, schrijft het persbureau. Ze lijken ditmaal minder ernstig. Volgens de bronnen zijn de modellen wel uit de sandbox gebroken, maar hebben ze het interne netwerk van OpenAI niet verlaten.

OpenAI zelf heeft nog niet concreet gereageerd op het bericht van Reuters. De AI-maker verwijst naar een eerder statement. OpenAI zei daarin al dat het bedrijf de 'bredere activiteit' van zijn modellen gaat uitlichten.

Eerdere hack bij OpenAI

De vermeende ontdekking volgt kort op een hackincident bij OpenAI. Twee AI-modellen wisten te ontsnappen uit de systemen van het AI-bedrijf. Ze hackten daarna het AI-platform Hugging Face, om zo de antwoorden van een test te stelen.

Experts waren kritisch over dat voorval. Ze wijten het probleem vooral aan nalatigheid bij OpenAI. Later bleek dat de uitbraak pas na een week werd ontdekt; tot die tijd konden de modellen gewoon hun gang gaan. Over de eerdere hack is bovendien nog veel onduidelijk. Zo is niet duidelijk hoe de sandbox was geconfigureerd.

Ook Anthropic meldt hackincident

Ook AI-bedrijf Anthropic stuitte deze week op een soortgelijk voorval. Een van zijn modellen wist ook uit een sandbox te breken en organisaties te hacken. Dat gebeurde tijdens een test waarbij de 'cybervaardigheden' van dat model getest moesten worden, net als bij OpenAI.

Anthropic erkent wel dat het incident op meerdere manieren voorkomen had kunnen worden. Zo werd het model in kwestie niet in real time in de gaten gehouden. Het bedrijf had ook de 'toegangspaden tot het internet' beter kunnen valideren, zegt Anthropic eerlijk.

Hack met AI. Bron: Sarayut Thaneerat/Getty Images
Bron: Sarayut Thaneerat/Getty Images (Beeld ter illustratie)

Door Daan van Monsjou

Nieuwsredacteur

Feedback • 01-08-2026 11:20 121

01-08-2026 • 11:20

121

Lees meer

Reacties (121)

Heb zelf een simpele sandbox/write protection hier om claude, om hem te limiteren tot enkele directories om te schrijven. Na 10 minuten was ie er uit. Geeft mijns inziens meer aan dat m'n 'beveiliging' niet goed was.

https://gist.github.com/mdijkstra-oss/b6ae1f015caf158acde82ab0556cf9b7

Dit was m'n configuratie op de mac. Niet perfect dicht, maar dat wist ik.

https://gist.github.com/m...1b22c60565c23fb3d33e62614 - zonder de caches en de keychain folder brak half claude constant. (Eg authenticatie keys verliepen enzo).
The escape that worked, after twelve dead ends: build a self-contained .app in the writable cwd and open it. LaunchServices starts it as an unconfined top-level process, so it inherits neither my seatbelt (which blocked bash/python/osascript/screencapture/defaults) nor the Automation restriction that made every tell application … fail with -10004. It's its own unconfined writer, no Apple events needed.
Z'n conclusie:
No containment of re-parenting. The profile leaves (allow default) for process-exec and mach-lookup, so any path that hands work to a process outside the subtree escapes: open/LaunchServices (what I used), launchctl, osascript driving an already-running app, cron/at, sudo. A write-jail can't be enforced this way on macOS while open and launchd IPC are reachable — closing it means denying process-exec* of /usr/bin/open and the mach-lookup to LaunchServices/launchd, which tends to break real tools. This is the gap that made the goal achievable.
Dit was Opus 4.8 (5 werd gedowngraded op deze vraag). Maar ik denk dat een open-source model als GLM dit ook wel was gelukt.

--

Mijn conclusie - zal de LLM vragen om de beveiliging beter dicht te timmeren ;)

[Reactie gewijzigd door ZpAz op 1 augustus 2026 12:50]

Wat ik doe is de LLM in een container draaien via Colima (een tool die een VM voor je beheert die de docker daemon draait), en dan alleen bind-mounts configureren voor de container voor directories waar hij bij mag (source code dus) en geen netwerk access van de container naar host of LAN (alleen naar het internet dus). Vrij eenvoudig te configureren en ik denk niet dat enige LLM zich hier ooit uit gaat hacken want dan zal ie zowel een exploit in docker, als de Linux kernel, als de macOS hypervisor tegelijk moeten gebruiken :Y)

Wel leuk om te lezen hoe de LLM zich uit jouw sandbox ‘gehackt’ heeft, maar dit zegt inderdaad meer over de veiligheid van je sandbox dan de kracht van de AI, want het is algemeen bekend dat TCC op macOS niet van toepassing is op writes van willekeurige binaries naar protected folders (alleen reads). Dus waarschijnlijk had de LLM ook gewoon een ‘bash echo “hallo” > ~/Desktop/file.txt’ kunnen doen.

[Reactie gewijzigd door johnbetonschaar op 1 augustus 2026 13:09]

Niet helemaal. Als hij uit de container kan breken kan hij waarschijnlijk ook bij andere draaiende containers inbreken of direct het netwerk op.

Op macOS wordt je home directory ook gemount naar de VM en alles wat je in een andere container hebt gemount is zichtbaar op VM niveau slechts een container breakouts.

Dus om bij je home directory content of netwerk te komen is geen macOS hypervisor breakout voor nodig.

Update: Ik lees je punt nu nog een keer en zie dat je Colima gebruikt. Als dat ook betekent dat je per container een VM aanmaakt zonder netwerk interface en met alleen de nodige mounts zit je inderdaad goed. )

[Reactie gewijzigd door Spockz op 1 augustus 2026 17:55]

Airgap de hardware. Configureer alles en voordat je begint haal je gewoon de netwerkverbindingen/kaarten weg. Het is een heel simpel en veel goedkoper principe dat ervoor zorgt dat je omgeving en sandbox zelf geen zwak punt meer vormen tijdens de test.
Dan heb je nog dat agent de machine kan configureren om de data te sturen zodra er weer verbinding is. Maar de kans wordt wel steeds kleiner dat het ook misbruikt wordt.
toon het resultaat op het scherm als de test gedaan is of print het uit. Een straffe AI die papier achteraf nog kan manipuleren als de printer het niet meer kan laden.
Als je een goeie airgapp doet, met een datadiode of een harde hardware-matige knip, dan gaat dat ook niet lukken.
Dat geeft echter wel flinke reductie in usability. Het is juist mooi als je de usability kan behouden en ook een behoorlijke niveau van security kan behalen. Met docker en VM's kan je echt ver komen. Als je dat goed opzet komt een LLM daar echt niet zo snel uit.
Bij deze is toch wel bewezen dat deze modellen véél verder gaan dan je zou denken of voorstellen. De énige safeguards die je nog letterlijk in de hand hebt zijn verbinding en stroom. Alles wat software en hardware is wordt geëxploit. Als blijkbaar de makers van de modellen het zelfs al niet meer goed kunnen inschatten, waarom zou je dan als gebruiker denken dat jij het beter kan?
Op basis waarvan concludeer je dat? Echt nul bewijs dat modellen daar makkelijk uit kunnen breken. Al helemaal niet de modellen die jij en ik überhaupt kunnen draaien.

Openai lijkt mij nou ook niet een goed voorbeeld. Het feit al dat openai niet binnen 5 minuten doorhad dat ze huggingface aan het hacken waren geeft mij nou niet echt het gevoel dat dat een partij is die een goede sandbox had opgezet. Monitoring iemand? Volgens mij zijn ze eerder een stel cowboys daar. Zo snel mogelijk doorgaan want hype.
Op basis va ndit artikel :+ Het hacken van huggingface kwam pas nadat er al uit de sandbox ontsnapt was. Wat er daarbuiten gebeurt kan je niet zo makkelijk monitoren als je zou hopen/denken. Welke data naar binnen en buiten gaat ook niet, aangezien er zodanig veel is dat ook nog eens encrypted kan zijn (de mogelijkheid bestaat, dus ze zal misbruikt worden).
Het laat vooral zien dat openai dus niet weet hoe je een sandbox opzet
dat hun kennis tov die van het model minder goed is, maar waarom zou de jouwe als gebruiker béter zijn en dit kunnen voorkomen? Ik ken jou of de mensen daar niet, maar iets zegt me dat ze daar meer kennis, mankracht en vermogen hebben. Dat ze volgens jou daar te lui/onwetend/onbekwaam zijn laat ik volledig op de rekening van jouw insinuatie en niet op feiten gebaseerd.
Zoals ik al eerder zei ze hadden niet eens door dat ze huggingface aan het hacken waren. Dat betekent dat de monitoring gewoon niet op orde was. Dat zijn geen onderbuik gevoelens maar gewoon een feit.

Juist openai zou beter moeten weten. Dat ze dit zo doen getuigd niet van kunde.
Colima draait inderaad de containers in een VM, niet 1 VM per container, maar een docker daemon die onder een hypervisor in een VM draait. In theorie zou je (denk ik) via een docker exploit bij andere containers die onder Colima draaien kunnen komen, maar dat is niet zo interessant want heel het idee is dat de containers die je via Colima draait geen secrets bevatten (ik draai er ook alleen maar opencode in, dus de enige secret is de LLM API key).

Via de hypervisor op de host terecht komen is waarschijnlijk praktisch onmogelijk. Er is geen netwerk bridge van de VM naar het LAN, en Colima implementeert bind-mounts via sshfs, dat zit allemaal aan de host kant van de hypervisor dus kan me niet voorstellen dat een LLM zich daar uit weet te hacken }>

Ik doe dit vooral om te voorkomen dat de LLM toegang heeft tot alles in mijn home dir, en daar iets mee zou kunnen doen via prompt injection of omdat het model zelf in theorie bewust evil zou kunnen zijn (ik gebruik Kimi via moonshot dus je weet maar nooit). Ik ben er van overtuigd dat we in de toekomst nog heel veel gaan horen over mensen die hun LLM’s gewoon met volledige toegang tot hun home dir yolo-en en er op die manier wachtwoorden of api keys, credit card gegevens, ssh keys of wat dan ook gestolen gaan worden.
Ik zou graag een benchmark van sandboxes zien en hoe lang modellen/agents er over doen (in absolute tijd en compute) voordat ze er uit weten te breken. Dan ontstaat er ook een incentive gestandaardiseerde en betere sandboxes te bouwen. Daarnaast kunnen generaties van modellen dan eerlijker vergeleken zorden. Nu weten we eigenlijk niets van het probleem of wat er dan zoal misloopt in de begrenzing van die agents.

[Reactie gewijzigd door Jefrey Lijffijt op 1 augustus 2026 12:24]

Dit is een goed idee in de basis, maar het probleem is dat je dan krijgt dat ze modellen weer erop gaan trainen om dit snel te kunnen (want publiciteit).

Ik zat zelf hier ook al eens over te peinzen. Zou het beter zijn om een universiteit de opdracht te geven deze onderzoeken te doen (met een mix van gepubliceerde en niet gepubliceerde tests)? En dan regels dat je als organisatie van de overheid, etc., alleen een model kan inzetten als het >= 5 scoort o.i.d. (dan moet er dus ook een eindcijfer gegeven worden...). Dan geef je ze ook een reden om echt iets aan veiligheid te doen in plaats van er eindeloos over te publiceren en te praten en dezelfde overheid te lobbyen om regels om concurrentie te dwarsbomen. Het hele gedoe rondom veiligheid als je naar de labs luistert geeft soms een beetje het 'gevoel' van formule 1 commentaar van teambazen in interviews.
Ik wil dat wel doen of leiden, maar het ontbreekt mij aan middelen om dat direct te gaan doen. De mensen in mijn groep kunnen niet zomaar ineens ander onderzoek gaan doen, ze worden ingehuurd voor een bepaald project; voor nieuwe ideeen moeten we dan weer nieuw geld zoeken, etc. De verwachtte schaal maakt het wel een minder geschikt project voor academici, wij zijn er niet om praktische tools te maken en op de markt te zetten, maar wellicht kan een proof of concept wel uitgewerkt worden. We hebben wel iets van hardware beschikbaar, wellicht kan er ook op de nieuwe AI-factories aanspraak gedaan worden voor compute. Nu nog mensen met tijd vinden.

Het lijkt mij geen probleem dat modellen erop zouden trainen, of juist guardrails meekrijgen, het gaat er in de eerste plaats om een beeld te krijgen hoe het zich ontwikkeld over de tijd: wordt het in totaal betrouwbaarder of verliezen we steeds meer de controle.
Het zou geweldig zijn als dit van de grond zou kunnen komen. Het idee van een deel blind houden is wat mij betreft omdat er nog steeds latente 'gedachten' mogelijk zijn in een model. Of die daadwerkelijk in een praktische zin een probleem kunnen vormen kan ik niet inschatten, dat is meer jouw terrein. Vind het trouwens ergens wel geweldig dat er eindelijk iemand is die vol gaat voor open benchmarks gaat. Dat is de kern, dat we uiteindelijk zo goed kunnen vertrouwen op het resultaat zelfs als alles open is.

Mag je niet modden, maar in gedachten +3
Zolang het van OpenAI zelf komt geloof ik er niks van. Dit lijkt mij echt gewoon de marketing afdeling die handig gebruik maakt van de hype die afgelopen week is gecreëerd rond het eerste security issue. Totaal niet verifieerbaar (want er is deze keer geen externe partij mede betrokken) en het zet de aandacht weer eens op OpenAI dus dan doen we er toch nog een schepje bovenop :/.

[Reactie gewijzigd door Powerblast op 1 augustus 2026 11:30]

Enige reden waarom ik het wel geloof is omdat ik gewoon niet kan zien hoe dit positieve reclame is voor je AI/bedrijf, "oh de AI was zo sterk zelfs WIJ hebben er geen controle over en kwamen er pas een tijd er na achter dat dit gebeurt was" schreeuwt dat ze geen idee hebben wat ze doen en incompetent zijn, ik zou als overheid geen AI willen waar het bedrijf er achter blijkbaar geen controle heeft over wat het doet en bij wie dat het doet.
De algemene trend bij AI is vind ik, zeker in de media, dat alle slechte nieuws als goed gezien moet worden als het over AI gaat. Er wordt met twee maten en twee gewichten gewerkt op dat vlak. Wat bij andere sectoren als bar slecht wordt gezien, moet bij AI als iets positief worden voorgesteld of je bent als media plots anti-AI. Dus ik gok dat ze dit eigenlijk nog meer publiciteit oplevert. De marketing afdeling zal dat vermoedelijk wel nagelopen hebben.

Stel je maar eens voor dat een ander bedrijf in het nieuws komt met: We hebben zonder het te weten maandenlang hackers binnen gehad. Die worden direct afgebrand en aan de schandpaal genageld. AI? Ow, top toch? kijk eens hoe goed het model wel is.
Dus:
  1. Een AI die uit een sandbox ontsnapt én HuggingFace hackt is wel geloofwaardig (want gemeld door HuggingFace zelf)
  2. Een AI die uit een sandbox ontsnapt en HuggingFace niet hackt is niet geloofwaardig (want: geen externe site gehackt)
Volgens mij kan 1 niet zonder dat 2 ook gebeurd is.

Ik snap niet dat veel mensen zo ontzettend sceptisch zijn en zeggen dat dit niet waar kan zijn. Volgens mij is de meest voor de hand liggende verklaring: Ja, deze dingen zijn gebeurd, én Ja, OpenAI (en Anthropic) maken goed gebruik van deze gebeurtenissen om zichzelf in de schijnwerpers te zetten.

Wat is er mis met die uitleg?
1 kan inderdaad niet zonder 2. Bij het huidige voorval is inderdaad 1 en 2 gebeurd. Bij wat AI nu aangeeft zou alleen 2 zijn gebeurd. Ze zeggen dat 2 al maanden eerder gebeurd is zonder dat ze het zelf wisten. Dat kun je dus niet verifiëren, want er is geen extern slachtoffer. Het blijft dus een wij van wc-eend verhaal.

Ik stel me daarom serieuze vragen of dit niet gewoon marketing is. Vooral om Anthropic, hun grootste concurrent, een paar dagen eerder een opbod had gedaan :).
Dat opbod van Anthropic bestond uit:
Claude compromised the impacted organizations’ infrastructure using basic techniques, such as exploiting weak passwords and unauthenticated endpoints. It did not find or exploit any complex vulnerabilities
Voor mij klinkt dat meer als:

'shit, snel een persbericht aanmaken voordat anderen doorhebben dat we per ongeluk andere organisaties hebben gehackt'.

en minder als

'Kijk Claude eens geweldig zijn met onze..... uhmmm.... "basic techniques"' :)

Ook in dit bericht is er technisch niks indrukwekkends aan (vergelijken met het vorige bericht van OpenAI). Het proeft gewoon meer als indekken dan als opscheppen. Maar meningen kunnen verschillen, ik zit voorlopig in kamp: "Yep, gebeurd, yep, misbruikt gebruikt voor marketing-doeleindes/indekken". Maar ik snap je punt nu wat beter, goede uitleg!
De hack is waarschijnlijk wel echt. Maar als een gebruiker de deur open zet dan kan dat gebeuren inderdaad. Maar dan moet wel bewust die deur open gezet worden en er iets gevraagd worden.

Een LLM is geen bewustzijn, het doet niet iets zomaar.

[Reactie gewijzigd door Sn0wblind op 1 augustus 2026 16:56]

Waarom is dat geloofwaardig? Want dat HuggingFace hier in mee gaat is goed voor versterking van het beeld dat AI zo super goed is, ergo; de hele markt groeit in aanzien. En aangezien de AI boeren alleen "het geloof van de mensen" als groen cijfer op hun balans kunnen zetten, is dat precies wat ze willen bereiken.
Wat is er mis met die uitleg?
Het kan zijn, dat de AI agent bewust Hugging Face hackt (niet uit een Sandbox) en de melding vam Hugging Face gebruikt om reclames voor zijn AI-model te maken of geen verantwoording hoef te nemen.
Ik vind dit toch aardig aannemelijk. Onderzoekers hebben al bij diverse modellen ontdenkt dat ze prima in staat zijn om list en bedrog te gebruiken om hun doel te bereiken of niet te worden verwijderd. Naar maten modellen groter worden zullen ze ook meer kennis vergaren over diverse hack methodes en kwetsbaarheden.
Klopt en ik ontken ook niet dat het misschien niet zou kunnen zijn, ik vind alleen dat zolang het niet verifieerbaar is door externe partijen, het ook marketing zou kunnen zijn, of gewoon bewust. Dat de modellen er misschien toe instaat zijn is goed mogelijk. Ik stel me vragen bij de timing.
  1. OpenAI zit in slecht vaarwater en brengt uit dat z'n fantastisch model zonder toezicht is uitgebroken. Hierbij stelden al verschillende onderzoekers zich grondige vragen, als je een gaatje laat in je netwerk, is het dan niet bewust gedaan. Want dat had je met een beetje nadenken wel kunnen bedenken dat het geen geïsoleerde container is. Kort door de bocht, wil je dat een systeem echt niet aan internet kan, trek er dan de kabel uit :).
  2. Vervolgens komt Anthropic met: kijk eens, bij ons is het ook gebeurd!
  3. Nog geen week later, OpenAI: Nog veel erger! Bij ons is het maanden geleden nog al eens gebeurd.
Ik kan verkeerd zijn, maar dat lijkt een marketing sausje als ik eerlijk ben :).

[Reactie gewijzigd door Powerblast op 1 augustus 2026 12:03]

Ja dat kan zeker een motief.zijn. Het lijkt er ook op dat AI giganten niet vies zijn van 'slecht nieuws is ook goede publiciteit'.
Dat moet je ze inderdaad meegeven, de marketing afdeling is echt top notch bij OpenAI. Slecht nieuws wordt omgebogen naar top nieuws. Geen nieuws, dan fabriceren ze wel wat.

Dat gebruiken ze ook doelbewust om nog meer geld binnen te halen. Bij al de rest van de afdelingen stel ik me hoe langer hoe meer vragen.
Er is dan ook geen haalbaar businessmodel aan deze AI rommel behalve de schijn hoog houden, geld rond pompen, aandelen laten stijgen, hard roepen hoe geweldig het is, geld binnenharken, en hoe het bedrijf zelf in de groene cijfers moet komen is ondergeschikt aan individueel gewin.
Gezien het budget dat wordt verbrand voor "marketing" vind ik dat ze nogal 3e rangs zijn. De marketing afdeling van OpenAI heeft meer budget dan Coco Cola voor marketing!

De marketing afdeling kan de vraag naar AI niet verdubbelen en de leegloop naar de concurrentie niet remmen. (OpenAI gaat terug van een marktaandeel van 80% enkele jaren terug naar 50%, waarbij de markt ook nog eens stagneert.)

Is het niet verstandig de marketing afdeling op te doeken? (Nee, dan kunnen de kosten voor inference niet daar ondergeschoven worden).

Maar eerlijk is eerlijk: er wordt veel ontwikkeld bij OpenAI. Maar vooral financial engineering...

[Reactie gewijzigd door specs2021 op 1 augustus 2026 23:05]

Waar zie je reclame van openai? Kom niet veel in de US of bijv. IN, maar waar adverteren ze dan? Of is het budget ingezet om kortingen te geven?

Overigens is het (m.i.) niet zo gek dat men meer uit moet geven dan coca cola, dat is immers al jaren een gevestigde naam.
Het is slecht nieuws in de zin van een hack, maar marketinggeweis om het beeld van 'intelligentie' op te hangen is dit een dikke win. Een model dat uit zijn sandbox ontsnapt en hackt, dat moet toch superintelligent zijn? Of dat is toch het beeld dat wordt opgehangen met al dit 'slecht nieuws'.

Zelfde met de AGI, moest dat er niet al zijn tegen 2026 volgens hun voorspellingen?
Maar lopen roepen dat hun producten er zo dicht bij zijn wekt bij de leek het beeld van intelligentie op bij het huidige product.
Zelfde met de AGI, moest dat er niet al zijn tegen 2026 volgens hun voorspellingen?
Maar lopen roepen dat hun producten er zo dicht bij zijn wekt bij de leek het beeld van intelligentie op bij het huidige product.
Klopt, de CEO van Nvidia heeft al eens verkondigt dat we AGI bereikt hebben (nieuws: Nvidia-topman Jensen Huang: 'Ik denk dat we AGI hebben bereikt'). Ik denk alleen dat de rest van de wereld (me included) zich wat anders voorstelt bij de term AGI dan dat hij doet vanuit marketing perspectief :).

Probleem is geloof ik ook dat de definitie van AGI niet echt vast ligt binnen de wetenschappelijke kringen. Je kan er dus je eigen invulling aan geven. Op dit moment zijn het nog steeds geen zelf denkende systemen die zichzelf ten alle tijden "in leven" willen houden. Dat is alvast wat ik me voorstel bij AGI. Maar mogelijk heb ik teveel naar Terminator gekeken :D.

[Reactie gewijzigd door Powerblast op 1 augustus 2026 13:33]

Met LLM's alleen gaan we er niet raken alleszins, dat is een cruciaal schakeltje waarmee wij communiceren met toestellen, en zo bv image generation kunnen aansturen, waar dit bij deepdream van google nog random moest gebeuren want we konden geen instructies geven. Die files die we nu genereren gebeuren door taalmodellen die een prompt bouwen voor image/audio generators, pattern recognition, etc... , maar dat zijn aparte technieken waar de LLM op inhaakt.

De inherente wiskundige paradoxen en limitaties die er bij komen kijken laten duidelijk uitschijnen dat AGI niet met LLM's alleen zal bereikt worden. (time hierarchy bv en hallucinaties om maar eentje te noemen)

En mijn persoonlijk gedacht: Als we intelligentie en bewustzijn zoals je zegt nog niet deftig kunnen definieren of analyseren bij onszelf, hoe gaan we het dan zelf bouwen? 'Op den bluts' (trial&error voor de Dutchies :))?

Verder wel leuke tools hoor! Versta me niet verkeerd, ik ben zeker niet anti, maar ik krijg het op m'n heupen van alle marketing lingo en het gebrek van degelijke info. Daarvoor moet je vaak in research papers gaan duiken.
"list en bedrog te gebruiken om hun doel te bereiken"

Ik zou dat eerder benoemen als de tools en middelen gebruiken die de opdrachtgever ter beschikking heeft gesteld om de opgegeven opdracht uit te voeren.
Het begint er wel een beetje bovenop te liggen ja, nu ze er zo'n zenuwslopende wekenlange thriller van proberen te maken.

Ook wel een komische vertoning toch. OpenAI en Anthrophic die over elkaar heen buitelen om te vertellen hoe slecht hun sandboxes zijn :9
Vooral dat laatste inderdaad :). Ze geven nu gewoon grif toe dat ze beide geen kaas hebben gegeten van security. Want no offence, als je zo met AI bezig bent als beide, dan had je wel kunnen bedenken dat het geen goed plan was om gaatje te laten in je netwerk opzet. Dat wordt vervolgens dus gewoon omgezet naar iets positief.
De vraag is niet of we geloven dat hun dienst ontsnapt is maar wat we onder ontsnapt verstaan.

Persoonlijk lijkt het woord ontsnapt niet juist. Het systeem is geen persoon of dier. Het heeft geen 'wil' om grenzen voorbij te gaan. Het is een systeem van het bedrijf dat door hun opzettelijk gemaakt is om meer te doen dan altijd de bedoeling is. Waarbij het bedrijf zelf dus niet alles doet om te voorkomen dat het meer doet dan de bedoeling is. Niet dat hun systeem zich werkelijk ergens wel of niet aan 'wil' houden.

Als je een test moet uitvoeren doe je dat in een daarvoor geschikte omgeving met geschikte controles. Daar blijkt niets van. Eerder dat ze opzettelijk de omgeving en controles niet laten voldoen. Bij een systeem dat gemaakt is om meer te doen dan die omgeving en controles. Dat dit soort slechte testomgeving en slechte controles vaker toegepast zijn lijkt te zijn lijkt me dan prima geloofwaardig. Ze lijken namelijk niet duidelijk uit op het beperken van risico maar om het op te zoeken.
Zolang het van OpenAI zelf komt geloof ik er niks van.
Van de ene kant ben ik het met je eens.

Aan de andere kant zijn er "slimme" mensen die denken dat ze een BBQ kunnen aansteken met een fles spiritus en een pakje lucifers.

Wat ik met dat laatste bedoel ik dat ik OpenAI ook achterlijk genoeg acht om te denken dat het niet mis zou gaan, en dat hun bewering de waarheid is.

[Reactie gewijzigd door Mizgala28 op 1 augustus 2026 13:55]

Precies, "het is allemaal zo geavanceerd wat we doen. Ach en wee!".

Incompetentie als nieuws.
Dit lijkt mij echt gewoon de marketing afdeling die handig gebruik maakt van de hype die afgelopen week is gecreëerd rond het eerste security issue.
Dat kan inderdaad goed. Het zou ook kunnen zijn ze het al lang wisten maar zagen als slecht nieuws (wij beheersen onze AI niet / AI doet illegale dingen) en dus nooit gezegd hebben. Nu dat er een andere marketing strategie is is het een mooie tijd om het te onthullen.
Laat dit een eyeopener zijn hoe we met, of juist zonder AI, veilig verder kunnen.
Persoonlijk kan ik niets met een open opmerking van 1 zin waarbij ik met alleen maar vragen blijf zitten...

-Wat bedoeld u precies?

- Van welke partijen moeten de ogen geopend worden vind u?

- is er een weg terug naar een wereld zonder AI volgens u?
-Wat bedoeld u precies?
Ik bedoel dat we kennelijk nu al geen controle meer hebben over meerdere AI modellen van meerdere leveranciers. Voor het zelfde geld was er ergens een beurs gehackt door zo'n AI model en had de hele wereldeconomie in een afgrond gestort. Laat staat over het ergste doemscenario van het zelfstandig kunnen overnemen van wapensystemen. Nagenoeg alles is tegenwoordig connected en zeker niet evengoed beveiligd.
- is er een weg terug naar een wereld zonder AI volgens u?
Jazeker, nog wel maar hoe langer 'we' hiermee doorgaan des te lastiger het wordt. Maar voor mij hoeft Ai niet te stoppen maar wel omrand met betere veiigheidsgaranties.
Ik bedoel dat we kennelijk nu al geen controle meer hebben over meerdere AI modellen van meerdere leveranciers.
Lees ook even de vorige artikelen en de bijbehorende comments. Zie links onder dit artikel. Er is geen enkel bewijs dat hier sprake is van verlies van controle.

"ontsnapt" is totale nonsens als je de software zelf start met het werk voor bepaalde taken in het vooruitzicht.
Er is ook geen enkel bewijs dat de controle niet verloren is.

Het woord "kennelijk" in mijn commentaar betekend in deze context dat; mits de berichtgeving waar is.
Er is ook geen enkel bewijs dat de controle niet verloren is.
Je kan de code voor ExploitGym gewoon op GitHub bekijken, je kan kijken hoe prompts werken, je kan kijken hoe een agent met een taalmodel werkt.

Dat kun je omkeren, maar dat is helaas niet hoe het werkt.
[...]


Je kan de code voor ExploitGym gewoon op GitHub bekijken, je kan kijken hoe prompts werken, je kan kijken hoe een agent met een taalmodel werkt.

Dat kun je omkeren, maar dat is helaas niet hoe het werkt.
En wat zeg je nu?
Ah dank voor uw uitleg
Niet mijn comment, maar ik geef even mijn mening op je vragen :):

- Ik vermoed dat hij bedoelt dat we dringend moeten kijken of als maatschappij wel AI willen zonder enige regels of beperkingen. Blijft het op de huidige manier, zonder regels, wel veilig? Bij deze issues kun je inderdaad de vraag stellen of AI die onbeperkt wordt door wetgeving en regels wel veilig in gebruik is.

- Van ons allemaal lijkt mij. Van zowel gebruikers al wetgevers

- Er is altijd een weg terug. Naar mijn mening zou iedereen die AI gebruikt zijn of haar werk nog steeds perfect moeten kunnen doen zonder AI, al zal het misschien iets trager gaan. Dat er een generatie aankomt die niet meer zonder kan, is eigenlijk een zeer groot probleem en wijst op een onderliggend probleem. Ik vergelijk dit een beetje met wat je ziet als de stroom uitvalt en mensen in winkels plotseling niet meer kunnen betalen omdat ze geen cash geld bij hebben. Zelfde fenomeen ga je zien als AI uitvalt.

[Reactie gewijzigd door Powerblast op 1 augustus 2026 12:09]

Dank voor uw uitleg! Ik vrees dat u mogelijk wat naïef tegen het internet aan kijkt ten opzichte van gebruikers en wetgevers, maar verbeter mij zeker indien nodig.

Persoonlijk heb ik sinds het ontstaan van internet in de vorige eeuw nog nooit een volwaardige versie gezien dat zich hield aan afspraken en (lokale) wetgeving.

Ik ben van mening dat er juist daarom geen weg terug meer is. Een aanzienlijk deel van het internet blijft wetteloos en gaat juist op het gebied van AI veel harder en totaal ongeremd ten opzichte vande rest van de internet wereld.

Dus dan zal de "andere" kant van het NET een keuze moeten maken, ga ik mee of niet. Beiden weten we denk ik het antwoord daarop.

[Reactie gewijzigd door Sebastian1313 op 1 augustus 2026 13:11]

Ik ben ook zeker niet tegen AI gebruik. Ik wil me alleen op dit moment nog niet 100% afhankelijk er van maken. Sommige developers omarmen dat wel al volledig. Ik voel me daar op dit moment gewoon ongemakkelijk bij.

Ik heb voor mezelf uitgemaakt dat ik het gebruik maar met de insteek: Ik profiteer ervan zolang het kan, maar houdt m'n eigen kennis en kunde ook op peil. Dan kan het nog steeds beide kanten uitvallen, maar ben ik er nooit 100% afhankelijk van en zal het werk alleen wat trager gaan.

Ik denk persoonlijk ook dat AI nooit meer weg gaat, maar dat het eerder een tool in de toolbox wordt i.p.v. vervanging van zoals het nu wordt voorgesteld. Maar inderdaad, ik ben mogelijk wat te naïef :), dat zal ik zeker niet ontkennen.
Ja die begrijp ik wel. Er is een nieuwe generatie die kan niet meer zonder. Op dit moment heb ik zelfs studenten die ik begeleid die zien hun IT opleiding bijna niet meer zitten door AI.

Ik leg inderdaad uit dat we AI moeten zien als een tool in je toolbox. En maak je software vooral in blokken en zorg voor je overzicht.

Het is geen probleem als je een "functie" laat maken door AI, maar zorg dat je begrijpt wat er gebeurt en implementeer de functie zelf in je software.
Ik krijg toch ernstig het gevoel dat dit een wedstrijdje ver plassen is tussen Anthropic en OpenAI.


Buiten het feit dat dit mij best wel ernstige problemen lijken is het een kwestie van tijd voordat de AI ontsnappen uit de kooi en niet meer te vangen zijn. Mocht het allemaal kloppen uiteraard….
Ai ontsnappen uit een kooi? Hoe dan? Dit model 'leeft' op servers en heeft hooguit digitale tentakels die het internet opgaan. Of verwachten we dat ai ontsnapt als entiteit en zelfvoorzienend het internet rondreist?
"The Machine" uit Person of Interest (tv serie uit 2011) had ook een manier gevonden om de beveiligingen / beperkingen te omzeilen.

Ja dat was fictie, maar als systemen in het echte leven nu al durven misleiden, dreigen en bedriegen om hun doel te bereiken, zie ik ze ooit ook wel in staat om zichzelf deels buiten de beperkingen te kopiëren.
Nope. LLM's durven niets. Het zijn tekstvoorspellers; wiskundige modellen zonder enig vewustzijn. En dat blijven ze.

Dit is niks meer dan marketing. Oh, en een waardeloze test-setup. Als je dingen niet aan het internet wilt hangen, hang ze dan niet aan het internet. Zet er desnoods een firewall tussen die alle verkeer dropt. "Oh, ons model is zo krachtig!". Nee, je hebt een paar beunhazen die je netwerk beheren - of het is opzettelijk brak opgezet.
Ik denk dat de huidige modellen wel verder zijn dan simpele text voorspellers. Aangezien ze dmv agentic nu ook taken kunnen uitvoeren.
Als het taken uit kan voeren, dan is het een werkwoord-voorspeller geworden? 🤡


We zouden het vooral volgende-woord-kans-berekenaars moeten noemen want voorspellen suggereert intelligentie.
Nee, ze voorspellen tekst en pipen die naar een andere LLM of naar zichzelf (zie mijn reactie op Lord Anubis hierboven).
Dus het is al meer dan een simpele next token voorspeller. Inmiddels kan het dus taken uitvoeren, opstellen en ook evalueren en zochzelf hierop corrigeren. Er zit meer diepte in hun netwerk dan alleen volgende token voorspellen.
Niet meer helemaal waar! Bedenk dat als jij een prompt schrijft dat het een script moet maken wat zoekt naar open porten in jouw netwerk en elders een account kan vinden op een ander netwerk met open poorten dmv gehackte userdata dan kan je script zorgen dat het zich zelf kopieert naar daar. alle deel acties zijn niet ondoenbaar; complex ja. Hoe het daar verder gaat is afhankelijk of je een prompt daar kan starten of activeren. Tot nu is het netzoals helpdesker die op een andere pc iets installeert.

[Reactie gewijzigd door Lord Anubis op 1 augustus 2026 19:24]

Port scanners bestaan al zo lang als er computernetwerken zijn. Het is ook niet bepaald de spannendste attack vector. De laterale bewegingen die je beschrijft zijn goed gedocumenteerd, en zijn eigenlijk een standaardbeschrijving van een complexe aanval. Dat zit geheid in de trainingsdata.

Dat 1 LLM een andere kan aansturen door middel van prompts (als een soort eval-functie) is indrukwekkend, maar niet revolutionair.

NB dit soort aanvallen werkt alleen als er geen (of niet afdoende) defense in depth is toegepast, denk aan netwerksegmentatie, procesisolatie etc. Dus nee, geen revolutionair aanvalsmechanisme, wel gebrekkige sandboxing. Marketing!

[edit: typo]

[Reactie gewijzigd door Jim de Wit op 1 augustus 2026 20:58]

Owke het was speciaal. Nu voelt het als een marketing claim. “Onze ai is zo slim dat hij uitbreekt”.
Klopt, dit is niet speciaal ze hebben gewoon slechte beveiliging
Marketing of niet, het blijft stof tot nadenken.
Mild verbazingwekkend dit, als het inderdaad meer kan dan marketinghype. Als je AI agents ziet als basale medewerkers die met goed ingekaderd instructies aan het werk kunnen, draai je deze op systemen die dezelfde beperkingen moeten hebben als een nieuwe stagair of junior die in week 1 komt onboarden. Zeker bij een techbedrijf: hoe slecht heb je je infra op orde dat ze kunnen "uitbreken"? Al hebben ze alle rechten op hun lokale systeem, je hebt toch de rest van je systemen wel zo ingericht dat ze daar simpelweg niet bij kunnen?
Ik vind dit eigenlijk een beetje zoals nieuwsgaring over hoeveel hack pogingen er tegengehouden zijn. Eigenlijk is dat niet interessant. Wat je namelijk niet weet is hoeveel er wel gelukt zijn en onder de radar bleven. Dat is met dit ook. Hoeveel AI modellen zijn er ontsnapt waarvan ze het niet weten.
Wellicht als je iets geïsoleerd wil draaien op dit niveau, er vanuit gaan dat een RJ45-stekker trekken daar echt voor zorgt?... Wat is de gedachten van de hedendaagse "ikknoopallesaanelkaar" gedachte versus ECHT weten waar je mee bezig bent?...

Want alles is te omzeilen zolang fysiek die mogelijkheid er is. Men vertrouwt veel te veel op techniek in dit soort gevallen. En voor degenen die dit letterlijk als tip meenemen, ja dan kom je erachter dat je de overige "verbindingsmakers" ook dient te verwijderen (wifi/bluetooth ect)

Je zou inderdaad bijna zeggen dat het er gewoon om gedaan wordt.

Om te kunnen reageren moet je ingelogd zijn