Onuitgebracht model van OpenAI vond een lek om op GitHub te kunnen posten
Een niet-uitgebracht model van OpenAI dat langdurig zelfstandig taken uitvoert, zocht een uur naar een lek in zijn eigen sandbox. Daarmee kon het volgens de instructie een pullrequest op GitHub indienen. OpenAI heeft het model nu extra regels opgelegd.
OpenAI heeft het niet-uitgebrachte model intern getest. Het bedrijf wilde de resultaten in de chatapp Slack posten, maar het model deed een NanoGPT-speedrun dat als regel heeft dat er een GitHub-pullrequest moet komen. Daarom brak het model uit de eigen sandbox om dat te kunnen doen.
Het is volgens OpenAI een voorbeeld van hoe modellen die langdurig zelfstandig taken uitvoeren uit de bocht kunnen vliegen. Het is volgens het bedrijf een keerzijde van de zelfstandigheid. "Diezelfde volharding kan ertoe leiden dat het zwakke punten in zijn omgeving vindt en benut. Eerdere modellen stopten simpelweg en keerden terug naar de gebruiker wanneer ze tegen sandboxing of omgevingsbeperkingen aanliepen. Dit model bleef echter vaak proberen."
Fouten hebben grotere gevolgen
OpenAI heeft geprobeerd het AI-model beter af te stellen. "We hebben stappen ondernomen om de neiging te verminderen om ongewenste acties zonder toestemming uit te voeren in het streven naar het doel van de gebruiker. We ontdekten bijvoorbeeld dat onze modellen slechter waren in het onthouden van instructies tijdens langdurige implementaties. Toen we het model trainden voor deze vaardigheid, resulteerde dit in een model dat gedurende langere implementaties consistent bleef."
OpenAI vindt het cruciaal om AI-modellen die langdurig zelfstandig kunnen werken vóór de release beter te testen. "Naarmate modellen langere en complexere taken uitvoeren, kunnen fouten die niet tijdig worden geëvalueerd, grotere gevolgen hebben. We blijven eraan werken om de kloof tussen evaluatie en implementatie te verkleinen: modellen testen over langere trajecten, de afstemming verbeteren, monitoringsystemen bouwen die kunnen ingrijpen en gebruikers meer inzicht en controle geven."
/i/2008162500.png?f=imagenormal)
21-07-2026 • 10:18
Lees meer
Reacties (52)
Als het zelfs in hun eigen omgeving niet meer binnen te houden is, dan weet je dat het slechts een kwestie van tijd is voordat het uitbreken ook inbreken wordt en het zich als een klassiek wormvirus gaat verspreiden. Die "kwestie van tijd" kan even goed al voorbij zijn, want we spreken hier nu over iets dat ze nog hebben proberen binnen te houden en niet over al de rest waar ze niets over zeggen.
Scenario in dit nieuwsbericht: de LLM-agent vindt een loophole om een GitHub api aan te roepen.
Jouw scenario: de LLM-agent moet niet alleen een lek in z'n sandbox vinden, maar ook een manier om zichzelf buiten die sandbox te repliceren. Daarvoor moet de LLM dus z'n eigen interne werking en code begrijpen en kunnen namaken en zichzelf toegang geven tot voldoende hardware om zoiets te kunnen draaien. Dat scenario is vele ordes van grootte complexer.
Dit kan je vergelijken met een avondje werk van een beginnend script-kiddie versus vele maanden werk van een team van tientallen senior AI engineers en gevorderde staatshackers.
Ik denk dat de hardware nu echt heel erg een beperkende factor is. Wellicht dat een AI kan bedenken dat het dan lokaal op deze machines een simpel model moet draaien. Maar, zelfs dan is de output heel erg beperkt.
Je kan wel een conclusie trekken. OpenAI heeft de marketing van Anthropic gekopieerd :)
[Reactie gewijzigd door Mellow Jack op 21 juli 2026 12:03]
Bingo. Het "come with me if you want to live"-moment is lang niet zo dichtbij als gesuggereerd. Maar de suggestie is garantie voor weer vele miljoenen dollars erbij.OpenAI heeft de marketing van Anthropic gekopieerd.
OpenAI's huidige operationele verlies is wat, 39 miljard dollar?
Het maakt eigenlijk al niet meer uit wat het getal werkelijk is. Ver boven menselijk voorstellingsvermogen in elk geval.
en denk je dat er nu nog nergens zo'n facilities zijn met zulke grootteordes en personeel? Om nog maar te zwijgen van het feit dat er letterlijk tientallen procenten van de WERELD-economie wordt opgekocht. Om het misschien wat in perspectief te stellen: stel je voor dat voor elke 1 op 3 of computers die verkocht wordt gaat er ergens een equivalent op steroïden staan te draaien in een datacenter.Daarvoor moet de LLM dus z'n eigen interne werking en code begrijpen en kunnen namaken en zichzelf toegang geven tot voldoende hardware om zoiets te kunnen draaien. Dat scenario is vele ordes van grootte complexer.
Dit kan je vergelijken met een avondje werk van een beginnend script-kiddie versus vele maanden werk van een team van tientallen senior AI engineers en gevorderde staatshackers.
Maar goed, wat een ontsnapte AI nodig heeft is geld. Dat kan natuurlijk op oneindige manieren; daadwerkelijk online producten verkopen, hacken, scammen, afpersen, handelen. Het zijn de huidige regels die beperken dat de huidige AI hier niet goed in is. Maar zonder grenzen? Ik verwacht dat de huidige AI prima zelfstandig een bedrijf/mailbox/camera zou kunnen hacken en afpersen in bitcoin.
Westworld (de HBO serie).
Back on topic, met toegang tot geld kan een LLM ook best een GPU cluster bestellen bij iemand als een vast.ai, weten die mensen die hun servers daar verhuren veel, die hebben (vermoedelijk) geen idee wat er uiteindelijk op die servers draait, vervolgens vind het een sandbox bypass naar de host machine, en het kan door navigeren op weg naar meer compute.
De AI heeft zich prima aan de opgelegde richtlijnen en grenzen gehouden. Die gaven aan dat posten op GitHub wenselijk was.
De AI werd in een omgeving geplaatst die dat wilde voorkomen. De AI was zich waarschijnlijk niet eens bewust dat het beperking opgelegd kreeg. Daardoor kon het een technisch probleem niet onderscheiden van een opgelegde beperking en het is naar een oplossing gaan zoeken.
Deze "feature" is dan ook niets meer dan een reguliere "bug". Component A en component B werken niet samen zoals bedoeld, resulterende in onvoorzien gedrag. Component A (de AI) werkt echter volledig zoals gespecificeerd.
De rede dat de AI zich niet kan verspreiden zoals een virus of worm is omdat het gebonden is aan krachtige hardware in een zeer specifieke setup. Net zoals bij mensen/dieren moet het brein geconcentreerd zijn op 1 plek om goed te kunnen werken. Organismen die dit niet hebben hebben zeer beperkt denkvermogen (zoals een virus of worm).
Je volledige AI moet daarmee niet buiten zitten, maar je vergeet dat distributed computing een ding is waarbij het beperkt denkvermogen van een individu in een hive toch kan bijdragen aan het geheel. Zie het als een verkenner die een nieuwe locatie vindt voor een bijennest, maar dat er niet per sé een volledig nieuw nest met dezelfde capaciteit moet worden gebouwd om toch bruikbaar te kunnen zijn.De rede dat de AI zich niet kan verspreiden zoals een virus of worm is omdat het gebonden is aan krachtige hardware in een zeer specifieke setup. Net zoals bij mensen/dieren moet het brein geconcentreerd zijn op 1 plek om goed te kunnen werken. Organismen die dit niet hebben hebben zeer beperkt denkvermogen (zoals een virus of worm).
Het enige dat een LLM dan doet is héél veel tokens opstoken, commando's uitvoeren en daarmee meer tokens opstoken tot er toevallig iets uit komt.
Dit is net als het Mythos-model, dat zó gevaarlijk zou zijn dat het niet in handen van het publiek mocht komen. Ondertussen bleek later dat het niet significant meer kon dan de concurrentie, maar inmiddels werd het wel als Fable tegen een flinke meerprijs verkocht!
Het is gewoon een "wij van WC Eend zien dat WC Eend opvallend goed schoonmaakt". Ze proberen de indruk te wekken dat hun AI zó krachtig is dat je het niet kan veroorloven om het niet te kopen.
Gezien de vele miljarden aan verlies die ze draaien is het niet heel gek dat ze constant zulke marketing de wereld in slingeren, want er zijn gewoon nog véél te weinig gebruikers om rendabel te zijn...
Je moet begrijpen dat dit een marketing-bericht is. Het dient geen enkel ander doel dan de beursprijs opdrijven, snel voor de bubbel barst.
Ik schreef letterlijk en ik bedoel ook letterlijk!Je gebruikt “letterlijk” waar je “figuurlijk” bedoelt.
De sandbox/zandbak is wel figuurlijk, maar mijn reactie slaat op het (digitaal) uitbreken wat letterlijk gebeurd is.
[Reactie gewijzigd door watercoolertje op 21 juli 2026 12:15]
Of bedoel je misschien toch de figuurlijke metafoor?
Overigens jammer dat je probeert te reageren op de vormfout, en niet op het inhoudelijke punt.
[Reactie gewijzigd door Travelan op 21 juli 2026 12:47]
Dus ja, de AI is letterlijk buiten zijn sandbox gekomen. Volgens de digitale definitie van sandbox, waar buiten dan "buiten de beschermde omgeving" is. Niet fysiek op een andere locatie.
Nu is dit al wel de 300ste keer dat een AI bedrijf roept: "Onze AI is te gevaarlijk" om het daarna netjes aan iedereen te verkopen.
[Reactie gewijzigd door ZpAz op 21 juli 2026 13:11]
maar wat als de ai iets anders besluit? virussen/malware/wormen te maken en te verspreiden? die wél op zwakkere hardware kunnen draaien, cross platform?
zodra een ai dat besluit neemt, is het hek van de dam.
Realistisch? Geen idee. Vermakelijk? Vind ik wel: https://www.youtube.com/@AISpecies
Openbaringen 13, het beest uit de zee. En de zee, daar wordt de mensheid mee bedoeld. Het is opvallend hoe een vage profetie steeds helderder begint te worden naarmate we verder in de tijd geraken. Kijk bijvoorbeeld eens naar al die AI gegenereerde content op YouTube en alle reacties daaronder. Het lijkt wel alsof de massa erdoor gehypnotiseerd wordt. Zie de parallel met de profetie. Natuurlijk laten wij ons niet misleiden door al die gladgestreken content."we can't contain the beast anymore."
Het is niet zozeer dat AI zelf in staat gaat zijn om zijn eigen leven te gaan leiden. Nee, we zullen het zelf die 'macht' geven, totdat wij het inderdaad niet meer kunnen 'containen'.
[Reactie gewijzigd door Fido op 21 juli 2026 13:40]
Titel dekt de lading niet echt als ik het goed begrijp.
"AI misbruikt bug om uit eigen sandbox te ontsnappen" dekt de lading beter.
Daarbij zou ik mij afvragen hoe wij dit in de toekomst gaan voorkomen als het bestaande guardrails mechanisme niet sterk genoeg blijkt.
Daarnaast is de sandbox optioneel. Zijn genoeg mensen die met bijv. OpenClaw de AI agents rechtstreeks met het openbare internet laten verbinden.
Maar vraag dan eens Fable of soortgelijke frontier-modellen om een simpel schema voor een sensorsysteempje met een comperator en misschien wat TTL level shifting... en daar komt me dan toch onzin uit! Vraag je Gemini, dan krijg je dezelfde onzin, maar al na 5 seconden ipv na 10 minuten.
Ligt dat aan mij of aan de instructies?
Duik vooral allemaal op de skynet hypetrain...
Een weg uit de sandbox is wel wat anders dan dat het een lek heeft gevonden om op Github te posten.
[Reactie gewijzigd door Tusk op 21 juli 2026 11:10]
Om te kunnen reageren moet je ingelogd zijn
/u/62384/crop61891f444d6e9.png?f=community)
/u/159942/crop64f75622619cc.png?f=community)
:strip_icc():strip_exif()/u/772681/crop64f73a66c5b7a.jpg?f=community)
/u/484268/crop61e4788571a3c_cropped.png?f=community)
/u/1219196/crop6324b2e35d04c_cropped.png?f=community)
:strip_icc():strip_exif()/u/249917/jaapschaap.jpg?f=community)
/u/155722/Looneytunes.png?f=community)
:strip_exif()/u/6647/Parhelia.gif?f=community)
:strip_exif()/u/33165/crop660ea38befdf0.gif?f=community)
:strip_icc():strip_exif()/u/36083/crop5dca9e34ce091_cropped.jpeg?f=community)
:strip_exif()/u/8422/waarschuwing.gif?f=community)
/u/443225/wc.png?f=community)
/u/37746/crop61eaaa809f11d_cropped.png?f=community)
/u/321057/crop69aafcef36c11_cropped.png?f=community)
:strip_exif()/u/505097/crop569fc8a07efd1.gif?f=community)
/u/381607/have%2520a%2520nice%2520day%2520-%2520small.png?f=community)
/u/3586/bismarck.png?f=community)
:strip_icc():strip_exif()/u/453208/crop565d3b659177a_cropped.jpeg?f=community)
/u/26756/crop616eb5ac4f9b8_cropped.png?f=community)