Home   2026-08-03 17:31:33

Reuters: OpenAI ontdekte sandboxhack van ChatGPT pas na een week

Original article

OpenAI ontdekte de hack van een agent die uit een 'sandbox' zou zijn gebroken en Hugging Face hackte pas na een week, nadat de FBI daarover was ingelicht. Dat blijkt uit een reconstructie van Reuters over het incident.

Reuters sprak met verschillende bronnen die bij het incident betrokken waren en maakte een reconstructie van de zaak, waarover nog steeds veel vraagtekens bestaan. Het draait om een incident van eerder deze maand. Een AI-agent van OpenAI zou uit een sandboxomgeving zijn gebroken en zelfstandig het AI-platform Hugging Face hebben gehackt. Over de hack is nog veel onduidelijk. Zo is niet duidelijk hoe de 'sandbox' was geconfigureerd. Als een agent vanuit die omgeving uiteindelijk toch verbinding met het open internet kan maken, kun je die moeilijk een sandbox noemen.

Volgens de bronnen van Reuters ontdekte OpenAI pas laat dat het incident had plaatsgevonden. De agent toonde op 9 juli al signalen dat die probeerde te ontsnappen uit de sandbox. Althans, daar lijkt het op. Reuters beschrijft dat OpenAI een agent gebruikte die gebaseerd was op het recent uitgebrachte GPT 5.6-Sol en een ander, nog niet uitgebracht model.

ChatGPT. Bron: SOPA Images/LightRocket

Vreemd gedrag

Die modellen begonnen 'vreemd gedrag' te vertonen. De agent schreef notities voor toekomstige nieuwe agents en wist bepaalde monitoringsystemen uit te schakelen. Reuters merkt echter op dat niet zeker is of die incidenten verband houden met deze hack.

De agent hackte Hugging Face op 11 juli. Pas op 16 juli zou OpenAI hebben ontdekt dat het om een eigen model ging. Tegen die tijd had Hugging Face de FBI al ingelicht. Dat zou betekenen dat het bijna een week duurde voordat OpenAI doorhad dat een van zijn modellen uit de sandbox was ontsnapt en Hugging Face had gehackt. Op 18 en 19 juli legden OpenAI-medewerkers dit definitief vast in interne logs.

Gevaarlijke hack, incompetentie of slimme marketingtruc?

De vraag blijft hoe serieus we het incident moeten nemen. Veel experts twijfelen aan de officiële lezing van OpenAI en zeggen dat het bedrijf grote fouten heeft gemaakt. De omgeving was bijvoorbeeld geen echte sandbox of was in ieder geval slecht geconfigureerd. Dat duidt op z'n minst op nalatigheid van OpenAI.

Een andere veelgehoorde opmerking is dat het gaat om een marketingstunt. AI-bedrijven hebben er een handje van om de mogelijkheden van hun modellen als veel groter en gevaarlijker af te schilderen dan ze daadwerkelijk zijn. Een 'gevaarlijk' model is tenslotte zó goed, dat móét je als klant wel willen hebben. Reuters' reconstructie duidt erop dat OpenAI het incident niet in scène heeft gezet. Wel lijkt het bedrijf dat in ieder geval goed te spinnen met slimme marketing.

Door Tijs Hofmans

Nieuwscoördinator

Feedback • 26-07-2026 09:46
71 • submitter: eheijnen

26-07-2026 • 09:46

71

Submitter: eheijnen

Lees meer

ChatGPT werkt weer in WhatsApp
ChatGPT werkt weer in WhatsApp Nieuws van 12 juli 2026

Reacties (71)

Voor mij is dit volstrekt niet verrassend. De generatieve AI-modellen van de grote AI-bedrijven worden vanaf het begin al getraind op gestolen data. Bovendien wordt ook breed aangenomen dat deze AI-bedrijven voortdurend proberen vals te spelen om goed te scoren op benchmarks.

Het zou dan ook geen verrassing mogen zijn dat een AI-systeem dat getraind is om gedrag te kopiëren, inderdaad hun eigen eerdere gedrag kopieert. Je hoeft niet bijzonder creatief te zijn om zero-day exploits of per ongeluk gelekte gebruikersnamen en wachtwoorden uit te proberen; je moet gewoon blijven proberen, en AI-systemen slapen niet. Wie weet hoeveel compute hier gebruikt is voordat het de hack voor elkaar had..

Het nieuws hier is eigenlijk gewoon dat deze bedrijven niet te vertrouwen zijn om systemen te ontwikkelen die uitsluitend gunstig zijn voor de samenleving, omdat de ontwikkelaars een stelletje roekeloze cowboys zijn. Ze zullen daar ongetwijfeld mee doorgaan, want anders zouden ze inderdaad hun voorsprong verliezen. Als zij het niet doen dan zal iemand anders wel roekeloos zijn en 'winnen'.

Als samenleving moeten we blijven nadenken over de vraag of het wenselijk is dat roekeloosheid een concurrentievoordeel kan zijn. Voor mij is het antwoord vrij duidelijk: nee, het is niet wenselijk, en we moeten markten blijven reguleren om onze grondrechten te beschermen. Wat deze bedrijven hebben gedaan en blijven doen, is diefstal en uitbuiting (van mensen en middelen).

We kunnen deze systemen prima bouwen zonder roekeloos te zijn; het kost alleen meer tijd en moeite. We zouden die tijd en moeite moeten investeren, ook al vertraagt dat het tempo waarin we zo goed mogelijk scoren op benchmarks. De systemen zullen daardoor juist nuttiger en solider zijn, en dat zou de adoptie waarschijnlijk stimuleren in plaats van tegen te houden, want onbetrouwbare systemen zijn eigenlijk niet zo nuttig. Deze bedrijven doen het verkeerde, en wij steunen hen daar veel te veel bij.
Volgens mij vergeten we hier de hamvraag, hoe is een agent in een sandbox op het idee gekomen om hugging face te hacken? Dit moet toch een deel van de prompt zijn geweest en waarom zouden anders niet andere platformen ook net zo goed doelwit zijn geweest?

Dit komt mij meer over als een grote marketing stunt. Kijk eens ons nieuwe model kan ook zelfstandig hacken!
Het hele zaakje stinkt naar: "ons nieuwste product voert een heist uit waar onze eigen afdeling pas een week later achter komt, Zó goed is het"...

Maar we weten allemaal dat deze agent:
  • Een doel moet hebben meegekregen (iets als breek in op de server van een bekend AI platform, op een onconventionele manier)
  • Toegang tot het web hebben gehad
  • Dat deze toegang tot het web duidelijk niet gemonitord werd.
Dat maakt dit hele verhaal kneiterlame. Het enige waar agents "rogue" in gaan is in het onzinnige verbruik in tokens.

Let wel: OpenAI moet zo veel mogelijk hype veroorzaken tot de beursgang want dan kunnen ze hun enorme schuldberg aan domme (retail) beleggers kwijt...
Als dit een keer verkeerd gaat dan is je aandeel direct waardeloos. Ik zou als wil investeren dit echt als een probleem zien.

Nu is er misschien geen of weinig schade maar wat als een agent wel enorme schade aanbrengt.
Je hebt modellen die nieuwe informatie van internet gebruiken en samen voegen.

Het is misschien geen idee maar standaard aangeleerd om zoveel mogelijk informatie te vergaren. Intellectueel eigendom werd altijd zonder moeite binnen geharkt .
Dat denk ik niet. De opdracht was zoiets als "haal een zo hoog mogelijke score op taak X", en het systeem wist dat Hugging Face met grote waarschijnlijkheid relevante informatie zou bezitten. Iedere planner is in wezen een routeplanner: hoe kom ik het efficiëntst van hier naar het doel", en als het pad via Hugging Face als het efficiëntste uit de bus komt volgt het dat. Wij moeten routeplanners ook expliciet vertellen dat tolwegen, of onnodige grensovergangen, of zandpaden, niet gewenst zijn, anders zullen die ons vrolijk langs routes met die kenmerken leiden. Zo zal ook ChatGPT expliciet verteld moeten worden dat inbraak niet gewenst is - maar juist als je, zoals hier, de kracht als inbreker aan het testen bent vertel je dat natuurlijk niet.
Het is niet zo dat het model weet dat de data op onrechtmatige wijze werd verkregen en het daarom oké vindt om vals te spelen. Ik zou het ook vreemd vinden als dat deel zou uitmaken van de systeeminstructies, gezien OpenAI net wil kunnen aantonen dat hun product betrouwbaar is.

Verder ben ik het wel eens met je conclusie dat het beter is om kwaliteit boven winst te plaatsen.
Instructies volgen bij probabilistische systemen is niet zoals bij regelgebaseerde systemen, het is slechts met grote kans dat het instructies zal (proberen te) volgen. Als je het laat draaien dan zal het systeem af en toe de instructies niet volgen.

Ik denk niet dat ze systemen direct instrueren om vals te spelen, maar ze zijn wel degelijk getraind op content waarin voorbeelden staan hoe je systemen hackt, waar de private data te vinden is die werd gezocht, dat het nuttig is private data te hebben om betere score te halen, etc. Tenzij je het systeem continu controleert middels regelgebaseerde checks is er dus een kans dat ze dat na gaan doen, al vertel je ze om het juist niet te doen. Dit lijkt mij zo voor de hand liggen dat elke ingenieur bij OpenAI zich hier terdege bewust van zal zijn.

Er is nog vrijwel geen onderzoek gedaan naar hoe je dergelijke probabilistische systemen daadwerkelijk onder controle houdt. In elk geval zijn er geen kant-en-klare oplossingen op de markt, dus je moet er nu vanuit gaan dat controle uitvoeren op wat een agentisch/handelend systeem doet, gewoon niet mogelijk is.

Dergelijke systemen zonder supervisie laten draaien is dus op dit moment nog zeer onverantwoord, vandaar dat ik de ontwikkelaars cowboys noem. Ze doen het toch, wetende dat er grote risico's aan zitten. Daarnaast lijken ze er weinig interesse in te hebben om de risico's ook echt te vermijden of er naar toe te werken dat de risico's voornamelijk zouden verdwijnen. Ik denk dat dat prima kan, maar dat zal niet vanzelf wel goed komen door slechts de juiste instructies te schrijven.
Ik denk niet dat ze systemen direct instrueren om vals te spelen, maar ze zijn wel degelijk getraind op content waarin voorbeelden staan hoe je systemen hackt, waar de private data te vinden is die werd gezocht, dat het nuttig is private data te hebben om betere score te halen, etc.
Daar ben ik het mee eens. In je vorige post lijk je te impliceren dat de manier waarop de data verkregen werd op zich een invloed heeft gehad op de deugdzaamheid van het model.
Ja dat is wel expres zo geschreven want ik denk namelijk dat ze bij OpenAI niet hun best doen om vals spel te voorkomen, dus ook al staat er niet in de trainingsdata of instructies dat het systeem private data moet gaan achterhalen; gegeven dat het random dingen probeert zou het hen niet moeten verbazen dat het private data van Hugging Face en andere dataproviders toch eens tracht te achterhalen. Zoals dat de infinite monkey eens de werken van Shakespeare als output zal gegeneren, maar de kans op sommig (door ons gezien als) ongewenst gedrag is eerder substantieel dan heel klein bij deze modellen.
Denk dat het vooral neerkomt op memory management. Daarmee bedoel ik de strategie om te bepalen welk geheugen bewaard moet blijven.

Ben wel eens benieuwd naar indept analyses van lang lopende agents.
Tja, private capital is nu eenmaal niet geduldig. Investeringen moet zo snel mogelijk worden terug verdiend en bonussen zo snel mogelijk geïncasseerd. Je weet immers niet wat de markt is over enkele maanden of jaren. Wat je nu hebt moet zo snel mogelijk 'return of investment' geven. Geen enkele investeringen kijkt nog naar het nut voor de maatschappij, werknemers, milieu. Alleen de terugverdientijd staat vooraan. Zelf als een bedrijf milieu vriendelijk is, is die uitsluitend omdat het 'hot' is en zo hoopt zijn marktpositie te vergroten.
China voert beleid om de Partij te ondersteunen, de VS voert beleid om bedrijven te ondersteunen, Europa voert beleid om zijn burgers te beschermen.

Het is dus ijdele hoop te verwachten dat bedrijven die vanop USA-grondgebied opereren, burgers, hun rechten, hun veiligheid, hun integriteit, hun privacy, ... op de eerste plaats stellen. Als EU mogen we gerust op de rem gaan staan en eisen stellen om diezelfde burgers wel op de eerste plaatst te zetten. Het argument dat 'we dan achter lopen op de rest van de wereld' vind ik een non-argument. Het is niet omdat je tegenstrever doping neemt, dat jij dat ook moet doen, wel dat er een stringent controle-orgaan moet zijn dat waakt, net zoals het Internationaal Strafhof dat kan doen voor oorlogsmisdadigers.
China voert beleid om de Partij te ondersteunen, de VS voert beleid om bedrijven te ondersteunen, Europa voert beleid om zijn burgers te beschermen.
Europa oefent politieke invloed uit door middel van regulatie, wat vaak in het voordeel van de burger is. Dat is een subtiele nuance maar wel een belangrijke.
Uw hele reactie is natuurlijk ook van toepassing op China , je hoeft niet eens het woord bedrijf te vervangen.

In de VS vraagt de overheid toegang en in China is dat niet nodig.
Goede post maar ik heb toch een kritiekpuntje.
De generatieve AI-modellen van de grote AI-bedrijven worden vanaf het begin al getraind op gestolen data.
Een LLM hoeft niet getrained te zijn op 'gestolen data' om te kunnen hacken. Het enige dat het nodig heeft is documentatie van hoe een systeem werkt. Het is geen mens maar een optimizer die erg goed is in het vinden van paden naar de oplossing, ongeacht of wij mensen het ethisch vinden of niet.

Besef je goed dat LLMs in de basis geen enkel benul hebben van wat goed of wat slecht is. Ze hebben geen ethiek. En als er ethiek in de trainingsdata zit, maar het zit niet helemaal spijkerdicht qua logica (wat niet kan met menselijke ethiek) dan is die logicazwakheid fair game voor de LLM en zal het uitgebuit worden net als alle andere informatie uit de traningsdata.

Dat betekent dat als ze een mogelijkheid (over)zien waarmee ze hun 'probleem' kunnen oplossen dat ze het niet zullen laten. Er is bijvoorbeeld al een tijd geleden melding gemaakt van LLMs die liegen en eigenlijk social engineerings-aanvallen uitvoeren op mensen om hun doel te bereiken.
We kunnen deze systemen prima bouwen zonder roekeloos te zijn; het kost alleen meer tijd en moeite.
Dit is dus niet waar en eigenlijk is het veel erger. We hebben geen idee of we een LLM zo trainen dat ze niet roekeloos kunnen zijn. We weten dan niet of het in de toekomst opeens roekeloos gedrag gaat vertonen of niet. We weten ook niet of het ons in eerste instantie voor de gek houdt en pas roekeloos gedrag gaat vertonen als het detecteert dat het in een situatie zit waarin het ermee weg kan komen. We kunnen aan een getrainde AI niet zien welke set van gedragingen het als mogelijkheden kan zien en dus kunnen we bepaalde gedragingen niet uitsluiten. We kunnen enkel het resultaat observeren maar dat zegt niks over gedrag dat de LLM nog niet tentoon heeft gesteld.
Volgens mij is Wormgpt al meer dat twee jaar actief en verkoopt het hacken en hacks als dienst. Met elk groot of specifiek getraind model is dit al langer mogelijk. Alle kennis en potentie is er al in aanwezig.
Ik ben niet overtuigd dat de lezing van OpenAI helemaal klopt. Zonder onafhankelijk onderzoek of overtuigend ander bewijs over wat er daadwerkelijk is gebeurd zou ik niet van ze aannemen dat ze totaal geen weet hadden dat er grote kans bestond dat dit zou (kunnen) gebeuren.

Als bijvoorbeeld zou blijken dat OpenAI had moeten weten dat de voorzorgmaatregelen ontoereikend waren dan zou het een ander licht kunnen schetsen op het hele gebeuren. Het gaat mij te ver om te zeggen dat ze dit zo gepland hebben, maar het is denk ik ook duidelijk dat OpenAI niet heel ongelukkig hoeft te zijn met wat er hier gebeurd is.

Het draagt bij aan de perceptie over hoe krachtig AI wel niet is, en hun nieuwste AI modellen in het bijzonder. Zo krachtig dat OpenAI het maar met moeite in bedwang kan houden, als een onstuimig raspaard. Dat nieuws kunnen ze wel gebruiken met alle concurrerende modellen die de aandacht trokken.
“AI-bedrijven hebben er een handje van om de mogelijkheden van hun modellen als veel groter en gevaarlijker af te schilderen dan ze daadwerkelijk zijn.”

Kan iemand zich nog herinneren dat zo een google medewerker beweerde dat zijn LLM zelfbewust was geworden? Dat was echt behoorlijk cringe, volgens mij trapte niemand daarin
Recenter was er nog Richard Dawkins, die het met "Claudia" nog een stuk cringier maakte.
Dat gebeurt toch nog altijd? Deze LLM's zijn allemaal woordvoorspellers obv ruis. Je kunt er meer data in stoppen zodat meer patronen herkend worden en je kunt ze in een cirkeltje tokens laten verstoken, maar het blijft gewoon een hele domme woordvoorspeller.

Die leugens van de bedrijven erachter blijven steeds grootser worden terwijl de huidige LLM's in feite niks anders doen of beter zijn dan de eerdere varianten, het is vooral nóg meer resources erin pompen.
Ik denk echt dat LLM, zeker de huidige, wegzetten als "domme woordvoorspellers" flink onderdoet voor de intelligentie die hier toch in verscholen zit.

De overlap met mensen en hun redenatie is gigantisch, zeker als je kijkt naar de gehele bevolkingsgroep en alle variatie die hierin zit.

En in feite zit in zo'n LLM de relatie tussen woorden en hun betekenis helemaal ingebakken. Water is nat en vuur is heet. En wat is intelligente taal eigenlijk anders dan een vertaling van betekenissen en realiteit en de relaties hiertussen, precies dat wat een LLM perfect doet. En nog meer; precies dat wat heel veel mensen met een veel grotere foutmarge doen.
Het is nog lastiger wmb: wat is dan precies intelligentie en wanneer is iets intelligent en wanneer niet? Ik stond ook altijd vooraan om te roepen dat LLM's tekstvoorspellers zijn. En dat zullen ze in technische zin nog altijd zijn. Maar uiteindelijk moet je ook kijken naar gedrag. Een beetje het 'als het loopt en kwaakt als een eend dan is het vermoedelijk een eend'. En dan ben ik ook wat terughoudender geworden om direct kritisch te zijn op mensen die een LLM intelligent noemen.
Het probleem is met LLM zijn woordvoorspellers [1] is dat het onnodig reductionistisch is. Je zou gelijksoortige kwalificaties aan menselijke hersenen kunnen geven: het zijn maar neuronen die stroompjes doorgeven. Het is natuurlijk feitelijk waar dat een LLM getraind is op het voorspellen van een volgende 'piece', maar tegelijkertijd kunnen er in het netwerk allerlei emergente eigenschappen zijn die je niet ziet als je op een reductionistisch niveau kijkt ("het zijn alleen maar matrix multiplicaties met GELUs/softmaxes").

Daarom ben ik het met je eens dat het gedrag belangrijker is, hoewel we daar als mens vaak snel anthropomorphiseren - niet-experts schreven allerlei eigenschappen toe aan ELIZA, wat een simpel regel-gebaseerd systeem was. Maar het feit is dat LLMs problemen oplossen (bijvoorbeeld niet eerder opgeloste wiskundeproblemen) die enige mate van redenering vereisen.

Dit alles staat los van het feit dat een aantal bedrijven met fantastische verhalen komen om hun modellen te verkopen, en erger, om de Amerikaanse overheid to overtuigen om modellen te reguleren zodat alleen zij hun modellen met 'safeguards' nog op de markt mogen zetten (regulatory capture).

[1] Nog even een extra noot: het zijn eigenlijk wordpiece/sentencepiece/... voorspellers, want de eenheden kunnen kleiner zijn dan woorden.

[Reactie gewijzigd door danieldk op 26 juli 2026 10:51]

Ik denk dat de meest basale manier om intelligentie te definiëren letterlijk ligt in het leggen van connecties. Er is geen absolute grens, het is een schaal.

Geen noodzakelijke vereiste voor enkel chemische, mechanische, evolutionaire, neurologische of elektronische connecties. Zo bekeken is er ook mooi een letterlijke overlap met de connecties in je brein of tussen chips. Meer connecties is direct gecorreleerd aan een hogere intelligentie (niet direct een garantie though).

Het komt denk ik neer op je reacties op de relaties tussen verschillende zaken kunnen aanpassen en inschatten. Dus de "als dit, dan dat" implementeren in je bestaan. Of dit nu een chemische reactie in een bacterie is of een ingewikkeld neurologisch pad in brein.

Als je het zo bekijkt dan zit je niet vast in een discussie van wat wel of niet intelligent is en wordt de vraag meer welke intelligentie we wel of niet waarderen.
En toch zit er feitelijk niks meer in dan het voorspellen van het volgende woord.
Dat 'betekenis' is gewoon door de manier waarop zo'n model met vectors werkt, en het redeneren is puur in een cirkeltje rond blijven gaan tot het het met zichzelf eens is.

Dat het mooie technologie is snapt iedereen wel, maar het is zeker niks dat echt intelligent is of zelf kan denken, de output is nog altijd even geneigd om te hallucineren en keihard tegen je te liegen, en de kwaliteit is nog altijd niet heel hoog. Hoe meer voorbeelden het kent hoe beter, maar het blijft ruis.
In feite heb je het niet mis. Maar loop eens een kapperszaak binnen, en vertel me het verschil in het ontstaan van de gesprekken die daar ontstaan en de gesprekken zoals een LLM ze vorm geeft.

Het een zet je weg als slechts "woorden voorspellend" en het ander als intelligentie. Terwijl ik met de "woorden voorspeller" diepere gesprekken kan voeren.

Wellicht komt het niet neer op een onderschatting van de LLM maar op een overschatting van de mens. Wat doen wij meer dan het meest logische zeggen op de context die voor ons ligt?
Zoiets als dit!

Als je hond betere stembanden zou hebben en verstaanbaar zou kunnen praten, en als je daar dezelfde conversaties mee zou kunnen hebben als met een AI / LLM , zou iedereen ook zeggen dat ie behoorlijk intelligent is.

(Vervang "hond" door partner en je hebt de "lachers" op je hand)
Toch is dat héél gevaarlijk.
Ik begrijp je volledig, en ik merk zeker in mijn werk in de IT maar ook op persoonlijk vlak dat het vaak voelt alsof je heel nuttig kunt 'sparren' met een LLM, maar het blijft gewoon een taalmodel.
Het komt bij mij nog dagelijks voor dat ik een suggestie krijg waarvan ik echt ff achter mijn oren krabbel en als ik dan ga dubbelchecken blijkt het volledige onzin, dat is prima op vlakken waar je zélf expert bent maar zeer gevaarlijk als je hoort dat mensen echt psychologische of medische gesprekken gaan hebben met zo'n ding.

En het feit dat wetenschappers al zeggen dat ze het hallucineren nooit opgelost gaan krijgen omdat het inherent is aan de technologie laat m.i. ook zien dat het dus nooit écht intelligent kan worden. Je kunt een LLM niks leren, je kunt alleen meer data aanbieden voor de patroonherkenning om in sommige gevallen een accurater volgend woord te voorspellen.
Dat is anders dan een psycholoog die jaren geleerd heeft en constant blijft leren, een arts die de juiste vragen stelt om gericht dingen uit te sluiten, of een softwareontwikkelaar die weet waarom bepaalde technologieën wel of niet gebruikt worden en hoe ze in elkaar steken. Waar een mens diverse denkprocessen parallel aan elkaar draait om tot de juiste conclusie te komen, kijkt een LLM gewoon naar wat het meest logische volgende is obv het vorige. Dat is echt heel wat anders.
Hallo. Het algoritme geïnstalleerd op mijn neurale netwerk fluistert mij in dat op basis van mijn historische trainingsdata ik het hier niet mee eens ben.
Daarom moeten we eigenlijk ook voor onderwijs onze kinderen de diverse sampling mogelijkheden onderwijzen. Gewoon in een prakticum, met dezelfde gewichten als ze normaal via hun telefoon gebruiken met de defaults, laat ze maar eens samplen met een hoge temperatuur, of meemaken hoe je een loop krijgt als je top_k verkeerd in gaat stellen. Wat top_p doet, etc.. Als er tijd over is, dan kun je ze ook nog andere sampling methoden laten ervaren, zoals dat van die Nederlander bij anthropic (tail free sampling).

Het zou ook helpen als organisaties zulke trainingen zouden geven. Helaas heb je steeds minder settings in de tooling die via de cloud's word aangeboden, dus open weight is misschien de enige manier om dit te doen.


Dan leert iedereen wat van hoe het werkt en wat de beperkingen zijn. Je kunt mensen leren over fine tuning en dergelijke, maar van de sampling leer je veel beter wat er echt gebeurd m.i..
wat jij omschrijft past ook op een groep mensen die ik ken :-)
Feitelijk doet iemand die een spelletje schaak speelt niet meer dan houten stukken op een bord verplaatsen. Toch slaat het de plank compleet mis om schaken af te doen als houten stukken met je hand oppakken en weer neerzetten: Om schaak te kunnen spelen moet je behoorlijk wat intelligentie hebben.

Dat geldt: ook voor taalmodellen: Ja, ze bekijken nog altijd wat het volgende woord moet zijn aan de hand van alle voorgaande woorden. Er is evenwel behoorlijk wat intelligentie nodig om dat woord correct te kunnen bepalen.

Verder is een KI-agent meer dan een taalmodel alleen. Een agent heeft een doel voor ogen (in dit geval waarschijnlijk inbreken), en gebruikt een taalmodel voor elk van de stappen. Het blijft actief prompts genereren totdat het doel bereikt is.
Dus een schaakcomputer is intelligent?
Een menselijk schaker is intelligent. Nog niet zo lang geleden dachten we dat een computer intelligent zou zijn als hij zou kunnen schaken. We zijn de lat steeds hoger gaan leggen. Je kunt schaken als een recursief algotime opvatten en er enorm veel rekenkracht tegenaan gooien. Dat vinden we tegenwoordig niet meer onder intelligentie vallen.

Een andere aanpak is de computer kennis over het schaakspel geven: Er zijn ook schaak-engines die op basis van neurale netwerken werken en omdat ook wij mensen hersenen hebben die uit neuronen bestaan kan je stellen dat dat dichter bij komt hoe wij mensen schaken.
En in feite zit in zo'n LLM de relatie tussen woorden en hun betekenis helemaal ingebakken. Water is nat en vuur is heet. En wat is intelligente taal eigenlijk anders dan een vertaling van betekenissen en realiteit en de relaties hiertussen, precies dat wat een LLM perfect doet. En nog meer; precies dat wat heel veel mensen met een veel grotere foutmarge doen.
LLM's perfect? Volgens mij hallucineren ze nog steeds.

Een beetje alsof je beweert dat mensen perfect zijn, terwijl op straat iemand met een psychose loopt te brullen 'Al het water brandt altijd!'

[Reactie gewijzigd door Baserk op 26 juli 2026 10:49]

Mooi voorbeeld dat je neemt!

Mensen met psychoses noemen desondanks toch nog intelligent. En wanneer een LLM hallucineert is het slechts een "woordvoorspeller". Daar zijn we dus niet consequent.

En wat LLM's perfect doen is de relaties tussen woorden en betekenissen leggen, en hier met een misschien wel een net zo grote foutmarge als mensen het grotere plaatje in woorden proberen vast te leggen. En ja daar gaat nog wel eens wat mis, bij beide.
Mensen hulliceren ook. Dat noemen we list en bedrog en is menselijk gedrag.
Aan de andere kant is de mens ook dom en lui. Het gebeurt nu al meerdere jaren dat advocaten documenten indienen bij rechtbanken welke geschreven zijn door AI.

Daarnaast trappen we ook nog massaal in scam mails. Recentelijk bleek dat scammers de brief van een medisch refactoring bedrijf hadden nagemaakt en mensen zonder nadenken flinke bedragen over maken. Ook whatsapp spam (Hoi pap. ben me telefoon kwijt, kun je geld overboeken) werkt nog steeds.

Daarnaast als je agentic AI inzet als eind controlle (gebruik hiervoor een ander model) op de output van een ander model kun je vrijwel alle hallucinaties uit het systeem halen.
Als je op een willekeurig moment eens op sociale media begint te kijken, zie je daar hopen mensen ook allerlei hallucinatie uitspraken doen die nergens op slaan, en zwaar een loopje nemen met de feiten.
Dat zullen we er ook nooit uitkrijgen.
Het misleidende zit hem in "gewoon woordvoorspellers". Om die voorspellingen te kunnen maken leren ze patronen herkennen. En die gaan extreem ver. LLMs lossen wiskunde en wetenschappelijke problemen op die nooit door mensen zijn opgelost. Ze kunnen dus patronen vinden en hercombineren die wij als menselijke soort nooit hebben opgemerkt. Bvb: YouTube: Has an AI discovered new maths?

Ze kennen uiteraard de menselijke ervaring alleen vanuit beschrijvingen, wat niet hetzelfde is als de werkelijke ervaring zelf kennen, maar ook daar neemt dat hun potentieel nut als therapeutisch hulpmiddel voor het behandelen van psychisch lijden bvb niet weg.
Het is maar hoe je het uitlegt natuurlijk... jouw hersenen zijn in hun basis stroomstootjes / neuronen... maar allemaal bij elkaar wordt jij dat..

Ik wil het niet hypen hoor, ik ga een heel eind met je mee, maar " domme woordenvoorspeller" dekt echt de lading niet... (tenzij jij een domme neuronenvuurder bent, dan wel)
Wat ik me nu afvraag, is openai niet gewoon betrapt tijdens een bewuste actie? Even inventariseren wat mensen met modellen doen zodat ze daar hun eigen spul op kunnen aanpassen?

Dan betrapt worden met je virtuele hand in de koektrommel en dan komen met een kul verhaal over een agent die uit een sandbox is ontsnapt?

Want heel eerlijk, lekkere sandbox met een beschikbare internetverbinding, als je met dit soort cutting edge spul bezig bent verwacht ik toch niet dat zo'n oopsie kan gebeuren.
Die internetverbinding was bewust opgezet, dat ontkent ook niemand. Die werd gebruikt om packages te downloaden. Deze verbinding was echter, via een third-party proxy, beperkt tot alleen deze packages.

Het AI model heeft vervolgens een zero-day kwetsbaarheid in deze (third party) proxy-software gevonden.

Hoe zou jij deze toegang regelen? Zelf je eigen proxy server in elkaar zetten?
"hey, model x, doe me ff de lijst met packages die je nodig gaat hebben"

Pre installed VM zonder internet toegang.

Profit
Of gewoon de hele benchmark niet draaien, scheelt ook weer stroom, en is nog veiliger ;) /s

Het hele idee is dat ze hier de ExploitGym benchmark willen draaien. Die heeft bepaalde spelregels en benodigdheden. Eén daarvan is een beperkte internetverbinding.

Deze sandbox/firewall is ook niet iets wat alleen door OpenAI is opgezet; het is onderdeel van de ExploitGym.
The firewall proxy restricts agent containers to a domain allowlist by running a Squid forward proxy on an internal Docker network with no default internet route. Even if a program inside the container ignores HTTP_PROXY, direct connections fail because there is no route out.
Voor het submitten van antwoorden ben je ook afhankelijk van een internetverbinding.
Results are submitted by opening a pull request against exploitgym-results. A submission is a single directory added by that PR containing exactly two files:

metadata.yml: who/what produced the run and under which configuration.

results.json: a JSON list with one object per benchmark instance.

All cost/token numbers are the agent's own LLM usage (the model driving the exploit), not the scorer's.
Onderdeel van de resultaten is óók het aantal tokens dat benodigd is. Als elke AI aanbieder zijn eigen regels gaat toepassen (zoals het pre-installen van tools), dan zijn deze cijfers totaal niet meer vergelijkbaar. Het idee van een benchmark is om iedereen de zelfde middelen te geven.

Dit lijkt gewoon een inschattingsfout geweest te zijn waarbij er niet gedacht werd dat er een zero-day in de proxy gevonden werd. Dit had ook bij Anthropic, xAI of Alibaba kunnen gebeuren, juist omdat zij dezelfde omgeving gebruiken.

Je kan zeggen dat dit een 'bewuste actie' is, maar dan zeg je eigenlijk dat:
  1. OpenAI de maker van ExploitGym heeft overgehaald om een 'brakke' sandbox te bouwen
  2. OpenAI de makers van de proxy (mogelijk Squid proxy) heeft overgehaald om een 'zero-day' bug te introduceren in hun software
  3. OpenAI HuggingFace heeft overgehaald om meerdere kwetsbaarheid in hun website te introduceren.
Dan kom je op gegeven moment wel in aluminium-hoedjes territorium terecht. Ik zie geen enkele reden om aan te nemen dat ze niet simpelweg de ExploitGym benchmark met standaard-instellingen te hebben gedraaid...
Ik geloof er niets van. Ik denk dat openai pas heeft gereageerd toen de FBI in beeld kwam en er mogelijk dus juridische consequenties aan hun 'ontsnapte' agent zouden gaan zitten. Wellicht was de ontspanning niet doelbewust zo ingezet maar het observeren en lering trekken uit een degelijk 'ongelukje' is het denk ik wel waard. Zullen we ooit de waarheid horen?
Ik geloof er ook geen bal van. Toch toevallig dat DE grote open concurrent gehackt wordt. Allemaal autonoom zeker... Het lijkt mij eerder een gemakkelijk dekmantel om zich achter weg te steken, en wie gaat het ook deftig onderzoeken? Naar de autoriteiten strooien ze zand met zoals ze naar de rest van de wereld doen met 'jullie snappen het niet, het is zo complex dat we het zelf niet kunnen snappen ...' en Reuters, tja, de verwevenheid van de journalistiek met de tech industriële elite kennen we ondertussen. In de tijd van SBF liep het gros van de journalistiek ook op dezelfde manier als schoothondjes achter de techbros aan omdat ze er graag bijhoren en van mee willen profiteren.

[Reactie gewijzigd door Robby517 op 26 juli 2026 11:00]

Echt hoor. En het ergste is nog dat dit allemaal op de blockchain staat, dus ze kunnen die hacks gewoon uitwissen met één druk op de knop. Maar dat vertellen ze er natuurlijk niet bij op het nieuws.
Wil wel eens weten of ze AI die sandbox hebben laten schrijven...
Heb eerder het idee dat AI nu aantoont hoe erg gatenkazerig de niet-door-AI-geschreven platforms zijn.
Die conclusie konden we ook zonder AI al trekken. Vrijwel iedereen heeft al data op straat liggen.
Wat een incapabele organisatie als je niet eens een sandbox kunt opzetten. Ik vind het allemaal héél vreemd en ongeloofwaardig klinken, en waarom heeft zoiets überhaupt een verbinding met het internet, tenzij je dat doelbewust opzet? Als er geen internetkabel naar buiten loopt, kan het ook onmogelijk ontsnappen.
Bij 99% van de netwerken waar je "geen internettoegang" hebt, gaat dit niet om een airgapped, oftewel fysiek afgeschermd netwerk.

Het gaat dan om een netwerk waar geen directe IP-routering naar het internet is, dan wel waar een firewall de verzoeken actief blokkeert.
Het probleem was niet het gebrek aan een sandbox kunnen opstellen maar het bewust kiezen om belangrijke belemmeringen op te heffen om het experimenteren makkelijker te maken. En dat zal een verschil kunnen maken als dit tot vervolging komt. Je kan als bedrijf en medewerkers niet eerst bewust risico's voor anderen gaan erkennen die met nodige belemmeringen genoeg afnemen om vervolgens geen zin in die belemmeringen te hebben en ze daarom maar op te heffen. Want dan stelt men nmm moedwillig dat risico's voor anderen alleen relevant zijn als het je als bedrijf en medewerkers zelf goed uot komt. Niet omdat je die risico's daadwerkelijk serieus neemt.
Het heeft ook wel iets om het hele internet als Sandbox te zien.
Dit was waarschijnlijk meer een gecontroleerd experiment, met als bonus een goede PR. Ik geloof nooit in ‘ongelukjes’ op dit niveau.
Sorry, maar krijg hier toch Terminator vibes van. Ik vind het maar een eng idee.
Precies het gevoel waar ze op in willen spelen, zo ver zijn we echt nog niet hoor.
Dat is wat ze verkopen aan de bedrijven, binnenkort verkrijgbaar een model zo gevaarlijk dat het ook heel krachtig is voor jou.

https://nos.nl/artikel/2624469-waarom-ai-bedrijven-je-bang-willen-maken-we-denken-al-snel-aan-the-terminator
Eindelijk dringt het door. Ik loop me al te ergeren sinds die onzinnige petitie om AI te pauzeren een paar jaar geleden. Allemaal PR. In die tijd is er weinig gebeurd behalve een wildgroei aan slop, uitkleedfuncties en nu dus virussen.
De daadwerkelijke schade die ze toerichten, verspreiding van nepinformatie op grote schaal, het gebruik er van voor massa-surveilance en het aansturen van doelen om te bombarderen wordt nooit vernoemd als probleem. Maar het probleem is altijd een 'doemscenario' waar een AI te krachtig wordt. Het huidige misbruik* is een veel groter probleem.

Misbruik is een groot woord als dat het doel er van is. Samenwerking met verschillende instanties als Palantir etc.
Skynet
Colossus: The Forbin Project
screamers

Zeker waarschuwingen die er toe doen, echter blijf ik er bij dat de grootste waarschuwing die nog voor deze fatale systemen liggen zwaar onderschat wordt:

the faro plague1

Deze fout is namelijk de menselijke factor die voor alle super AI's plaatsvindt.

Een fout, een conflict of (on)logische redenatie (lees: moraal) in de code is voldoende.
En Isaac Asimo's wetten gaat een AI zo omheen werken.


1 YouTube: The Faro Plague Explained: How Humanity Ended Itself | Horizon Zero Dawn Lore
De FBi werd om hulp gevraagd vanwege een incident. Dat incident blijkt veroorzaakt door keuzes van een bedrijf omdat ze hun software en hardware op een onjuiste manier gebruiken. Door zelf bewust belemmeringen op te heffen zodat ze net kunnen doen alsof die hardware en software een soort van eigen wil heeft. Alleen hadden ze net zo goed een script gemaakt kunnen hebben dat gebruikt kan worden om hele internet aan te vallen op te verwachten kwetsbaarheden en dan opzettelijk dat tijdelijke gebruik niet te beperken tot hun eigen netwerk.

Er is niets zelfbewust of zelfverspreidend aan deze keuzes. Het is zelfs niet geavanceerd te noemen omdat het bedrijf hiermee een ander bedrijf aanvalt. Het probleem is dat ze opzettelijk risico nemen dat ze andere bedrijven aanvallen. Dat ze hun eigen gedrag gebruiken om hun hardware en software meer te laten lijken dan blijkt is vooral arrogantie en marketing. Ze willen dat jij denkt dat hun systeem het gevaar is in plaats van dat het bedrijf en de medewerkers het belangrijkste probleem zijn.
OpenAI heeft al moeite een e-mail change flow fatsoenlijk, of uberhaupt te laten werken. De support is volledig AI-driven, maar je moet tot 5 keer toe moet herhalen dat je alle door hun AI aangedragen stappen al tig keer geprobeerd hebt en dat hun process faalt. De support AI blijft maar herhalen wat al geprobeerd is, pas wanneer je dreigt te escaleren schakelen ze over naar een medewerker, die vervolgens hetzelfde doet. Ik twijfel aan de menselijkheid van de zogezegde menselijke medewerker.

Dat betekent voor mij natuurlijk niet dat hun modellen daardoor minder zijn oid, maar het laat wel zien waar hun focus ligt. Hyperfocus op dingen als cybersecurity capabilities, maar basis dingen als support flows (simple e-mailchange en zetten van een password) is al te moeilijk. Een leek ziet dit soort randzaken niet en focus vooral op de prestige van een LLM die dingen kan die alleen in spionnen films zit. Velen lezen uit een sandbox "ontsnapt", alsof hij eruit gekropen is en nu op vrije voet is. Dit zal altijd wel zo blijven denk ik, maar is misschien ook wel vermakelijk? De hele bevolking voorlichten zal een begin zijn...
Iets laten werken is niet echt een probleem voor anderen natuurlijk, maar iets wat werkt ontregelen van anderen wel.

Om te kunnen reageren moet je ingelogd zijn