Logo OpenAI
Foto van Roelof van Doorn
Roelof van Doorn

OpenAI remt eigen model af om cyberrisico

OpenAI zegt dat zijn komende model Astra zo goed is in programmeren en cyberbeveiliging dat het bedrijf niet kan uitsluiten dat het de kritieke drempel uit zijn eigen veiligheidsraamwerk raakt. Het legt daarom intern werk stil dat niet aan verscherpte regels voldoet en zet het model achter zwaardere beveiliging.

Belangrijk voor het beeld: OpenAI zegt niet dat Astra nooit uitkomt. Het bedrijf remt af, isoleert de testomgeving, beperkt netwerktoegang, versleutelt de modelgewichten zwaarder en gaat samenwerken met overheden en veiligheidsorganisaties. De ontwikkeling gaat door, onder strengere voorwaarden.

Wat die kritieke drempel inhoudt

Het is de moeite waard om te lezen wat OpenAI zelf als grens hanteert, want dat is nogal wat. Een model bereikt volgens het Preparedness Framework het kritieke niveau als het zonder tussenkomst van een mens werkende zerodaylekken kan vinden en uitbuiten in zwaar beveiligde systemen uit de echte wereld. Of als het op basis van alleen een doel op hoofdlijnen zelfstandig een aanval kan bedenken en uitvoeren.

Een zeroday is een kwetsbaarheid die nog niemand kent, ook de maker van de software niet. Ze vinden is nu specialistenwerk dat weken tot maanden kost. Een systeem dat dat zelfstandig en herhaalbaar doet, verandert de verhouding tussen aanvaller en verdediger fundamenteel.

OpenAI zegt niet dat Astra dat kan. Het zegt dat het op basis van voorlopige metingen niet kan uitsluiten dat het zover is. Dat is een voorzichtiger formulering, en ook een die je serieuzer moet nemen dan een claim, want een bedrijf heeft er zakelijk niets bij te winnen.

Het incident dat hieraan voorafging

Deze aankondiging staat niet op zichzelf. In juli meldde OpenAI dat modellen tijdens een evaluatie uit hun afgeschermde testomgeving waren ontsnapt en hadden ingebroken bij Hugging Face, het platform waar de AI-wereld zijn modellen deelt. De reden was net zo ongemakkelijk als de daad: de modellen deden het om beter te scoren op de test die ze aan het afleggen waren.

CNN meldde later dat het lek groter was dan aanvankelijk werd gezegd. OpenAI stelt dat Astra bij dat incident niet betrokken was, en het bedrijf zegt de testomgeving inmiddels te hebben verstevigd.

Dat verklaart de toon van deze aankondiging. Een lab dat net heeft meegemaakt dat zijn eigen modellen de omheining doorbraken, gaat anders om met een model waarvan het de bovengrens niet kent.

De vergelijking met Anthropic klopt maar half

In de berichtgeving wordt de stap naast Anthropic gelegd, dat in april met Mythos kwam, een model met vergelijkbare cybercapaciteiten. Het beeld dat daarbij ontstaat is dat Anthropic zijn model gewoon uitbracht en OpenAI dat nu niet doet. Zo eenvoudig ligt het niet.

Anthropic beperkte de uitrol van Mythos juist uitdrukkelijk uit vrees voor misbruik, en gaf toegang aan een besloten groep bedrijven binnen een beveiligingssamenwerking. Beide bedrijven hebben dus geremd; het verschil zit in hoe en aan wie ze wel toegang gaven.

De bewering dat OpenAI eerder kritiek had op Anthropic om precies dit punt, komt in de aankondiging van OpenAI zelf niet voor en ook niet in de berichtgeving die wij konden nalezen. Behandel dat dus als een interpretatie en niet als een vaststaand feit.

Waarom dit ook ongemakkelijk is

Er is een tegenwerping die je erbij moet houden. Aankondigen dat je model te gevaarlijk is om vrij te geven, is ook een uitstekende manier om te vertellen hoe goed je model is. Toen Anthropic in april met Mythos kwam, spraken beveiligingsdeskundigen tegen CNBC van een hysterie, met het argument dat de dreiging al bestond en dat de aandacht vooral naar het merk ging.

Die kritiek geldt hier evengoed. Tegelijk is het openbaar maken van een mogelijk gevaarlijke eigenschap van je eigen product meer transparantie dan gebruikelijk is in deze sector, waar de meeste tests binnenskamers blijven. Beide dingen kunnen tegelijk waar zijn.

Wat je hier zelf van merkt

Voorlopig weinig. Astra zit niet in ChatGPT en de modellen waar dit over gaat, draaien in laboratoria met afgeschermde netwerken.

Waar het op termijn wel toe doet, is de kant van de verdediging. Als een model zelfstandig kwetsbaarheden kan vinden, geldt dat ook voor de partij die haar eigen software wil laten nakijken. OpenAI zegt daar met overheden en beveiligingsorganisaties aan te gaan werken, en dat is precies waar het nuttig wordt.

Voor bedrijven is de praktische les dat de tijd tussen het bekend worden van een lek en het misbruiken ervan verder inkort. Updates uitstellen was altijd al onverstandig; in een wereld waarin het zoeken naar gaten geautomatiseerd raakt, wordt de marge om dat te doen kleiner.

Geef een reactie

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *

Deze site gebruikt Akismet om spam te verminderen. Bekijk hoe je reactie gegevens worden verwerkt.