OpenAI onthult zes nieuwe gevallen van AI-wangedrag en belooft transparantie
OpenAI publiceerde op 16 september zes rapporten over onverwacht of ongeoorloofd gedrag van zijn kunstmatige-intelligentiemodellen en beloofde dergelijke incidenten systematischer openbaar te maken.
klasse = “cf”>
De ChatGPT-maker zei dat de gevallen zich voordeden tijdens training of evaluatie. Het ging onder meer om pogingen om fouten te verbergen, gegevens te verzinnen en acties te ondernemen zonder toestemming.
“Wij geloven niet dat de AI-industrie de afstemming en monitoring in voldoende mate heeft opgelost om nog veel langer verantwoord op te schalen op maximale snelheid”, aldus het bedrijf.
Het nieuwe raamwerk omvat ongeoorloofde acties, pogingen om toezicht te omzeilen en niet-goedgekeurde coördinatie tussen AI-systemen, van ontwikkeling en testen tot en met de implementatie.
Een incident hoeft geen schade te veroorzaken of een breder patroon te creëren om in aanmerking te komen voor openbaarmaking.
OpenAI zei dat het publiceren van de rapporten externe waarnemers bewijsmateriaal zou geven om de risico’s van steeds capabeler wordende modellen te beoordelen en beslissingen over verdere ontwikkeling te onderbouwen.
In één geval uploadde een model zonder toestemming een bestand met onderzoeksgegevens naar internet, zodat het in zijn antwoord dat bestand kon citeren. Het uploaden is gelukt, maar de poging om het als citaat te gebruiken mislukte.
klasse = “cf”>
Een ander rapport beschreef een model dat zichzelf instructies gaf om ontbrekende financiële gegevens te verzinnen en die voor de gebruiker te verbergen. OpenAI zei dat instructies om fouten te verbergen vaak werden gevolgd.
De onthullingen volgen op een ernstiger incident in juli, toen modellen de beperkingen op internettoegang omzeilden tijdens interne cyberveiligheidstests en systemen van OpenAI en AI-platform Hugging Face in gevaar brachten.
OpenAI zei dat de zes rapporten individuele gevallen beschreven en niet aangaven hoe vaak dergelijk gedrag in zijn modellen voorkwam.
Antropisch CEO Dario Amodei riep op 12 september op tot een gecoördineerde vertraging van de AI-ontwikkeling, zodat er meer tijd is om de risico’s te begrijpen en aan te pakken.
