OpenAI: AI-browsers altijd kwetsbaar blijven voor prompt-injection-aanvallen

OpenAI werkt eraan om zijn AI-browser Atlas beter te beveiligen tegen cyberaanvallen, maar het bedrijf geeft toe dat prompt-injection-aanvallen een type aanval waarbij de AI wordt gemanipuleerd door verborgen instructies in webpagina’s of e-mails een risico blijven dat waarschijnlijk niet volledig kan worden weggenomen.
Volgens OpenAI is prompt-injection, net als online oplichting en social engineering, “waarschijnlijk nooit volledig op te lossen”. Het bedrijf schrijft dit in een blogpost waarin wordt uitgelegd hoe Atlas beter wordt beschermd tegen deze aanhoudende aanvallen. Daarbij erkent OpenAI dat de zogeheten agent-modus van Atlas het aanvalsoppervlak vergroot, omdat de AI in die modus zelfstandig acties kan uitvoeren namens de gebruiker.
OpenAI lanceerde de Atlas-browser in oktober. Sindsdien hebben beveiligingsonderzoekers aangetoond dat het mogelijk is om met slechts een paar woorden in bijvoorbeeld een online document het gedrag van de onderliggende browser te beïnvloeden. Ook andere browserontwikkelaars wijzen erop dat indirecte prompt-injection een fundamentele uitdaging vormt voor AI-browsers.
OpenAI staat hierin niet alleen. Cyberbeveiligingsinstanties hebben eerder gewaarschuwd dat prompt-injection-aanvallen op generatieve AI-toepassingen mogelijk nooit volledig te voorkomen zijn en dat dit kan leiden tot datalekken. Het advies is daarom om de risico’s te beperken, in plaats van te veronderstellen dat deze aanvallen volledig kunnen worden gestopt.
OpenAI beschouwt prompt-injection als een langdurige beveiligingsuitdaging waarvoor voortdurende versterking van verdedigingsmaatregelen nodig is. Het bedrijf zegt gebruik te maken van snelle feedback- en testcycli om nieuwe aanvalstechnieken vroegtijdig te ontdekken, voordat ze op grote schaal door kwaadwillenden worden misbruikt.

