Een recent lek in de gegevens van ChatGPT heeft geleid tot verontrustende onthullingen met betrekking tot de privacy van gebruikers. Gevoelige gesprekken gevoerd met de populaire chatbot werden onverwacht zichtbaar in Google Search Console (GSC), een tool die normaal wordt gebruikt door ontwikkelaars om het verkeer naar hun websites te monitoren. Dit soort lekken roept vragen op over de maatregelen voor gegevensbescherming die worden getroffen door OpenAI, het bedrijf achter ChatGPT.
Het probleem kwam aan het licht toen Jason Packer, eigenaar van het analyseadviesbureau Quantable, opmerkte dat er ongebruikelijk lange zoekopdrachten in de GSC verschenen. Deze opdrachten leken afkomstig te zijn van gebruikers die ChatGPT vroegen om hulp bij persoonlijke kwesties zoals relatie- of zakelijke problemen. De vragen waren soms meer dan 300 tekens lang, wat afwijkt van de gebruikelijke korte zoektermen die in GSC worden gerapporteerd.
Samen met weboptimalisatieconsultant Slobodan Manić voerde Packer een diepgaand onderzoek uit naar de oorzaak van deze lekken. Zij kwamen tot de conclusie dat er mogelijk sprake was van het direct scrapen van Google-zoekresultaten door OpenAI, een praktijk waarbij gegevens van de zoekmachine worden gehaald om de functionaliteit van de chatbot te verbeteren. Hoewel OpenAI niet bevestigde of deze theorie correct was, gaf het bedrijf wel aan dat er een “glitch” was geweest die inmiddels was opgelost.
De incidenten roepen echter twijfels op over de mate waarin OpenAI de privacy van zijn gebruikers waarborgt. Het bedrijf heeft namelijk niet verduidelijkt of het stoppen van het gebruik van Google Search ook betekent dat er geen enkele data meer wordt gescrapet. Dit gebrek aan transparantie heeft geleid tot bezorgdheid onder gebruikers en experts over de mogelijkheid dat hun privé-informatie op onbedoelde manieren wordt blootgesteld.
De lekken in GSC zijn niet de eerste keer dat ChatGPT in opspraak raakt vanwege privacykwesties. Eerder dit jaar bleek dat gebruikersprompts in de zoekindex van Google verschenen, wat OpenAI ertoe dwong om snel actie te ondernemen om deze te verwijderen. In dat geval hadden gebruikers echter op een vakje geklikt dat hun prompts openbaar maakte. Bij de huidige incidenten lijkt er geen sprake te zijn van een dergelijke actie door de gebruiker, wat de situatie des te zorgwekkender maakt.
Packer speculeert dat de technische fout mogelijk te maken heeft met een specifieke URL die wordt toegevoegd aan de gebruikersprompts, waardoor deze onbedoeld in GSC terechtkomen. Dit suggereert dat er sprake is van een fundamenteel probleem in de manier waarop gegevens worden verwerkt en gedeeld door OpenAI en Google, zonder dat de gebruikers hiervan op de hoogte zijn.
Hoewel OpenAI heeft aangegeven het probleem te hebben opgelost, blijven er vragen bestaan over de omvang en de gevolgen van het lek. Het bedrijf heeft geen specifieke aantallen gegeven over hoeveel gebruikers mogelijk zijn getroffen, wat bijdraagt aan de onzekerheid en angst onder de gebruikers van de dienst. Met meer dan 700 miljoen wekelijkse gebruikers van ChatGPT is de impact potentieel groot.
De situatie werpt een schaduw over de robuustheid van de privacybeschermingsmechanismen van OpenAI. Gebruikers en privacy-experts vragen zich af of het bedrijf voldoende maatregelen neemt om de gegevens van zijn gebruikers te beschermen en of er meer transparantie kan worden gegeven over de wijze waarop gegevens worden verwerkt en gedeeld. Het is duidelijk dat er nog veel werk aan de winkel is om het vertrouwen van het publiek in de beveiliging van AI-gestuurde diensten te herstellen.