OpenAI introduceert een nieuwe AI-agent in ChatGPT die een breed scala aan computertaken voor gebruikers kan uitvoeren. Deze tool, genaamd ChatGPT agent, stelt gebruikers in staat om op natuurlijke wijze met de agent te communiceren, wat betekent dat men simpelweg commando’s en vragen kan stellen in gewone taal. OpenAI beweert dat deze agent taken zoals het navigeren door een agenda, het genereren van bewerkbare presentaties en het uitvoeren van code kan voltooien.
De ChatGPT agent is een samensmelting van verschillende mogelijkheden van eerdere OpenAI-tools, waaronder de Operator, die websites zelfstandig kan doorzoeken, en de Deep Research-tool, die informatie kan synthetiseren van talrijke websites om een samenhangend onderzoeksrapport te creëren. Abonnees van OpenAI’s Pro, Plus en Team plannen kunnen vanaf donderdag gebruikmaken van deze nieuwe agent door de “agent-modus” in het dropdown-menu van ChatGPT te selecteren.
Met de introductie van ChatGPT agent maakt OpenAI een gedurfde stap om ChatGPT om te vormen van een louter conversatietool naar een agent die daadwerkelijk acties kan ondernemen en taken kan overnemen van gebruikers. Hoewel er in Silicon Valley al verschillende AI-agents zijn ontwikkeld door bedrijven als OpenAI, Google en Perplexity, hebben eerdere versies moeite gehad met het uitvoeren van complexe taken. OpenAI beweert echter dat ChatGPT agent aanzienlijk capabeler is dan zijn voorgangers.
De nieuwe agent biedt toegang tot ChatGPT connectors, waarmee gebruikers apps zoals Gmail en GitHub kunnen verbinden. Hierdoor kan de agent relevante informatie opvragen op basis van de gegeven prompts. OpenAI suggereert dat gebruikers de agent kunnen inzetten voor taken zoals het plannen en kopen van ingrediënten voor een Japans ontbijt voor vier personen, of het analyseren van drie concurrenten en het creëren van een presentatie. Deze mogelijkheden vereisen dat de agent websites doorzoekt, een plan van aanpak maakt en verschillende tools gebruikt, waardoor het een van de meest complexe taken is die OpenAI tot nu toe heeft aangepakt.
De onderliggende model van ChatGPT agent biedt volgens OpenAI state-of-the-art prestaties op verschillende benchmarks. Op de Humanity’s Last Exam heeft het model een score van 41,6% behaald, wat het dubbele is van wat eerdere modellen van OpenAI bereikten. Op het gebied van wiskunde scoort de agent 27,4% op de FrontierMath benchmark, waarbij het gebruik kan maken van tools zoals een terminal voor het uitvoeren van code.
Gezien de verbeterde capaciteiten van de ChatGPT agent, heeft OpenAI extra beveiligingsmaatregelen geïmplementeerd. Het bedrijf heeft de agent ontworpen met veiligheid als prioriteit, vooral omdat de geavanceerde mogelijkheden in verkeerde handen gevaarlijk kunnen zijn. De ChatGPT agent is aangemerkt als “hoog vermogen” in de domeinen van biologische en chemische wapens, wat betekent dat het model in staat is om bestaande wegen naar ernstige schade te versterken. Hoewel er geen direct bewijs is dat de agent een bedreiging vormt, heeft OpenAI ervoor gekozen om een voorzichtige benadering te hanteren en nieuwe veiligheidsmaatregelen te activeren om de risico’s te beperken.
Deze beveiligingsmaatregelen omvatten een realtime monitor die elke prompt die in de ChatGPT agent wordt ingevoerd, controleert. Als een verzoek betrekking heeft op biologie, wordt de reactie van de agent door een tweede monitor gecontroleerd om te bepalen of de inhoud een biologische dreiging kan vormen. Bovendien heeft OpenAI de geheugenfunctie van ChatGPT uitgeschakeld voor deze agent om misbruik te voorkomen, zoals het exfiltreren van gevoelige gegevens via promptinjectie-aanvallen.
Ofschoon de ChatGPT agent indrukwekkend klinkt, moet nog blijken hoe effectief deze in de praktijk is. Tot nu toe hebben agenttechnologieën moeite gehad met interactie in de echte wereld. Desondanks is OpenAI ervan overtuigd dat het een capabel model heeft ontwikkeld dat in staat is om de belofte van AI-agents waar te maken.