OpenAI heeft aangekondigd dat het zijn nieuwste generatie beeldmodel, ChatGPT Images 2, lanceert. Dit model is ontworpen om tekstzware afbeeldingen te genereren, zoals infographics, wetenschappelijke posters, studiegidsen en marketingmateriaal. Deze ontwikkeling markeert een verschuiving van de eerder populaire Sora AI-videotoepassing, die onlangs werd stopgezet.
Het besluit om ChatGPT Images 2 te lanceren komt te midden van een bredere trend in de AI-industrie, waarin bedrijven streven naar het ontwikkelen van agentgerelateerde tools en het sluiten van belangrijke deals, zoals een recente overeenkomst met het Pentagon. OpenAI’s nieuwe model speelt in op de groeiende behoefte aan creatief-economische taken, waarbij visuele intelligentie een cruciale rol speelt.
Volgens Adele Li, productleider voor ChatGPT Images, biedt het model een uitbreiding van de mogelijkheden voor persoonlijke en creatieve assistentie, wat een integraal onderdeel is van de visie van ChatGPT om een allesomvattende AI-toepassing te creëren. Het nieuwe beeldmodel verbetert typografie, iconografie en compositie, en kan tekst genereren in meerdere talen, een gebied waar AI-beeldmodellen traditioneel mee worstelen.
ChatGPT Images 2 is nu beschikbaar voor alle gebruikers, met generatiebeperkingen die afhankelijk zijn van het abonnementsniveau. Ontwikkelaars die het model in de API gebruiken, kunnen beelden creëren in 2K en 4K resolutie, hoewel deze hogere resoluties nog in de testfase zijn. Gebruikers die betalen, kunnen ook beelden genereren met behulp van denk- en redeneermodellen, die helpen informatie van het web te verzamelen en te verwerken in een leesbaar ontwerp.
Hoewel het model technisch gezien een beeldmodel is, biedt het niet dezelfde fantasierijke surrealisme als Midjourney of de uitgebreide bewerkingsmogelijkheden van Adobe Firefly. Het richt zich in plaats daarvan op een doelgroep die behoefte heeft aan het maken van aantrekkelijke inhoud, zoals docenten en marketingmanagers. Docenten kunnen het gebruiken voor het maken van geïllustreerde lesplannen, terwijl marketingmanagers visuele content voor sociale media kunnen creëren.
Een van de nadelen van het model is dat bij het aanpassen van een AI-afbeelding deze opnieuw gegenereerd moet worden, wat sneller leidt tot het verbruiken van credits bij tekstzware ontwerpen. OpenAI blijft echter toegewijd aan een iteratief, prompt-gebaseerd bewerkingsproces om het gebruiksgemak te behouden.
Op het gebied van veiligheid heeft OpenAI zijn procedures sinds het vorige beeldmodel niet significant veranderd. Het model bevat nog steeds metadata volgens de C2PA-standaard, zodat de oorsprong van AI-afbeeldingen kan worden geïdentificeerd. Beleid tegen misbruik en illegale afbeeldingen blijft een belangrijk aandachtspunt, vooral gezien recente voorbeelden van AI-gegenereerde deepfakes en niet-consensuele intieme afbeeldingen.
Met ChatGPT Images 2 zet OpenAI een nieuwe stap in de richting van het verwezenlijken van zijn visie op een super-app, die een breed scala aan AI-functionaliteiten integreert. Het model biedt gebruikers de mogelijkheid om complexe, visueel consistente inhoud te creëren en speelt zo in op de groeiende vraag naar economisch waardevolle creatieve taken in verschillende sectoren.