In de snel veranderende wereld van technologie blijven de ontwikkelingen op het gebied van kunstmatige intelligentie (AI) niet achter. Recentelijk heeft OpenAI zijn ChatGPT uitgerust met een nieuwe en verbeterde beeldgenerator, getiteld GPT Image 1.5. Dit biedt gebruikers een reeks geavanceerde mogelijkheden voor beeldbewerking, vergelijkbaar met de upgrades die Google eerder dit jaar introduceerde met zijn Gemini-platform, onder de codenaam Nano Banana.
Een van de opvallendste verbeteringen van GPT Image 1.5 is de mogelijkheid om specifieke delen van een afbeelding te bewerken zonder de rest van het beeld aan te tasten. Dit betekent dat gebruikers elementen kunnen toevoegen of verwijderen, of de kleur en stijl van een onderwerp kunnen wijzigen zonder dat de gehele afbeelding eruitziet als een compleet andere foto. Dit is een functie die ChatGPT heeft overgenomen van de Gemini-toolset.
Daarnaast kunnen gebruikers met deze nieuwe update meerdere beelden samenvoegen tot één enkele scène. Bijvoorbeeld, als je een foto wilt maken van jou en je beste vriend voor de Sydney Harbour Bridge, hoef je alleen maar de bronafbeeldingen te leveren, en de AI doet de rest. Dit stelt gebruikers in staat om visuele stijlen aan te passen terwijl de details consistent blijven.
OpenAI beweert dat de nieuwe beeldgenerator en bewerker instructies “betrouwbaarder” kan volgen en beelden tot vier keer sneller kan renderen dan voorheen. Hoewel de resultaten realistischer en minder foutgevoelig zouden moeten zijn, erkent OpenAI dat er nog ruimte is voor verbetering.
Om de prestaties van GPT Image 1.5 te vergelijken met die van Google’s Gemini, hebben we beide modellen getest via hun abonnementsdiensten. De resultaten waren behoorlijk gevarieerd maar over het algemeen gelijkwaardig in termen van kwaliteit en realisme. Beide systemen hebben zo nu en dan last van onrealistische fysica of herhalingen, maar dit is zelden storend.
Wat betreft het bewerken van beelden, zijn beide AI-modellen nu zeer bekwaam in het uitvoeren van schone beeldbewerkingen. Zo konden beide AI’s de kleding van een journalist veranderen zonder de rest van de afbeelding aan te raken. Dergelijke aanpassingen zouden normaal gesproken veel tijd en een goede kennis van bijvoorbeeld Photoshop vereisen.
Het wijzigen van kleuren werd goed afgehandeld door beide systemen, maar wanneer het aankwam op perspectiefveranderingen, zoals het bekijken van een afbeelding vanuit een andere hoek, hadden beide AI’s meer moeite. Desondanks presteerde ChatGPT iets beter dan Gemini in het consistent leveren van goede resultaten.
Een andere interessante functie is het vermogen om objecten uit afbeeldingen te verwijderen. Zowel Gemini als ChatGPT slaagden erin om een huisje uit een landschap te verwijderen zonder de rest van de afbeelding te verstoren. Dit soort tijdrovende bewerkingen kan nu in enkele seconden worden uitgevoerd.
Naast individuele bewerkingen kunnen ChatGPT en Gemini nu ook beelden combineren. Dit betekent dat je afzonderlijke foto’s kunt samenvoegen tot één, compleet met een achtergrond naar keuze. Hoewel de resultaten soms nog niet helemaal naadloos zijn, vooral qua belichting en schaal, biedt ChatGPT iets betere consistentie bij het samenvoegen van verschillende elementen.
Het combineren en remixen van beelden biedt veel creatieve vrijheden, van het samenstellen van familiefoto’s tot het veranderen van locaties en weersomstandigheden. Hoewel de technologie indrukwekkend is, blijven er uitdagingen, vooral bij het werken met beelden van mensen die je persoonlijk kent, vanwege de subtiele details die de AI nog niet perfect kan nabootsen.
In de strijd tussen ChatGPT en Gemini is het duidelijk dat beide platforms op een hoog niveau opereren. ChatGPT heeft momenteel een lichte voorsprong, maar de verschillen zijn minimaal. Het blijft spannend om te zien hoe deze beeldbewerkingsmogelijkheden zich verder zullen ontwikkelen in de toekomst.