DALL-E 3: Läckta Alpha Testdetaljer visar nästa generations bildgenerator

DALL-E 3: Läckta Alpha Testdetaljer visar nästa generations bildgenerator

OpenAI kanske förbereder nästa version av sin DALL-E AI text-till-bild-generator med en serie alfa-tester som nu har läckt ut till allmänheten, enligt Avkodare.

En anonym läckare på Discord delade med sig av detaljer om sin upplevelse, med tillgång till den kommande OpenAI-bildmodellen som kallas DALL-E 3. Han dök upp först i maj och berättade för den intressebaserade Discord-kanalen att han var en del av ett alfatest för OpenAI, testar en ny AI-bildmodell. Han delade med sig av bilderna han genererade då.

Vi har ALDRIG sett så här bra bildgenerering! | SNEAK PEAK

May alpha-testversionen hade förmågan att generera bilder med flera bildförhållanden inuti bildmodellen. YouTuber, MattVidPro AI visade sedan upp flera av bilderna som genererades i bildförhållandet 16:9. Denna version visade också modellens skicklighet för högkvalitativ textproduktion, vilket fortsätter att vara en smärta för rivaliserande modeller, även för toppgeneratorer som Stable Diffusion och Midjourney.

Några exempel visade bilder, som text smält in i en tegelvägg, ett neonskylt med ord, en skylt i en stad, en tårtdekoration och ett namn etsat in i ett berg. Modellen hävdar att DALL-E är bra på att generera människor. En sådan bild visade en kvinna som äter spagetti på en fest ur fisheye-synpunkt.

Läckaren återvände till Discord-kanalen i mitten av juli med fler detaljer och nya bilder. Han påstod sig vara en del av en ”sluten alfa”-testversion som inkluderade cirka 400 försökspersoner. Han tillade att han var inbjuden till rättegången via e-post och att han också ingick i testningen av den ursprungliga DALL-E och DALL-E 2. Det var detta som ledde till slutsatsen att alfatestet kan vara för DALL-E 3, men det har inte bekräftats.

OpenAI Dall-E 3 alfa testversionsbild.
OpenAI Dall-E 3 alpha testversionsbild.

Modellen har uppdaterats rejält mellan maj och juli. Läckaren har visat upp detta genom att dela bilder som genererats utifrån samma prompt, som visar hur kraftfull DALL-E 3 har blivit över tiden. Uppmaningen lyder a målning av en rosa gycklare som ger en high five till en panda under en cykeltävling. Cyklarna är gjorda av ost och marken är väldigt lerig. De kör i en dimmig skog. Pandan är arg.

Maj-alfa producerar den allmänna scenen som träffar de flesta punkterna i prompten. Det är lite förvrängning i händerna som kopplar ihop, och hjulen på cyklarna är gula i motsats till att de är gjorda av ost. Juli-alfa är dock mycket mer detaljerad, med den rosa gycklaren och pandan tydligt high-fiving och cykelhjulen gjorda av ost i flera generationer.

Under tiden, i Midjourney, saknas gycklaren från platsen, pandorna är på motorcyklar istället för cyklar. Det finns vägar, istället för lera. Pandaorna är glada istället för arga.

Det finns en mängd DALL-E 3 juli alfabildsexempel som visar modellens potential. Men med alfatestet ocensurerat, noterade läckaren att det också har potential att generera scener med ”våld och nakenhet eller upphovsrättsskyddat material som företagslogotyper.”

Några exempel inkluderar en blodig anime-tjej, en Game of Thrones karaktär, a Grand Theft Auto V cover, en zombie Jesus som äter en Subway-smörgås, vilket också tyder på mild gore, och Shrek som grävdes upp från en arkeologisk utgrävning, bland annat.

MattVidPro AI noterade att bildmodellen genererar bilder som om de skulle vara i en specifik stil.

DALL-E 2 lanserades i april 2022 men var hårt reglerad med en väntelista på grund av dess popularitet och oro för etik och säkerhet. AI-bildgeneratorn blev tillgänglig för allmänheten i september 2022.

Stöd vårt arbete ❤️

Om du gillade den här artikeln, överväg att lämna dricks för att hjälpa oss fortsätta publicera bra innehåll.

Säker betalning med PayPal
Se även:  Hur AI förstör fågelskådningen: Risker för djurlivet och fågelskådare