Under de senaste månaderna har Apple släppt en ständig ström av forskningsdokument som beskriver sitt arbete med generativ AI. Hittills har Apple varit fåordiga om exakt vad som lagar mat i dess forskningslabb, medan rykten cirkulerar om att Apple för samtal med Google om att licensiera sin Gemini AI för iPhones.
Men det har varit ett par teasers av vad vi kan förvänta oss. I februari presenterade ett forskningsdokument från Apple en öppen källkodsmodell som heter MLLM-Guided Image Editing (MGIE) som kan redigera media med hjälp av instruktioner på naturligt språk från användare. Nu, ytterligare en forskningsartikel om Iller UI har skickat AI-gemenskapen till en frenesi.
Tanken är att distribuera en multimodal AI (en som förstår texter såväl som multimediatillgångar) för att bättre förstå delar av ett mobilt användargränssnitt. — och viktigast av allt, att leverera praktiska tips. Det är ett viktigt mål när ingenjörer tävlar om att göra AI mer användbar för en genomsnittlig smartphoneanvändare än den nuvarande statusen för ”salongstrick”.
I den riktningen är den största drivkraften att koppla bort de generativa AI-funktionerna från molnet, avsluta behovet av en internetanslutning och distribuera varje uppgift på enheten så att det blir snabbare och säkrare. Ta till exempel Googles Gemini, som körs lokalt på telefonerna i Google Pixel och Samsung Galaxy S24-serien – och snart OnePlus-telefoner – och utför uppgifter som sammanfattning och översättning.
Vad är Apples Ferret UI?

Med Ferret-UI siktar Apple tydligen på att blanda ihop det smarta med en multimodal AI-modell med iOS. Just nu ligger fokus på mer ”elementära” sysslor som ”ikonigenkänning, hitta text och widgetlistning.” Det handlar dock inte bara om att förstå vad som visas på en iPhones skärm, utan också att förstå det logiskt och svara på kontextuella frågor som ställs av användare genom dess resonemangsmöjligheter.
Det enklaste sättet att beskriva Ferret UI:s möjligheter är som ett intelligent system för optisk teckenigenkänning (OCR) som drivs av AI. ”Efter träning i de kurerade datamängderna uppvisar Ferret-UI enastående förståelse av UI-skärmar och förmågan att utföra öppna instruktioner”, konstaterar forskningsartikeln. Teamet bakom Ferret UI har ställt in det för att rymma ”valfri upplösning.”
Du kan ställa frågor som ”Är den här appen säker för mitt 12-åriga barn?” medan du surfar genom App Store. I sådana situationer kommer AI:n att läsa appens åldersklassificering och kommer följaktligen att ge svaret. Hur svaret skulle serveras – text eller ljud – är inte specificerat, eftersom tidningen inte nämner Siri eller någon virtuell assistent, för den delen.
Apple föll inte för långt från GPT-trädet

Men idéerna är mycket mer panoramiska och smarta. Fråga den ”Hur kan jag dela appen med en vän?” och AI kommer att markera ”dela”-ikonen på skärmen. Naturligtvis kommer det att ge dig en sammanfattning av vad som blinkar på skärmen, men samtidigt kommer den logiskt att analysera de visuella tillgångarna på skärmen – precis som rutor, knappar, bilder, ikoner och mer. Det är en enorm tillgänglighetsvinst.
Om du vill höra de tekniska termerna, ja, uppsatsen hänvisar till dessa funktioner som ”perceptionskonversation”, ”funktionell slutledning” och ”interaktionskonversation.” En av forskningsrapportens beskrivningar sammanfattar faktiskt Ferret UI-möjligheterna perfekt, och beskriver det som ”den första MLLM designad för att utföra exakta hänvisnings- och jordningsuppgifter som är specifika för UI-skärmar, samtidigt som den tolkar och agerar på ett skickligt sätt efter öppna språkinstruktioner.”

Som ett resultat kan den beskriva skärmdumpar, berätta vad en viss tillgång gör när den trycks på och avgöra om något på skärmen är interaktivt med pekingångar. Ferret UI är inte bara ett internt projekt. Istället, för resonemanget och beskrivningsdelen, förlitar den sig på OpenAI:s GPT-4-teknik, som driver ChatGPT, tillsammans med en hel massa andra konversationsprodukter där ute.
Noterbart är den speciella version som föreslås i tidningen lämplig för flera bildförhållanden. Utöver dess analys- och resonemangsförmåga på skärmen, beskriver forskningsartikeln också några avancerade funktioner som är ganska fantastiska att föreställa sig. Till exempel, i skärmdumpen nedan, verkar den kunna inte bara analysera handskriven text, utan kan också förutsäga den korrekta versionen från användarens felstavade klotter.

MIt kan också läsa text som är avskuren i den övre eller nedre kanten och annars skulle kräva en vertikal rullning. Det är dock inte perfekt. Ibland felidentifierar den en knapp som en flik och läser fel tillgångar som kombinerar bilder och text i ett enda block.
När det ställdes mot OpenAI:s GPT-4V-modell, levererade Ferret UI en imponerande nivå av konversationsinteraktion när de ställdes frågor relaterade till innehållet på skärmen. Som kan ses på bilden nedan föredrar Ferret UI mer kortfattade och raka svar, medan GPT-4V skriver mer detaljerade svar.
Valet är subjektivt, men om jag skulle fråga en AI: ”Hur köper jag toffeln som visas på skärmen”, skulle jag föredra att det bara gav mig de rätta stegen med så få ord som möjligt. Men Ferret UI presterade beundransvärt på att inte bara hålla saker kortfattade utan också med noggrannhet. Vid den ovannämnda uppgiften fick Ferret UI 91,7 % vid konversationsinteraktionsutgångar, medan GPT-4V bara var något före med 93,4 % noggrannhet.
Ett universum av spännande möjligheter

Ferret UI markerar en imponerande debut av AI som kan göra meningsfulla åtgärder på skärmen. Nu, innan vi blir alltför entusiastiska över möjligheterna här, är vi inte säkra på hur exakt Apple siktar på att integrera detta med iOS, eller om det kommer att förverkligas alls, av flera skäl. Bloomberg rapporterade nyligen att Apple var medveten om att vara en eftersläpning i AI-loppet, och det är ganska uppenbart av bristen på inhemska generativa AI-produkter i Apples ekosystem.
För det första är ryktena om att Apple till och med överväger ett Gemini-licensavtal med Google eller OpenAI ett tecken på att Apples eget arbete inte är på samma nivå som konkurrenternas. I ett sådant scenario skulle det vara klokare att utnyttja det arbete Google redan har gjort med Gemini (som nu försöker ersätta Google Assistant på telefoner) än att driva en halvdan AI-produkt på iPhones och iPads.
Apple har helt klart ambitiösa idéer och fortsätter att arbeta med dem, vilket demonstreras av experimenten som beskrivs i flera forskningsartiklar. Men även om Apple lyckas uppfylla Ferret UI:s löften inom iOS, skulle det fortfarande vara en ytlig implementering av generativ AI på enheten.

Funktionella integrationer, även om de bara är begränsade till interna förinstallerade appar, kan ge fantastiska resultat. Låt oss till exempel säga att du läser ett e-postmeddelande medan AI:n redan har bedömt innehållet på skärmen i bakgrunden. När du läser meddelandet i Mail-appen kan du be AI:n med ett röstkommando att göra en kalenderpost av den och spara den i ditt schema.
Det behöver inte nödvändigtvis vara en superkomplex flerstegssyssla som involverar mer än en app. Säg att du tittar på en restaurangs kunskapssida för Google Sök, och genom att helt enkelt säga ”ring platsen” läser AI telefonnumret på skärmen, kopierar det till uppringaren och startar ett samtal.
Eller låt oss säga att du läser en tweet om en film som kommer ut den 6 april, och du säger åt AI:n att skapa en genväg riktad till Fandango-appen. Eller, ett inlägg om en strand i Vietnam inspirerar din nästa ensamresa, och ett enkelt ”boka mig en biljett till Con Dai” tar dig till Skyscanner-appen med alla dina bidrag redan ifyllda.

Men allt detta är lättare sagt än gjort och beror på flera variabler, av vilka några kan vara utom Apples kontroll. Till exempel skulle webbsidor fyllda med popup-fönster och påträngande annonser göra det nästan omöjligt för Ferret UI att göra sitt jobb. Men på den positiva sidan, iOS-utvecklare följer strikt designriktlinjerna som fastställts av Apple, så det är troligt att Ferret UI skulle göra sin magi mer effektivt på iPhone-appar.
Det skulle ändå vara en imponerande vinst. Och eftersom vi pratar om implementering på enheten som är tätt bakad på OS-nivå, är det osannolikt att Apple skulle ta betalt för bekvämligheten, till skillnad från vanliga generativa AI-produkter som ChatGPT Plus eller Microsoft Copilot Pro. Skulle iOS 18 äntligen ge oss en glimt av en omarbetad iOS överladdad på AI-smart? Vi måste vänta tills Apples Worldwide Developers Conference 2024 för att ta reda på det.
Stöd vårt arbete ❤️
Om du gillade den här artikeln, överväg att lämna dricks för att hjälpa oss fortsätta publicera bra innehåll.





















