Även om det finns appar som LM Studio och GPT4All för att köra AI-modeller lokalt på datorer, har vi inte många sådana alternativ på Android-telefoner. Som sagt, MLC LLM har utvecklat en Android-app som heter MLC Chat som låter dig ladda ner och köra LLM-modeller lokalt på Android-enheter. Du kan ladda ner små AI-modeller (2B till 8B) som Llama 3, Gemma, Phi-2, Mistral och mer. På det sättet, låt oss börja.
Notera:
För närvarande använder MLC Chat inte NPU:n på enheten på alla Snapdragon-enheter, så tokengenereringen är till stor del långsam. Slutsatsen görs enbart på processorn. Vissa enheter som Samsung Galaxy S23 Ultra (drivs av Snapdragon 8 Gen 2) är optimerade för att köra MLC Chat-appen så att du kan få en bättre upplevelse.
- Gå vidare och ladda ner MLC Chat-appen (Gratis) för Android-telefoner. Du måste ladda ner APK-filen (148MB) och installera den.
- Starta sedan MLC Chat-appen och du kommer att se en lista över AI-modeller. Den stöder även den senaste Llama 3 8B-modellen, och du har också alternativ som Phi-2, Gemma 2B och Mistral 7B.
- Jag laddade ner Microsofts Phi-2 modell eftersom den är liten och lätt.
- När modellen har laddats ner trycker du på chatt-knappen bredvid modellen.
- Nu kan du börja chatta med AI-modellen lokalt på din Android-telefon. Du behöver inte ens en internetanslutning.
- I mina tester, Phi-2 gick bra på min telefon men det var lite hallucinationer. Gemma vägrade springa. Och Llama 3 8B var för långsam.

- På min OnePlus 7T som drivs av Snapdragon 855+ SoC, ett fem år gammalt chip, genererade den utsignal kl. 3 tokens per sekund medan du kör Phi-2.
Så det är så här du kan ladda ner och köra LLM-modeller lokalt på din Android-enhet. Visst, tokengenereringen är långsam, men den fortsätter att visa att du nu kan köra AI-modeller lokalt på din Android-telefon. För närvarande är det använder bara processornmen med Qualcomm AI Stack-implementering kan Snapdragon-baserade Android-enheter utnyttja den dedikerade NPU, GPU och CPU för att erbjuda mycket bättre prestanda.
På Apple-sidan använder utvecklare redan MLX ramverk för snabb lokal slutledning på iPhones. Det genererar nära 8 tokens per sekund. Så förvänta dig att Android-enheter också får stöd för NPU på enheten och levererar fantastisk prestanda. Qualcomm säger förresten själv att Snapdragon 8 Gen 2 kan generera 8,48 tokens per sekund när du kör en större 7B-modell. Det skulle prestera ännu bättre på en 2B kvantiserad modell.
Hur som helst, det är allt från oss. Om du vill chatta med dina dokument med hjälp av en lokal AI-modell, kolla in vår dedikerade artikel. Och om du stöter på några problem, låt oss veta i kommentarsektionen nedan.
Stöd vårt arbete ❤️
Om du gillade den här artikeln, överväg att lämna dricks för att hjälpa oss fortsätta publicera bra innehåll.





















