Nvidia gick med i 3-biljoner marknadsvärderingsklubben i juni tidigare i år och överträffade Apple och Microsoft. Denna astronomiska tillväxt har varit möjlig på grund av dess dominans inom GPU- och AI-hårdvaruutrymmet. Nvidia är dock inte det enda företaget som tillverkar chips för dagens växande AI-arbetsbelastning. Många företag, som Intel, Google, Amazon och andra, arbetar med anpassat kisel för utbildning och slutledning av AI-modeller. Så låt oss titta på lovande Nvidia-konkurrenter i AI-hårdvaruutrymmet.
AMD
När det kommer till högpresterande AI-acceleratorer är AMD där uppe och tävlar mot Nvidia, både när det gäller träning och slutledning. Medan analytiker antyder att Nvidia har en marknadsandel på 70% till 90% i AI-hårdvaruutrymmet, har AMD börjat ställa i ordning sitt hus.
AMD introducerade sin Instinct MI300X accelerator för AI-arbetsbelastningar och HPC (High Performance Computing) i december 2024. AMD hävdar att dess Instinct MI300X-accelerator levererar 1,6 gånger bättre prestanda än Nvidia H100 i slutledning och nästan liknande prestation i träning.
Inte nog med det, den erbjuder en kapacitet på upp till 192GB HBM3-minne (High-Bandwidth Memory), mycket högre än Nvidia H100s 80GB-kapacitet. MI300X levererar en minnesbandbredd på upp till 5,3 TBps, återigen högre än H100:s 3,4 TBps.
Så AMD kämpar verkligen mot Nvidias regeringstid. AMD har dock fortfarande en lång väg kvar att gå innan de etablerar sig som en stor rival till Nvidia. Svaret på detta ligger i mjukvaran. Nvidias vallgrav är CUDAdatorplattformen som tillåter utvecklare att direkt interagera med Nvidia GPU:er för accelererad parallell bearbetning.
CUDA-plattformen har ett stort antal bibliotek, SDK:er, verktygssatser, kompilatorer och felsökningsverktyg, och den stöds av populära ramverk för djupinlärning som PyTorch och TensorFlow. Utöver det har CUDA funnits i nästan två decennier, och utvecklare är mer bekanta med Nvidia GPU:er och deras funktioner, särskilt inom maskininlärning. Nvidia har skapat en stor community kring CUDA med bättre dokumentation och utbildningsresurser.
Som sagt, AMD satsar hårt på ROCm (Radeon Open Compute) mjukvaruplattform och den stöder PyTorch, TensorFlow och andra öppna ramverk. Företaget har också beslutat att öppna källkod en del av ROCm-mjukvarustacken. Utvecklare har dock kritiserat ROCm för att erbjuda en fragmenterad upplevelse och brist på heltäckande dokumentation. Kommer du ihåg att George Hotz ropade AMD för sin instabila drivrutin?
AMD tinybox är pausad tills vi kan bygga och köra relevant firmware på våra GPU:er.
Drivrutinen är fortfarande väldigt instabil och när den kraschar eller hänger sig har vi ingen möjlighet att felsöka den. Vi har inget sätt att dumpa tillståndet för en GPU. Tydligen är det inte bara MES som orsakar dessa…— the tiny corp (@__tinygrad__) 19 mars 2024
Så summan av kardemumman är att AMD måste förena sin mjukvaruplattform och ta med ML forskare och utvecklare med bättre ROCm-dokumentation och support. Stora jättar som Microsoft, Meta, OpenAI och Databricks distribuerar redan MI300X-acceleratorer under ROCm så det är ett gott tecken.
Intel
Många analytiker skriver av Intel från AI-chiputrymmet, men Intel har varit en av de ledande inom slutsatser med sina CPU-baserade Xeon-servrar. Företaget lanserade nyligen sin Gaudi 3 AI-acceleratorsom är ett ASIC (Application-Specific Integrated Circuit)-chip som inte är baserat på traditionell CPU- eller GPU-design. Den erbjuder både utbildning och slutledning för generativa AI-arbetsbelastningar.

Intel hävdar att Gaudi 3 AI-acceleratorn är 1,5 gånger snabbare vid träning och slutledning än Nvidia H100. Dess Tensor Processor Cores (TPC) och MME Engines är specialiserade för matrisoperationer som krävs för djupinlärningsarbetsbelastningar.
När det gäller mjukvara går Intel den öppna källkodsvägen med OpenVINO och sin egen mjukvarustapel. Gaudi-programsviten integrerar ramverk, verktyg, drivrutiner och bibliotek och stöder öppna ramverk som PyTorch och TensorFlow. När det gäller Nvidias CUDA, Intel-chef, Pat Gelsinger nyligen sa:
Du vet, hela branschen är motiverad att eliminera CUDA-marknaden. Vi tänker på CUDA-vallgraven som ytlig och liten.
Om du inte är medveten har Intel tillsammans med Google, Arm, Qualcomm, Samsung och andra företag bildat en grupp som kallas Unified Acceleration Foundation (UXL). Gruppen strävar efter att skapa en öppen källkod alternativ till Nvidias egenutvecklade CUDA mjukvaruplattform. Uppgiften är att skapa en kiselagnostisk plattform för att träna och köra modeller på vilket chip som helst. Detta kommer att förhindra att utvecklare låses in i Nvidias CUDA-plattform.
Nu, vilken form framtiden kommer att ta är något bara tiden kommer att utvisa. Men Intels försök att avsätta CUDA från tronen har börjat.
Om det finns en AI-jätte som inte är beroende av Nvidia så är det Google. Ja, du läste rätt. Google har utvecklat sin interna TPU (Tensor Processing Unit) sedan 2015 på ASIC-design. Dess kraftfulla TPU v5p är 2,8 gånger snabbare än Nvidia H100 vid träning av AI-modeller och mycket effektiv vid slutledning. Och den sjätte generationens Trillium TPU är ännu mer kraftfull. Google använder sin TPU för träning, finjustering och slutledning.
På Google Cloud Next 2024-evenemanget, Patrick Moorhead, grundare och VD på Moor Insights & Strategy. fick bekräftelse från Google att det är Gemini-modellen tränades helt på TPUvilket är ganska betydande. Det används redan för att dra slutsatser om Gemini.
Sökjätten erbjuder sin TPU via Google Cloud för en mängd olika AI-arbetsbelastningar. Faktum är att Apples AI-modeller tränades på Googles TPU. I den meningen är Google en sann rival till Nvidiaoch med sitt anpassade kisel slår den andra chiptillverkare både i träning och slutledning.
Till skillnad från Microsoft är Google inte alltför beroende av Nvidia. Inte att förglömma, Google introducerade nyligen sin Axion-processor som är en armbaserad CPU. Den levererar oöverträffad effektivitet för datacenter och kan hantera CPU-baserad AI-träning och slutledning också.
Slutligen, även när det gäller mjukvarustöd, har Google övertaget. Den stöder ramverk som JAX, Keras, PyTorch och TensorFlow direkt.
Amazon
Amazon driver AWS (Amazon Web Services) som erbjuder molnbaserade datorplattformar för företag och företag. För att tillgodose företag för AI-arbetsbelastningar har Amazon utvecklat två anpassade ASIC-chips för utbildning och slutledning. AWS Trainium kan hantera djupinlärningsträning för upp till 100B modeller. Och AWS Inferentia används för AI-inferencing.

Hela poängen med AWS anpassade chips är att erbjuda låg kostnad och hög prestanda. Amazon skalar internt sina ansträngningar för att göra anspråk på AI-hårdvaruutrymmet. Företaget har också sin egen AWS Neuron SDK, som integrerar populära ramverk som PyTorch och TensorFlow.
Microsoft
I likhet med Google utökar Microsoft också sin anpassade kiselsatsning inom företaget. I november 2024 introducerade Microsoft sin MAIA 100 chips för AI-arbetsbelastningar och Cobalt 100 (armbaserad CPU) för dess Azure-molninfrastruktur. Redmond-jätten försöker undvika en kostsam övertro på Nvidia för sina AI-datorbehov.

MAIA 100-chippet är utvecklat på en ASIC-design, som används specifikt för AI-inferens och träning. Enligt uppgift testas MAIA 100-chippet för närvarande för GPT-3.5 Turbo-inferencing. Microsoft har ett djupt samarbete med Nvidia och AMD för sina behov av molninfrastruktur.
Så vi vet inte hur relationen kommer att utvecklas när Microsoft och andra företag börjar distribuera sitt anpassade kisel brett.
Qualcomm
Qualcomm släppte sin Cloud AI 100-accelerator 2020 för AI-inferencing, men den har inte tagit fart, som förväntat. Företaget uppdaterade det med Cloud AI 100 Ultra i november 2024. Chiptillverkaren hävdar att Cloud AI 100 Ultra är specialbyggd (ASIC) för generativa AI-applikationer. Den klarar sig 100B parametermodeller på ett enda kort med en TDP på bara 150W.

Qualcomm har utvecklat sin egen AI-stack och moln AI SDK. Bolaget är främst intresserad av att dra slutsatser snarare än träning. Hela löftet med Qualcomm Cloud AI 100 Ultra är dess oöverträffade energieffektivitet. Den erbjuder upp till 870 TOPS medan den utför INT8-operationer.
Hewlett Packard Enterprise (HPE) använder Qualcomm Cloud AI 100 Ultra för att driva generativa AI-arbetsbelastningar på sina servrar. Och det har Qualcomm samarbetade med Cerebras att tillhandahålla end-to-end modellutbildning och slutledning på en enda plattform.
Cerebras
Förutom stormännen där ute, är Cerebras en startup som arbetar med att träna storskaliga AI-system. Deras Wafer-Scale Engine 3 (WSE-3) är faktiskt en stor processor i wafer-skala som kan hantera modeller upp till 24 biljoner parametrar, 10 gånger storleken på GPT-4. Det är en galen siffra.

Den har en jättestora 4 biljoner transistorer eftersom det är ett gigantiskt chip som använder nästan all wafer. Inget behov av att koppla ihop flera chips och minne. Det hjälper också till att minska kraften eftersom det finns mindre datarörelse mellan olika komponenter. Den slår Nvidias toppmoderna Blackwell GPU när det gäller petaflops per watt.
De Cerebras WSE-3-chip riktar sig till megaföretag som vill bygga stora och mycket kraftfulla AI-system genom att eliminera distribuerad datoranvändning. Cerebras har samlat kunder som AstraZeneca, GSK, The Mayo Clinic och stora amerikanska finansinstitutioner.
Dessutom lanserade företaget nyligen sitt API för Cerebras Inference, som erbjuder oöverträffad prestanda på Llama 3.1 8B- och 70B-modeller.
Groq
Groq tog också AI-branschen med storm tidigare i år med sin LPU (Language Processing Unit) accelerator. Den genererar konsekvent 300 till 400 tokens per sekund när den körs med Llama 3 70B-modellen. Efter Cerebras är det näst snabbaste AI-inferencing lösning som faktiskt kan användas av utvecklare i deras produktionsappar och tjänster.

Groq är ett ASIC-chip, specialbyggt för generativa AI-applikationer av ex-Google TPU-ingenjörer. Det låser upp parallellism i en massiv skala. Och kostnadsmässigt är det det billigare att köra AI-modeller på Groqs LPU än på Nvidia GPU:er. Medan för relativt mindre modeller fungerar Groqs LPU bra. Vi måste se hur det presterar när vi kör 500B+ eller biljonskaliga modeller.
Avslutande tankar
Det här är de andra chiptillverkarna än Nvidia som konkurrerar i AI-hårdvaruutrymmet. SambaNova erbjuder också utbildning-som-en-tjänst, men vi har inte sett några kvantifierbara riktmärken för AI-acceleratorn för att göra en bedömning. Utöver det går Tenstorrent nu över till RISC-V-baserad IP-licensiering för sina chipdesigner.
Sammantaget går AI-branschen mot anpassat kisel och utvecklar egna specialbyggda AI-acceleratorer. Även om Nvidia fortfarande är det föredragna valet för träning på grund av CUDA:s breda användning, kan trenden under de kommande åren förändras när mer specialiserade acceleratorer mognar. För slutsatsen finns det redan många lösningar som överträffar Nvidia för närvarande.
AI-landskapet på mjukvarufronten förändras snabbt. Nu är det dags för AI-acceleratorer för att markera ett paradigmskifte.
Stöd vårt arbete ❤️
Om du gillade den här artikeln, överväg att lämna dricks för att hjälpa oss fortsätta publicera bra innehåll.




















