M-serien kan ikke følge med, når det gælder lokal AI på Apple Silicon
M4 Max og drømmen om lynhurtig lokal AI – her er sandheden
Du har investeret i et MacBook Pro med M4 Max og 128GB unified memory. Sikke en maschine. Tænk på alle de lokale AI-modeller, du kan køre uden at svede.
Ja, velkommen til virkeligheden.
En udvikler gennemgik et imponerende optimeringsmaraton med custom Metal inference engines, aggressiv tuning og adskillige modelarkitekturer. Konklusionen? Du ender stadig irgendwo i omegnen af 80-150 tokens per sekund, så snart du bevæger dig op i "brugbare" modelstørrelser.
Hvad sker der med Apple Silicon?
Unified memory var Apples store salgsargument. Ingen mere data shuffling mellem CPU og GPU – alt ligger sammen, og det burde være hurtigt.
Og det er det også. For mange opgaver.
Men når det gælder store sprogmodeller til kodning, fortæller tallene en anden historie:
- Llama.cpp Q4_0: Cirka 70 tokens/sek
- MLX 4-bit: Omkring 80 tokens/sek
- Custom tuned Qwen3-Coder-Next: Runt 120 tokens/sek
- Custom tuned Qwen3.6-35B ved 4-bit: Cirka 85 tokens/sek
Mønstret er tydeligt: når du arbejder med modeller på 7B+ parametre, rammer du en væg. Uanset hvor meget du optimerer.
Hvorfor?
Udvikleren bag benchmarkene peger på memory bandwidth som flaskehalsen – ikke regnekraften.
Det giver god mening, når man tænker over, hvordan transformer-modeller fungerer. Hver token kræver, at en stor del af modelvægtene læses fra hukommelsen. Selv med M4 Max' formidable båndbredde, ender du med at vente på data. Matrix-multiplikationer kan være hurtige, men de er kun så hurtige som det data, der fodrer dem.
Det forklarer også, hvorfor mindre modeller er dramatisk hurtigere. En 0.1B model kan nå 1000 tokens/sek, mens 1.5B lander på cirka 140 tokens/sek. Scaling er ikke lineær – det er brutalt.
Dine muligheder
Leder du efter 200+ tokens/sek med fornuftig reasoning og tool-calling? Så bliver valgmulighederne smalle:
Cloud-løsninger Anthropic, OpenAI, DeepSeek – de leverer regnekraft, men abonnementspriser fra 20 til 200+ dollars om måneden for seriøs brug. Pålideligt og hurtigt, men afhængigt af eksterne tjenester.
Specialiseret hardware Cerebras leverer imponerende hastigheder (deres model kører 1000+ tokens/sek), men prisskiltet gør det utilgængeligt for de fleste.
Lokale modeller med justerede forventninger Kan du acceptere lidt langsommere hastigheder? Modeller som Qwen3.5-32B i 4-8 bit quantization kan give brugbar kodnings-assistance ved 80-120 tokens/sek. Det er nok til produktivt arbejde, hvis din workflow kan håndtere lidt mere latency.
Spørgsmålet om local vs. cloud
Det handler i bund og grund om dine behov:
- Vælg local hvis du har strikse datakrav, ustabil internetforbindelse eller vil eksperimentere uden løbende omkostninger
- Vælg cloud hvis konsistent hastighed vejer tungere, du har brug for den bedste modelkapacitet, eller dit budget kan bære abonnementspriser
For mange udviklere giver en hybrid-tilgang mest mening – local til eksperimentering og hurtige opgaver, cloud til produktionsworkloads hvor hastighed og kapacitet er kritisk.
Konklusionen
Apple Silicon er imponerende til mange AI-opgaver. Men at køre hurtig lokal inference med kapable kodningsmodeller forbliver udfordrende. Hardwaren var ganske enkelt ikke designet til dette specifikke workload, og ingen mængde Metal-optimering kan overvinde fundamentale arkitektoniske begrænsninger.
Bygger du en AI-assisteret udviklingsworkflow? Så match din infrastruktur til dine faktiske behov – og vær ærlig om, hvorvidt "local first"-tilgangen hjælper eller hæmmer dig.
Hvad er din erfaring med lokal AI inference? Har du fundet konfigurationer der bryder igennem disse performance-barrierer?