De ce Mac-urile tale cu Apple Silicon nu sunt chiar monștrii AI-ului local (încă)
De ce MacBook-ul tău M4 Max nu poate să ruleze AI-ul local așa cum te-ai aștepta
Ai deschis cutia, ai configurat noul MacBook Pro cu M4 Max și 128GB de memorie unificată. Te-ai gândit că ai acum un monstru pentru AI local. Că poți să rulezi un coding assistant direct pe mașină, fără să depinzi de cloud, fără să plătești abonamente. Teoretic, 128GB de memorie unificată sună ca ceva serios, nu?
Ei bine, realitatea e mai puțin roz decât ai sperat.
Promisiunea vs. Realitatea
Arhitectura de memorie unificată de la Apple Silicon este într-adevăr o inovație. CPU și GPU împart aceeași memorie, deci nu mai există transferuri lente între ele. Pentru multe sarcini AI, asta funcționează excelent.
Dar când ajungi să servești modele lingvistice mari pentru coding, numerele nu mințesc:
- Llama.cpp Q4_0: ~70 tokens pe secundă
- MLX 4-bit: ~80 tokens pe secundă
- Qwen3-Coder-Next optimizat custom: ~120 tokens pe secundă
- Qwen3.6-35B la 4-bit optimizat: ~85 tokens pe secundă
Observi un pattern clar: de îndată ce lucrezi cu modele de minimum 7B parametri, adică cele care sunt utile pentru coding, dai de un zid. Indiferent cât optimizezi, indiferent ce engine de inferență folosești.
De ce se întâmplă asta?
Dezvoltatorii care au făcut benchmark-urile suspectează că problema nu e puterea de calcul, ci lățimea de bandă a memoriei. Și are sens când te gândești cum funcționează transformatoarele.
Pentru fiecare token generat, trebuie să citești o porțiune semnificativă din greutățile modelului din memorie. Chiar și cu M4 Max-ul care are o lățime de bandă impresionantă, ești limitat de cât de repede poți muta datele. Operațiile matrix sunt rapide, dar doar la fel de rapide precum datele care le hrănesc.
Asta explică de ce modelele mici merg mult mai bine — e pur și simplu mai puțină informație de mutat. Un model de 0.1B parametri poate atinge 1000 tokens pe secundă, dar sare la 1.5B și cobori la vreo 140 tokens pe secundă. Nu e liniar deloc — e brutal.
Ce opțiuni ai?
Dacă vrei coding assistance la peste 200 tokens pe secundă fără să pierzi din capabilitățile de reasoning și tool-calling, peisajul se îngustează:
Cloud-ul Modelele hostate de la Anthropic (Claude), OpenAI sau DeepSeek oferă putere de calcul imensă, dar costă între 20 și 200+ dolari pe lună pentru utilizare serioasă. Sunt de încredere și rapide, dar ești dependent de servere externe și de disponibilitatea lor.
Hardware specializat Cerebras oferă viteze de inferență cu adevărat impresionante — modelul lor GPT-oss-120b rulează la peste 1000 tokens pe secundă — dar prețul îl face inaccesibil pentru majoritatea dezvoltatorilor individuali și pentru multe echipe.
Modele locale cu așteptări realiste Dacă ai neapărat nevoie de inferență locală, ia în considerare dacă poți accepta viteze ceva mai mici. Modele precum Qwen3.5-32B sau arhitecturi similare la 4-8 bit quantization pot oferi asistență de coding decentă la 80-120 tokens pe secundă — suficient pentru muncă productivă, dacă workflow-ul tău permite puțină latență în plus.
Întrebarea reală: local vs. cloud
Totul se reduce la nevoile tale specifice:
- Alege local dacă ai cerințe stricte de confidențialitate a datelor, acces intermitent la internet, sau vrei să experimentezi fără costuri recurente.
- Alege cloud dacă viteza constantă contează mai mult decât proprietatea, ai nevoie de cele mai bune capabilități de model, sau bugetul tău poate susține abonamentele.
Pentru mulți dezvoltatori, o abordare hibridă face cel mai mult sens — modele locale pentru experimentare și sarcini rapide, cloud pentru workload-uri de producție unde viteza și capabilitățile sunt critice.
Concluzia
Apple Silicon e impresionant pentru multe sarcini AI, dar rularea inferenței rapide cu modele capable de coding rămâne o provocare. Hardware-ul pur și simplu nu a fost proiectat cu acest workload specific în minte, și nicio optimizare Metal nu poate depăși constrângerile arhitecturale fundamentale.
Dacă construiești un workflow de dezvoltare asistat de AI, cea mai bună abordare este să potrivești infrastructura cu nevoile tale reale — și să fii sincer cu tine însuți despre dacă abordarea "local first" te ajută sau te ține pe loc.
Care e experiența ta cu inferența AI locală? Ai găsit configurații care depășesc aceste bariere de performanță?