Proč M-série na lokální AI nestačí
MacBook Pro s M4 Max a 128 GB paměti: Funguje lokální AI kódování?
Koupili jste si nový MacBook Pro s M4 Max a 128 GB sjednocené paměti s vidinou, že budete bez problémů provozovat lokálního AI asistenta pro programování? Jednoduchá matematika napovídá, že 128 GB unified memory = pořádný výkon pro velké jazykové modely, že ano?
No, realita je bohužel složitější. Jeden vývojář to zjistil tvrdou cestou přes custom Metal inference enginy, agresivní optimalizace a různé architektury modelů. Výsledek? Strop někde kolem 80-150 tokenů za sekundu — a to už mluvíme o modelech, které jsou vůbec k něčemu užitečné.
Co slibovali vs. co dostáváme
Apple Silicon přinesl zajímavou inovaci v podobě unified memory architektury. Žádné přesouvání dat mezi CPU a GPU pamětí — všechno žije pohromadě, což by mělo znamenat rychlejší zpracování AI úloh. A pro spoustu úkolů to taky funguje.
Ale u obsluhy velkých jazykových modelů pro coding asistenci? Čísla mluví jasně. I s agresivně optimalizovanými inference enginy postavenými přímo pro Metal se výkon zastavuje na předvídatelných úrovních:
- Llama.cpp Q4_0: Zhruba 70.9 tokenů/s
- MLX 4-bit: Přibližně 80.6 tokenů/s
- Custom optimized Qwen3-Coder-Next: Zhruba 120 tokenů/s
- Custom optimized Qwen3.6-35B při 4-bit: Zhruba 85 tokenů/s
Vzorec je jasný: jakmile se dostanete k "užitečným" modelům (obecně 7B+ parametrů pro coding úlohy), narážíte na zeď — bez ohledu na to, jak moc optimalizujete.
Proč se to děje?
Vývojář za těmito benchmarky se domnívá, že problém není v samotném výpočetním výkonu, ale v propustnosti paměti. A to dává smysl, když se zamyslíte nad tím, jak transformer modely fungují.
Generování každého tokenu vyžaduje čtení značné části vah modelu z paměti. I s působivou propustností M4 Max jste limitováni rychlostí přesunu dat. Matrix multiplikace můžou být rychlé, ale jen tak rychlé, jak rychle jsou krmeny daty.
Tohle vysvětluje, proč menší modely fungují dramatičně lépe — prostě se přesouvá méně dat. Model s 0.1B parametrů může dosáhnout 1000 tokenů/s, ale přejdete na 1.5B a spadnete na zhruba 140 tokenů/s. Škálování není lineární — je brutální.
Jaké máte možnosti?
Pokud hledáte coding asistenci při 200+ tokenech za sekundu a zároveň potřebujete rozumné schopnosti uvažování a tool-calling, možnosti se výrazně zužují:
Cloud řešení Hostované modely od providerů jako Anthropic (Claude), OpenAI nebo DeepSeek nabízejí pořádný výpočetní výkon, ale za subscription ceny od $20 do $200+ měsíčně pro seriózní použití. Jsou spolehlivé a rychlé, ale závisíte na externích službách.
Specializovaný hardware Cerebras nabízí skutečně působivé rychlosti inference (jejich GPT-oss-120b model běží přes 1000 tokenů/s), ale cenovka ho dělá nedostupným pro většinu individuálních vývojářů a spoustu týmů.
Lokální modely s upravenými očekáváními Pokud potřebujete lokální inference, zvažte, jestli zvládnete o něco pomalejší rychlosti. Modely jako Qwen3.5-32B nebo podobné architektury při 4-8 bitové kvantizaci můžou poskytnout slušnou coding asistenci při 80-120 tokenech/s — dost na produktivní práci, když váš workflow toleruje o trochu vyšší latenci.
Ta skutečná otázka: Lokálně vs. Cloud
Tenhle spor se nakonec točí kolem vašich konkrétních potřeb:
- Zvolte lokální pokud máte přísné požadavky na data privacy, občasný přístup k internetu, nebo chcete experimentovat bez průběžných nákladů
- Zvolte cloud pokud je konzistentní rychlost důležitější než vlastnictví, potřebujete ty nejlepší možnosti modelů, nebo váš rozpočet unese předplatné
Pro spoustu vývojářů dává hybridní přístup největší smysl — lokální modely pro experimentování a rychlé úkoly, cloud pro produkční workloady, kde rychlost a schopnosti kriticky záleží.
Závěr
Apple Silicon je skutečně působivý pro spoustu AI úloh, ale rychlá lokální inference s schopnými coding modely zůstává výzvou. Hardware prostě nebyl navržený s tímto konkrétním workloadem na mysli, a žádné množství Metal optimalizací nepřekoná fundamentální architektonické omezení.
Pokud stavíte AI-asistovaný vývojářský workflow, vaše nejlepší sázka je přizpůsobit infrastrukturu vašim skutečným potřebám — a být upřímní ohledně toho, jestli vám "local first" přístup pomáhá, nebo brzdí.
Jaké máte zkušenosti s lokální AI inference? Našli jste konfigurace, které tyto výkonnostní bariéry prolomily?