Mac M et IA locale : pourquoi la réalité dépasse la promesse
MacBook Pro M4 Max et IA locale : pourquoi la réalité ne tient pas ses promesses
Tu viens de craquer pour un MacBook Pro M4 Max avec 128 Go de mémoire unifiée. Forcément, tu t'imagines trainer des modèles de langage pour coder en local, sans contrainte. 128 Go, c'est du sérieux, non ?
Eh bien, comme l'a découvert un développeur à ses dépens, la réalité est bien plus tordue. Entre moteurs d'inférence Metal optimisés et tests sur différents modèles, une vérité emerge : il y a un plafond autour de 80-150 tokens par seconde dès que tu fais tourner des modèles vraiment utiles.
La promesse硬件 versus le concret
Apple Silicon a vraiment innové avec son architecture de mémoire unifiée. Plus besoin de transfers entre CPU et GPU — tout vit ensemble, ce qui devrait accélérer les traitements IA. Et pour beaucoup de tâches, c'est vrai.
Mais pour faire tourner des modèles de langage pour coder, les chiffres racontent une autre histoire. Même avec des moteurs d'inférence ultra-optimisés pour Metal, les performances stagnent :
- Llama.cpp Q4_0 : environ 70 tokens/seconde
- MLX 4-bit : roughly 80 tokens/seconde
- Qwen3-Coder-Next optimisé : environ 120 tokens/seconde
- Qwen3.6-35B en 4-bit optimisé : autour de 85 tokens/seconde
Le pattern est clair : dès que tu passes à des tailles de modèles "utiles" (7B+ en général pour coder), tu tapes dans un mur.
Pourquoi ça coince ?
Le développeur derrière ces benchmarks pointe du doigt la bande passante mémoire, pas la puissance brute. Et ça tient la route quand tu comprends comment fonctionnent les transformers.
Chaque génération de token demande de lire une grosse partie des poids du modèle depuis la mémoire. Même avec la bande passante impressionnante du M4 Max, tu restes limité par la vitesse à laquelle tu peux bouger ces données. Les multiplications matricielles peuvent être rapides, mais elles dépendent de ce qu'on leur donne.
C'est pour ça que les petits modèles s'en sortent tellement mieux — y'a moins de données à bouger. Un modèle 0.1B peut atteindre 1000 tokens/seconde, mais passe à 1.5B et tu tombes à 140 tokens/seconde. Le scaling n'est pas linéaire, il est brutal.
Tes options ?
Si tu veux coder à 200+ tokens/seconde tout en gardant des capacités de raisonnement et d'outils, le choix se rétrécit :
Les solutions cloud Les modèles hébergés par Anthropic (Claude), OpenAI ou DeepSeek offrent une puissance considérable mais coutent entre 20 et 200€ par mois pour un usage sérieux. Fiables et rapides, mais tu dépends de services externes.
Le matériel spécialisé Cerebras propose des vitesses d'inférence bluffantes (leur modèle GPT-oss-120b tourne à plus de 1000 tokens/seconde), mais le prix les réserve aux entreprises ou aux budgets conséquent.
Les modèles locaux avec des attentes réalistes Si tu as besoin de l'inférence locale, demande-toi si tu peux accepter un rythme plus lent. Des modèles comme Qwen3.5-32B en quantification 4-8 bit offrent une assistance correcte à 80-120 tokens/seconde — suffisant pour bosser si ton workflow s'adapte.
La vraie question : local ou cloud ?
Ce débat dépend surtout de tes besoins :
- Choisis le local si tu as des exigences strictes de confidentialité, un accès internet intermittent, ou si tu veux expérimenter sans cout récurrent.
- Choisis le cloud si la vitesse constante prime, si tu as besoin des meilleures capacités possibles, ou si ton budget peut absorber les abonnements.
Pour beaucoup de développeurs, l'approche hybride a du sens — modèles locaux pour l'expérimentation et les petites tâches, cloud pour la prod où vitesse et capacités sont critiques.
Le mot de la fin
Apple Silicon est vraiment impressionnant pour beaucoup de tâches IA, mais faire tourner de la vraie inference rapide en local reste compliqué. Le hardware n'a simplement pas été conçu pour cette charge spécifique, et aucune optimisation Metal ne peut contourner ces contraintes architecturales.
Si tu construis un workflow de dev assisté par IA, le mieux c'est d'adapter ton infrastructure à tes vrais besoins — et d'être honnête sur le fait que l'approche "local first" te sert ou te freine.
Tu as testé des configs qui cassent ces barrières de perf ? Raconte.