Mac kompyuteringizda AI kod yozish asboblarini mahalliy ishga tushirish

Mac kompyuteringizda AI kod yozish asboblarini mahalliy ishga tushirish

Iyl 09, 2026 local-ai apple-silicon llama-cpp coding-agents gemma macos machine-learning speculative-decoding

Nima Uchun Lokal AI Tanlash Kerak?

Barchamizga ma'lum: kod yozayotganingizda ijodiy zanjir boshlanadi, va shu paytda — internet o'chadi. Bulutdagi AI yordamchi ishlab bo'lmaydi, va siz kod tomon qarab, keyin nima qilishni o'ylaysiz.

Mana shunday holat menga ham sodir bo'ldi, va natijada mahalliy AI kodlash agentini ishga tushirishni o'ylab ko'rdim. Natija menga yanglish bo'ldi: to'g'ri sozlamalar bilan Apple Silicon ustida kutilgandan yaxshiroq natija olish mumkin.

Qanday Qilib Ishlaydi

Ko'p sinov va testlardan so'ng, M1 Max (64GB operativ xotira) da eng yaxshi natija bergan sozlamalar quyidagicha:

Asosiy Texnologiyalar:

  • Metal tezlashtirish bilan yig'ilgan llama.cpp
  • Gemma 4 26B-A4B, GGUF formatda (Q4 hisoblash bilan)
  • Speculative decoding uchun MTP draft modeli
  • Screenshot qo'llab-quvvatlash uchun multimodal proektor
  • Pi — terminal asosidagi kodlash agenti

Bu eng kuchli variant emas, lekin amalda ishlatish uchun eng mos tanlov. Sizga token soni hisobida tezlik kerak, javob kutish emas.

Qaysi Raqamlar Muhim?

Barcha sozlamalarda bir xil prompt bilan test o'tkazdim:

"Unified diff ni parse qiluvchi va o'zgartirilgan fayllar ro'yxatini qaytaruvchi kichik Python funksiyasi yozing. Keyin ikkita edge case tushuntiring."

Har bir test taxminan 128 token yaratdi.

Boshlang'ich Natija:

Gemma 4 ni Metal orqali to'g'ridan-to'g'ri ishga tushirish 58.2 token/soniya berdi. Bu ishlatish mumkin, lekin haqiqiy kodlash sessiyalarida sekin edi.

MTP Ning Farqi:

Bu yerda qiziqarli qism boshlanadi. Multi-Token Prediction modelga bir nechta tokenni oldindan "bashorat qilish" imkonini beradi. To'g'ri bashoratlarni qabul qilib, noto'g'rilarini bekor qiladi. Q8 MTP draft modeli yoqilganda, tezlik 72.2 token/soniyaga ko'tarildi — 24% yaxshilanish, asosiy model o'zgarmagan holda.

Prompt qayta ishlash tezligi deyarli o'zgarmadi (297-299 token/soniya atrofida), lekin kodlash agentlarida generatsiya tezligi muhim. Siz doimiy yangi prompt yubormaysiz — model javob yaratishini, qaror qabul qilishini va vositalarni ishlatishini kutasiz.

Draft token sonini 1 dan 6 gacha sinab ko'rdim. M1 Max uchun 3 ta draft token eng yaxshi natija berdi. 4 dan yuqorisi sekinlashtira boshladi — bu oddiy, ko'proq bashorat = ko'proq bekor qilish.

llama.cpp vs MLX: kutilmagan g'olib

Bu menga ham g'alati tuyuldi: Apple Silicon uchun maxsus optimallashtirilgan MLX (Apple'ning o'z ML framework'i) ustunlik qiladi deb o'ylagandim. Amalda esa:

| Runtime | Token/soniya | |---------|--------------| | llama.cpp Metal + MTP | 72.2 | | llama.cpp Metal | 58.2 | | MLX-LM (Unsloth 4-bit) | 45.8 | | MLX-LM (standard 4-bit) | 43.9 | | MLX-LM (OptiQ 4-bit) | 38.1 |

MTP bilan llama.cpp eng yaxshi MLX konfiguratsiyasidan 58% tezroq bo'ldi. Llama.cpp ustida yillar davomida olib borilgan optimizatsiya ishlari o'z mevasini bergan — macOSda苹果 silikonida juda yaxshi ishlaydi.

Vizual Imkoniyatlar Qo'shish

To'liq kodlash agenti uchun screenshot jo'natish qobiliyati muhim. Agentga yaratgan narsangizni ko'rsatish, UI o'zgartirishini tekshirish — bularning hammasi screenshot orqali amalga oshiriladi.

Muammo shundaki, faqat Gemma 4 12B tabiiy multimodal. Biz foydalanayotgan 26B modeli uchun alohida multimodal proektor kerak.

--mmproj proektorni llama.cpp ga qo'shganimda, Pi to'g'ri multimodal imkoniyatlarni bildirdi, va rasm vositalari ishlay boshladi. Eng yaxshisi — bu hech qanday sekinlashtirish keltirmadi, tezlik 72.2 token/soniyada qoldi.

Haqiqiy Tajriba

Bu sozlamalar bilan taxminan 17GB model fayllari kerak (16GB asosiy model, MTP head va proektor). 64GB operativ xotirangiz bo'lsa, bu muammo emas.

Pi agent sifatida OpenAI API formatiga mos keladigan interfeys taqdim etadi. Bu — llama.cpp server rejimida ochiladigan endpoint. Natijada OpenAI API qo'llab-quvvatlaydigan har qanday vosita bilan ishlay olasiz.

Asosiy foyda? Internet o'chganda ham — va bu eng yomon paytda bo'ladi — kodlashda davom etasiz. Agent bulutdagi alternativa nisbatan biroz sekinroq, lekin unchalikemas, ish jarayonini to'xtatmaydi.

Boshlash Yo'l-yo'riqi

Avvalo, Metal qo'llab-quvvatlash bilan llama.cpp ni yig'ishingiz kerak. Loyiha macOS uchun yaxshi hujjatlarga ega. Yig'ilgandan so'ng, server rejimi OpenAI API endpoint ochadi.

Modellar uchun Hugging Face dagi Unsloth GGUF versiyalari yaxshi optimallashtirilgan. Asosiy model uchun Q4_K_XL, MTP draft modeli uchun Q8 variantini oling.

--spec-draft-n-max qiymatini sozlang — 3 dan boshlang, 1 dan 6 gacha sinab ko'ring. Turli Apple Silicon konfiguratsiyalari uchun optimal nuqta farq qilishi mumkin.

Bunga Qimmatmi?

Agar doimiy ravishda AI yordamchilari bilan kod yozsangiz va mos hardwarega ega bo'lsangiz (minimum 16GB, 32GB+ tavsiya etiladi), — albatta arziydi. Internetga bog'liq emasligi o'zi katta qiymat. MTP esa generatsiya tezligini amalda ishlatish mumkin darajaga olib keldi.

GPT-4 darajasidagi intellektni bu ochiq modellarda olmaysiz, lekin kod yozish, refactoring, debug qilish va umumiy kodlash vazifalari uchun — ko'pchilik o'ylaganidan ko'ra qobiliyatli. Va bu sizniki — lokal, xavfsiz, kechikish yoki xizmat uzilishlari yo'q.

Vositlar sezilarli darajada rivojlangan. Agar avval lokal modellarni sinab ko'rgan bo'lsangiz va tezlik tufayli xafa bo'lsangiz — bu sozlamalarni sinab ko'ring. MTP ahamiyatli o'zgartirish kiritdi.

Read in other languages:

RU BG EL CS TR SV FI RO PT PL NB NL HU IT FR ES DE DA ZH-HANS EN