Mac 跑 AI 模型試算|M1-M4 統一記憶體 LLM 計算機
免費試算 Mac 能不能跑本地 AI 模型(LLM):選晶片(M1 到 M4 Max/Ultra)和記憶體,算出能跑多大的模型、記幾輪對話、每秒生成幾個 token。統一記憶體 GPU 上限已自動換算。
Mac 跑模型跟顯卡差在哪
Apple Silicon 是統一記憶體:GPU 和系統共用同一池 RAM,macOS 預設讓 GPU 最多用到約 75%。所以 Mac 的「VRAM」就是你買的記憶體容量打七五折,再扣掉系統和其他程式正在用的。Mac 的強項是記憶體可以買很大(128GB 以上),跑 70B 級大模型比組多卡便宜;弱項是長文件的前置處理(prompt 處理)比同級獨顯慢,因為算力較低。
生成速度一樣受記憶體頻寬決定:M4 Pro(273GB/s)跑 14B Q4 大約每秒 20 個 token,體感流暢;基本款 M4(120GB/s)跑同一顆大約 9 個,會等得有感——選機器時「頻寬」比「核心數」更決定 AI 體驗。
常見問題
75% 上限可以調高嗎?
可以,終端機下 sudo sysctl iogpu.wired_limit_mb=數字 能放寬(重開機失效)。日常建議別調太滿,系統記憶體被擠壓會整台卡住。
用什麼軟體跑?
入門用 LM Studio(圖形介面、選模型就跑)或 Ollama(命令列);要壓效能用 llama.cpp 的 Metal 後端,或 Apple 自家 MLX 格式的模型,同一顆模型 MLX 在 Mac 上通常快一到兩成。
買 Mac 跑 AI,記憶體怎麼選?
先想要跑的模型:8B 級 16GB 就夠;14B 建議 24GB 起;32B 要 48GB;70B 要 64GB 以上。記憶體不能事後加,寧可買大一級。
MacBook 跑模型會很燙嗎?
生成中 GPU 滿載,Air(無風扇)幾分鐘後會降速,長時間跑建議 Pro 或桌機(Mac mini/Studio)。