就是算

GPU 跑 AI 模型試算|VRAM 需求與 token 速度計算機

免費試算顯示卡能不能跑本地 AI 模型(LLM):選顯卡和模型大小,算出 VRAM 夠不夠、能記幾輪對話、每秒大約生成幾個 token。內建 RTX 30/40/50 系與 AMD 顯卡規格,量化格式(Q4/Q8/FP16)一鍵切換。

這個數字怎麼算的

顯卡跑 AI 模型,VRAM 要裝三樣東西:模型權重(參數量 × 每個參數的位元組數,Q4 量化約 0.6 bytes、FP16 是 2 bytes)、KV cache(記住上下文用的,每個 token 都要佔一塊)、執行緩衝(約 1GB)。三樣加起來超過 VRAM 就跑不動,或被迫用系統記憶體,速度掉一個數量級。

生成速度的瓶頸不是算力,是記憶體頻寬:每生成一個 token,GPU 都要把整個模型權重從 VRAM 讀一遍,所以理論速度 ≈ 頻寬 ÷ 模型大小,實際大約打六折。這也是為什麼同樣的模型,量化壓小之後不只省空間、速度也變快。

「1GB」是什麼概念

用這個工具的換算基準,1GB VRAM 大約等於:Q4 量化的 18 億(1.79B)個參數,或 FP16 的 5.4 億個參數;拿來放 KV cache 的話,以 8B 級模型(GQA 架構)計,大約能記住 8,000 個 token 的上下文——約一萬多個中文字。所以「多 1GB」可以理解成:模型可以大一點點,或者讓它多記住半篇長文。

常見問題

每秒幾個 token 才夠用?

人的閱讀速度大約每秒 5-10 個 token。20 tok/s 以上體感流暢,10 以下會等得有感,3 以下基本不堪用。用途是跑批次任務的話慢一點無妨。

VRAM 不夠可以用記憶體補嗎?

可以(offload 部分層到系統記憶體),但速度會被拖到 DDR 的頻寬,通常掉到十分之一。寧可換小一級的模型或壓到 Q4,全部塞進 VRAM。

Q4 量化會變笨嗎?

會損失一點品質,但 Q4_K_M 級別的損失多數任務感覺不出來,是社群公認的性價比甜蜜點;Q8 幾乎無損。低於 Q4(Q3、Q2)劣化開始明顯。

KV cache 為什麼吃這麼多?

模型每記住一個 token,每一層都要存一份 Key/Value 向量。本工具用現代 GQA 架構模型的典型值估算(8B 級約 128KB/token);跑 llama.cpp 可以把 KV cache 也量化成 Q8,佔用再砍半。

Mac 沒有 VRAM,怎麼算?

Apple Silicon 是統一記憶體,規則和獨立顯卡不同,我們做了專屬版:Mac 跑 AI 模型試算,選晶片和記憶體直接算。

雙顯卡 VRAM 可以相加嗎?

可以分層放到兩張卡(llama.cpp/vLLM 都支援),VRAM 近似相加,但頻寬不相加,速度以持有較多層的卡為準,還會多一點卡間傳輸損耗。