客人來評估,十個有八個第一句是「我要買哪張卡」。其實先問的應該是:你要跑多大的模型、要不要同時給幾個人用。顯存(VRAM)決定模型裝不裝得下,裝得下才談速度。
先記一個粗略換算
LLM 用 4-bit 量化跑的話,參數量(B)大概乘 0.6 到 0.7 就是需要的顯存 GB 數,再留一點給對話長度。7B 約 5–6GB、14B 約 9–10GB、32B 約 20GB、70B 約 40GB 以上。
8GB
- LLM(4-bit)
- 7–8B 模型,單人問答
- 生圖
- SD 1.5 順、SDXL 勉強
- 適合
- 個人試用、小工作室初學
16GB
- LLM(4-bit)
- 14B 順、32B 要犧牲速度
- 生圖
- SDXL 順、Flux 可跑(fp8)
- 適合
- 設計工作室出圖機、小公司內部問答
24GB
- LLM(4-bit)
- 32B 順,多人同時問
- 生圖
- Flux 順、高解析與批次
- 適合
- 5–20 人團隊共用
32GB(RTX 5090)
- LLM(4-bit)
- 32B 很順、70B 靠 offload 慢慢跑
- 生圖
- 影片生成、高解析批次
- 適合
- 公司知識庫主機、專業影像團隊
雙卡或 96GB
- LLM(4-bit)
- 70B 順跑、多模型同時
- 生圖
- 多人同時出圖
- 適合
- 企業級、對外服務
幾個常見誤會
- 「RAM 大就好」:系統記憶體不能代替顯存,模型塞不進顯卡就會慢十倍以上。RAM 的角色是做緩衝,建議至少是顯存的兩倍。
- 「先買小的之後再加卡」:兩張 16GB 不等於 32GB,多卡跑單一模型有損耗,而且主機板、電源、機殼都要一開始就規劃。
- 「用最強模型才有用」:內部文件問答、分類、摘要,14B 到 32B 的開源模型調好就夠,先把資料整理好比換模型有效。
怎麼決定
把你要做的事、同時用的人數告訴我們,評估時我們會直接用你的資料在對應等級的機器上跑給你看。手上已經有卡的話,也先看它能做到哪,不用急著買。