不過,P40 平還平,定位要搞清楚:它是舊款數據中心推理硬件,不是現代桌面顯示卡嗰種「插落去就用」體驗 。文中價格亦沿用來源所列美元價,未計你自己可能需要的風扇、導風罩、線材或轉接件。
跑本地 LLM 推理,最現實的第一關往往係:模型放唔放得入 GPU 記憶體。InsiderLLM 指,P40 的 24GB VRAM 可令部分 14B 模型完全放入 GPU 跑,而同一情況下 12GB RTX 3060 未必放得落 。另一份 2026 二手 GPU 指南亦用「VRAM 優先」角度看 AI 工作負載,偏向選高 VRAM 二手卡,而不是某些較新但 VRAM 較少的型號 。
當然,P40 已經唔年輕。Vast.ai 列出 Tesla P40 發布日期為 2016 年 9 月 13 日,記憶體容量為 24GB 。Accio 形容它是 Pascal 世代的數據中心 GPU,原本面向推理和虛擬化,如今因為 24GB 容量和低二手價,被本地 AI 玩家重新拿來使用 。速度方面就要有心理準備:InsiderLLM 指它按現代標準算慢,約比 RTX 3090 慢三倍 。
P40 的卡價可以好吸引,但如果主機撐唔住,平卡都會變貴。買之前至少檢查四件事:
P40 最合理的定位,是一部本地推理盒。Accio 將 P40 的「第二生命」連到本地 LLM 執行,並在 P40 homelab 使用情境中提到 llama.cpp 。比較穩陣的做法,是先由能夠放入 24GB VRAM 的模型和設定開始,再慢慢調整 context 長度與 serving 設定。
期望管理好重要。RBA 的平價 build 文章指出,P40 不能跑最大的前沿模型,而且有架構限制;但只要配置得宜,仍然可以相當有用 。
如果你想要一張安靜、低溫、所有新模型都輕鬆應付的桌面 GPU,P40 大概率會令你失望。InsiderLLM 形容它按現代標準算慢,約比 RTX 3090 慢三倍 。
但現實中仍有人買,原因亦好清楚:夠平、夠 VRAM。RBA 曾分享一個具體平價 server build,使用二手 P40 跑 Qwen3 Coder 30B,約有每秒 50 tokens 的速度 。呢個應當視為個別案例,而不是通用 benchmark;實際速度會受模型、設定、context 大小、整機配置和散熱影響。
| 選項 | 點解會揀 | 來源提及的成本與容量 | 主要取捨 |
|---|---|---|---|
| 二手 Tesla P40 24GB | 用最低成本買到 24GB VRAM,適合本地推理 | 來源分別提到約 150–200 美元、200–250 美元、200 美元以下或 300 美元以下二手價 | 舊數據中心卡、無顯示輸出、250W TDP,而且散熱要自己處理 |
| 二手 RTX 3090 24GB | 同樣 24GB,但速度和使用體驗通常更好 | 一份 2026 二手 GPU 指南列出二手價約 700–850 美元 | 貴過 P40 好多;不過 P40 被形容約比 RTX 3090 慢三倍 |
| A100 40GB/80GB | 真正需要更大 VRAM 和更高階工作負載時考慮 | A100 有 40GB 和 80GB 配置;A100 80GB 二手價被報告為數千美元級別 |
如果目標是用最低成本做一部可用的本地推理機,可以跟以下次序:
以最低入場成本計,二手 Tesla P40 24GB 仍然係舊 server 升級本地 AI 的突出選擇:近期指南將它的 24GB VRAM 二手價大致放在 150–250 美元或 300 美元以下範圍 。但真正成功的公式不是「買張平卡」咁簡單,而係 P40 加上足夠供電、直接風道,以及合理期望。
想保留 24GB 容量但少啲頭痕,二手 RTX 3090 24GB 更值得比較 。如果你需要 A100 級別的記憶體,就要停止用「平玩舊機」思路,改為準備大得多的預算 。
| 通常已經偏離「用舊機平玩」的目的 |