三只貓
Rich Mindset Zone
richmindsetzone.com
← All posts

1% 成本的 LLM 推理:POWER8 + Optane 方案到底行不行?

最近幾個月,科技社群瘋傳一組「低成本跑萬億參數模型」的方案:用二手 Optane 持久記憶體搭出 768GB 記憶體空間,總硬體成本不到 5000 美元。這數字聽起來誘人——比起動輒 20 萬美元的 8×H100 伺服器,確實是 1% 的價錢。但問題是:這 1% 的成本,到底買到了什麼?是一條可行走的路,還是只是一場工程師的行為藝術?

硬體規格的「數學陷阱」

先看數字。768GB Optane 方案的核心優勢是容量:12 條 128GB 的 Optane DIMM 插上去,空間足夠塞進一個量化後的萬億參數 MoE 模型。二手市場上這些記憶體條大約 300-600 美元一條,加上二手 Xeon 平台、機殼、電源,總成本大約 4000-5000 美元。這確實只是 H100 集群的零頭。

但容量從來不是推論的瓶頸。LLM 推論是記憶體頻寬綁定的工作——每一顆 token 的生成都需要把模型權重從記憶體流過運算核心。Optane DIMM 的持續讀寫頻寬大約是 5-10 GB/s 每通道,而 RTX 3060 的 GDDR6 記憶體頻寬是 360 GB/s。這是一個數量級的差距,直接決定了 token 生成速度:Optane 方案跑 1T MoE 模型大約 1-3 tok/s,而 RTX 3060 跑 7B-13B 模型可以到 35-70 tok/s。

更殘酷的是「每 token 成本」的計算。在 0.15 美元/度電的假設下,Optane 方案產生 10 萬個 token 的電費大約是 0.50-1.25 美元,而 RTX 3060 只要 0.02-0.04 美元。加上硬體折舊,差距更大:Optane 方案的「每 token-per-second 成本」大約是 5000 美元,RTX 3060 方案則是 19 美元。相差 260 倍。

POWER8 的復古魅力與現實瓶頸

POWER8 架構本身是個有趣的研究對象。2016 年的 IBM Power System S822/S824,二手價大約 600 美元,雙路配置可以到 20 核 160 線程(SMT8),記憶體頻寬在雙路交錯模式下可達 230 GB/s。有人用 llama.cpp 在上面跑 Qwen 2.5 7B,優化後達到 6.81 tok/s。這數字比預期好——證明了老舊的非 x86 架構依然能跑現代模型。

但 6.81 tok/s 是什麼概念?作為參考,一個流暢的對話體驗需要至少 20-30 tok/s,代碼補全工具需要 50+ tok/s。6.81 tok/s 的意思是:你打出一個問題,大約要等 10-15 秒才能看到完整回覆。如果你用的是 Cursor、Aider 這類 agentic coding 工具,單次工具調用就要一分鐘。這不是「可用」,這是「可以證明它能跑」。

功耗也是問題。POWER8 全負載 400W,而 Apple M2 Max 只要 60W 就能跑出 58 tok/s。每百萬 token 的電費:POWER8 是 1.63 美元,M2 Max 是 0.03 美元。54 倍的差距。在邊緣部署或長時間運行的場景下,功耗成本會吃掉任何「硬體便宜」的優勢。

國產方案的實際表現:赤兔與 LMDeploy

中國在 LLM 推理框架上的投入確實值得關注。「赤兔」(Chitu)引擎由清華大學 PACMAN 實驗室開發,定位是「生產級大模型推理引擎」,支持 NVIDIA、昇騰、摩爾線程等多種硬體,並實現了 CPU+GPU 異構混合推理。LMDeploy 的 TurboMind 引擎則在混合精度推理上表現優異,報告聲稱比 vLLM 快 1.8 倍,4-bit 推理性能比 FP16 高 2.4 倍。

這些框架確實解決了一部分問題:它們讓非 NVIDIA 硬體也能跑 LLM,讓舊硬體有了新的生命。但核心瓶頸——記憶體頻寬——是硬體層面的限制,軟體優化能改善,但無法突破物理極限。赤兔在 3 節點 8 卡配置下跑 DeepSeek-R1 671B 可以到 22-29 tok/s,這是很不錯的成績,但那需要 24 張 GPU,成本早已不是「1%」了。

真正的「低成本」方案,其實是量化技術的進步。當 7B 模型用 4-bit 量化後只有 4.5GB,一張 300 美元的 RTX 3060 12GB 就能完全裝下並跑出 35-55 tok/s。這才是大多數 indie developer 和 SME 真正需要的:不是跑萬億參數模型的「可能性」,而是跑 7B-14B 模型的「實用性」。

結論:低成本推論的正確打開方式

如果你的目標是「證明它能跑」或「研究記憶體子系統的極限」,POWER8 + Optane 是個有趣的實驗。如果你的目標是「用 LLM 來做事情」,這條路走不通。

對香港和繁體中文圈的 indie developer 和 SME,我的建議很具體:

  1. 預算 300 美元:買一張二手 RTX 3060 12GB,搭配 32GB DDR4,總成本大約 670 美元。這套系統可以跑 Llama 3.1 8B、Qwen3-14B 等模型,速度足以支持 agentic coding 和互動式對話。

  2. 預算 1000 美元:考慮 RTX 4070 Ti Super 16GB 或等待 RTX 5070,搭配 64GB DDR5。這讓你可以跑 27B 模型,覆蓋大多數生產場景。

  3. 預算 3000+ 美元:兩張 RTX 3090 24GB(二手約 800 美元一張)搭配 128GB DDR5,可以跑 70B 模型,或用 Chitu/LMDeploy 部署多用戶服務。

  4. 如果必須跑超大模型:租雲端 GPU(每小時 1-2 美元的 A10 實例),而不是自己搭硬體。租用成本幾乎總是低於自建,除非你每月運行超過數百小時。

記憶體容量是「能跑」的門檻,但頻寬和算力才是「能用」的關鍵。在 GPU 短缺的時代,Alternative path 確實存在,但它不是 Optane,而是量化技術、混合精度、以及更聰明的硬體選擇。