開源硬體 vs 貴價GPU:Optane PMem 跑LLM嘅真實效能
全世界嘅AI團隊都喺度追H100,但有一班人走咗另一條路。2026年5月,一位Reddit用戶用六條二手Intel Optane DCPMM加一張RTX 3060,以大約$4,000-5,000美金嘅成本,成功本地運行咗Moonshot嘅Kimi K2.5——一個約一兆參數嘅Mixture-of-Experts模型。呢個數字唔係快,但佢揭示咗一個好多人忽略嘅事實:LLM推理嘅瓶頸,從來都唔係運算力,而係記憶體容量同頻寬之間嘅取捨。
被淘汰嘅「死物」點解突然有用
Intel Optane Persistent Memory係一款2019年推出嘅產品,定位喺DRAM同SSD之間——byte-addressable、容量大、但比DRAM慢。當年佢喺數據庫場景嘅定位好尷尬:唔夠DRAM快,又唔夠SSD平。Intel喺2022年正式停產,成條產品線被淘汰。
但LLM推理改變咗件事。當你載入一個量化到q4_K_M嘅70B模型時,權重檔案大約40GB;如果係DeepSeek-V3或者Kimi K2.5呢類MoE模型,成個模型可以大到600GB以上。H100嘅80GB HBM3完全裝唔落,8卡H100系統嘅成本超過$200,000美金。
二手市場上嘅Optane DIMM卻可以用大約$1.5-2.5美金每GB嘅價錢提供768GB容量。APFrisco嘅具體配置係:六條128GB Optane DCPMM(總計768GB)加192GB DDR4 ECC,配一塊Xeon Gold 6246雙路主機板,再加一張$300嘅RTX 3060 12GB做GPU加速。軟件層用llama.cpp嘅App Direct模式,配合--override-tensor同--cpu-moe旗幟將MoE嘅sparse expert weights放喺Optane記憶體,attention layers同routing components放喺GPU VRAM。
成個系統加埋大約$4,000-5,000美金——係同等VRAM容量嘅8卡H100系統嘅四十分之一。
頻寬係一切:四粒token嘅物理限制
講完容量講速度。Optane嘅讀取頻寬大約每條DIMM 6-8GB/s,12條加埋大約80-100GB/s。呢個數字同GDDR6嘅360GB/s、或者H100 HBM3嘅3,350GB/s比,差距係數量級。
LLM生成token嘅時候,每一粒新token都要讀取成個模型嘅權重。所以理論上限好簡單:tok/s = 記憶體頻寬 ÷ 模型大小。一個600GB嘅1T MoE模型喺100GB/s頻寬下,上限係0.17 tok/s。MoE架構因為每次只有部份expert被激活,實際表現會好啲,大約1.5-4 tok/s。
具體啲講:
- Llama 3 70B q4_K_M:Optane rig約4.2 tok/s,4×RTX 3090約85 tok/s,20倍差距
- DeepSeek-V3 (671B MoE):Optane rig約2.8 tok/s,8K prompt嘅prefill時間19秒
- Kimi K2.5 (1T MoE):APFrisco報告約4 tok/s,但prefill要接近一分鐘
- 8B模型喺RTX 3060:50-58 tok/s,Optane rig根本無需要跑咁細嘅模型
呢到有個好重要嘅insight:Optane喺容量嘅價錢係無敵,但速度嘅代價你必須接受。如果讀者嘅目標模型可以放喺96GB VRAM(4×3090),GPU rig一定係更好選擇。Optane唯一嘅winning scenario係你需要載入一個GPU rig放唔落、但你又唔介意等嘅模型。
香港團隊應該點樣諗呢條路
對香港嘅AI創業團隊嚟講,Optane呢個option有幾個實際考慮。
第一,出口管制係真實存在嘅。H100同A100對中國(包括香港)嘅出口限制令到本地團隊好難直接用最新硬件。二手市場嘅Intel Xeon平台完全冇呢個問題。
第二,香港嘅電費同空間成本唔低。Optane rig idle大約280W、load約600W,對比RTX 3060 rig idle約80W、load約270W,長期運行嘅電費差距顯著。每100K token嘅電力成本,Optane rig大約$1.25,GPU rig大約$0.023,相差超過50倍。
第三,LMDeploy同vLLM目前未有正式嘅Optane支援。主流開源推理框架都假設你行GPU-only。如果你要用Optane,目前幾乎只有llama.cpp一條路。唔係話行唔到,但代表你少咗好多production-grade嘅工具(paged attention、continuous batching、多用戶並發)。
但有一類場景Optane係真係work嘅:私隱敏感嘅批量推理。如果你係做legal tech、醫療AI、或者金融文檔分析,數據唔可以送出街,又需要跑一個70B或以上嘅模型做深度分析,Optane rig可以用$5,000美金做到H100 cluster $200,000美金做到嘅嘢——只係慢啲。你晚上掉個batch入去,聽朝睇結果,呢個workflow係完全可行嘅。
更具前瞻性嘅係,CXL(Compute Express Link)記憶體擴展正正係承接Optane留低嘅位置。Intel砍咗Optane之後,整個業界都意識到「容量平過DRAM但快過SSD」嘅記憶體層係LLM workload嘅剛需。CXL有望喺未來兩年提供類似嘅容量/價錢比例,但頻寬會好好多。
行動建議
如果你係香港嘅indie dev或者細團隊,想玩本地LLM:
-
先買GPU。$300嘅RTX 3060 12GB加$700嘅Ryzen 5800X系統,夠你行Llama 3.1 8B@58 tok/s同14B@33 tok/s。呢個係性價比最高嘅入門點。
-
只有當你需要70B+先考慮Optane。如果你嘅workload真係需要70B或以上嘅模型,而你又冇budget買幾張二手3090,咁先開始睇Optane。
-
注意total cost of ownership。Optane rig嘅硬件成本平,但電費、散熱、同埋你等token嘅時間成本都要計入。每分鐘等4粒token,喺香港呢個「時間就係錢」嘅地方,可能仲貴過租API。
-
等CXL。如果你唔急,CXL記憶體擴展產品預計2027年會開始普及,到時會有更好嘅性能同更成熟嘅軟件生態。
Optane rig係一個好犀利嘅技術demo,亦係一條俾人睇到「容量vs速度」取捨嘅實體教材。但對大部分團隊嚟講,佢嘅角色唔係替代GPU,而係提醒我哋:AI硬件嘅創新唔止係追求更快嘅GPU,更加係點樣用唔同嘅記憶體層去解決唔同嘅問題。呢個思路,可能係2026年最值錢嘅教訓。