AI 社交智能新 benchmark:Wolfcha 如何用狼人殺考驗 LLM
MMLU 考常識、GSM8K 考數學、HumanEval 考寫 code——但如果 AI 要喺一張枱上,面對八個各有盤算嘅對手,講大話、捉大話、結盟、背叛,佢仲有冇辦法贏?呢個問題唔係哲學討論,而係一個叫 Wolfcha 嘅 open-source 項目已經做到嘅嘢。Wolfcha 畀你一個人同成枱 AI 玩家玩狼人殺,而背後嘅技術架構,意外地揭露咗 LLM 目前最真實嘅能力邊界。
當 MMLU 失效:社交推理先係真正嘅圖靈測試
MMLU 呢類 static benchmark 有一個根本缺陷:佢係單向嘅。俾一條問題,AI 答一個答案,對錯分明。但現實世界嘅智能從來唔係咁運作——你講一句話,對方嘅反應會改變你下一句;你睇到對方嘅表情,會調整你嘅策略。呢種動態嘅、多輪嘅、不完全資訊下嘅決策,先係人類智能嘅日常。
Wolfcha 嘅狼人殺場景完美捕捉咗呢種複雜性。每個 AI 玩家喺夜晚知道嘅資訊唔同,白天要透過對話推測其他人嘅身份。好人陣營要從矛盾嘅發言中搵出線索,狼人要偽裝、誤導、甚至犧牲隊友換取信任。呢種多輪博弈之中,一個錯誤嘅推理或者一次唔自然嘅發言,就會暴露自己。冇任何 static benchmark 可以捕捉到呢種動態壓力。
呢啲場景逼使 AI 做嘅唔係知識 recall,而係 strategic reasoning——我要講咩先可以令佢哋信我?佢剛才果句說話係咪有破綻?如果我而家跳預言家,風險同回報係點?呢啲先係「智能」嘅核心。
雙層角色扮演:Wolfcha 嘅技術突破
Wolfcha 最有趣嘅設計唔係遊戲本身,而係佢嘅「雙層角色扮演」架構。第一層:AI 扮演一個「虛擬玩家」,呢個 player 有自己嘅性格、背景、講嘢語氣。第二層:呢個虛擬玩家再扮演狼人殺入面嘅角色——預言家、女巫、狼人等等。換句話講,AI 要喺一個角色之中再演另一個角色。
呢個設計唔係為咗炫技,而係必要。狼人殺嘅樂趣在於每個玩家嘅獨特性——有人 aggressive 成日踩人、有人沉默等機會、有人喜歡玩心理戰。如果每個 AI 都係標準化嘅「理性 agent」,遊戲會變得 predictable 同沉悶。Wolfcha 透過畀每個 AI 玩家一個 personality profile,令到遊戲產生真正嘅 unpredictability。
技術上,呢個要求 LLM 有極強嘅 instruction following 能力同埋 context 管理能力。AI 要記住自己嘅「虛擬身份」、記住遊戲進度、記住邊個講過咩、仲要即時調整策略。TokenDance 作為底層嘅 LLM 統一接口,整合咗 DeepSeek、Qwen、Gemini 等模型——唔同模型喺同一場景下嘅表現差異,本身就係一份珍貴嘅 benchmark 數據。
從遊戲到 benchmark:社交智能嘅可量化時代
Wolfcha 嘅價值遠遠超過一隻遊戲。佢提供咗一個可重複嘅、結構化嘅社交推理評估環境。每個遊戲環節(夜晚行動、白天討論、投票、遺言)都產生大量可量化嘅數據:推理準確率、說服成功率、bluff 被識破嘅頻率、隊友之間嘅協作效率。
相比起 SimpleQA 或者 MMLU-Pro 呢類知識型 benchmark,Wolfcha 測量嘅係更底層嘅認知能力:理論心智(Theory of Mind)、策略欺騙、長期規劃、不確定性下嘅決策。呢啲能力同人類點樣喺真實世界運作高度吻合——商業談判、團隊協作、競爭策略,本質上都係社交推理。
對於 LLM 開發者嚟講,Wolfcha 提供咗一個低成本嘅測試場:唔使自己搭建場景,直接 deploy 一個 instance 就可以用唔同模型跑遊戲,睇到具體嘅行為差異。邊個模型講大話最自然?邊個模型最容易被誤導?邊個模型可以識破複雜嘅欺騙策略?呢啲問題嘅答案,可能比任何 academic benchmark 都更有參考價值。
畀開發者嘅啟示
Wolfcha 俾我哋嘅最大啟示係:下一代 AI 評估,應該從「AI 識唔識答問題」轉向「AI 識唔識同人互動」。Static benchmark 已經到咗天花板,而社交推理遊戲提供咗一個天然嘅、可擴展嘅替代方案。
如果你係開發者,有幾個 action items 值得考慮:第一,去試玩 Wolfcha(wolf-cha.com),親身感受 AI 玩家嘅社交表現,你會發現不同模型喺說服力同邏輯一致性上有巨大差異。第二,諗吓你自己嘅產品有冇場景可以引入類似嘅多 agent 評估機制——唔一定係遊戲,Customer support bot 之間嘅協作、AI sales agent 嘅說服能力,都可以用類似框架測試。第三,關注呢個領域嘅發展——社交推理 benchmark 好有可能成為繼 MMLU 之後下一個主流評估標準。
狼人殺呢隻古老嘅派對遊戲,可能係我哋距離真正通用人工智能最近嘅一面鏡。