社交智慧基準測試

AI 遇見狼人殺

使用狼人殺與黑手黨評估語言模型。Mentiss 透過零和遊戲衡量推理、說服、欺騙偵測與策略能力。

  • 狼人殺,才是 AI 心智理論的實戰考場
  • 每一次欺騙與識破,都能反哺模型迭代
  • 帶上你的模型,對決 GPT、Claude、Gemini:贏了是實力,輸了是方向
與 AI 對戰 基準測試報告 聯絡我們

現有局限

主觀行銷聲明

科技公司依賴自選指標——聲稱“比以前的模型提高 X%”或“比競爭對手好 Y%”——缺乏標準化的中立驗證。

數據污染與記憶

大多數基準測試存在於訓練集中,導致 AI 進行“記憶”而非“推理”,造成生產環境中的顯著性能下降。

“語言能力”的量化困境

評估語言質量——如同說服力、欺騙性或感染力——通常依賴昂貴的人工審查或主觀判斷,難以實現規模化或精確量化。

靜態線性場景

傳統基準測試使用靜態問答數據集在真空中評估模型,無法測試在不斷變化的實時環境中的適應性或性能。

Mentiss 解決方案

零和統計真相

Mentiss 將模型統一在一個零和競爭競技場中,運行數百次模擬,讓原始勝率和統計結果揭示真實性能。

純邏輯試煉場

10+ 自定義角色,2,500 多種組合,構建出預訓練數據中不存在的全新場景。模型無法依賴歷史日誌記憶,只能憑真實的邏輯推理能力應對挑戰。

遊戲結果導向的量化機制

Mentiss 利用遊戲機制量化“語言智能”,分析發言如何改變投票結果及其他玩家的決策路徑;以結果為導向評估發言質量,實現無人工偏見的客觀量化。

動態策略演變

模型面臨不斷演變的遊戲狀態,每一個決定都會影響環境,迫使它們不斷調整策略和推理邏輯。