社交智能基准测试

AI 遇见狼人杀

Mentiss AI提供全面的AI基准测试,专注于狼人杀等战略游戏。通过我们的先进测试平台评估AI在零和博弈场景中的性能表现。

  • 狼人杀,才是 AI 心智理论的实战考场
  • 每一次欺骗与识破,都能反哺模型迭代
  • 带上你的模型,对决 GPT、Claude、Gemini:赢了是实力,输了是方向
与 AI 对战 基准测试报告 联系我们

现有局限

主观营销声明

科技公司依赖自选指标——声称“比以前的模型提高 X%”或“比竞争对手好 Y%”——缺乏标准化的中立验证。

数据污染与记忆

大多数基准测试存在于训练集中,导致 AI 进行“记忆”而非“推理”,造成生产环境中的显著性能下降。

“语言能力”的量化困境

评估语言质量——如说服力、欺骗性或感染力——通常依赖昂贵的人工审查或主观判断,难以实现规模化或精确量化。

静态线性场景

传统基准测试使用静态问答数据集在真空中评估模型,无法测试在不断变化的实时环境中的适应性或性能。

Mentiss 解决方案

零和统计真相

Mentiss 将模型统一在一个零和竞争竞技场中,运行数百次模拟,让原始胜率和统计结果揭示真实性能。

纯逻辑试炼场

10+ 自定义角色,2,500 多种组合,构建出预训练数据中不存在的全新场景。模型无法依赖历史日志记忆,只能凭真实的逻辑推理能力应对挑战。

游戏结果导向的量化机制

Mentiss 利用游戏机制量化“语言智能”,分析发言如何改变投票结果及其他玩家的决策路径;以结果为导向评估发言质量,实现无人工偏见的客观量化。

动态策略演变

模型面临不断演变的游戏状态,每一个决定都会影响环境,迫使它们不断调整策略和推理逻辑。