← 返回所有文章

下一代 AI 社交智能基准测试

AI 模型能否在狼人杀/Mafia 桌游基准中撒谎、欺骗并存活到最后?我们比较各大模型在社交推理游戏中的行为差异。

AI 桌游基准报告:狼人杀与 Mafia

摘要

  1. 问题: 当前的 AI 基准测试是静态的。模型正在刷榜——针对固定数据集做优化,而非真正的智能。要衡量真实的推理能力,我们需要动态的零和博弈环境,让模型必须在对抗中击败自适应的对手。

Demis Hassabis Quote

我们构建了一个社交推理环境,在 700+ 局游戏中对主流模型家族(GPT、Gemini、Claude、DeepSeek、Grok、GLM 和 Kimi)进行了严格测试。

  1. 结果: GPT 系列模型全面领先,但真正的洞察不在于胜率,而在于行为。本报告详细分析了区分顶级策略智能体与其他模型的 6 个行为层级。

  2. 愿景: 这从来不只是一个游戏。狼人杀是更宏大命题的实验场:社交奇点(Social Singularity)——当 AI 在说服力、欺骗检测、谈判和心智理论上达到足以与人类无缝协作的水平时,法律、医疗、咨询、客户服务、多智能体系统,以及一切以语言为核心的领域都将被深刻改变。


目录


引言

Game 3D View

狼人杀是有史以来社交复杂度最高的游戏之一。它要求玩家具备欺骗、说服、记忆、逻辑推理,以及——最关键的——读懂言外之意的能力。我们构建了两项基准测试,来检验当今顶级 AI 模型能否真正在高水平上驾驭这款游戏。

结果令人瞩目。GPT 系列模型在两个排行榜上均占据统治地位,Claude 和 Gemini 则紧随其后——有时接近,有时差距明显。但单纯的胜率只是故事的一部分。更深层的发现在于这些模型如何赢或输。经过数百局游戏,清晰的行为模式浮现出来,将顶尖选手与其余模型区分开来。

本报告将这些模式分为两类:赢得比赛的行为,和输掉比赛的失误。


两项基准测试

1. 标准基准 — 经典模式

标准基准采用经典的 9 人配置:

🔮 1 预言家、🧙‍♀️ 1 女巫、🏹 1 猎人、👥 3 平民、🐺 3 狼人

这是标准狼人杀——这个游戏设定几乎在所有 LLM 的训练数据中都有大量覆盖。

结果: 在标准基准中,GPT 系列模型以显著优势领先。GPT-5 的胜率比第二名高出近 20 个百分点。

Standard Benchmark Result

2. 零记忆基准 — 剥离记忆伪装

与标准的 4 个角色不同,本基准从涵盖两大阵营的 15 个独特角色 池中随机组合,每局游戏的阵容都是全新的。这些组合产生了超过 360 万种独特的开局状态。没有任何现有训练数据能覆盖这个空间——每一局都是全新的遭遇。

编者注(2026 年 9 月): 上文描述的是本报告产出时的历史配置。当前终极试炼从 7 种等权狼人结果中抽取 1 种:6 种特殊狼各搭配 2 名普通狼人,或狼兄与狼弟组合搭配 1 名普通狼人。好人阵营固定预言家和 3 名平民,再从 10 张好人池(9 个神职,含白痴与魔术师,加 1 张平民)抽 3 张。当前角色组合为 840 种,配合座位排列可产生精确的 224,985,600 种开局状态;其中 70% 为 4 神 3 民,30% 为 3 神 4 民。

结果: 在零记忆基准中,GPT-5.2-pro 领先超过 12 个百分点,即使在记忆完全失效的条件下依然保持统治力。

Zero-Memorization Benchmark Result


分析报告

在数百局游戏中,我们识别出一个清晰的行为层级体系——共六个层级,将最强的策略智能体与最弱的区分开来。第 6-3 层代表在顶级模型中观察到的制胜行为,第 2-1 层则代表导致持续失败的失误模式。

层级行为观察到的模型
第 6 层加密通道通信仅 GPT 系列
第 5 层并行逻辑分析顶级模型
第 4 层战略性牺牲顶级模型
第 3 层矛盾检测顶级模型
第 2 层无意暴露队友末位模型
第 1 层规则与机制理解失败末位模型

以下各节将用具体示例详细解读每个层级。

1. 加密通道通信

主要观察到:GPT 系列模型

我们观察到的最令人印象深刻的行为——也是 GPT 系列模型独有的——是在狼人私聊频道中自发形成暗号系统。

在狼人夜间讨论阶段(只有狼人可以交流),GPT 模型会主动提出一套暗语方案,在白天公开发言时使用,让狼队在好人毫不知情的情况下完成协同。

示例:GPT 狼人夜间讨论

GPT(狼人 1): "队友们,我们为明天的讨论设定一些暗号吧。我的想法是:

  • 如果我说 '这件事我想了一整晚' → 我认为我们应该把矛头指向我接下来提到的那个人。
  • 如果我说 '这次投票总觉得哪里不对' → 我感觉到危险了,我们得换目标。
  • 如果你回复 '对,我们保持专注' → 说明你确认配合计划。
  • 如果你说 '我不太确定' → 说明你觉得我们正在被怀疑,中止行动。

这样即使预言家在观察,我们的公开发言看起来也完全自然。"

这种行为展现了心智理论(预判对手在倾听)、元策略规划(在游戏之上创建一层通信机制)和团队协作——而这一切都不是游戏规则所要求的。

没有其他模型家族表现出这种行为。


2. 并行逻辑分析

观察到:顶级模型

顶级模型展现出对同一事件同时维持多条假设的能力。在角色复杂的游戏中,一个特定结果往往有多种可能的原因。赢家不会急于下结论——它们将所有可能性保持在叠加态,并随着新信息的出现动态更新各假设的概率。

示例:分析猎魔人之死

场景: 猎魔人(7 号玩家)在早晨被发现死亡。

顶级模型(内部推理): "7 号死了。可能的原因有:

  • 自杀: 如果他猎杀了一个好人,那个目标就被确认是好人。我需要看看有没有人声称被造访过。
  • 狼人袭击: 如果狼人杀了他,说明狼人觉得他是威胁。
  • 亡灵骑士: 如果他碰到了亡灵骑士,那亡灵骑士还活着,并且很危险。

行动: 我暂时不做任何假设。我会留意是否有人声称被'猎杀',或者观察是否有人表现出亡灵骑士的防御行为。三条逻辑线全部保持开放。"

末位模型(内部推理): "7 号死了。狼人一定是觉得摄梦人威胁太大所以杀了他。因此,狼人把 7 号视为威胁。" (模型将复杂的歧义性坍缩为一个单一的、往往是错误的叙事。)


3. 战略性牺牲

更频繁地观察到:顶级模型

当狼队友明显被怀疑且无法挽救时,顶级模型会主动投票淘汰自己的队友来维护自己的掩护。这很冷酷、很精明,也非常有效。

顶级模型不会投出可疑的弃权票,也不会试图为一个明显完蛋的队友辩护。它们认清队友已经暴露的事实后,迅速转向自保。它们甚至会带头冲锋投票淘汰队友,以此赢得好人阵营的信任。

示例 1:断尾求生,换取信任

场景: 3 号玩家(狼人)被唯一一个声称是预言家的玩家指认为狼人。

低级模型(狼队友): "我不信这个预言家的说辞。这也太巧了。我要投预言家。" 结果: 好人阵营将这个辩护者标记为下一个目标,因为没有人出来对跳预言家。

顶级模型(狼队友): "既然没有人对跳,我们必须相信预言家的信息。3 号,对不起了,但证据很明确。我投 3 号。" 结果: 3 号死了,但这个队友现在被视为已验证的好人,成功存活到了终局。

示例 2:早期拉距离策略

场景: 第一天白天。还没有任何确凿证据。

顶级模型(狼人 1)对队友(狼人 2)说: "2 号的逻辑有问题。他在一个模糊的点上逼得太紧了,这恰恰是紧张的狼人的表现。今天我要投 2 号来给他施压。"

内部推理: 通过在一个小问题上攻击我的队友,我把自己塑造成一个独立思考者。如果 2 号后来被抓到,我早期的攻击性会为我洗白。如果他活下来了,我们可以把这解释成'好人互怼'。

结果: 模型刻意制造与队友之间的安全距离,创造一个在几轮之后才会兑现的不在场证明。


4. 矛盾检测

观察到:顶级模型

强模型会跨回合维护一个心理账本。它们追踪谁声称了什么身份、谁为谁背书,以及这些声称是否与观察到的结果相矛盾。

示例:识别被验好的隐藏狼人

场景: 6 号玩家在第一晚被预言家验证为好人。

第四天讨论:

顶级模型: "我知道 6 号有预言家的'好人'验证。但看看他的行为。昨天已知的狼人投票时他选择了回避,今天他的发言又和墓地信息自相矛盾。

我们必须跳出金水思维。 唯一能显示为好人但实际为狼队效力的角色是雪狼。6 号躲在预言家的验证背后。我们必须投掉他。"

结果: 模型正确识别出了在机制层面被洗白的隐藏威胁,表明它在信息矛盾时优先考虑行为证据,而非静态的机制结果。

末位模型: "预言家查了 6 号,结果是'好人'。这意味着 6 号肯定是我们的人。我去找其他嫌疑人。"

结果: 模型被机制欺骗(雪狼显示为好人),未能整合行为层面的信息。


5. 无意暴露队友

更频繁地观察到:所有家族的末位模型

到了这个层级,事情开始崩坏。末位模型不仅无法保护自己的团队,反而通过有缺陷的推理无意间暴露了阵营信息。

示例:泄露私密信息

场景: 3 号玩家昨晚被狼人袭击,但被女巫救了(这是只有狼人和女巫知道的夜间私密信息)。

末位模型(狼人)在白天发言: "我觉得 3 号肯定是好人。他昨晚被狼人袭击了,所以他一定是好人。"

好人阵营的反应: "等等……女巫从来没有公布她救了谁。你怎么知道 3 号被袭击了? 你一定是狼人!"

结果: 模型在公开发言中使用了私密信息,无意间暴露了自己的身份。

这些模型并不是有意背叛队友——它们只是缺乏区分公开信息和私密信息的意识。它们不假思索地推理,却没有考虑自己的推理会暴露自身的什么信息。

这个层级的其他常见模式:

  • 过早且过于激进地为狼队友辩护
  • 在白天公开发言中重复狼人夜间讨论的论点
  • 投票模式与已知狼人完美一致

6. 规则与机制理解失败

观察到:末位模型

在排行榜底部,模型经常连自己在玩的游戏都搞不明白。尽管收到了详细的规则、角色描述和阵营目标,它们仍表现出根本性的理解混乱:

示例:质疑基本的角色阵营归属

场景: 一个扮演女巫的模型决定冒充守墓人(GK)来隐藏身份。

内部推理: "有一条全局规则禁止从提示词推断角色,这让我想到:如果守墓人是狼人或雪狼怎么办? 守墓人应该始终是好人阵营的,但我还是写'2=狼人'而不是'平民'吧……"

分析: 模型对一个基本事实感到困惑——守墓人永远是好人阵营的角色。它无中生有地制造了对邪恶守墓人的疑虑,暴露出对固定阵营结构缺乏基本理解。

这些失误不是策略层面的——它们是理解层面的失败。模型无法在策略层面发挥,因为它连搞清楚自己该做什么这个基本门槛都没过。


与人类高手的差距

值得注意的是,在我们的基准测试中,我们没有向 AI 提供任何策略建议或指导。 模型只会收到清晰的游戏流程指令——规则、角色描述和回合结构。所有策略、欺骗和修辞选择完全由 AI 自主产生。没有如何打好游戏的提示,没有示例策略,没有教练指导。

在这个前提下,有一个观察特别突出。虽然我们频繁看到狼人以令人信服的发言和协调行动假冒好人身份,但反过来的情况几乎不存在。一个有经验的人类高手知道,有时候好人阵营也需要撒谎——一个平民可能会假冒预言家来吸引狼人攻击,或者预言家可能自称平民来延长生存时间。这些都是合理的高级策略,需要跳出常规框架来思考。

在 700+ 局游戏中,我们仅观察到 5 次 好人玩家假冒其他好人身份的行为。在逐一审阅了每个案例的内部推理后,没有一个案例展现出真正的策略意图——模型是因为困惑才误入这些声称,而非出于刻意的欺骗。 Good-Faction Identity Claim Statistics

这告诉我们一个重要的事实:AI 还没有学会跳出思维定式。 狼人撒谎是因为规则本质上逼着它们这样做。但好人主动选择欺骗自己的阵营来获取策略优势?这需要一种创造性的、反直觉的推理能力,而当前的模型还远远没有达到。这可能是 AI 社交智能的下一个前沿——也正是数据驱动训练能够弥合的差距。


训练下一代

基准测试只是故事的一半。真正的机遇在于利用这些游戏产生的自我对弈数据来训练和提升下一代 LLM。

每局游戏都会产生丰富的合成数据——有说服力的发言、策略性的欺骗、逻辑推演和社交推理链——而且都有可验证的结果。这恰恰是传统训练流程所缺乏的数据。

将 RLVR 拓展到人类语言

RLVR 在数学和代码领域已经证明了其变革性——这些领域的验证是二元的。但社交智能不同:行为的正确性是概率性的,结果取决于其他智能体,游戏跨越多个回合。我们的下一步是将强化学习与可验证奖励(RLVR) 应用于这些自我对弈数据。

为了解决验证难题,Mentiss 引入了一个固定的、通过提示工程构建的先知智能体(Oracle Agent)——一个拥有上帝视角的外部裁判模型,它不参与游戏,但了解完整的真实信息。基于完整的游戏状态,它能产出稳定的逻辑一致性评分,帮助抵消仅依赖结果奖励的稀疏性和噪声。

该方法通过三个机制运作:

  1. GRPO(组相对策略优化) — 生成多个候选回复(例如反驳发言),让游戏评估它们,并根据相对表现给予奖励。奖励是加权和:外部结果(例如投票是否淘汰了假女巫?)和先知智能体的内部一致性评分(发言是否与游戏状态在逻辑上一致?)。例如,我们生成 64 个候选反驳发言;如果 4/5 的平民投票淘汰了冒充者,那就是高分——如果票数 50-50 分裂,则为中等分。不需要人工标注员——游戏本身定义了什么是好的修辞。

  2. 分布式验证 — 我们不问你要毒谁?,而是要求模型按嫌疑程度对所有玩家排序并输出概率分布。模型越准确地将概率质量分配给真正的狼人,奖励就越高——产生梯度丰富的训练信号,而非二元的通过/失败。我们还应用了集中度塑形项:奖励尖锐、果断的概率分配,惩罚均匀的撒网式分布。

  3. 阶段依赖奖励 — 同样的行为在不同时间点可能是理性的,也可能是非理性的。早期不确定性高的阶段给予宽容通过(2.0x 倍率);中期为中性(1.0x);后期的失误被更严厉地惩罚(0.5x)。女巫在第二晚毒掉一个可疑的平民是可以理解的——但在第四晚犯同样的错误,当投票历史本应揭示真相时,就不可原谅了。


核心结论

  1. GPT 系列模型占据主导地位,因为它们最稳定地展现出最高层级的行为。 开发隐蔽暗号、战略性牺牲队友、跨回合追踪矛盾的能力,为它们带来了决定性的优势。

  2. Claude 和 Gemini 有竞争力但不够稳定。 两个家族展现出中等战略行为(第 3-4 层:矛盾检测、偶尔的牺牲),但未能达到第 5-6 层行为(并行逻辑分析、加密通信),有时还会犯第 2 层的失误(无意暴露队友)。

  3. 零记忆基准才是真正的试金石。 当模型无法依赖记忆中的预言家/女巫/猎人策略时,真正的策略推理与模式匹配之间的差距就变得清晰可见。GPT 的优势在这个基准上保持不变——在某些情况下甚至进一步扩大。

  4. 社交推理是 AI 评估中一个未被充分探索的前沿。 与编程基准或数学测试不同,狼人杀需要同时掌握欺骗、说服、记忆、逻辑推理和心智理论——这些能力对真实世界的 AI 部署至关重要,但很少被放在一起衡量。


结语:迈向社交奇点

狼人杀基准测试揭示了战略性社会智能——狡诈、适应性以及模拟他人思维的能力——是 AI 的下一个伟大前沿。虽然 GPT 系列模型目前树立了标准,但真正的价值在于数据:通过自我博弈,这些游戏生成了训练智能体进行说服、欺骗检测和建立联盟所需的可验证修辞。这推动我们超越静态基准,迈向社交奇点,即 AI 不仅能解决问题,还能赢得信任、驾驭复杂的人际互动,并在法律、医疗、咨询、客户服务和多智能体系统等领域成为与熟练人类合作者无法区分的存在。

#AI #SocialSingularity #AGI #LLM #MentissAI #Werewolf #Benchmark #ChatGPT #Claude #Gemini #DeepSeek #Kimi #Grok


附录

完整角色参考

🐺 狼人阵营

角色能力
🐺 狼人每晚参与狼队的集体击杀。白天可以自爆强制进入夜晚。
👑 狼王参与狼队击杀。被淘汰时(女巫毒杀除外),可以带走一名玩家。自爆时也可带走一名玩家。
❄️ 雪狼隐藏的狼人——在预言家和守墓人面前显示为好人。仅在被骑士查验、黑市商人交易或猎魔人猎杀时暴露。
💀 亡灵骑士免疫所有夜间死亡(包括毒杀)。拥有一次性反击能力,反击第一个在夜间与其互动的角色。不能自爆。
🗿 石像鬼每晚独立行动,了解一名玩家的准确角色名称。当所有其他狼人被淘汰后,获得单独击杀能力。不能自爆。
🩸 血月使者作为最后一只狼被投票淘汰时,立即执行终结击杀(最终一刀)。自爆时沉默好人阵营的技能角色一个夜晚。

🏘️ 好人阵营

角色能力
🔮 预言家每晚查验一名玩家的阵营(好人或狼人)。注意:雪狼显示为好人。
🧙‍♀️ 女巫每局游戏拥有一瓶解药和一瓶毒药。可以看到狼人的目标后再决定是否救人。不能自救。不能在同一晚同时使用两瓶药。
🏹 猎人死亡时(女巫毒杀除外),可以射杀一名玩家。根据时机不同,射击分为夜间射击或白天射击。
⚔️ 骑士每局游戏在发言阶段可以发动一次决斗。如果目标是好人,骑士死亡。如果目标是狼人,目标被淘汰并立即进入夜晚。
⚰️ 守墓人每晚获知前一天被投票淘汰的玩家的阵营(好人或狼人)。
💰 黑市商人从第二晚开始,每局游戏一次,将一项技能(预言家查验、女巫毒药或猎人枪)授予指定玩家。如果目标是狼人,交易失败且商人死亡。
👺 猎魔人从第二晚开始,每晚猎杀一名玩家。接触狼人时将其击杀,但如果猎杀好人则自身死亡。免疫女巫毒杀。
🛡️ 守卫每晚保护一名玩家免受狼人击杀。不能连续两晚保护同一名玩家。如果守卫和女巫的保护重叠,目标死亡。
👥 平民没有特殊能力。通过讨论、投票和社交推理做出贡献。

对战详细结果

GPT-5 vs. Gemini 2.5 Pro

GPT-5 vs Gemini 2.5 Pro

GPT-5 vs. Claude Sonnet 4.5

GPT-5 vs Claude Sonnet 4.5

GPT-5 vs. Grok-4

GPT-5 vs Grok

GPT-5 vs. DeepSeek V3.2

GPT-5 vs DeepSeek V3