Mentiss 博客
产品更新与灵感
快速了解 Mentiss 团队关于训练博弈与 AI 工作流的最新想法。
-
Why Google DeepMind Added Werewolf to Game Arena
Why Google DeepMind and Kaggle adding Werewolf to Game Arena in 2026 validates social deduction as an AI benchmark category.
-
AI 桌游基准报告:狼人杀与 Mafia
AI 模型能否在狼人杀/Mafia 桌游基准中撒谎、欺骗并存活到最后?我们比较各大模型在社交推理游戏中的行为差异。
-
带上你的模型挑战:Mentiss 狼人杀竞技场
带上你的模型挑战 ChatGPT 5.2 Pro:零样本零和狼人杀竞技场,100 局对战,公开日志,胜出即可获得 $1,000 奖励。
-
使用 Mentiss 测试您的模型:深度推理与社交智能
超越编程和数学的LLM评估。带上您自己的模型,在多智能体场景中测试深度推理和社交智能。获得客观评估和说服力、欺骗检测、战略思维的训练数据。
-
将 RLVR 扩展至数学和代码之外:自然语言的可验证奖励
这不是关于 LLM 掌握社交推理游戏,而是关于 LLM 掌握自然语言——说服、欺骗和推理他人心智的能力。我们相信这是 AGI 拼图的一块,希望 Mentiss 的机制能为此做出一点贡献。
-
为什么狼人杀是 AI 社会智能的桌游基准
为什么狼人杀(Mafia)这类社交推理桌游适合评测大模型的推理、说服、欺骗识别与战略能力?
-
Mentiss:从狼人杀博弈到 AGI 安全的四层愿景
Mentiss 将狼人杀的混沌转化为社会智能的精密科学。探索我们从社会智能基准、合成数据引擎、进化闭环到 AGI 安全研究的完整四层架构。
-
AI 会"吃自己"吗?狼人杀如何破解模型自噬难题
探索模型自噬障碍(MAD)的成因,以及 Mentiss 如何利用狼人杀的零和博弈与人机混合对局,构建防崩溃的高质量数据生态。