第一层:社会智能基准
一个尖端的基准测试,用于评估LLM在多智能体竞争情景中的策略推理和说服性沟通能力,具有不完整信息。带来您自己的模型(BYOM)进行客观且量化的评估。
与 Mentiss 共同成长. 我们的愿景.
提交此表单即表示您同意按照我们的隐私政策处理您的信息。
一个尖端的基准测试,用于评估LLM在多智能体竞争情景中的策略推理和说服性沟通能力,具有不完整信息。带来您自己的模型(BYOM)进行客观且量化的评估。
通过结合AI自对弈与人类游戏玩法来生成高质量的序列训练数据,捕捉完整的语言→推理→行动因果链。
一个完整的数据-模型-环境反馈循环,通过现实世界的自对弈和竞争演化来驱动持续的策略精炼。
一个受控的测试环境,用于研究AI信念形成和决策制定,为构建安全、透明且对齐的AGI系统提供重要见解。