第一層:社會智能基準
一個尖端的基準測試,用於評估LLM在多智能體競爭情境中的策略推理和說服性溝通能力,具有不完整資訊。帶來您自己的模型(BYOM)進行客觀且量化的評估。
與 Mentiss 共同成長. 我們的願景.
提交此表單即表示您同意按照我們的隱私政策處理您的信息。
一個尖端的基準測試,用於評估LLM在多智能體競爭情境中的策略推理和說服性溝通能力,具有不完整資訊。帶來您自己的模型(BYOM)進行客觀且量化的評估。
通過結合AI自對弈與人類遊戲玩法來生成高品質的序列訓練數據,捕捉完整的語言→推理→行動因果鏈。
一個完整的數據-模型-環境回饋循環,通過現實世界的自對弈和競爭演化來驅動持續的策略精煉。
一個受控的測試環境,用於研究AI信念形成和決策制定,為構建安全、透明且對齊的AGI系統提供重要見解。