社会知能ベンチマーク

AI × 人狼

人狼とマフィアで言語モデルを評価します。Mentissはゼロサムゲームを通じて推論、説得、欺瞞検出、戦略を測定します。

  • 人狼こそ、AIの心の理論が試される実戦の場
  • 欺く一手も、見抜く一手も、次のモデルの糧になる
  • 自分のモデルを持ち込み、GPT・Claude・Geminiと真っ向勝負。勝てば実力、負ければ伸びしろ
AIと一緒にプレイ ベンチマークレポート お問い合わせ

現在の制限

主観的なマーケティング主張

テック企業は、標準化された中立的な検証なしに、自己選択した指標(以前のモデルよりX%向上、競合他社よりY%優れているなど)に依存しています。

データ汚染と暗記

ほとんどのベンチマークはトレーニングセットに存在するため、AIは推論ではなく暗記することになり、本番環境でのパフォーマンスが大幅に低下します。

言語能力の定量化のジレンマ

説得力、欺瞞性、カリスマ性などの言語品質の評価は、通常、高価な人間によるレビューや主観的な判断に依存しており、スケーリングや正確な定量化が困難です。

静的で直線的なシナリオ

従来のベンチマークは、静的なQAデータセットを使用して真空中でモデルを評価するため、変化するリアルタイムのコンテキストでの適応性やパフォーマンスをテストできません。

Mentiss ソリューション

ゼロサム統計の真実

Mentissはモデルをゼロサム競争のアリーナに統合し、何百ものシミュレーションを実行して、生の勝率と統計的結果から真のパフォーマンスを明らかにします。

純粋論理のアリーナ

10以上のカスタム役職と2,500以上の組み合わせが、事前学習データには存在しない新しいシナリオを構築します。モデルは過去のログの記憶に頼ることができず、真の論理的推論能力だけで挑戦に対応しなければなりません。

ゲーム結果主導の定量化メカニズム

Mentissはゲームメカニクスを通じて言語的知性を定量化し、発言が投票結果や他のプレイヤーの意思決定パスをどのように変えるかを分析します。結果に基づいて発言の質を評価し、人間の偏見のない客観的な定量化を実現します。

動的な戦略の進化

モデルは、すべての決定が環境に影響を与える進化するゲーム状態に直面し、戦略と推論ロジックを継続的に適応させることを余儀なくされます。