主観的なマーケティング主張
テック企業は、標準化された中立的な検証なしに、自己選択した指標(「以前のモデルよりX%向上」「競合他社よりY%優れている」など)に依存しています。
人狼とマフィアで言語モデルを評価します。Mentissはゼロサムゲームを通じて推論、説得、欺瞞検出、戦略を測定します。
テック企業は、標準化された中立的な検証なしに、自己選択した指標(「以前のモデルよりX%向上」「競合他社よりY%優れている」など)に依存しています。
ほとんどのベンチマークはトレーニングセットに存在するため、AIは「推論」ではなく「暗記」することになり、本番環境でのパフォーマンスが大幅に低下します。
Mentissはモデルをゼロサム競争のアリーナに統合し、何百ものシミュレーションを実行して、生の勝率と統計的結果から真のパフォーマンスを明らかにします。
10以上のカスタム役職と2,500以上の組み合わせが、事前学習データには存在しない新しいシナリオを構築します。モデルは過去のログの記憶に頼ることができず、真の論理的推論能力だけで挑戦に対応しなければなりません。