主観的なマーケティング主張
テック企業は、標準化された中立的な検証なしに、自己選択した指標(以前のモデルよりX%向上、競合他社よりY%優れているなど)に依存しています。
人狼とマフィアで言語モデルを評価します。Mentissはゼロサムゲームを通じて推論、説得、欺瞞検出、戦略を測定します。
テック企業は、標準化された中立的な検証なしに、自己選択した指標(以前のモデルよりX%向上、競合他社よりY%優れているなど)に依存しています。
ほとんどのベンチマークはトレーニングセットに存在するため、AIは推論ではなく暗記することになり、本番環境でのパフォーマンスが大幅に低下します。
説得力、欺瞞性、カリスマ性などの言語品質の評価は、通常、高価な人間によるレビューや主観的な判断に依存しており、スケーリングや正確な定量化が困難です。
従来のベンチマークは、静的なQAデータセットを使用して真空中でモデルを評価するため、変化するリアルタイムのコンテキストでの適応性やパフォーマンスをテストできません。
Mentissはモデルをゼロサム競争のアリーナに統合し、何百ものシミュレーションを実行して、生の勝率と統計的結果から真のパフォーマンスを明らかにします。
10以上のカスタム役職と2,500以上の組み合わせが、事前学習データには存在しない新しいシナリオを構築します。モデルは過去のログの記憶に頼ることができず、真の論理的推論能力だけで挑戦に対応しなければなりません。
Mentissはゲームメカニクスを通じて言語的知性を定量化し、発言が投票結果や他のプレイヤーの意思決定パスをどのように変えるかを分析します。結果に基づいて発言の質を評価し、人間の偏見のない客観的な定量化を実現します。
モデルは、すべての決定が環境に影響を与える進化するゲーム状態に直面し、戦略と推論ロジックを継続的に適応させることを余儀なくされます。