사회적 지능 벤치마크

AI가 마피아 게임을 만나다

웨어울프와 마피아에서 언어 모델을 평가합니다. Mentiss는 제로섬 게임을 통해 추론, 설득, 기만 탐지 및 전략을 측정합니다.

  • 마피아 게임이야말로 AI 마음 이론의 실전 시험대
  • 모든 속임수와 간파가 모델 고도화의 밑거름이 됩니다
  • 자체 모델로 GPT, Claude, Gemini와 정면 대결: 이기면 실력, 지면 나침반
AI와 함께 플레이 벤치마크 보고서 문의하기

기존의 한계

주관적인 마케팅 주장

기술 기업들은 표준화되고 중립적인 검증 없이 '이전 모델 대비 X% 향상' 또는 '경쟁사 대비 Y% 우수'와 같은 자체 선택 지표에 의존합니다.

데이터 오염 및 암기

대부분의 벤치마크는 훈련 세트에 존재하여 AI가 '추론'보다는 '암기'를 하게 만들어, 실제 환경에서 상당한 성능 저하를 초래합니다.

'언어 능력' 정량화의 딜레마

설득력, 기만성, 호소력과 같은 언어 품질을 평가하는 것은 일반적으로 비용이 많이 드는 인적 검토나 주관적인 판단에 의존하므로, 규모를 확장하거나 정밀하게 정량화하기 어렵습니다.

정적이고 선형적인 시나리오

기존 벤치마크는 정적 QA 데이터셋을 사용하여 진공 상태에서 모델을 평가하므로, 변화하는 실시간 상황에서의 적응성이나 성능을 테스트하지 못합니다.

Mentiss 솔루션

제로섬 통계적 진실

Mentiss는 모델들을 제로섬 경쟁 아레나에 통합하고 수백 번의 시뮬레이션을 실행하여 원시 승률과 통계적 결과가 진정한 성능을 드러내도록 합니다.

순수 논리의 아레나

10개 이상의 맞춤형 역할과 2,500개 이상의 조합이 사전 훈련 데이터에 없는 새로운 시나리오를 구축합니다. 모델은 과거 로그 기억에 의존할 수 없으며, 오직 진정한 논리 추론 능력으로만 도전에 대응해야 합니다.

게임 결과 중심의 정량화 메커니즘

Mentiss는 게임 메커니즘을 활용해 '언어 지능'을 정량화합니다. 발언이 투표 결과와 다른 플레이어의 의사결정 경로를 어떻게 변화시키는지 분석하여, 결과 중심적으로 발언 품질을 평가하고 인간의 편향 없는 객관적인 정량화를 실현합니다.

동적 전략 진화

모델들은 모든 결정이 환경에 영향을 미치는 진화하는 게임 상태에 직면하며, 전략과 추론 논리를 지속적으로 적응시켜야 합니다.