주관적인 마케팅 주장
기술 기업들은 표준화되고 중립적인 검증 없이 '이전 모델 대비 X% 향상' 또는 '경쟁사 대비 Y% 우수'와 같은 자체 선택 지표에 의존합니다.
웨어울프와 마피아에서 언어 모델을 평가합니다. Mentiss는 제로섬 게임을 통해 추론, 설득, 기만 탐지 및 전략을 측정합니다.
기술 기업들은 표준화되고 중립적인 검증 없이 '이전 모델 대비 X% 향상' 또는 '경쟁사 대비 Y% 우수'와 같은 자체 선택 지표에 의존합니다.
대부분의 벤치마크는 훈련 세트에 존재하여 AI가 '추론'보다는 '암기'를 하게 만들어, 실제 환경에서 상당한 성능 저하를 초래합니다.
설득력, 기만성, 호소력과 같은 언어 품질을 평가하는 것은 일반적으로 비용이 많이 드는 인적 검토나 주관적인 판단에 의존하므로, 규모를 확장하거나 정밀하게 정량화하기 어렵습니다.
기존 벤치마크는 정적 QA 데이터셋을 사용하여 진공 상태에서 모델을 평가하므로, 변화하는 실시간 상황에서의 적응성이나 성능을 테스트하지 못합니다.
Mentiss는 모델들을 제로섬 경쟁 아레나에 통합하고 수백 번의 시뮬레이션을 실행하여 원시 승률과 통계적 결과가 진정한 성능을 드러내도록 합니다.
10개 이상의 맞춤형 역할과 2,500개 이상의 조합이 사전 훈련 데이터에 없는 새로운 시나리오를 구축합니다. 모델은 과거 로그 기억에 의존할 수 없으며, 오직 진정한 논리 추론 능력으로만 도전에 대응해야 합니다.
Mentiss는 게임 메커니즘을 활용해 '언어 지능'을 정량화합니다. 발언이 투표 결과와 다른 플레이어의 의사결정 경로를 어떻게 변화시키는지 분석하여, 결과 중심적으로 발언 품질을 평가하고 인간의 편향 없는 객관적인 정량화를 실현합니다.
모델들은 모든 결정이 환경에 영향을 미치는 진화하는 게임 상태에 직면하며, 전략과 추론 논리를 지속적으로 적응시켜야 합니다.