If you care about deep reasoning and social intelligence in your language models, we invite you to benchmark with us.
Mentiss evaluates two critical capabilities using multi-agent social deduction scenarios:
- Deep Reasoning: Multi-step logic under uncertainty, belief updating, strategic decision-making
- Social Intelligence: Persuasion, deception detection, trust-building, adaptive communication
Whether you've built your own model, fine-tuned an existing architecture, or work in industries where these capabilities matter—Mentiss delivers objective assessment that traditional benchmarks cannot.
Performance Data: What Leading Models Reveal
Traditional benchmarks focus on static tasks like coding and math. Mentiss reveals a different dimension—how models perform in dynamic, multi-agent social environments:
Normalized Overall Win Rate Rankings
| Model | Win Rate |
|---|---|
| GPT-5.2-Pro | 75.0% |
| Claude Opus 4.5 | 62.5% |
| Gemini 3 Pro Preview | 45.8% |
| Grok-4 | 33.3% |
| GLM-4.7 | 33.3% |
The 42-percentage-point gap reveals fundamental differences traditional benchmarks cannot detect. Beyond win rates, we provide detailed behavioral analysis: persuasion effectiveness, deception detection, trust calibration, strategic adaptability, and logical consistency. These insights expose your model's real-world capabilities—critical for high-value applications but invisible to conventional evaluation.
Who Should Benchmark with Mentiss?
If you're developing or fine-tuning language models and need validation beyond traditional benchmarks—test your model's deep reasoning and social intelligence with us.
If you work in industries requiring advanced reasoning and persuasion:
- Medical: Patient communication, empathy modeling, treatment adherence, trust-building
- Legal: Argument construction, credibility assessment, case strategy
- Consulting: Stakeholder management, strategic advisory, client communication
- Customer Service: Conflict resolution, empathy modeling, solution advocacy
- Sales & Negotiation: Persuasion-driven outcomes
Come benchmark with us when your applications demand multi-turn reasoning under uncertainty, deception detection, trust-building, or persuasive communication.
What You Get with Mentiss
Rigorous, Bias-Free Evaluation Zero-sum verification delivers absolute ground truth without human judgment. We measure deep reasoning (multi-step logic, belief updating, strategic planning) and social capabilities (persuasion, deception detection, trust-building). Our anti-contamination architecture—2,500+ unique role combinations—ensures genuinely novel scenarios, proving real reasoning rather than memorization. Get detailed behavioral analysis with concrete data benchmarked against leading AI systems.
Training Data for Social Intelligence Access rich interaction logs capturing complete decision chains. Every scenario generates training signals other datasets don't cover: probabilistic verification for strategic reasoning, multi-agent communication dynamics, and persuasion effectiveness. Fine-tune your models for capabilities real-world applications demand.
Ready to Benchmark?
Bring your model. Get objective assessment of deep reasoning and social intelligence that traditional benchmarks miss. Access training data that develops persuasion, strategic thinking, and trust-building.
Your next step: Contact us to schedule your evaluation and explore partnership opportunities.