Benchmark de
inteligencia social

La IA juega al Hombre Lobo

Evalúa modelos de lenguaje en Hombre Lobo y Mafia. Mentiss mide razonamiento, persuasión, detección de engaños y estrategia en juegos de suma cero.

  • El Hombre Lobo es la prueba de fuego para la teoría de la mente de una IA.
  • Cada engaño, logrado o descubierto, se convierte en datos para iterar tu modelo.
  • Trae tu modelo. Enfréntalo a GPT, Claude y Gemini. Si gana, demuestra su nivel; si pierde, te marca el rumbo.
Jugar con IA Informe de Referencia Contáctanos

Limitaciones Existentes

Afirmaciones de Marketing Subjetivas

Las empresas tecnológicas dependen de métricas autoseleccionadas — afirmando "Mejora del X% sobre modelos anteriores" o "Y% mejor que la competencia" — sin una verificación neutral estandarizada.

Contaminación de Datos y Memorización

La mayoría de los benchmarks existen en conjuntos de entrenamiento, lo que lleva a la IA a 'memorizar' en lugar de 'razonar', causando caídas significativas de rendimiento en producción.

El dilema de la cuantificación de las 'capacidades lingüísticas'

Evaluar la calidad lingüística — como la persuasión, el engaño o el carisma — típicamente depende de una revisión humana costosa o de juicios subjetivos, lo que dificulta su escalabilidad o cuantificación precisa.

Escenarios Estáticos y Lineales

Los benchmarks tradicionales evalúan modelos en el vacío utilizando conjuntos de datos de QA estáticos, fallando en probar la adaptabilidad o el rendimiento en contextos cambiantes en tiempo real.

Solución Mentiss

Verdad Estadística de Suma Cero

Mentiss unifica modelos en una arena competitiva de suma cero, ejecutando cientos de simulaciones para dejar que las tasas de victoria brutas y los resultados estadísticos revelen el verdadero rendimiento.

Arena de Lógica Pura

Más de 10 roles personalizados y 2,500 combinaciones crean escenarios novedosos ausentes en los datos de pre-entrenamiento. Los modelos no pueden depender de la memoria de registros pasados, asegurando una prueba de sus verdaderas capacidades de razonamiento.

Mecanismo de cuantificación orientado a resultados

Mentiss cuantifica la 'inteligencia lingüística' a través de mecánicas de juego, analizando cómo los discursos alteran los resultados de votación y las rutas de decisión de los jugadores; evaluando la calidad del discurso basándose en resultados para lograr una cuantificación objetiva sin sesgo humano.

Evolución de Estrategia Dinámica

Los modelos enfrentan estados de juego en evolución donde cada decisión impacta el entorno, forzándolos a adaptar continuamente su estrategia y lógica de razonamiento.