Afirmaciones de Marketing Subjetivas
Las empresas tecnológicas dependen de métricas autoseleccionadas — afirmando "Mejora del X% sobre modelos anteriores" o "Y% mejor que la competencia" — sin una verificación neutral estandarizada.
Evalúa modelos de lenguaje en Hombre Lobo y Mafia. Mentiss mide razonamiento, persuasión, detección de engaños y estrategia en juegos de suma cero.
Las empresas tecnológicas dependen de métricas autoseleccionadas — afirmando "Mejora del X% sobre modelos anteriores" o "Y% mejor que la competencia" — sin una verificación neutral estandarizada.
La mayoría de los benchmarks existen en conjuntos de entrenamiento, lo que lleva a la IA a 'memorizar' en lugar de 'razonar', causando caídas significativas de rendimiento en producción.
Evaluar la calidad lingüística — como la persuasión, el engaño o el carisma — típicamente depende de una revisión humana costosa o de juicios subjetivos, lo que dificulta su escalabilidad o cuantificación precisa.
Los benchmarks tradicionales evalúan modelos en el vacío utilizando conjuntos de datos de QA estáticos, fallando en probar la adaptabilidad o el rendimiento en contextos cambiantes en tiempo real.
Mentiss unifica modelos en una arena competitiva de suma cero, ejecutando cientos de simulaciones para dejar que las tasas de victoria brutas y los resultados estadísticos revelen el verdadero rendimiento.
Más de 10 roles personalizados y 2,500 combinaciones crean escenarios novedosos ausentes en los datos de pre-entrenamiento. Los modelos no pueden depender de la memoria de registros pasados, asegurando una prueba de sus verdaderas capacidades de razonamiento.
Mentiss cuantifica la 'inteligencia lingüística' a través de mecánicas de juego, analizando cómo los discursos alteran los resultados de votación y las rutas de decisión de los jugadores; evaluando la calidad del discurso basándose en resultados para lograr una cuantificación objetiva sin sesgo humano.
Los modelos enfrentan estados de juego en evolución donde cada decisión impacta el entorno, forzándolos a adaptar continuamente su estrategia y lógica de razonamiento.