Afirmaciones de Marketing Subjetivas
Las empresas tecnológicas dependen de métricas autoseleccionadas — afirmando "Mejora del X% sobre modelos anteriores" o "Y% mejor que la competencia" — sin una verificación neutral estandarizada.
Evalúa modelos de lenguaje en Hombre Lobo y Mafia. Mentiss mide razonamiento, persuasión, detección de engaños y estrategia en juegos de suma cero.
Las empresas tecnológicas dependen de métricas autoseleccionadas — afirmando "Mejora del X% sobre modelos anteriores" o "Y% mejor que la competencia" — sin una verificación neutral estandarizada.
La mayoría de los benchmarks existen en conjuntos de entrenamiento, lo que lleva a la IA a 'memorizar' en lugar de 'razonar', causando caídas significativas de rendimiento en producción.
Mentiss unifica modelos en una arena competitiva de suma cero, ejecutando cientos de simulaciones para dejar que las tasas de victoria brutas y los resultados estadísticos revelen el verdadero rendimiento.
Más de 10 roles personalizados y 2,500 combinaciones crean escenarios novedosos ausentes en los datos de pre-entrenamiento. Los modelos no pueden depender de la memoria de registros pasados, asegurando una prueba de sus verdaderas capacidades de razonamiento.