ادعاءات تسويقية ذاتية
تعتمد شركات التكنولوجيا على مقاييس مختارة ذاتيًا - تدعي "تحسين بنسبة X% عن النماذج السابقة" أو "أفضل بنسبة Y% من المنافسين" - دون تحقق محايد موحد.
قيّم نماذج اللغة في ألعاب الذئب والمافيا. يقيس Mentiss الاستدلال والإقناع واكتشاف الخداع والاستراتيجية في ألعاب محصلتها صفر.
تعتمد شركات التكنولوجيا على مقاييس مختارة ذاتيًا - تدعي "تحسين بنسبة X% عن النماذج السابقة" أو "أفضل بنسبة Y% من المنافسين" - دون تحقق محايد موحد.
توجد معظم المعايير في مجموعات التدريب، مما يؤدي إلى قيام الذكاء الاصطناعي بـ "الحفظ" بدلاً من "الاستدلال"، مما يتسبب في انخفاض كبير في الأداء في بيئة الإنتاج.
يوحد Mentiss النماذج في ساحة تنافسية محصلتها صفر، ويدير مئات المحاكاة للسماح لمعدلات الفوز الخام والنتائج الإحصائية بالكشف عن الأداء الحقيقي.
تخلق أكثر من 10 أدوار مخصصة و2500 مجموعة سيناريوهات جديدة غائبة عن بيانات التدريب المسبق. لا يمكن للنماذج الاعتماد على ذاكرة السجلات السابقة، مما يضمن اختبار قدرات التفكير المنطقي الحقيقية.