Meta-Evaluating Local LLMs: Rethinking Performance Metrics for Serious Games
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Isaza-Giraldo, Andrés, Bala, Paulo, Pereira, Lucas |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Performance Gains of LLMs With Humans in a World of LLMs Versus Humans
par: McCullum, Lucas, et autres
Publié: (2025)
par: McCullum, Lucas, et autres
Publié: (2025)
Flowco: Rethinking Data Analysis in the Age of LLMs
par: Freund, Stephen N., et autres
Publié: (2025)
par: Freund, Stephen N., et autres
Publié: (2025)
Effects of Theory of Mind and Prosocial Beliefs on Steering Human-Aligned Behaviors of LLMs in Ultimatum Games
par: Yadav, Neemesh, et autres
Publié: (2025)
par: Yadav, Neemesh, et autres
Publié: (2025)
Evaluating LLMs as Human Surrogates in Controlled Experiments
par: Hoq, Adnan, et autres
Publié: (2026)
par: Hoq, Adnan, et autres
Publié: (2026)
Helmsman of the Masses? Evaluate the Opinion Leadership of Large Language Models in the Werewolf Game
par: Du, Silin, et autres
Publié: (2024)
par: Du, Silin, et autres
Publié: (2024)
CUPID: Evaluating Personalized and Contextualized Alignment of LLMs from Interactions
par: Kim, Tae Soo, et autres
Publié: (2025)
par: Kim, Tae Soo, et autres
Publié: (2025)
Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework
par: Petrova, Nora, et autres
Publié: (2026)
par: Petrova, Nora, et autres
Publié: (2026)
CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs
par: Liu, Hongtao, et autres
Publié: (2025)
par: Liu, Hongtao, et autres
Publié: (2025)
Hacc-Man: An Arcade Game for Jailbreaking LLMs
par: Valentim, Matheus, et autres
Publié: (2024)
par: Valentim, Matheus, et autres
Publié: (2024)
Game Plot Design with an LLM-powered Assistant: An Empirical Study with Game Designers
par: Alavi, Seyed Hossein, et autres
Publié: (2024)
par: Alavi, Seyed Hossein, et autres
Publié: (2024)
Game Development as Human-LLM Interaction
par: Hong, Jiale, et autres
Publié: (2024)
par: Hong, Jiale, et autres
Publié: (2024)
Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases
par: Ford, Casey, et autres
Publié: (2026)
par: Ford, Casey, et autres
Publié: (2026)
Evaluating Behavioral Alignment in Conflict Dialogue: A Multi-Dimensional Comparison of LLM Agents and Humans
par: Kwon, Deuksin, et autres
Publié: (2025)
par: Kwon, Deuksin, et autres
Publié: (2025)
Large Language Models and Games: A Survey and Roadmap
par: Gallotta, Roberto, et autres
Publié: (2024)
par: Gallotta, Roberto, et autres
Publié: (2024)
Playing 20 Question Game with Policy-Based Reinforcement Learning
par: Hu, Huang, et autres
Publié: (2018)
par: Hu, Huang, et autres
Publié: (2018)
Death of the Novel(ty): Beyond n-Gram Novelty as a Metric for Textual Creativity
par: Saakyan, Arkadiy, et autres
Publié: (2025)
par: Saakyan, Arkadiy, et autres
Publié: (2025)
User-Assistant Bias in LLMs
par: Pan, Xu, et autres
Publié: (2025)
par: Pan, Xu, et autres
Publié: (2025)
Probing the Multi-turn Planning Capabilities of LLMs via 20 Question Games
par: Zhang, Yizhe, et autres
Publié: (2023)
par: Zhang, Yizhe, et autres
Publié: (2023)
Automatic Bug Detection in LLM-Powered Text-Based Games Using LLMs
par: Jin, Claire, et autres
Publié: (2024)
par: Jin, Claire, et autres
Publié: (2024)
HICode: Hierarchical Inductive Coding with LLMs
par: Zhong, Mian, et autres
Publié: (2025)
par: Zhong, Mian, et autres
Publié: (2025)
Meta-Prompting: Enhancing Language Models with Task-Agnostic Scaffolding
par: Suzgun, Mirac, et autres
Publié: (2024)
par: Suzgun, Mirac, et autres
Publié: (2024)
ComboBench: Can LLMs Manipulate Physical Devices to Play Virtual Reality Games?
par: Li, Shuqing, et autres
Publié: (2025)
par: Li, Shuqing, et autres
Publié: (2025)
Multi-agent KTO: Reinforcing Strategic Interactions of Large Language Model in Language Game
par: Ye, Rong, et autres
Publié: (2025)
par: Ye, Rong, et autres
Publié: (2025)
The BS-meter: A ChatGPT-Trained Instrument to Detect Sloppy Language-Games
par: Trevisan, Alessandro, et autres
Publié: (2024)
par: Trevisan, Alessandro, et autres
Publié: (2024)
DreamGarden: A Designer Assistant for Growing Games from a Single Prompt
par: Earle, Sam, et autres
Publié: (2024)
par: Earle, Sam, et autres
Publié: (2024)
Offscript: Automated Auditing of Instruction Adherence in LLMs
par: Clark, Nicholas, et autres
Publié: (2025)
par: Clark, Nicholas, et autres
Publié: (2025)
Can LLMs Generate Visualizations with Dataless Prompts?
par: Coelho, Darius, et autres
Publié: (2024)
par: Coelho, Darius, et autres
Publié: (2024)
Aligning LLMs with Individual Preferences via Interaction
par: Wu, Shujin, et autres
Publié: (2024)
par: Wu, Shujin, et autres
Publié: (2024)
Are Today's LLMs Ready to Explain Well-Being Concepts?
par: Jiang, Bohan, et autres
Publié: (2025)
par: Jiang, Bohan, et autres
Publié: (2025)
Clinical knowledge in LLMs does not translate to human interactions
par: Bean, Andrew M., et autres
Publié: (2025)
par: Bean, Andrew M., et autres
Publié: (2025)
AutoLife: Automatic Life Journaling with Smartphones and LLMs
par: Xu, Huatao, et autres
Publié: (2024)
par: Xu, Huatao, et autres
Publié: (2024)
HARGPT: Are LLMs Zero-Shot Human Activity Recognizers?
par: Ji, Sijie, et autres
Publié: (2024)
par: Ji, Sijie, et autres
Publié: (2024)
Direct Advantage Regression: Aligning LLMs with Online AI Reward
par: He, Li, et autres
Publié: (2025)
par: He, Li, et autres
Publié: (2025)
Olapa-MCoT: Enhancing the Chinese Mathematical Reasoning Capability of LLMs
par: Zhu, Shaojie, et autres
Publié: (2023)
par: Zhu, Shaojie, et autres
Publié: (2023)
AI Conversational Interviewing: Transforming Surveys with LLMs as Adaptive Interviewers
par: Wuttke, Alexander, et autres
Publié: (2024)
par: Wuttke, Alexander, et autres
Publié: (2024)
CBEval: A framework for evaluating and interpreting cognitive biases in LLMs
par: Shaikh, Ammar, et autres
Publié: (2024)
par: Shaikh, Ammar, et autres
Publié: (2024)
Copiloting Diagnosis of Autism in Real Clinical Scenarios via LLMs
par: Jiang, Yi, et autres
Publié: (2024)
par: Jiang, Yi, et autres
Publié: (2024)
Building Trust in Mental Health Chatbots: Safety Metrics and LLM-Based Evaluation Tools
par: Park, Jung In, et autres
Publié: (2024)
par: Park, Jung In, et autres
Publié: (2024)
Mind the Value-Action Gap: Do LLMs Act in Alignment with Their Values?
par: Shen, Hua, et autres
Publié: (2025)
par: Shen, Hua, et autres
Publié: (2025)
RAG-based EEG-to-Text Translation Using Deep Learning and LLMs
par: Collautti, Enrico, et autres
Publié: (2026)
par: Collautti, Enrico, et autres
Publié: (2026)
Documents similaires
-
Performance Gains of LLMs With Humans in a World of LLMs Versus Humans
par: McCullum, Lucas, et autres
Publié: (2025) -
Flowco: Rethinking Data Analysis in the Age of LLMs
par: Freund, Stephen N., et autres
Publié: (2025) -
Effects of Theory of Mind and Prosocial Beliefs on Steering Human-Aligned Behaviors of LLMs in Ultimatum Games
par: Yadav, Neemesh, et autres
Publié: (2025) -
Evaluating LLMs as Human Surrogates in Controlled Experiments
par: Hoq, Adnan, et autres
Publié: (2026) -
Helmsman of the Masses? Evaluate the Opinion Leadership of Large Language Models in the Werewolf Game
par: Du, Silin, et autres
Publié: (2024)