GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Qingchen, Zheng, Zifan, Chen, Ding, Niu, Simin, Tang, Bo, Xiong, Feiyu, Li, Zhiyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
by: Yu, Qingchen, et al.
Published: (2024)
by: Yu, Qingchen, et al.
Published: (2024)
Optimal play in 'Guess Who?'
by: Cushing, David, et al.
Published: (2025)
by: Cushing, David, et al.
Published: (2025)
Guess Who's Coming to Graduation?
by: Miller, Ann
Published: (2010)
by: Miller, Ann
Published: (2010)
KAPG: Adaptive Password Guessing via Knowledge-Augmented Generation
by: Yang, Xudong, et al.
Published: (2025)
by: Yang, Xudong, et al.
Published: (2025)
Wild Guesses and Mild Guesses in Active Concept Learning
by: Chari, Anirudh, et al.
Published: (2026)
by: Chari, Anirudh, et al.
Published: (2026)
Optimal Strategy in "Guess Who?": Beyond Binary Search
by: Nica, Mihai
Published: (2015)
by: Nica, Mihai
Published: (2015)
D-algebraic Guessing
by: Tabuguia, Bertrand Teguia
Published: (2025)
by: Tabuguia, Bertrand Teguia
Published: (2025)
E-Guess: Usability Evaluation for Educational Games
by: Aleph Campos da Silveira
Published: (2021)
by: Aleph Campos da Silveira
Published: (2021)
What can Information Guess? Guessing Advantage vs. Rényi Entropy for Small Leakages
by: Béguinot, Julien, et al.
Published: (2024)
by: Béguinot, Julien, et al.
Published: (2024)
HaluMem: Evaluating Hallucinations in Memory Systems of Agents
by: Chen, Ding, et al.
Published: (2025)
by: Chen, Ding, et al.
Published: (2025)
TurtleBench: Evaluating Top Language Models via Real-World Yes/No Puzzles
by: Yu, Qingchen, et al.
Published: (2024)
by: Yu, Qingchen, et al.
Published: (2024)
Grimoire is All You Need for Enhancing Large Language Models
by: Chen, Ding, et al.
Published: (2024)
by: Chen, Ding, et al.
Published: (2024)
Empowering Large Language Models to Set up a Knowledge Retrieval Indexer via Self-Learning
by: Liang, Xun, et al.
Published: (2024)
by: Liang, Xun, et al.
Published: (2024)
Guessing Strategies for Shuffling Machines
by: Clay, Alexander
Published: (2025)
by: Clay, Alexander
Published: (2025)
Guessing What, Noise or Codeword?
by: Ma, Xiao
Published: (2024)
by: Ma, Xiao
Published: (2024)
On Indestructible Strongly Guessing Models
by: Mohammadpour, Rahman, et al.
Published: (2023)
by: Mohammadpour, Rahman, et al.
Published: (2023)
Metainformation in Quantum Guessing Games
by: Heinosaari, Teiko, et al.
Published: (2025)
by: Heinosaari, Teiko, et al.
Published: (2025)
On the Asymptotic Behavior of Guessing Sequences
by: Benhamou, Tom, et al.
Published: (2026)
by: Benhamou, Tom, et al.
Published: (2026)
From Blind Guess to Informed Judgment: Teaching LLMs to Evaluate Materials by Building Knowledge-Augmented Preference Signals
by: Yu, Yeyong, et al.
Published: (2026)
by: Yu, Yeyong, et al.
Published: (2026)
Guess or Recall? Training CNNs to Classify and Localize Memorization in LLMs
by: Dentan, Jérémie, et al.
Published: (2025)
by: Dentan, Jérémie, et al.
Published: (2025)
xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
by: Chen, Ding, et al.
Published: (2025)
by: Chen, Ding, et al.
Published: (2025)
Where am I? Guess the location and win two watches
Guessing Efficiently for Constrained Subspace Approximation
by: Bhaskara, Aditya, et al.
Published: (2025)
by: Bhaskara, Aditya, et al.
Published: (2025)
Slavic Techniques for Hat Guessing Algorithms
by: McInnis, I. M. J.
Published: (2025)
by: McInnis, I. M. J.
Published: (2025)
Effective Guessing Has Unlikely Consequences
by: Salamon, András Z., et al.
Published: (2021)
by: Salamon, András Z., et al.
Published: (2021)
Guessing Decoding of Short Blocklength Codes
by: Wang, Qianfan, et al.
Published: (2025)
by: Wang, Qianfan, et al.
Published: (2025)
Europe. Guess who's coming to EMU?
Published: (1996)
Published: (1996)
Soft-output Guessing Codeword Decoding
by: Duffy, Ken R., et al.
Published: (2024)
by: Duffy, Ken R., et al.
Published: (2024)
A Quantitative Guessing Geodesics Theorem
by: Shlomovich, Talia
Published: (2024)
by: Shlomovich, Talia
Published: (2024)
Are Your Reasoning Models Reasoning or Guessing? A Mechanistic Analysis of Hierarchical Reasoning Models
by: Ren, Zirui, et al.
Published: (2026)
by: Ren, Zirui, et al.
Published: (2026)
From Guessing to Asking: An Approach to Resolving the Persona Knowledge Gap in LLMs during Multi-Turn Conversations
by: Baskar, Sarvesh, et al.
Published: (2025)
by: Baskar, Sarvesh, et al.
Published: (2025)
I Guess That's Why They Call it the Blues: Causal Analysis for Audio Classifiers
by: Kelly, David A., et al.
Published: (2026)
by: Kelly, David A., et al.
Published: (2026)
LLM-Guided Prompt Evolution for Password Guessing
by: Mazin, Vladimir A., et al.
Published: (2026)
by: Mazin, Vladimir A., et al.
Published: (2026)
See or Guess: Counterfactually Regularized Image Captioning
by: Cao, Qian, et al.
Published: (2024)
by: Cao, Qian, et al.
Published: (2024)
A Road To Compactness Through Guessing Models
by: Mohammadpour, Rahman
Published: (2022)
by: Mohammadpour, Rahman
Published: (2022)
Reverse Online Guessing Attacks on PAKE Protocols
by: Christian, Eloise, et al.
Published: (2026)
by: Christian, Eloise, et al.
Published: (2026)
Europe. Guess who wasn't coming to dinner?
Published: (2001)
Published: (2001)
GuessBench: Sensemaking Multimodal Creativity in the Wild
by: Zhu, Zifeng, et al.
Published: (2025)
by: Zhu, Zifeng, et al.
Published: (2025)
Guess & Sketch: Language Model Guided Transpilation
by: Lee, Celine, et al.
Published: (2023)
by: Lee, Celine, et al.
Published: (2023)
GeoGuess: Multimodal Reasoning based on Hierarchy of Visual Information in Street View
by: Cheng, Fenghua, et al.
Published: (2025)
by: Cheng, Fenghua, et al.
Published: (2025)
Similar Items
-
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
by: Yu, Qingchen, et al.
Published: (2024) -
Optimal play in 'Guess Who?'
by: Cushing, David, et al.
Published: (2025) -
Guess Who's Coming to Graduation?
by: Miller, Ann
Published: (2010) -
KAPG: Adaptive Password Guessing via Knowledge-Augmented Generation
by: Yang, Xudong, et al.
Published: (2025) -
Wild Guesses and Mild Guesses in Active Concept Learning
by: Chari, Anirudh, et al.
Published: (2026)