Guess What I am Thinking: A Benchmark for Inner Thought Reasoning of Role-Playing Language Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Rui, Wang, MingYu, Wang, XinTao, Lu, Dakuan, Tan, Xiaoyu, Chu, Wei, Xu, Yinghui |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MINDECHO: Role-Playing Language Agents for Key Opinion Leaders
by: Xu, Rui, et al.
Published: (2024)
by: Xu, Rui, et al.
Published: (2024)
ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
by: Xu, Rui, et al.
Published: (2025)
by: Xu, Rui, et al.
Published: (2025)
SCP-116K: A High-Quality Problem-Solution Dataset and a Generalized Pipeline for Automated Extraction in the Higher Education Science Domain
by: Lu, Dakuan, et al.
Published: (2025)
by: Lu, Dakuan, et al.
Published: (2025)
Thought-Like-Pro: Enhancing Reasoning of Large Language Models through Self-Driven Prolog-based Chain-of-Thought
by: Tan, Xiaoyu, et al.
Published: (2024)
by: Tan, Xiaoyu, et al.
Published: (2024)
Thinking in Character: Advancing Role-Playing Agents with Role-Aware Reasoning
by: Tang, Yihong, et al.
Published: (2025)
by: Tang, Yihong, et al.
Published: (2025)
FaithCoT-Bench: Benchmarking Instance-Level Faithfulness of Chain-of-Thought Reasoning
by: Shen, Xu, et al.
Published: (2025)
by: Shen, Xu, et al.
Published: (2025)
Where am I? Guess the location and win two watches
Struct-X: Enhancing Large Language Models Reasoning with Structured Data
by: Tan, Xiaoyu, et al.
Published: (2024)
by: Tan, Xiaoyu, et al.
Published: (2024)
Towards Collaborative Intelligence: Propagating Intentions and Reasoning for Multi-Agent Coordination with Large Language Models
by: Qiu, Xihe, et al.
Published: (2024)
by: Qiu, Xihe, et al.
Published: (2024)
AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification
by: Tan, Xiaoyu, et al.
Published: (2025)
by: Tan, Xiaoyu, et al.
Published: (2025)
Guess What I Think: Streamlined EEG-to-Image Generation with Latent Diffusion Models
by: Lopez, Eleonora, et al.
Published: (2024)
by: Lopez, Eleonora, et al.
Published: (2024)
Therefore I am. I Think
by: Esakkiraja, Esakkivel, et al.
Published: (2026)
by: Esakkiraja, Esakkivel, et al.
Published: (2026)
Atomic Thinking of LLMs: Decoupling and Exploring Mathematical Reasoning Abilities
by: Kuang, Jiayi, et al.
Published: (2025)
by: Kuang, Jiayi, et al.
Published: (2025)
PsyPlay: Personality-Infused Role-Playing Conversational Agents
by: Yang, Tao, et al.
Published: (2025)
by: Yang, Tao, et al.
Published: (2025)
Proactive Conversational Agents with Inner Thoughts
by: Liu, Xingyu Bruce, et al.
Published: (2024)
by: Liu, Xingyu Bruce, et al.
Published: (2024)
Cogito, Ergo Ludo: An Agent that Learns to Play by Reasoning and Planning
by: Wang, Sai, et al.
Published: (2025)
by: Wang, Sai, et al.
Published: (2025)
RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents
by: Lai, Huayi, et al.
Published: (2026)
by: Lai, Huayi, et al.
Published: (2026)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
by: Liu, Xu, et al.
Published: (2026)
by: Liu, Xu, et al.
Published: (2026)
Play Guessing Game with LLM: Indirect Jailbreak Attack with Implicit Clues
by: Chang, Zhiyuan, et al.
Published: (2024)
by: Chang, Zhiyuan, et al.
Published: (2024)
SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents
by: Jiang, Changhao, et al.
Published: (2025)
by: Jiang, Changhao, et al.
Published: (2025)
FreeFly-Thinking : Aligning Chain-of-Thought Reasoning with Continuous UAV Navigation
by: Zhou, Jiaxu, et al.
Published: (2026)
by: Zhou, Jiaxu, et al.
Published: (2026)
CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation
by: Tu, Quan, et al.
Published: (2024)
by: Tu, Quan, et al.
Published: (2024)
VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents
by: Wu, Weihao, et al.
Published: (2025)
by: Wu, Weihao, et al.
Published: (2025)
MERRY: Semantically Decoupled Evaluation of Multimodal Emotional and Role Consistencies of Role-Playing Agents
by: Wang, Zhenyu, et al.
Published: (2026)
by: Wang, Zhenyu, et al.
Published: (2026)
I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench
by: Li, Yuan, et al.
Published: (2024)
by: Li, Yuan, et al.
Published: (2024)
Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR
by: Tang, Yihong, et al.
Published: (2026)
by: Tang, Yihong, et al.
Published: (2026)
Robust Deep Hawkes Process under Label Noise of Both Event and Occurrence
by: Tan, Xiaoyu, et al.
Published: (2024)
by: Tan, Xiaoyu, et al.
Published: (2024)
Guessing What, Noise or Codeword?
by: Ma, Xiao
Published: (2024)
by: Ma, Xiao
Published: (2024)
HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness
by: Wang, Jianing, et al.
Published: (2026)
by: Wang, Jianing, et al.
Published: (2026)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
by: Xu, Ancheng, et al.
Published: (2024)
by: Xu, Ancheng, et al.
Published: (2024)
ThoughtProbe: Classifier-Guided Thought Space Exploration Leveraging LLM Intrinsic Reasoning
by: Wang, Zijian, et al.
Published: (2025)
by: Wang, Zijian, et al.
Published: (2025)
Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
by: Shao, Chenyang, et al.
Published: (2025)
by: Shao, Chenyang, et al.
Published: (2025)
Think before Recommendation: Autonomous Reasoning-enhanced Recommender
by: Kong, Xiaoyu, et al.
Published: (2025)
by: Kong, Xiaoyu, et al.
Published: (2025)
LARP: Language-Agent Role Play for Open-World Games
by: Yan, Ming, et al.
Published: (2023)
by: Yan, Ming, et al.
Published: (2023)
Character is Destiny: Can Role-Playing Language Agents Make Persona-Driven Decisions?
by: Xu, Rui, et al.
Published: (2024)
by: Xu, Rui, et al.
Published: (2024)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
by: Zhang, Jialiang, et al.
Published: (2026)
by: Zhang, Jialiang, et al.
Published: (2026)
Does Chain-of-Thought Reasoning Really Reduce Harmfulness from Jailbreaking?
by: Lu, Chengda, et al.
Published: (2025)
by: Lu, Chengda, et al.
Published: (2025)
AdaMARP: An Adaptive Multi-Agent Interaction Framework for General Immersive Role-Playing
by: Xu, Zhenhua, et al.
Published: (2026)
by: Xu, Zhenhua, et al.
Published: (2026)
Better Zero-Shot Reasoning with Role-Play Prompting
by: Kong, Aobo, et al.
Published: (2023)
by: Kong, Aobo, et al.
Published: (2023)
A Multimodal Dialogue System for Playing the Game “Guess the card”
by: Ivan Meza
Published: (2010)
by: Ivan Meza
Published: (2010)
Similar Items
-
MINDECHO: Role-Playing Language Agents for Key Opinion Leaders
by: Xu, Rui, et al.
Published: (2024) -
ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
by: Xu, Rui, et al.
Published: (2025) -
SCP-116K: A High-Quality Problem-Solution Dataset and a Generalized Pipeline for Automated Extraction in the Higher Education Science Domain
by: Lu, Dakuan, et al.
Published: (2025) -
Thought-Like-Pro: Enhancing Reasoning of Large Language Models through Self-Driven Prolog-based Chain-of-Thought
by: Tan, Xiaoyu, et al.
Published: (2024) -
Thinking in Character: Advancing Role-Playing Agents with Role-Aware Reasoning
by: Tang, Yihong, et al.
Published: (2025)