Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fan, Mingyuan, Han, Weiguang, Wang, Daixin, Chen, Cen, Zhang, Zhiqiang, Zhou, Jun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards
von: Fan, Mingyuan, et al.
Veröffentlicht: (2026)
von: Fan, Mingyuan, et al.
Veröffentlicht: (2026)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion
von: Zhou, Guanghao, et al.
Veröffentlicht: (2026)
von: Zhou, Guanghao, et al.
Veröffentlicht: (2026)
Beyond the Speculative Game: A Survey of Speculative Execution in Large Language Models
von: Zhang, Chen, et al.
Veröffentlicht: (2024)
von: Zhang, Chen, et al.
Veröffentlicht: (2024)
WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
von: Yin, Qiyue, et al.
Veröffentlicht: (2025)
von: Yin, Qiyue, et al.
Veröffentlicht: (2025)
Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
Benchmarking Reasoning Robustness in Large Language Models
von: Yu, Tong, et al.
Veröffentlicht: (2025)
von: Yu, Tong, et al.
Veröffentlicht: (2025)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
von: Yang, Jinluan, et al.
Veröffentlicht: (2025)
von: Yang, Jinluan, et al.
Veröffentlicht: (2025)
SHARP: Synthesizing High-quality Aligned Reasoning Problems for Large Reasoning Models Reinforcement Learning
von: Wu, Xiong Jun, et al.
Veröffentlicht: (2025)
von: Wu, Xiong Jun, et al.
Veröffentlicht: (2025)
Zero-Shot Human Mobility Forecasting via Large Language Model with Hierarchical Reasoning
von: Li, Wenyao, et al.
Veröffentlicht: (2025)
von: Li, Wenyao, et al.
Veröffentlicht: (2025)
FedCoT: Communication-Efficient Federated Reasoning Enhancement for Large Language Models
von: Li, Chuan, et al.
Veröffentlicht: (2025)
von: Li, Chuan, et al.
Veröffentlicht: (2025)
Responsible Diffusion Models via Constraining Text Embeddings within Safe Regions
von: Li, Zhiwen, et al.
Veröffentlicht: (2025)
von: Li, Zhiwen, et al.
Veröffentlicht: (2025)
ChatUIE: Exploring Chat-based Unified Information Extraction using Large Language Models
von: Xu, Jun, et al.
Veröffentlicht: (2024)
von: Xu, Jun, et al.
Veröffentlicht: (2024)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
von: Zhang, Junkai, et al.
Veröffentlicht: (2025)
von: Zhang, Junkai, et al.
Veröffentlicht: (2025)
On the Trustworthiness Landscape of State-of-the-art Generative Models: A Survey and Outlook
von: Fan, Mingyuan, et al.
Veröffentlicht: (2023)
von: Fan, Mingyuan, et al.
Veröffentlicht: (2023)
An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning
von: Li, Yikun, et al.
Veröffentlicht: (2026)
von: Li, Yikun, et al.
Veröffentlicht: (2026)
PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models
von: Xu, Yinggan, et al.
Veröffentlicht: (2025)
von: Xu, Yinggan, et al.
Veröffentlicht: (2025)
MedGuideX: Internalizing Decision Logic from Executable Guidelines into Large Language Models for Clinical Reasoning
von: Shen, Yuhao, et al.
Veröffentlicht: (2026)
von: Shen, Yuhao, et al.
Veröffentlicht: (2026)
AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field
von: Liang, Chen, et al.
Veröffentlicht: (2025)
von: Liang, Chen, et al.
Veröffentlicht: (2025)
From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
von: Zhou, Chenyue, et al.
Veröffentlicht: (2025)
von: Zhou, Chenyue, et al.
Veröffentlicht: (2025)
Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play
von: Cipolina-Kun, Lucia, et al.
Veröffentlicht: (2025)
von: Cipolina-Kun, Lucia, et al.
Veröffentlicht: (2025)
Enterprise Large Language Model Evaluation Benchmark
von: Wang, Liya, et al.
Veröffentlicht: (2025)
von: Wang, Liya, et al.
Veröffentlicht: (2025)
The Token Games: Evaluating Language Model Reasoning with Puzzle Duels
von: Henniger, Simon, et al.
Veröffentlicht: (2026)
von: Henniger, Simon, et al.
Veröffentlicht: (2026)
From Natural Language to Executable Narsese: A Neuro-Symbolic Benchmark and Pipeline for Reasoning with NARS
von: Gabriel, Mina, et al.
Veröffentlicht: (2026)
von: Gabriel, Mina, et al.
Veröffentlicht: (2026)
Large Language Models Are Neurosymbolic Reasoners
von: Fang, Meng, et al.
Veröffentlicht: (2024)
von: Fang, Meng, et al.
Veröffentlicht: (2024)
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
von: Liao, Yi, et al.
Veröffentlicht: (2025)
von: Liao, Yi, et al.
Veröffentlicht: (2025)
Advancing Spatial Reasoning in Large Language Models: An In-Depth Evaluation and Enhancement Using the StepGame Benchmark
von: Li, Fangjun, et al.
Veröffentlicht: (2024)
von: Li, Fangjun, et al.
Veröffentlicht: (2024)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
von: Li, Ce, et al.
Veröffentlicht: (2025)
von: Li, Ce, et al.
Veröffentlicht: (2025)
AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials
von: Lv, Taoyuze, et al.
Veröffentlicht: (2025)
von: Lv, Taoyuze, et al.
Veröffentlicht: (2025)
Eliciting Causal Abilities in Large Language Models for Reasoning Tasks
von: Wang, Yajing, et al.
Veröffentlicht: (2024)
von: Wang, Yajing, et al.
Veröffentlicht: (2024)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
Chain of Execution Supervision Promotes General Reasoning in Large Language Models
von: Chen, Nuo, et al.
Veröffentlicht: (2025)
von: Chen, Nuo, et al.
Veröffentlicht: (2025)
MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models
von: Wang, Jason Z
Veröffentlicht: (2026)
von: Wang, Jason Z
Veröffentlicht: (2026)
Investigating Advanced Reasoning of Large Language Models via Black-Box Environment Interaction
von: Yin, Congchi, et al.
Veröffentlicht: (2025)
von: Yin, Congchi, et al.
Veröffentlicht: (2025)
KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language Models
von: Zhang, Xiao, et al.
Veröffentlicht: (2026)
von: Zhang, Xiao, et al.
Veröffentlicht: (2026)
Rethinking and Benchmarking Large Language Models for Graph Reasoning
von: Hu, Yuwei, et al.
Veröffentlicht: (2025)
von: Hu, Yuwei, et al.
Veröffentlicht: (2025)
Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games
von: Malik, Saumya
Veröffentlicht: (2024)
von: Malik, Saumya
Veröffentlicht: (2024)
EmbedAgent: Benchmarking Large Language Models in Embedded System Development
von: Xu, Ruiyang, et al.
Veröffentlicht: (2025)
von: Xu, Ruiyang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards
von: Fan, Mingyuan, et al.
Veröffentlicht: (2026) -
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025) -
LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion
von: Zhou, Guanghao, et al.
Veröffentlicht: (2026) -
Beyond the Speculative Game: A Survey of Speculative Execution in Large Language Models
von: Zhang, Chen, et al.
Veröffentlicht: (2024) -
WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
von: Yin, Qiyue, et al.
Veröffentlicht: (2025)