TurnaboutLLM: A Deductive Reasoning Benchmark from Detective Games
Fuente:
arXiv
Saved in:
| Main Authors: | Yuan, Yuan, He, Muyu, Shahid, Muhammad Adil, Huang, Jiani, Li, Ziyang, Zhang, Li |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Vision Language Models Cannot Plan, but Can They Formalize?
by: He, Muyu, et al.
Published: (2025)
by: He, Muyu, et al.
Published: (2025)
Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies
by: Song, Zirui, et al.
Published: (2025)
by: Song, Zirui, et al.
Published: (2025)
The Valley of Code Reasoning: Scaling Knowledge Distillation of Large Language Models
by: He, Muyu, et al.
Published: (2025)
by: He, Muyu, et al.
Published: (2025)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
by: Jing, Huihao, et al.
Published: (2025)
by: Jing, Huihao, et al.
Published: (2025)
Toward Honest Language Models for Deductive Reasoning
by: Liu, Jiarui, et al.
Published: (2025)
by: Liu, Jiarui, et al.
Published: (2025)
LogiDynamics: Unraveling the Dynamics of Inductive, Abductive and Deductive Logical Inferences in LLM Reasoning
by: Zheng, Tianshi, et al.
Published: (2025)
by: Zheng, Tianshi, et al.
Published: (2025)
Hypothesis Testing Prompting Improves Deductive Reasoning in Large Language Models
by: Li, Yitian, et al.
Published: (2024)
by: Li, Yitian, et al.
Published: (2024)
KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
by: Shi, Jiajun, et al.
Published: (2025)
by: Shi, Jiajun, et al.
Published: (2025)
How Far Are We from Intelligent Visual Deductive Reasoning?
by: Zhang, Yizhe, et al.
Published: (2024)
by: Zhang, Yizhe, et al.
Published: (2024)
Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
Self-playing Adversarial Language Game Enhances LLM Reasoning
by: Cheng, Pengyu, et al.
Published: (2024)
by: Cheng, Pengyu, et al.
Published: (2024)
Could Thinking Multilingually Empower LLM Reasoning?
by: Gao, Changjiang, et al.
Published: (2025)
by: Gao, Changjiang, et al.
Published: (2025)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
by: Chen, Michael K., et al.
Published: (2025)
by: Chen, Michael K., et al.
Published: (2025)
Understanding LLM Reasoning for Abstractive Summarization
by: Yuan, Haohan, et al.
Published: (2025)
by: Yuan, Haohan, et al.
Published: (2025)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
by: Tang, Wenjie, et al.
Published: (2025)
by: Tang, Wenjie, et al.
Published: (2025)
\texttt{ReMind}: Understanding Deductive Code Reasoning in LLMs
by: Gao, Jun, et al.
Published: (2025)
by: Gao, Jun, et al.
Published: (2025)
How to Detect and Defeat Molecular Mirage: A Metric-Driven Benchmark for Hallucination in LLM-based Molecular Comprehension
by: Li, Hao, et al.
Published: (2025)
by: Li, Hao, et al.
Published: (2025)
The Role of Deductive and Inductive Reasoning in Large Language Models
by: Cai, Chengkun, et al.
Published: (2024)
by: Cai, Chengkun, et al.
Published: (2024)
DeduCE: Deductive Consistency as a Framework to Evaluate LLM Reasoning
by: Pandey, Atharva, et al.
Published: (2025)
by: Pandey, Atharva, et al.
Published: (2025)
Deductive Beam Search: Decoding Deducible Rationale for Chain-of-Thought Reasoning
by: Zhu, Tinghui, et al.
Published: (2024)
by: Zhu, Tinghui, et al.
Published: (2024)
GameArena: Evaluating LLM Reasoning through Live Computer Games
by: Hu, Lanxiang, et al.
Published: (2024)
by: Hu, Lanxiang, et al.
Published: (2024)
Revealing Algorithmic Deductive Circuits for Logical Reasoning
by: Nguyen, Phuong Minh, et al.
Published: (2026)
by: Nguyen, Phuong Minh, et al.
Published: (2026)
Leveraging LLMs for Hypothetical Deduction in Logical Inference: A Neuro-Symbolic Approach
by: Li, Qingchuan, et al.
Published: (2024)
by: Li, Qingchuan, et al.
Published: (2024)
Fine-Grained and Thematic Evaluation of LLMs in Social Deduction Game
by: Kim, Byungjun, et al.
Published: (2024)
by: Kim, Byungjun, et al.
Published: (2024)
MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction
by: Li, Yixuan, et al.
Published: (2026)
by: Li, Yixuan, et al.
Published: (2026)
MindMerger: Efficient Boosting LLM Reasoning in non-English Languages
by: Huang, Zixian, et al.
Published: (2024)
by: Huang, Zixian, et al.
Published: (2024)
BioProBench: Comprehensive Dataset and Benchmark in Biological Protocol Understanding and Reasoning
by: Liu, Yuyang, et al.
Published: (2025)
by: Liu, Yuyang, et al.
Published: (2025)
SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
by: Zhu, Xiangyang, et al.
Published: (2025)
by: Zhu, Xiangyang, et al.
Published: (2025)
Toward Mechanistic Explanation of Deductive Reasoning in Language Models
by: Maltoni, Davide, et al.
Published: (2025)
by: Maltoni, Davide, et al.
Published: (2025)
Investigating the Robustness of Deductive Reasoning with Large Language Models
by: Hoppe, Fabian, et al.
Published: (2025)
by: Hoppe, Fabian, et al.
Published: (2025)
EVEDIT: Event-based Knowledge Editing with Deductive Editing Boundaries
by: Liu, Jiateng, et al.
Published: (2024)
by: Liu, Jiateng, et al.
Published: (2024)
AMONGAGENTS: Evaluating Large Language Models in the Interactive Text-Based Social Deduction Game
by: Chi, Yizhou, et al.
Published: (2024)
by: Chi, Yizhou, et al.
Published: (2024)
Def-DTS: Deductive Reasoning for Open-domain Dialogue Topic Segmentation
by: Lee, Seungmin, et al.
Published: (2025)
by: Lee, Seungmin, et al.
Published: (2025)
Data Analysis and Performance Evaluation of Simulation Deduction Based on LLMs
by: Zhang, Shansi, et al.
Published: (2025)
by: Zhang, Shansi, et al.
Published: (2025)
Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search Agent
by: Huang, Ziyang, et al.
Published: (2025)
by: Huang, Ziyang, et al.
Published: (2025)
ChronoPlay: A Framework for Modeling Dual Dynamics and Authenticity in Game RAG Benchmarks
by: He, Liyang, et al.
Published: (2025)
by: He, Liyang, et al.
Published: (2025)
Benchmarking Chinese Commonsense Reasoning of LLMs: From Chinese-Specifics to Reasoning-Memorization Correlations
by: Sun, Jiaxing, et al.
Published: (2024)
by: Sun, Jiaxing, et al.
Published: (2024)
Software Engineering Methods For AI-Driven Deductive Legal Reasoning
by: Padhye, Rohan
Published: (2024)
by: Padhye, Rohan
Published: (2024)
GAMEBoT: Transparent Assessment of LLM Reasoning in Games
by: Lin, Wenye, et al.
Published: (2024)
by: Lin, Wenye, et al.
Published: (2024)
Rethinking Easy-to-Hard: Limits of Curriculum Learning in Post-Training for Deductive Reasoning
by: Mordig, Maximilian, et al.
Published: (2026)
by: Mordig, Maximilian, et al.
Published: (2026)
Similar Items
-
Vision Language Models Cannot Plan, but Can They Formalize?
by: He, Muyu, et al.
Published: (2025) -
Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies
by: Song, Zirui, et al.
Published: (2025) -
The Valley of Code Reasoning: Scaling Knowledge Distillation of Large Language Models
by: He, Muyu, et al.
Published: (2025) -
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
by: Jing, Huihao, et al.
Published: (2025) -
Toward Honest Language Models for Deductive Reasoning
by: Liu, Jiarui, et al.
Published: (2025)