Shattering the Shortcut: A Topology-Regularized Benchmark for Multi-hop Medical Reasoning in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zi, Xing, Zhou, Xinying, Xiao, Jinghao, Moreira, Catarina, Prasad, Mukesh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Benchmarking Chinese Commonsense Reasoning with a Multi-hop Reasoning Perspective
par: You, Wangjie, et autres
Publié: (2025)
par: You, Wangjie, et autres
Publié: (2025)
Kinship Data Benchmark for Multi-hop Reasoning
par: Sun, Tianda, et autres
Publié: (2026)
par: Sun, Tianda, et autres
Publié: (2026)
Omne-R1: Learning to Reason with Memory for Multi-hop Question Answering
par: Liu, Boyuan, et autres
Publié: (2025)
par: Liu, Boyuan, et autres
Publié: (2025)
TopoBench: Benchmarking LLMs on Hard Topological Reasoning
par: Maniparambil, Mayug, et autres
Publié: (2026)
par: Maniparambil, Mayug, et autres
Publié: (2026)
MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs
par: Fabbri, Alexander R., et autres
Publié: (2025)
par: Fabbri, Alexander R., et autres
Publié: (2025)
DEEPAMBIGQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
par: Ji, Jiabao, et autres
Publié: (2025)
par: Ji, Jiabao, et autres
Publié: (2025)
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
SAFE: Stepwise Atomic Feedback for Error correction in Multi-hop Reasoning
par: Kwon, Daeyong, et autres
Publié: (2026)
par: Kwon, Daeyong, et autres
Publié: (2026)
Multimodal Cognitive Reframing Therapy via Multi-hop Psychotherapeutic Reasoning
par: Kim, Subin, et autres
Publié: (2025)
par: Kim, Subin, et autres
Publié: (2025)
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
par: Hong, Zijin, et autres
Publié: (2025)
par: Hong, Zijin, et autres
Publié: (2025)
MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs
par: Qu, Zhan, et autres
Publié: (2025)
par: Qu, Zhan, et autres
Publié: (2025)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
par: Wei, Jianhui, et autres
Publié: (2025)
par: Wei, Jianhui, et autres
Publié: (2025)
Logic-Regularized Verifier Elicits Reasoning from LLMs
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
Break the Chain: Large Language Models Can be Shortcut Reasoners
par: Ding, Mengru, et autres
Publié: (2024)
par: Ding, Mengru, et autres
Publié: (2024)
Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Deceptive Semantic Shortcuts on Reasoning Chains: How Far Can Models Go without Hallucination?
par: Li, Bangzheng, et autres
Publié: (2023)
par: Li, Bangzheng, et autres
Publié: (2023)
The Potential of LLMs in Medical Education: Generating Questions and Answers for Qualification Exams
par: Zhu, Yunqi, et autres
Publié: (2024)
par: Zhu, Yunqi, et autres
Publié: (2024)
Learning from Synthetic Data Improves Multi-hop Reasoning
par: Kabra, Anmol, et autres
Publié: (2026)
par: Kabra, Anmol, et autres
Publié: (2026)
BeamAggR: Beam Aggregation Reasoning over Multi-source Knowledge for Multi-hop Question Answering
par: Chu, Zheng, et autres
Publié: (2024)
par: Chu, Zheng, et autres
Publié: (2024)
Improving Multi-hop Logical Reasoning in Knowledge Graphs with Context-Aware Query Representation Learning
par: Kim, Jeonghoon, et autres
Publié: (2024)
par: Kim, Jeonghoon, et autres
Publié: (2024)
GlobalRAG: Enhancing Global Reasoning in Multi-hop Question Answering via Reinforcement Learning
par: Luo, Jinchang, et autres
Publié: (2025)
par: Luo, Jinchang, et autres
Publié: (2025)
MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
par: Wu, Juncheng, et autres
Publié: (2025)
par: Wu, Juncheng, et autres
Publié: (2025)
The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models
par: Kim, Dueun, et autres
Publié: (2026)
par: Kim, Dueun, et autres
Publié: (2026)
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
par: Wei, Shaohang, et autres
Publié: (2025)
par: Wei, Shaohang, et autres
Publié: (2025)
Mitigating Shortcut Reasoning in Language Models: A Gradient-Aware Training Approach
par: Cao, Hongyu, et autres
Publié: (2026)
par: Cao, Hongyu, et autres
Publié: (2026)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
par: Kabir, Mohsinul, et autres
Publié: (2026)
par: Kabir, Mohsinul, et autres
Publié: (2026)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
par: Xu, Liang, et autres
Publié: (2024)
par: Xu, Liang, et autres
Publié: (2024)
SentGraph: Hierarchical Sentence Graph for Multi-hop Retrieval-Augmented Question Answering
par: Liang, Junli, et autres
Publié: (2026)
par: Liang, Junli, et autres
Publié: (2026)
Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs
par: Yang, Chang, et autres
Publié: (2025)
par: Yang, Chang, et autres
Publié: (2025)
DepWiGNN: A Depth-wise Graph Neural Network for Multi-hop Spatial Reasoning in Text
par: Li, Shuaiyi, et autres
Publié: (2023)
par: Li, Shuaiyi, et autres
Publié: (2023)
Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation
par: Zhang, Xiangxu, et autres
Publié: (2025)
par: Zhang, Xiangxu, et autres
Publié: (2025)
MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs
par: Sirdeshmukh, Ved, et autres
Publié: (2025)
par: Sirdeshmukh, Ved, et autres
Publié: (2025)
RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
par: Zhou, Ruiwen, et autres
Publié: (2024)
par: Zhou, Ruiwen, et autres
Publié: (2024)
DaPT: A Dual-Path Framework for Multilingual Multi-hop Question Answering
par: Wang, Yilin, et autres
Publié: (2026)
par: Wang, Yilin, et autres
Publié: (2026)
From Reasoning to Generalization: Knowledge-Augmented LLMs for ARC Benchmark
par: Lei, Chao, et autres
Publié: (2025)
par: Lei, Chao, et autres
Publié: (2025)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
par: Jiang, Zhuohang, et autres
Publié: (2025)
par: Jiang, Zhuohang, et autres
Publié: (2025)
Breaking Thought Patterns: A Multi-Dimensional Reasoning Framework for LLMs
par: Tang, Xintong, et autres
Publié: (2025)
par: Tang, Xintong, et autres
Publié: (2025)
Multi-hop Question Answering
par: Mavi, Vaibhav, et autres
Publié: (2022)
par: Mavi, Vaibhav, et autres
Publié: (2022)
MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine
par: Kong, Shufeng, et autres
Publié: (2025)
par: Kong, Shufeng, et autres
Publié: (2025)
Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models
par: Gu, Xiaojie, et autres
Publié: (2026)
par: Gu, Xiaojie, et autres
Publié: (2026)
Documents similaires
-
Benchmarking Chinese Commonsense Reasoning with a Multi-hop Reasoning Perspective
par: You, Wangjie, et autres
Publié: (2025) -
Kinship Data Benchmark for Multi-hop Reasoning
par: Sun, Tianda, et autres
Publié: (2026) -
Omne-R1: Learning to Reason with Memory for Multi-hop Question Answering
par: Liu, Boyuan, et autres
Publié: (2025) -
TopoBench: Benchmarking LLMs on Hard Topological Reasoning
par: Maniparambil, Mayug, et autres
Publié: (2026) -
MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs
par: Fabbri, Alexander R., et autres
Publié: (2025)