Dissecting Failure Dynamics in Large Language Model Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhu, Wei, Zhang, Jian, Yu, Lixing, Yue, Kun, Tang, Zhiwen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
von: Xu, Hainiu, et al.
Veröffentlicht: (2024)
von: Xu, Hainiu, et al.
Veröffentlicht: (2024)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2025)
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2025)
Large Language Model Reasoning Failures
von: Song, Peiyang, et al.
Veröffentlicht: (2026)
von: Song, Peiyang, et al.
Veröffentlicht: (2026)
Break the Chain: Large Language Models Can be Shortcut Reasoners
von: Ding, Mengru, et al.
Veröffentlicht: (2024)
von: Ding, Mengru, et al.
Veröffentlicht: (2024)
DuetSim: Building User Simulator with Dual Large Language Models for Task-Oriented Dialogues
von: Luo, Xiang, et al.
Veröffentlicht: (2024)
von: Luo, Xiang, et al.
Veröffentlicht: (2024)
Key-Point-Driven Mathematical Reasoning Distillation of Large Language Model
von: Zhu, Xunyu, et al.
Veröffentlicht: (2024)
von: Zhu, Xunyu, et al.
Veröffentlicht: (2024)
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
von: Prakash, Nirmalendu, et al.
Veröffentlicht: (2025)
von: Prakash, Nirmalendu, et al.
Veröffentlicht: (2025)
Agentic Reasoning for Large Language Models
von: Wei, Tianxin, et al.
Veröffentlicht: (2026)
von: Wei, Tianxin, et al.
Veröffentlicht: (2026)
A Survey on Enhancing Causal Reasoning Ability of Large Language Models
von: Li, Xin, et al.
Veröffentlicht: (2025)
von: Li, Xin, et al.
Veröffentlicht: (2025)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
von: Zhou, Yue, et al.
Veröffentlicht: (2024)
von: Zhou, Yue, et al.
Veröffentlicht: (2024)
Paraphrase and Solve: Exploring and Exploiting the Impact of Surface Form on Mathematical Reasoning in Large Language Models
von: Zhou, Yue, et al.
Veröffentlicht: (2024)
von: Zhou, Yue, et al.
Veröffentlicht: (2024)
Dissecting Tool-Integrated Reasoning: An Empirical Study and Analysis
von: Zhao, Yufeng, et al.
Veröffentlicht: (2025)
von: Zhao, Yufeng, et al.
Veröffentlicht: (2025)
Logical Reasoning in Large Language Models: A Survey
von: Liu, Hanmeng, et al.
Veröffentlicht: (2025)
von: Liu, Hanmeng, et al.
Veröffentlicht: (2025)
ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models
von: Chen, Bin, et al.
Veröffentlicht: (2025)
von: Chen, Bin, et al.
Veröffentlicht: (2025)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
von: Zhu, Yakun, et al.
Veröffentlicht: (2025)
von: Zhu, Yakun, et al.
Veröffentlicht: (2025)
Large Language Models-guided Dynamic Adaptation for Temporal Knowledge Graph Reasoning
von: Wang, Jiapu, et al.
Veröffentlicht: (2024)
von: Wang, Jiapu, et al.
Veröffentlicht: (2024)
Answering the Unanswerable Is to Err Knowingly: Analyzing and Mitigating Abstention Failures in Large Reasoning Models
von: Liu, Yi, et al.
Veröffentlicht: (2025)
von: Liu, Yi, et al.
Veröffentlicht: (2025)
Dissecting Clinical Reasoning in Language Models: A Comparative Study of Prompts and Model Adaptation Strategies
von: Jullien, Mael, et al.
Veröffentlicht: (2025)
von: Jullien, Mael, et al.
Veröffentlicht: (2025)
Enhance Reasoning for Large Language Models in the Game Werewolf
von: Wu, Shuang, et al.
Veröffentlicht: (2024)
von: Wu, Shuang, et al.
Veröffentlicht: (2024)
BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models
von: Tang, Yuzhe
Veröffentlicht: (2026)
von: Tang, Yuzhe
Veröffentlicht: (2026)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
von: Wong, Annie, et al.
Veröffentlicht: (2025)
von: Wong, Annie, et al.
Veröffentlicht: (2025)
GLoRE: Evaluating Logical Reasoning of Large Language Models
von: liu, Hanmeng, et al.
Veröffentlicht: (2023)
von: liu, Hanmeng, et al.
Veröffentlicht: (2023)
Simulated Annealing Enhances Theory-of-Mind Reasoning in Autoregressive Language Models
von: Hu, Xucong, et al.
Veröffentlicht: (2026)
von: Hu, Xucong, et al.
Veröffentlicht: (2026)
Saliency-driven Dynamic Token Pruning for Large Language Models
von: Tao, Yao, et al.
Veröffentlicht: (2025)
von: Tao, Yao, et al.
Veröffentlicht: (2025)
Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning
von: Zhang, Chuang, et al.
Veröffentlicht: (2026)
von: Zhang, Chuang, et al.
Veröffentlicht: (2026)
Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning
von: Cheng, Xiaoxue, et al.
Veröffentlicht: (2025)
von: Cheng, Xiaoxue, et al.
Veröffentlicht: (2025)
Attention-Aligned Reasoning for Large Language Models
von: Zhang, Hongxiang, et al.
Veröffentlicht: (2025)
von: Zhang, Hongxiang, et al.
Veröffentlicht: (2025)
Large Language Models can Learn Rules
von: Zhu, Zhaocheng, et al.
Veröffentlicht: (2023)
von: Zhu, Zhaocheng, et al.
Veröffentlicht: (2023)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
von: Hu, Jinwu, et al.
Veröffentlicht: (2025)
von: Hu, Jinwu, et al.
Veröffentlicht: (2025)
Dissecting Persona-Driven Reasoning in Language Models via Activation Patching
von: Poonia, Ansh, et al.
Veröffentlicht: (2025)
von: Poonia, Ansh, et al.
Veröffentlicht: (2025)
DynamicMind: A Tri-Mode Thinking System for Large Language Models
von: Li, Wei, et al.
Veröffentlicht: (2025)
von: Li, Wei, et al.
Veröffentlicht: (2025)
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
von: Xu, Fengli, et al.
Veröffentlicht: (2025)
von: Xu, Fengli, et al.
Veröffentlicht: (2025)
On the Failure of Latent State Persistence in Large Language Models
von: Huang, Jen-tse, et al.
Veröffentlicht: (2025)
von: Huang, Jen-tse, et al.
Veröffentlicht: (2025)
EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health Records
von: Shi, Wenqi, et al.
Veröffentlicht: (2024)
von: Shi, Wenqi, et al.
Veröffentlicht: (2024)
Incoherent Probability Judgments in Large Language Models
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024)
von: Zhu, Jian-Qiao, et al.
Veröffentlicht: (2024)
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation
von: Hu, Wenhao, et al.
Veröffentlicht: (2025)
von: Hu, Wenhao, et al.
Veröffentlicht: (2025)
Large Language Models Cannot Self-Correct Reasoning Yet
von: Huang, Jie, et al.
Veröffentlicht: (2023)
von: Huang, Jie, et al.
Veröffentlicht: (2023)
The Impact of Reasoning Step Length on Large Language Models
von: Jin, Mingyu, et al.
Veröffentlicht: (2024)
von: Jin, Mingyu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
von: Xu, Hainiu, et al.
Veröffentlicht: (2024) -
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
von: Tian, Shi-Yu, et al.
Veröffentlicht: (2025) -
Large Language Model Reasoning Failures
von: Song, Peiyang, et al.
Veröffentlicht: (2026) -
Break the Chain: Large Language Models Can be Shortcut Reasoners
von: Ding, Mengru, et al.
Veröffentlicht: (2024) -
DuetSim: Building User Simulator with Dual Large Language Models for Task-Oriented Dialogues
von: Luo, Xiang, et al.
Veröffentlicht: (2024)