Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Yancheng, Li, Shilong, Liu, Jiaheng, Wang, Weixun, Bu, Xingyuan, Zhang, Ge, Peng, Zhongyuan, Zhang, Zhaoxiang, Zheng, Zhicheng, Su, Wenbo, Zheng, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deconstructing Long Chain-of-Thought: A Structured Reasoning Optimization Framework for Long CoT Distillation
di: Luo, Yijia, et al.
Pubblicazione: (2025)
di: Luo, Yijia, et al.
Pubblicazione: (2025)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
di: Li, Shilong, et al.
Pubblicazione: (2024)
di: Li, Shilong, et al.
Pubblicazione: (2024)
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
di: Li, Shilong, et al.
Pubblicazione: (2024)
di: Li, Shilong, et al.
Pubblicazione: (2024)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
di: He, Yancheng, et al.
Pubblicazione: (2024)
di: He, Yancheng, et al.
Pubblicazione: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
di: Bai, Ge, et al.
Pubblicazione: (2024)
di: Bai, Ge, et al.
Pubblicazione: (2024)
ProgCo: Program Helps Self-Correction of Large Language Models
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
AIR: Complex Instruction Generation via Automatic Iterative Refinement
di: Liu, Wei, et al.
Pubblicazione: (2025)
di: Liu, Wei, et al.
Pubblicazione: (2025)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
di: Wu, Yanan, et al.
Pubblicazione: (2024)
di: Wu, Yanan, et al.
Pubblicazione: (2024)
Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models
di: Zheng, Baihui, et al.
Pubblicazione: (2025)
di: Zheng, Baihui, et al.
Pubblicazione: (2025)
Think-J: Learning to Think for Generative LLM-as-a-Judge
di: Huang, Hui, et al.
Pubblicazione: (2025)
di: Huang, Hui, et al.
Pubblicazione: (2025)
Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models
di: Tan, Yingshui, et al.
Pubblicazione: (2025)
di: Tan, Yingshui, et al.
Pubblicazione: (2025)
The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning
di: Chen, Qiguang, et al.
Pubblicazione: (2026)
di: Chen, Qiguang, et al.
Pubblicazione: (2026)
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
di: Wang, Pei, et al.
Pubblicazione: (2024)
di: Wang, Pei, et al.
Pubblicazione: (2024)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
di: Zhang, Alexander, et al.
Pubblicazione: (2025)
di: Zhang, Alexander, et al.
Pubblicazione: (2025)
Thought Manipulation: External Thought Can Be Efficient for Large Reasoning Models
di: Liu, Yule, et al.
Pubblicazione: (2025)
di: Liu, Yule, et al.
Pubblicazione: (2025)
CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria
di: Hu, Xinyu, et al.
Pubblicazione: (2026)
di: Hu, Xinyu, et al.
Pubblicazione: (2026)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
di: Tan, Yingshui, et al.
Pubblicazione: (2024)
di: Tan, Yingshui, et al.
Pubblicazione: (2024)
Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal
di: Yuan, Aojie, et al.
Pubblicazione: (2026)
di: Yuan, Aojie, et al.
Pubblicazione: (2026)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
di: Gu, Jihao, et al.
Pubblicazione: (2025)
di: Gu, Jihao, et al.
Pubblicazione: (2025)
Part I: Tricks or Traps? A Deep Dive into RL for LLM Reasoning
di: Liu, Zihe, et al.
Pubblicazione: (2025)
di: Liu, Zihe, et al.
Pubblicazione: (2025)
Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs
di: Long, Rujiao, et al.
Pubblicazione: (2025)
di: Long, Rujiao, et al.
Pubblicazione: (2025)
ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Streaming Hallucination Detection in Long Chain-of-Thought Reasoning
di: Lu, Haolang, et al.
Pubblicazione: (2026)
di: Lu, Haolang, et al.
Pubblicazione: (2026)
Break the Chain: Large Language Models Can be Shortcut Reasoners
di: Ding, Mengru, et al.
Pubblicazione: (2024)
di: Ding, Mengru, et al.
Pubblicazione: (2024)
Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models
di: Chen, Qiguang, et al.
Pubblicazione: (2025)
di: Chen, Qiguang, et al.
Pubblicazione: (2025)
When the Chain Breaks: Interactive Diagnosis of LLM Chain-of-Thought Reasoning Errors
di: Chen, Shiwei, et al.
Pubblicazione: (2026)
di: Chen, Shiwei, et al.
Pubblicazione: (2026)
Efficient Reasoning via Chain of Unconscious Thought
di: Gong, Ruihan, et al.
Pubblicazione: (2025)
di: Gong, Ruihan, et al.
Pubblicazione: (2025)
Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs
di: Cao, Jie, et al.
Pubblicazione: (2026)
di: Cao, Jie, et al.
Pubblicazione: (2026)
Graph Chain-of-Thought: Augmenting Large Language Models by Reasoning on Graphs
di: Jin, Bowen, et al.
Pubblicazione: (2024)
di: Jin, Bowen, et al.
Pubblicazione: (2024)
Echoes within the Reasoning: Stealthy and Effective Watermarking via Chain of Thought
di: Lu, Jiacheng, et al.
Pubblicazione: (2026)
di: Lu, Jiacheng, et al.
Pubblicazione: (2026)
Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
di: Gu, Jihao, et al.
Pubblicazione: (2024)
di: Gu, Jihao, et al.
Pubblicazione: (2024)
Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
di: Liu, Jiashun, et al.
Pubblicazione: (2025)
di: Liu, Jiashun, et al.
Pubblicazione: (2025)
SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens
di: He, Yinhan, et al.
Pubblicazione: (2025)
di: He, Yinhan, et al.
Pubblicazione: (2025)
Enhancing Interpretability in Software Change Management with Chain-of-Thought Reasoning
di: Sun, Yongqian, et al.
Pubblicazione: (2025)
di: Sun, Yongqian, et al.
Pubblicazione: (2025)
Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization
di: Hong, Bin, et al.
Pubblicazione: (2025)
di: Hong, Bin, et al.
Pubblicazione: (2025)
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
di: Cui, Yingqian, et al.
Pubblicazione: (2024)
di: Cui, Yingqian, et al.
Pubblicazione: (2024)
Deep Hidden Cognition Facilitates Reliable Chain-of-Thought Reasoning
di: Chen, Zijun, et al.
Pubblicazione: (2025)
di: Chen, Zijun, et al.
Pubblicazione: (2025)
One Sample to Rule Them All: Extreme Data Efficiency in Multidiscipline Reasoning with Reinforcement Learning
di: Li, Yiyuan, et al.
Pubblicazione: (2026)
di: Li, Yiyuan, et al.
Pubblicazione: (2026)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models
di: Zheng, Baolin, et al.
Pubblicazione: (2025)
di: Zheng, Baolin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Deconstructing Long Chain-of-Thought: A Structured Reasoning Optimization Framework for Long CoT Distillation
di: Luo, Yijia, et al.
Pubblicazione: (2025) -
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
di: Li, Shilong, et al.
Pubblicazione: (2024) -
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
di: Li, Shilong, et al.
Pubblicazione: (2024) -
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
di: He, Yancheng, et al.
Pubblicazione: (2024) -
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
di: Bai, Ge, et al.
Pubblicazione: (2024)