Chain of Preference Optimization: Improving Chain-of-Thought Reasoning in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Xuan, Du, Chao, Pang, Tianyu, Liu, Qian, Gao, Wei, Lin, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Demystifying Long Chain-of-Thought Reasoning in LLMs
par: Yeo, Edward, et autres
Publié: (2025)
par: Yeo, Edward, et autres
Publié: (2025)
CoT-UQ: Improving Response-wise Uncertainty Quantification in LLMs with Chain-of-Thought
par: Zhang, Boxuan, et autres
Publié: (2025)
par: Zhang, Boxuan, et autres
Publié: (2025)
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
par: Ye, Jiacheng, et autres
Publié: (2024)
par: Ye, Jiacheng, et autres
Publié: (2024)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
par: Qi, Penghui, et autres
Publié: (2025)
par: Qi, Penghui, et autres
Publié: (2025)
LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation
par: Zhang, Xuan, et autres
Publié: (2024)
par: Zhang, Xuan, et autres
Publié: (2024)
Exploring Chain-of-Thought Reasoning for Steerable Pluralistic Alignment
par: Zhang, Yunfan, et autres
Publié: (2025)
par: Zhang, Yunfan, et autres
Publié: (2025)
Improving Your Model Ranking on Chatbot Arena by Vote Rigging
par: Min, Rui, et autres
Publié: (2025)
par: Min, Rui, et autres
Publié: (2025)
Fractured Chain-of-Thought Reasoning
par: Liao, Baohao, et autres
Publié: (2025)
par: Liao, Baohao, et autres
Publié: (2025)
Understanding Hidden Computations in Chain-of-Thought Reasoning
par: Bharadwaj, Aryasomayajula Ram
Publié: (2024)
par: Bharadwaj, Aryasomayajula Ram
Publié: (2024)
Feature Extraction and Steering for Enhanced Chain-of-Thought Reasoning in Language Models
par: Li, Zihao, et autres
Publié: (2025)
par: Li, Zihao, et autres
Publié: (2025)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
par: Yao, Jiarui, et autres
Publié: (2025)
par: Yao, Jiarui, et autres
Publié: (2025)
Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens
par: Zhao, Chengshuai, et autres
Publié: (2025)
par: Zhao, Chengshuai, et autres
Publié: (2025)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
par: Xie, Zhuohan, et autres
Publié: (2025)
par: Xie, Zhuohan, et autres
Publié: (2025)
Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning
par: Gu, Yu, et autres
Publié: (2026)
par: Gu, Yu, et autres
Publié: (2026)
When More is Less: Understanding Chain-of-Thought Length in LLMs
par: Wu, Yuyang, et autres
Publié: (2025)
par: Wu, Yuyang, et autres
Publié: (2025)
Value-Guided Search for Efficient Chain-of-Thought Reasoning
par: Wang, Kaiwen, et autres
Publié: (2025)
par: Wang, Kaiwen, et autres
Publié: (2025)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
par: Zheng, Xiaosen, et autres
Publié: (2024)
par: Zheng, Xiaosen, et autres
Publié: (2024)
Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
par: Li, Xintong, et autres
Publié: (2026)
par: Li, Xintong, et autres
Publié: (2026)
Understanding Chain-of-Thought in LLMs through Information Theory
par: Ton, Jean-Francois, et autres
Publié: (2024)
par: Ton, Jean-Francois, et autres
Publié: (2024)
Constraint-Rectified Training for Efficient Chain-of-Thought
par: Wu, Qinhang, et autres
Publié: (2026)
par: Wu, Qinhang, et autres
Publié: (2026)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
par: Jia, Xiaojun, et autres
Publié: (2024)
par: Jia, Xiaojun, et autres
Publié: (2024)
CoMAT: Chain of Mathematically Annotated Thought Improves Mathematical Reasoning
par: Leang, Joshua Ong Jun, et autres
Publié: (2024)
par: Leang, Joshua Ong Jun, et autres
Publié: (2024)
Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning
par: Wang, Tianduo, et autres
Publié: (2024)
par: Wang, Tianduo, et autres
Publié: (2024)
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
par: Mu, Yongyu, et autres
Publié: (2025)
par: Mu, Yongyu, et autres
Publié: (2025)
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
par: Arcuschin, Iván, et autres
Publié: (2025)
par: Arcuschin, Iván, et autres
Publié: (2025)
Compositional Reasoning with Transformers, RNNs, and Chain of Thought
par: Yehudai, Gilad, et autres
Publié: (2025)
par: Yehudai, Gilad, et autres
Publié: (2025)
Scalable Chain of Thoughts via Elastic Reasoning
par: Xu, Yuhui, et autres
Publié: (2025)
par: Xu, Yuhui, et autres
Publié: (2025)
Long Chain-of-Thought Reasoning Across Languages
par: Barua, Josh, et autres
Publié: (2025)
par: Barua, Josh, et autres
Publié: (2025)
Understanding Reasoning in Chain-of-Thought from the Hopfieldian View
par: Hu, Lijie, et autres
Publié: (2024)
par: Hu, Lijie, et autres
Publié: (2024)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
par: Sun, Linzhuang, et autres
Publié: (2025)
par: Sun, Linzhuang, et autres
Publié: (2025)
Evolving Demonstration Optimization for Chain-of-Thought Feature Transformation
par: Wang, Xinyuan, et autres
Publié: (2026)
par: Wang, Xinyuan, et autres
Publié: (2026)
Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning
par: Jia, Jinghan, et autres
Publié: (2026)
par: Jia, Jinghan, et autres
Publié: (2026)
HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression
par: Zheng, Minghui, et autres
Publié: (2026)
par: Zheng, Minghui, et autres
Publié: (2026)
OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification
par: Wu, Zijian, et autres
Publié: (2025)
par: Wu, Zijian, et autres
Publié: (2025)
Rethinking Chain-of-Thought Reasoning for Videos
par: Zhong, Yiwu, et autres
Publié: (2025)
par: Zhong, Yiwu, et autres
Publié: (2025)
Enhancing Generalization in Chain of Thought Reasoning for Smaller Models
par: Yin, Maxwell J., et autres
Publié: (2025)
par: Yin, Maxwell J., et autres
Publié: (2025)
Reinforcing General Reasoning without Verifiers
par: Zhou, Xiangxin, et autres
Publié: (2025)
par: Zhou, Xiangxin, et autres
Publié: (2025)
PathCoT: Chain-of-Thought Prompting for Zero-shot Pathology Visual Reasoning
par: Zhou, Junjie, et autres
Publié: (2025)
par: Zhou, Junjie, et autres
Publié: (2025)
Internal Chain-of-Thought: Empirical Evidence for Layer-wise Subtask Scheduling in LLMs
par: Yang, Zhipeng, et autres
Publié: (2025)
par: Yang, Zhipeng, et autres
Publié: (2025)
Documents similaires
-
Demystifying Long Chain-of-Thought Reasoning in LLMs
par: Yeo, Edward, et autres
Publié: (2025) -
CoT-UQ: Improving Response-wise Uncertainty Quantification in LLMs with Chain-of-Thought
par: Zhang, Boxuan, et autres
Publié: (2025) -
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
par: Ye, Jiacheng, et autres
Publié: (2024) -
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
par: Qi, Penghui, et autres
Publié: (2025) -
LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation
par: Zhang, Xuan, et autres
Publié: (2024)