Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Huimin, Mao, Xin, Li, Feng-Lin, Wu, Xiaobao, Chen, Wang, Zhang, Wei, Luu, Anh Tuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotation
di: Xu, Huimin, et al.
Pubblicazione: (2025)
di: Xu, Huimin, et al.
Pubblicazione: (2025)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
di: Lai, Xin, et al.
Pubblicazione: (2024)
di: Lai, Xin, et al.
Pubblicazione: (2024)
Don't Forget Your Reward Values: Language Model Alignment via Value-based Calibration
di: Mao, Xin, et al.
Pubblicazione: (2024)
di: Mao, Xin, et al.
Pubblicazione: (2024)
Unsupervised Hallucination Detection by Inspecting Reasoning Processes
di: Srey, Ponhvoan, et al.
Pubblicazione: (2025)
di: Srey, Ponhvoan, et al.
Pubblicazione: (2025)
Step-level Value Preference Optimization for Mathematical Reasoning
di: Chen, Guoxin, et al.
Pubblicazione: (2024)
di: Chen, Guoxin, et al.
Pubblicazione: (2024)
As Simple as Fine-tuning: LLM Alignment via Bidirectional Negative Feedback Loss
di: Mao, Xin, et al.
Pubblicazione: (2024)
di: Mao, Xin, et al.
Pubblicazione: (2024)
SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression
di: Xu, Yuyang, et al.
Pubblicazione: (2025)
di: Xu, Yuyang, et al.
Pubblicazione: (2025)
Step-Controlled DPO: Leveraging Stepwise Error for Enhanced Mathematical Reasoning
di: Lu, Zimu, et al.
Pubblicazione: (2024)
di: Lu, Zimu, et al.
Pubblicazione: (2024)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
di: Fei, Wu, et al.
Pubblicazione: (2025)
di: Fei, Wu, et al.
Pubblicazione: (2025)
A Survey on Neural Topic Models: Methods, Applications, and Challenges
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
Towards the TopMost: A Topic Modeling System Toolkit
di: Wu, Xiaobao, et al.
Pubblicazione: (2023)
di: Wu, Xiaobao, et al.
Pubblicazione: (2023)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
di: Xu, Huimin, et al.
Pubblicazione: (2026)
di: Xu, Huimin, et al.
Pubblicazione: (2026)
LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision
di: Xu, Jundong, et al.
Pubblicazione: (2025)
di: Xu, Jundong, et al.
Pubblicazione: (2025)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
Read as You See: Guiding Unimodal LLMs for Low-Resource Explainable Harmful Meme Detection
di: Pan, Fengjun, et al.
Pubblicazione: (2025)
di: Pan, Fengjun, et al.
Pubblicazione: (2025)
Are LLMs Good Zero-Shot Fallacy Classifiers?
di: Pan, Fengjun, et al.
Pubblicazione: (2024)
di: Pan, Fengjun, et al.
Pubblicazione: (2024)
Aspect-Based Summarization with Self-Aspect Retrieval Enhanced Generation
di: Feng, Yichao, et al.
Pubblicazione: (2025)
di: Feng, Yichao, et al.
Pubblicazione: (2025)
KDMCSE: Knowledge Distillation Multimodal Sentence Embeddings with Adaptive Angular margin Contrastive Learning
di: Nguyen, Cong-Duy, et al.
Pubblicazione: (2024)
di: Nguyen, Cong-Duy, et al.
Pubblicazione: (2024)
GroupDPO: Memory efficient Group-wise Direct Preference Optimization
di: Leng, Jixuan, et al.
Pubblicazione: (2026)
di: Leng, Jixuan, et al.
Pubblicazione: (2026)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
di: Chen, Shaolong, et al.
Pubblicazione: (2026)
di: Chen, Shaolong, et al.
Pubblicazione: (2026)
Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models
di: Srey, Ponhvoan, et al.
Pubblicazione: (2026)
di: Srey, Ponhvoan, et al.
Pubblicazione: (2026)
AKEW: Assessing Knowledge Editing in the Wild
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
Learning Uncertainty from Sequential Internal Dispersion in Large Language Models
di: Srey, Ponhvoan, et al.
Pubblicazione: (2026)
di: Srey, Ponhvoan, et al.
Pubblicazione: (2026)
Step Guided Reasoning: Improving Mathematical Reasoning using Guidance Generation and Step Reasoning
di: Cao, Lang, et al.
Pubblicazione: (2024)
di: Cao, Lang, et al.
Pubblicazione: (2024)
Uncertainty-Aware Step-wise Verification with Generative Reward Models
di: Ye, Zihuiwen, et al.
Pubblicazione: (2025)
di: Ye, Zihuiwen, et al.
Pubblicazione: (2025)
Topic Modeling as Multi-Objective Contrastive Optimization
di: Nguyen, Thong, et al.
Pubblicazione: (2024)
di: Nguyen, Thong, et al.
Pubblicazione: (2024)
Modeling Dynamic Topics in Chain-Free Fashion by Evolution-Tracking Contrastive Learning and Unassociated Word Exclusion
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
Step-wise Rubric Rewards for LLM Reasoning
di: Xie, Weichu, et al.
Pubblicazione: (2026)
di: Xie, Weichu, et al.
Pubblicazione: (2026)
MRAG: A Modular Retrieval Framework for Time-Sensitive Question Answering
di: Siyue, Zhang, et al.
Pubblicazione: (2024)
di: Siyue, Zhang, et al.
Pubblicazione: (2024)
SOD: Step-wise On-policy Distillation for Small Language Model Agents
di: Zhong, Qiyong, et al.
Pubblicazione: (2026)
di: Zhong, Qiyong, et al.
Pubblicazione: (2026)
Sailing by the Stars: A Survey on Reward Models and Learning Strategies for Learning from Rewards
di: Wu, Xiaobao
Pubblicazione: (2025)
di: Wu, Xiaobao
Pubblicazione: (2025)
Vision-and-Language Pretraining
di: Nguyen, Thong, et al.
Pubblicazione: (2022)
di: Nguyen, Thong, et al.
Pubblicazione: (2022)
InfoCTM: A Mutual Information Maximization Perspective of Cross-Lingual Topic Modeling
di: Wu, Xiaobao, et al.
Pubblicazione: (2023)
di: Wu, Xiaobao, et al.
Pubblicazione: (2023)
MUR: Momentum Uncertainty guided Reasoning for Large Language Models
di: Yan, Hang, et al.
Pubblicazione: (2025)
di: Yan, Hang, et al.
Pubblicazione: (2025)
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
ClozeMath: Improving Mathematical Reasoning in Language Models by Learning to Fill Equations
di: Pham, Quang Hieu, et al.
Pubblicazione: (2025)
di: Pham, Quang Hieu, et al.
Pubblicazione: (2025)
DPO-Shift: Shifting the Distribution of Direct Preference Optimization
di: Yang, Xiliang, et al.
Pubblicazione: (2025)
di: Yang, Xiliang, et al.
Pubblicazione: (2025)
FASTopic: Pretrained Transformer is a Fast, Adaptive, Stable, and Transferable Topic Model
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotation
di: Xu, Huimin, et al.
Pubblicazione: (2025) -
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
di: Lai, Xin, et al.
Pubblicazione: (2024) -
Don't Forget Your Reward Values: Language Model Alignment via Value-based Calibration
di: Mao, Xin, et al.
Pubblicazione: (2024) -
Unsupervised Hallucination Detection by Inspecting Reasoning Processes
di: Srey, Ponhvoan, et al.
Pubblicazione: (2025) -
Step-level Value Preference Optimization for Mathematical Reasoning
di: Chen, Guoxin, et al.
Pubblicazione: (2024)