SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin
Fuente:
arXiv
Salvato in:
| Autori principali: | Yi, Hao, Li, Qingyang, Hu, Yulan, Zhang, Fuzheng, Zhang, Di, Liu, Yong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TSO: Self-Training with Scaled Preference Optimization
di: Chen, Kaihui, et al.
Pubblicazione: (2024)
di: Chen, Kaihui, et al.
Pubblicazione: (2024)
Towards Comprehensive Preference Data Collection for Reward Modeling
di: Hu, Yulan, et al.
Pubblicazione: (2024)
di: Hu, Yulan, et al.
Pubblicazione: (2024)
Towards Reward Fairness in RLHF: From a Resource Allocation Perspective
di: Ouyang, Sheng, et al.
Pubblicazione: (2025)
di: Ouyang, Sheng, et al.
Pubblicazione: (2025)
Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models
di: Yi, Hao, et al.
Pubblicazione: (2024)
di: Yi, Hao, et al.
Pubblicazione: (2024)
Graph Ranking Contrastive Learning: A Extremely Simple yet Efficient Method
di: Hu, Yulan, et al.
Pubblicazione: (2023)
di: Hu, Yulan, et al.
Pubblicazione: (2023)
Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR
di: Yi, Hao, et al.
Pubblicazione: (2026)
di: Yi, Hao, et al.
Pubblicazione: (2026)
VIGraph: Generative Self-supervised Learning for Class-Imbalanced Node Classification
di: Hu, Yulan, et al.
Pubblicazione: (2023)
di: Hu, Yulan, et al.
Pubblicazione: (2023)
Just Ask One More Time! Self-Agreement Improves Reasoning of Language Models in (Almost) All Scenarios
di: Lin, Lei, et al.
Pubblicazione: (2023)
di: Lin, Lei, et al.
Pubblicazione: (2023)
Coarse-to-Fine Process Reward Modeling for Mathematical Reasoning
di: Hu, Yulan, et al.
Pubblicazione: (2025)
di: Hu, Yulan, et al.
Pubblicazione: (2025)
Small-Margin Preferences Still Matter-If You Train Them Right
di: Pang, Jinlong, et al.
Pubblicazione: (2026)
di: Pang, Jinlong, et al.
Pubblicazione: (2026)
ERABAL: Enhancing Role-Playing Agents through Boundary-Aware Learning
di: Tang, Yihong, et al.
Pubblicazione: (2024)
di: Tang, Yihong, et al.
Pubblicazione: (2024)
Refining Latent Representations: A Generative SSL Approach for Heterogeneous Graph Learning
di: Hu, Yulan, et al.
Pubblicazione: (2023)
di: Hu, Yulan, et al.
Pubblicazione: (2023)
Learning Top-k Subtask Planning Tree based on Discriminative Representation Pre-training for Decision Making
di: Ruan, Jingqing, et al.
Pubblicazione: (2023)
di: Ruan, Jingqing, et al.
Pubblicazione: (2023)
Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
di: Cheng, Xiang, et al.
Pubblicazione: (2025)
di: Cheng, Xiang, et al.
Pubblicazione: (2025)
Inductive-Deductive Strategy Reuse for Multi-Turn Instructional Dialogues
di: Ou, Jiao, et al.
Pubblicazione: (2024)
di: Ou, Jiao, et al.
Pubblicazione: (2024)
Routing to the Right Expertise: A Trustworthy Judge for Instruction-based Image Editing
di: Sun, Chenxi, et al.
Pubblicazione: (2025)
di: Sun, Chenxi, et al.
Pubblicazione: (2025)
Chain-of-Specificity: An Iteratively Refining Method for Eliciting Knowledge from Large Language Models
di: Wei, Kaiwen, et al.
Pubblicazione: (2024)
di: Wei, Kaiwen, et al.
Pubblicazione: (2024)
No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning
di: Li, Zhicong, et al.
Pubblicazione: (2026)
di: Li, Zhicong, et al.
Pubblicazione: (2026)
DMQR-RAG: Diverse Multi-Query Rewriting for RAG
di: Li, Zhicong, et al.
Pubblicazione: (2024)
di: Li, Zhicong, et al.
Pubblicazione: (2024)
SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression
di: Xu, Yuyang, et al.
Pubblicazione: (2025)
di: Xu, Yuyang, et al.
Pubblicazione: (2025)
When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs
di: Zhang, Zhuoran, et al.
Pubblicazione: (2025)
di: Zhang, Zhuoran, et al.
Pubblicazione: (2025)
DialogBench: Evaluating LLMs as Human-like Dialogue Systems
di: Ou, Jiao, et al.
Pubblicazione: (2023)
di: Ou, Jiao, et al.
Pubblicazione: (2023)
SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
di: Dang, Jisheng, et al.
Pubblicazione: (2025)
Leanabell-Prover: Posttraining Scaling in Formal Reasoning
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025)
Legend: Leveraging Representation Engineering to Annotate Safety Margin for Preference Datasets
di: Feng, Duanyu, et al.
Pubblicazione: (2024)
di: Feng, Duanyu, et al.
Pubblicazione: (2024)
Improving Attributed Text Generation of Large Language Models via Preference Learning
di: Li, Dongfang, et al.
Pubblicazione: (2024)
di: Li, Dongfang, et al.
Pubblicazione: (2024)
Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
di: Zhuang, Ziqing, et al.
Pubblicazione: (2026)
di: Zhuang, Ziqing, et al.
Pubblicazione: (2026)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
COPR: Continual Human Preference Learning via Optimal Policy Regularization
di: Zhang, Han, et al.
Pubblicazione: (2024)
di: Zhang, Han, et al.
Pubblicazione: (2024)
Adaptive Margin RLHF via Preference over Preferences
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
Improving Value-based Process Verifier via Low-Cost Variance Reduction
di: Sun, Zetian, et al.
Pubblicazione: (2025)
di: Sun, Zetian, et al.
Pubblicazione: (2025)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
di: Yang, Yiqin, et al.
Pubblicazione: (2026)
di: Yang, Yiqin, et al.
Pubblicazione: (2026)
GUNDAM: Aligning Large Language Models with Graph Understanding
di: Ouyang, Sheng, et al.
Pubblicazione: (2024)
di: Ouyang, Sheng, et al.
Pubblicazione: (2024)
Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
di: Xu, Kaishuai, et al.
Pubblicazione: (2024)
di: Xu, Kaishuai, et al.
Pubblicazione: (2024)
Unitary Multi-Margin BERT for Robust Natural Language Processing
di: Chang, Hao-Yuan, et al.
Pubblicazione: (2024)
di: Chang, Hao-Yuan, et al.
Pubblicazione: (2024)
Klear-CodeTest: Scalable Test Case Generation for Code Reinforcement Learning
di: Fu, Jia, et al.
Pubblicazione: (2025)
di: Fu, Jia, et al.
Pubblicazione: (2025)
Strong Preferences Affect the Robustness of Preference Models and Value Alignment
di: Xu, Ziwei, et al.
Pubblicazione: (2024)
di: Xu, Ziwei, et al.
Pubblicazione: (2024)
DSTC: Direct Preference Learning with Only Self-Generated Tests and Code to Improve Code LMs
di: Liu, Zhihan, et al.
Pubblicazione: (2024)
di: Liu, Zhihan, et al.
Pubblicazione: (2024)
Learning What Matters Now: Dynamic Preference Inference under Contextual Shifts
di: Cao, Xianwei, et al.
Pubblicazione: (2026)
di: Cao, Xianwei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
TSO: Self-Training with Scaled Preference Optimization
di: Chen, Kaihui, et al.
Pubblicazione: (2024) -
Towards Comprehensive Preference Data Collection for Reward Modeling
di: Hu, Yulan, et al.
Pubblicazione: (2024) -
Towards Reward Fairness in RLHF: From a Resource Allocation Perspective
di: Ouyang, Sheng, et al.
Pubblicazione: (2025) -
Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models
di: Yi, Hao, et al.
Pubblicazione: (2024) -
Graph Ranking Contrastive Learning: A Extremely Simple yet Efficient Method
di: Hu, Yulan, et al.
Pubblicazione: (2023)