DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | She, Shuaijie, Bao, Yu, Lu, Yu, Xu, Lu, Li, Tao, Zhu, Wenhao, Huang, Shujian, Cheng, Shanbo, Lu, Lu, Wang, Yuxuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EnAnchored-X2X: English-Anchored Optimization for Many-to-Many Translation
by: Yang, Sen, et al.
Published: (2025)
by: Yang, Sen, et al.
Published: (2025)
MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization
by: She, Shuaijie, et al.
Published: (2024)
by: She, Shuaijie, et al.
Published: (2024)
GRRM: Group Relative Reward Modeling for Machine Translation
by: Yang, Sen, et al.
Published: (2026)
by: Yang, Sen, et al.
Published: (2026)
Multilingual Contrastive Decoding via Language-Agnostic Layers Skipping
by: Zhu, Wenhao, et al.
Published: (2024)
by: Zhu, Wenhao, et al.
Published: (2024)
Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data
by: Zou, Wei, et al.
Published: (2025)
by: Zou, Wei, et al.
Published: (2025)
Seed-X: Building Strong Multilingual Translation LLM with 7B Parameters
by: Cheng, Shanbo, et al.
Published: (2025)
by: Cheng, Shanbo, et al.
Published: (2025)
Question Translation Training for Better Multilingual Reasoning
by: Zhu, Wenhao, et al.
Published: (2024)
by: Zhu, Wenhao, et al.
Published: (2024)
From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition
by: Wang, Tianduo, et al.
Published: (2025)
by: Wang, Tianduo, et al.
Published: (2025)
MT-PATCHER: Selective and Extendable Knowledge Distillation from Large Language Models for Machine Translation
by: Li, Jiahuan, et al.
Published: (2024)
by: Li, Jiahuan, et al.
Published: (2024)
Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions
by: Li, Jiahuan, et al.
Published: (2023)
by: Li, Jiahuan, et al.
Published: (2023)
SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translation
by: Xu, Ting, et al.
Published: (2025)
by: Xu, Ting, et al.
Published: (2025)
Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models
by: She, Shuaijie, et al.
Published: (2023)
by: She, Shuaijie, et al.
Published: (2023)
MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework
by: Qi, Yupeng, et al.
Published: (2025)
by: Qi, Yupeng, et al.
Published: (2025)
Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent
by: Cheng, Shanbo, et al.
Published: (2024)
by: Cheng, Shanbo, et al.
Published: (2024)
DEPO: Dual-Efficiency Preference Optimization for LLM Agents
by: Chen, Sirui, et al.
Published: (2025)
by: Chen, Sirui, et al.
Published: (2025)
G-DIG: Towards Gradient-based Diverse and High-quality Instruction Data Selection for Machine Translation
by: Pan, Xingyuan, et al.
Published: (2024)
by: Pan, Xingyuan, et al.
Published: (2024)
R-PRM: Reasoning-Driven Process Reward Modeling
by: She, Shuaijie, et al.
Published: (2025)
by: She, Shuaijie, et al.
Published: (2025)
StyleSentinel: Reliable Artistic Copyright Verification via Stylistic Fingerprints
by: Chen, Lingxiao, et al.
Published: (2025)
by: Chen, Lingxiao, et al.
Published: (2025)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
by: Xiang, Hao, et al.
Published: (2024)
by: Xiang, Hao, et al.
Published: (2024)
Robust Channel Learning for Large-Scale Radio Speaker Verification
by: Yang, Wenhao, et al.
Published: (2024)
by: Yang, Wenhao, et al.
Published: (2024)
Integrated Multi-Level Knowledge Distillation for Enhanced Speaker Verification
by: Yang, Wenhao, et al.
Published: (2024)
by: Yang, Wenhao, et al.
Published: (2024)
Retaining Key Information under High Compression Ratios: Query-Guided Compressor for LLMs
by: Cao, Zhiwei, et al.
Published: (2024)
by: Cao, Zhiwei, et al.
Published: (2024)
Channel Adaptation for Speaker Verification Using Optimal Transport with Pseudo Label
by: Yang, Wenhao, et al.
Published: (2024)
by: Yang, Wenhao, et al.
Published: (2024)
Reliable and Real-Time Highway Trajectory Planning via Hybrid Learning-Optimization Frameworks
by: Lu, Yujia, et al.
Published: (2025)
by: Lu, Yujia, et al.
Published: (2025)
InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment
by: Lu, Yunhong, et al.
Published: (2025)
by: Lu, Yunhong, et al.
Published: (2025)
Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning
by: Wang, Tianduo, et al.
Published: (2024)
by: Wang, Tianduo, et al.
Published: (2024)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
by: Zhu, Zining, et al.
Published: (2025)
by: Zhu, Zining, et al.
Published: (2025)
Enhancing LLM Reliability via Explicit Knowledge Boundary Modeling
by: Zheng, Hang, et al.
Published: (2025)
by: Zheng, Hang, et al.
Published: (2025)
TrainVerify: Equivalence-Based Verification for Distributed LLM Training
by: Lu, Yunchi, et al.
Published: (2025)
by: Lu, Yunchi, et al.
Published: (2025)
Neutral species facilitate coexistence among cyclically competing species under birth and death processes
by: Lu, Yikang, et al.
Published: (2026)
by: Lu, Yikang, et al.
Published: (2026)
LLaMAX: Scaling Linguistic Horizons of LLM by Enhancing Translation Capabilities Beyond 100 Languages
by: Lu, Yinquan, et al.
Published: (2024)
by: Lu, Yinquan, et al.
Published: (2024)
Mining the Explainability and Generalization: Fact Verification Based on Self-Instruction
by: Lu, Guangyao, et al.
Published: (2024)
by: Lu, Guangyao, et al.
Published: (2024)
Son Preference, Gender Gap in Higher Education Attainment and High‐Skilled Occupations: Evidence From China
by: Yangming Bao, et al.
Published: (2025)
by: Yangming Bao, et al.
Published: (2025)
AgentOps: Enabling Observability of LLM Agents
by: Dong, Liming, et al.
Published: (2024)
by: Dong, Liming, et al.
Published: (2024)
Step-Wise Formal Verification for LLM-Based Mathematical Problem Solving
by: Zhou, Kuo, et al.
Published: (2025)
by: Zhou, Kuo, et al.
Published: (2025)
T-REG: Preference Optimization with Token-Level Reward Regularization
by: Zhou, Wenxuan, et al.
Published: (2024)
by: Zhou, Wenxuan, et al.
Published: (2024)
LLM4MG: Adapting Large Language Model for Multipath Generation via Synesthesia of Machines
by: Huang, Ziwei, et al.
Published: (2025)
by: Huang, Ziwei, et al.
Published: (2025)
Modified Electrolyte with Sodium Alginate to Effectively Protect the Anode of Aqueous Zinc‐Ion Battery
by: Shaoyang Liu, et al.
Published: (2025)
by: Shaoyang Liu, et al.
Published: (2025)
PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning
by: Lu, Wenquan, et al.
Published: (2026)
by: Lu, Wenquan, et al.
Published: (2026)
$f$-PO: Generalizing Preference Optimization with $f$-divergence Minimization
by: Han, Jiaqi, et al.
Published: (2024)
by: Han, Jiaqi, et al.
Published: (2024)
Similar Items
-
EnAnchored-X2X: English-Anchored Optimization for Many-to-Many Translation
by: Yang, Sen, et al.
Published: (2025) -
MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization
by: She, Shuaijie, et al.
Published: (2024) -
GRRM: Group Relative Reward Modeling for Machine Translation
by: Yang, Sen, et al.
Published: (2026) -
Multilingual Contrastive Decoding via Language-Agnostic Layers Skipping
by: Zhu, Wenhao, et al.
Published: (2024) -
Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data
by: Zou, Wei, et al.
Published: (2025)