Direct Multi-Turn Preference Optimization for Language Agents
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shi, Wentao, Yuan, Mengqi, Wu, Junkang, Wang, Qifan, Feng, Fuli |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
von: Li, Moxin, et al.
Veröffentlicht: (2025)
von: Li, Moxin, et al.
Veröffentlicht: (2025)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models
von: Jung, Sunghee, et al.
Veröffentlicht: (2025)
von: Jung, Sunghee, et al.
Veröffentlicht: (2025)
Large Language Models are Learnable Planners for Long-Term Recommendation
von: Shi, Wentao, et al.
Veröffentlicht: (2024)
von: Shi, Wentao, et al.
Veröffentlicht: (2024)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
von: Xiong, Xiqiao, et al.
Veröffentlicht: (2025)
von: Xiong, Xiqiao, et al.
Veröffentlicht: (2025)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
The Crucial Role of Samplers in Online Direct Preference Optimization
von: Shi, Ruizhe, et al.
Veröffentlicht: (2024)
von: Shi, Ruizhe, et al.
Veröffentlicht: (2024)
Length Desensitization in Direct Preference Optimization
von: Liu, Wei, et al.
Veröffentlicht: (2024)
von: Liu, Wei, et al.
Veröffentlicht: (2024)
Accelerating Direct Preference Optimization with Prefix Sharing
von: Wang, Franklin, et al.
Veröffentlicht: (2024)
von: Wang, Franklin, et al.
Veröffentlicht: (2024)
ROPO: Robust Preference Optimization for Large Language Models
von: Liang, Xize, et al.
Veröffentlicht: (2024)
von: Liang, Xize, et al.
Veröffentlicht: (2024)
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
von: Li, Xintong, et al.
Veröffentlicht: (2025)
von: Li, Xintong, et al.
Veröffentlicht: (2025)
Orthogonal Finetuning for Direct Preference Optimization
von: Yang, Chenxu, et al.
Veröffentlicht: (2024)
von: Yang, Chenxu, et al.
Veröffentlicht: (2024)
Multi-Reference Preference Optimization for Large Language Models
von: Le, Hung, et al.
Veröffentlicht: (2024)
von: Le, Hung, et al.
Veröffentlicht: (2024)
Understanding Reference Policies in Direct Preference Optimization
von: Liu, Yixin, et al.
Veröffentlicht: (2024)
von: Liu, Yixin, et al.
Veröffentlicht: (2024)
Preference Optimization with Multi-Sample Comparisons
von: Wang, Chaoqi, et al.
Veröffentlicht: (2024)
von: Wang, Chaoqi, et al.
Veröffentlicht: (2024)
FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment
von: Zhu, Kewen, et al.
Veröffentlicht: (2026)
von: Zhu, Kewen, et al.
Veröffentlicht: (2026)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
von: Wang, Guoqing, et al.
Veröffentlicht: (2025)
von: Wang, Guoqing, et al.
Veröffentlicht: (2025)
Filtered Direct Preference Optimization
von: Morimura, Tetsuro, et al.
Veröffentlicht: (2024)
von: Morimura, Tetsuro, et al.
Veröffentlicht: (2024)
Direct Preference Optimization with an Offset
von: Amini, Afra, et al.
Veröffentlicht: (2024)
von: Amini, Afra, et al.
Veröffentlicht: (2024)
Disentangling Length from Quality in Direct Preference Optimization
von: Park, Ryan, et al.
Veröffentlicht: (2024)
von: Park, Ryan, et al.
Veröffentlicht: (2024)
Less is More: Improving LLM Alignment via Preference Data Selection
von: Deng, Xun, et al.
Veröffentlicht: (2025)
von: Deng, Xun, et al.
Veröffentlicht: (2025)
Federated Fine-Tuning of Large Language Models: Kahneman-Tversky vs. Direct Preference Optimization
von: Spadea, Fernando, et al.
Veröffentlicht: (2025)
von: Spadea, Fernando, et al.
Veröffentlicht: (2025)
Self-Play Preference Optimization for Language Model Alignment
von: Wu, Yue, et al.
Veröffentlicht: (2024)
von: Wu, Yue, et al.
Veröffentlicht: (2024)
Lower-Left Partial AUC: An Effective and Efficient Optimization Metric for Recommendation
von: Shi, Wentao, et al.
Veröffentlicht: (2024)
von: Shi, Wentao, et al.
Veröffentlicht: (2024)
Enhancing LLM Safety via Constrained Direct Preference Optimization
von: Liu, Zixuan, et al.
Veröffentlicht: (2024)
von: Liu, Zixuan, et al.
Veröffentlicht: (2024)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
von: Li, Kenneth, et al.
Veröffentlicht: (2024)
von: Li, Kenneth, et al.
Veröffentlicht: (2024)
Entropy Controllable Direct Preference Optimization
von: Omura, Motoki, et al.
Veröffentlicht: (2024)
von: Omura, Motoki, et al.
Veröffentlicht: (2024)
On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
von: Lin, Yong, et al.
Veröffentlicht: (2024)
von: Lin, Yong, et al.
Veröffentlicht: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
von: He, Jiafan, et al.
Veröffentlicht: (2024)
von: He, Jiafan, et al.
Veröffentlicht: (2024)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
Refined Direct Preference Optimization with Synthetic Data for Behavioral Alignment of LLMs
von: Gallego, Víctor
Veröffentlicht: (2024)
von: Gallego, Víctor
Veröffentlicht: (2024)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
von: Rosset, Corby, et al.
Veröffentlicht: (2024)
von: Rosset, Corby, et al.
Veröffentlicht: (2024)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023)
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023)
InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
von: Gu, Yanggan, et al.
Veröffentlicht: (2025)
von: Gu, Yanggan, et al.
Veröffentlicht: (2025)
On the Role of Preference Variance in Preference Optimization
von: Guo, Jiacheng, et al.
Veröffentlicht: (2025)
von: Guo, Jiacheng, et al.
Veröffentlicht: (2025)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
von: Zhou, Yifei, et al.
Veröffentlicht: (2024)
von: Zhou, Yifei, et al.
Veröffentlicht: (2024)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
von: Chen, Shaolong, et al.
Veröffentlicht: (2026)
von: Chen, Shaolong, et al.
Veröffentlicht: (2026)
Eliciting Behaviors in Multi-Turn Conversations
von: Huang, Jing, et al.
Veröffentlicht: (2025)
von: Huang, Jing, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
von: Li, Moxin, et al.
Veröffentlicht: (2025) -
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024) -
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024) -
DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models
von: Jung, Sunghee, et al.
Veröffentlicht: (2025) -
Large Language Models are Learnable Planners for Long-Term Recommendation
von: Shi, Wentao, et al.
Veröffentlicht: (2024)