ROPO: Robust Preference Optimization for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liang, Xize, Chen, Chao, Qiu, Shuang, Wang, Jie, Wu, Yue, Fu, Zhihang, Shi, Zhihao, Wu, Feng, Ye, Jieping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ROUTE: Robust Multitask Tuning and Collaboration for Text-to-SQL
di: Qin, Yang, et al.
Pubblicazione: (2024)
di: Qin, Yang, et al.
Pubblicazione: (2024)
Controlling Thinking Speed in Reasoning Models
di: Lin, Zhengkai, et al.
Pubblicazione: (2025)
di: Lin, Zhengkai, et al.
Pubblicazione: (2025)
Structure-aware Domain Knowledge Injection for Large Language Models
di: Liu, Kai, et al.
Pubblicazione: (2024)
di: Liu, Kai, et al.
Pubblicazione: (2024)
Delving into the Reversal Curse: How Far Can Large Language Models Generalize?
di: Lin, Zhengkai, et al.
Pubblicazione: (2024)
di: Lin, Zhengkai, et al.
Pubblicazione: (2024)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
di: Guo, Yiran, et al.
Pubblicazione: (2025)
di: Guo, Yiran, et al.
Pubblicazione: (2025)
Weights-Rotated Preference Optimization for Large Language Models
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
On the Role of Preference Variance in Preference Optimization
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
Concise and Organized Perception Facilitates Reasoning in Large Language Models
di: Liu, Junjie, et al.
Pubblicazione: (2023)
di: Liu, Junjie, et al.
Pubblicazione: (2023)
Don't Take Things Out of Context: Attention Intervention for Enhancing Chain-of-Thought Reasoning in Large Language Models
di: Yan, Shaotian, et al.
Pubblicazione: (2025)
di: Yan, Shaotian, et al.
Pubblicazione: (2025)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
SAC-KG: Exploiting Large Language Models as Skilled Automatic Constructors for Domain Knowledge Graphs
di: Chen, Hanzhu, et al.
Pubblicazione: (2024)
di: Chen, Hanzhu, et al.
Pubblicazione: (2024)
Aligning Large Language Models with Searcher Preferences
di: Wu, Wei, et al.
Pubblicazione: (2026)
di: Wu, Wei, et al.
Pubblicazione: (2026)
INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection
di: Chen, Chao, et al.
Pubblicazione: (2024)
di: Chen, Chao, et al.
Pubblicazione: (2024)
Self-Play Preference Optimization for Language Model Alignment
di: Wu, Yue, et al.
Pubblicazione: (2024)
di: Wu, Yue, et al.
Pubblicazione: (2024)
Preference Packing: Efficient Preference Optimization for Large Language Models
di: Cho, Jaekyung
Pubblicazione: (2026)
di: Cho, Jaekyung
Pubblicazione: (2026)
WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More
di: Yue, Yuxuan, et al.
Pubblicazione: (2024)
di: Yue, Yuxuan, et al.
Pubblicazione: (2024)
MAPO: Boosting Large Language Model Performance with Model-Adaptive Prompt Optimization
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
Enhance Reasoning for Large Language Models in the Game Werewolf
di: Wu, Shuang, et al.
Pubblicazione: (2024)
di: Wu, Shuang, et al.
Pubblicazione: (2024)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
di: Li, Junsong, et al.
Pubblicazione: (2025)
di: Li, Junsong, et al.
Pubblicazione: (2025)
Hallucination Detection: Robustly Discerning Reliable Answers in Large Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization
di: Chen, Jiayi, et al.
Pubblicazione: (2025)
di: Chen, Jiayi, et al.
Pubblicazione: (2025)
PLaD: Preference-based Large Language Model Distillation with Pseudo-Preference Pairs
di: Zhang, Rongzhi, et al.
Pubblicazione: (2024)
di: Zhang, Rongzhi, et al.
Pubblicazione: (2024)
Who Reasons in the Large Language Models?
di: Shao, Jie, et al.
Pubblicazione: (2025)
di: Shao, Jie, et al.
Pubblicazione: (2025)
Enhancing LLM's Cognition via Structurization
di: Liu, Kai, et al.
Pubblicazione: (2024)
di: Liu, Kai, et al.
Pubblicazione: (2024)
M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization
di: Bai, Bizhe, et al.
Pubblicazione: (2025)
di: Bai, Bizhe, et al.
Pubblicazione: (2025)
Accurate and Scalable Graph Neural Networks via Message Invariance
di: Shi, Zhihao, et al.
Pubblicazione: (2025)
di: Shi, Zhihao, et al.
Pubblicazione: (2025)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
di: Feng, Zhili, et al.
Pubblicazione: (2025)
di: Feng, Zhili, et al.
Pubblicazione: (2025)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
Evolutionary Computation in the Era of Large Language Model: Survey and Roadmap
di: Wu, Xingyu, et al.
Pubblicazione: (2024)
di: Wu, Xingyu, et al.
Pubblicazione: (2024)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
di: Wu, Jiulong, et al.
Pubblicazione: (2025)
di: Wu, Jiulong, et al.
Pubblicazione: (2025)
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
di: Yu, Huimu, et al.
Pubblicazione: (2024)
di: Yu, Huimu, et al.
Pubblicazione: (2024)
Coarse-to-Fine Highlighting: Reducing Knowledge Hallucination in Large Language Models
di: Lv, Qitan, et al.
Pubblicazione: (2024)
di: Lv, Qitan, et al.
Pubblicazione: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
di: He, Jiafan, et al.
Pubblicazione: (2024)
di: He, Jiafan, et al.
Pubblicazione: (2024)
Robust Prompt Optimization for Large Language Models Against Distribution Shifts
di: Li, Moxin, et al.
Pubblicazione: (2023)
di: Li, Moxin, et al.
Pubblicazione: (2023)
Understanding Privacy Risks of Embeddings Induced by Large Language Models
di: Zhu, Zhihao, et al.
Pubblicazione: (2024)
di: Zhu, Zhihao, et al.
Pubblicazione: (2024)
CURATRON: Complete and Robust Preference Data for Rigorous Alignment of Large Language Models
di: Nguyen, Son The, et al.
Pubblicazione: (2024)
di: Nguyen, Son The, et al.
Pubblicazione: (2024)
Beyond Pass-by-Pass Optimization: Intent-Driven IR Optimization with Large Language Models
di: Qiu, Lei, et al.
Pubblicazione: (2026)
di: Qiu, Lei, et al.
Pubblicazione: (2026)
Fine Tuning Large Language Models for Medicine: The Role and Importance of Direct Preference Optimization
di: Savage, Thomas, et al.
Pubblicazione: (2024)
di: Savage, Thomas, et al.
Pubblicazione: (2024)
Dynamic Generation of Personalities with Large Language Models
di: Liu, Jianzhi, et al.
Pubblicazione: (2024)
di: Liu, Jianzhi, et al.
Pubblicazione: (2024)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
di: Yang, Rui, et al.
Pubblicazione: (2024)
di: Yang, Rui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ROUTE: Robust Multitask Tuning and Collaboration for Text-to-SQL
di: Qin, Yang, et al.
Pubblicazione: (2024) -
Controlling Thinking Speed in Reasoning Models
di: Lin, Zhengkai, et al.
Pubblicazione: (2025) -
Structure-aware Domain Knowledge Injection for Large Language Models
di: Liu, Kai, et al.
Pubblicazione: (2024) -
Delving into the Reversal Curse: How Far Can Large Language Models Generalize?
di: Lin, Zhengkai, et al.
Pubblicazione: (2024) -
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
di: Guo, Yiran, et al.
Pubblicazione: (2025)