Intrinsic Mutual Information as a Modulator for Preference Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Liao, Peng, Zheng, Peijia, Li, Lingbo, Liang, Shangsong, Chen, Lin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Modular Retrieval-Augmented Generalization for Human Action Recognition
di: Liao, Peng, et al.
Pubblicazione: (2026)
di: Liao, Peng, et al.
Pubblicazione: (2026)
SimPER: A Minimalist Approach to Preference Alignment without Hyperparameters
di: Xiao, Teng, et al.
Pubblicazione: (2025)
di: Xiao, Teng, et al.
Pubblicazione: (2025)
BiDoRA: Bi-level Optimization-Based Weight-Decomposed Low-Rank Adaptation
di: Qin, Peijia, et al.
Pubblicazione: (2024)
di: Qin, Peijia, et al.
Pubblicazione: (2024)
D-SCoRE: Document-Centric Segmentation and CoT Reasoning with Structured Export for QA-CoT Data Generation
di: Zhou, Weibo, et al.
Pubblicazione: (2025)
di: Zhou, Weibo, et al.
Pubblicazione: (2025)
Adaptive Preference Optimization with Uncertainty-aware Utility Anchor
di: Wang, Xiaobo, et al.
Pubblicazione: (2025)
di: Wang, Xiaobo, et al.
Pubblicazione: (2025)
Orthogonal Finetuning for Direct Preference Optimization
di: Yang, Chenxu, et al.
Pubblicazione: (2024)
di: Yang, Chenxu, et al.
Pubblicazione: (2024)
Preference Optimization with Multi-Sample Comparisons
di: Wang, Chaoqi, et al.
Pubblicazione: (2024)
di: Wang, Chaoqi, et al.
Pubblicazione: (2024)
Enhancing LLM Safety via Constrained Direct Preference Optimization
di: Liu, Zixuan, et al.
Pubblicazione: (2024)
di: Liu, Zixuan, et al.
Pubblicazione: (2024)
MGM: Global Understanding of Audience Overlap Graphs for Predicting the Factuality and the Bias of News Media
di: Manzoor, Muhammad Arslan, et al.
Pubblicazione: (2024)
di: Manzoor, Muhammad Arslan, et al.
Pubblicazione: (2024)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
di: Zhu, Zining, et al.
Pubblicazione: (2025)
di: Zhu, Zining, et al.
Pubblicazione: (2025)
Modulated Intervention Preference Optimization (MIPO): Keep the Easy, Refine the Difficult
di: Jang, Cheolhun
Pubblicazione: (2024)
di: Jang, Cheolhun
Pubblicazione: (2024)
SimPO: Simple Preference Optimization with a Reference-Free Reward
di: Meng, Yu, et al.
Pubblicazione: (2024)
di: Meng, Yu, et al.
Pubblicazione: (2024)
On the Role of Preference Variance in Preference Optimization
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
What Level of Automation is "Good Enough"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction
di: Li, Lingbo, et al.
Pubblicazione: (2025)
di: Li, Lingbo, et al.
Pubblicazione: (2025)
Chain of Preference Optimization: Improving Chain-of-Thought Reasoning in LLMs
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
di: Zhang, Xuan, et al.
Pubblicazione: (2024)
Optimizing Language Models for Human Preferences is a Causal Inference Problem
di: Lin, Victoria, et al.
Pubblicazione: (2024)
di: Lin, Victoria, et al.
Pubblicazione: (2024)
On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
di: Lin, Yong, et al.
Pubblicazione: (2024)
di: Lin, Yong, et al.
Pubblicazione: (2024)
PORT: Preference Optimization on Reasoning Traces
di: Lahlou, Salem, et al.
Pubblicazione: (2024)
di: Lahlou, Salem, et al.
Pubblicazione: (2024)
Length Desensitization in Direct Preference Optimization
di: Liu, Wei, et al.
Pubblicazione: (2024)
di: Liu, Wei, et al.
Pubblicazione: (2024)
Efficient RLVR Training via Weighted Mutual Information Data Selection
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
di: Cao, Yuanpu, et al.
Pubblicazione: (2024)
di: Cao, Yuanpu, et al.
Pubblicazione: (2024)
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
di: He, Yinhan, et al.
Pubblicazione: (2026)
di: He, Yinhan, et al.
Pubblicazione: (2026)
ROPO: Robust Preference Optimization for Large Language Models
di: Liang, Xize, et al.
Pubblicazione: (2024)
di: Liang, Xize, et al.
Pubblicazione: (2024)
DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding
di: Zhang, Ruiyi, et al.
Pubblicazione: (2025)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2025)
Pragmatic Feature Preferences: Learning Reward-Relevant Preferences from Human Input
di: Peng, Andi, et al.
Pubblicazione: (2024)
di: Peng, Andi, et al.
Pubblicazione: (2024)
Many of Your DPOs are Secretly One: Attempting Unification Through Mutual Information
di: Tutnov, Rasul, et al.
Pubblicazione: (2025)
di: Tutnov, Rasul, et al.
Pubblicazione: (2025)
Understanding Reference Policies in Direct Preference Optimization
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
Accelerating Direct Preference Optimization with Prefix Sharing
di: Wang, Franklin, et al.
Pubblicazione: (2024)
di: Wang, Franklin, et al.
Pubblicazione: (2024)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
di: Li, Junsong, et al.
Pubblicazione: (2025)
di: Li, Junsong, et al.
Pubblicazione: (2025)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
di: Chen, Shaolong, et al.
Pubblicazione: (2026)
di: Chen, Shaolong, et al.
Pubblicazione: (2026)
TSO: Self-Training with Scaled Preference Optimization
di: Chen, Kaihui, et al.
Pubblicazione: (2024)
di: Chen, Kaihui, et al.
Pubblicazione: (2024)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
di: Lai, Xin, et al.
Pubblicazione: (2024)
di: Lai, Xin, et al.
Pubblicazione: (2024)
Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment
di: Yin, Yueqin, et al.
Pubblicazione: (2024)
di: Yin, Yueqin, et al.
Pubblicazione: (2024)
Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation
di: Yao, Jiashu, et al.
Pubblicazione: (2026)
di: Yao, Jiashu, et al.
Pubblicazione: (2026)
STENCIL: Submodular Mutual Information Based Weak Supervision for Cold-Start Active Learning
di: Beck, Nathan, et al.
Pubblicazione: (2024)
di: Beck, Nathan, et al.
Pubblicazione: (2024)
Group Robust Preference Optimization in Reward-free RLHF
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024)
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024)
Direct Multi-Turn Preference Optimization for Language Agents
di: Shi, Wentao, et al.
Pubblicazione: (2024)
di: Shi, Wentao, et al.
Pubblicazione: (2024)
Multi-Reference Preference Optimization for Large Language Models
di: Le, Hung, et al.
Pubblicazione: (2024)
di: Le, Hung, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Modular Retrieval-Augmented Generalization for Human Action Recognition
di: Liao, Peng, et al.
Pubblicazione: (2026) -
SimPER: A Minimalist Approach to Preference Alignment without Hyperparameters
di: Xiao, Teng, et al.
Pubblicazione: (2025) -
BiDoRA: Bi-level Optimization-Based Weight-Decomposed Low-Rank Adaptation
di: Qin, Peijia, et al.
Pubblicazione: (2024) -
D-SCoRE: Document-Centric Segmentation and CoT Reasoning with Structured Export for QA-CoT Data Generation
di: Zhou, Weibo, et al.
Pubblicazione: (2025) -
Adaptive Preference Optimization with Uncertainty-aware Utility Anchor
di: Wang, Xiaobo, et al.
Pubblicazione: (2025)