RePO: Understanding Preference Learning Through ReLU-Based Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Junkang, Huang, Kexin, Wang, Xue, Gao, Jinyang, Ding, Bolin, Wu, Jiancan, He, Xiangnan, Wang, Xiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
par: Huang, Kexin, et autres
Publié: (2025)
par: Huang, Kexin, et autres
Publié: (2025)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
par: Wu, Junkang, et autres
Publié: (2025)
par: Wu, Junkang, et autres
Publié: (2025)
RePO: Replay-Enhanced Policy Optimization
par: Li, Siheng, et autres
Publié: (2025)
par: Li, Siheng, et autres
Publié: (2025)
AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization
par: Lu, Jinda, et autres
Publié: (2025)
par: Lu, Jinda, et autres
Publié: (2025)
RePO: Bridging On-Policy Learning and Off-Policy Knowledge through Rephrasing Policy Optimization
par: Xia, Linxuan, et autres
Publié: (2026)
par: Xia, Linxuan, et autres
Publié: (2026)
N-ReLU: Zero-Mean Stochastic Extension of ReLU
par: Manik, Md Motaleb Hossen, et autres
Publié: (2025)
par: Manik, Md Motaleb Hossen, et autres
Publié: (2025)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
par: Liufu, Weijia, et autres
Publié: (2026)
par: Liufu, Weijia, et autres
Publié: (2026)
The Geometry of ReLU Networks through the ReLU Transition Graph
par: Dhayalkar, Sahil Rajesh
Publié: (2025)
par: Dhayalkar, Sahil Rajesh
Publié: (2025)
Efficient Verification and Falsification of ReLU Neural Barrier Certificates
par: Ren, Dejin, et autres
Publié: (2025)
par: Ren, Dejin, et autres
Publié: (2025)
The Resurrection of the ReLU
par: Horuz, Coşku Can, et autres
Publié: (2025)
par: Horuz, Coşku Can, et autres
Publié: (2025)
Discrete Functional Geometry of ReLU Networks via ReLU Transition Graphs
par: Dhayalkar, Sahil Rajesh
Publié: (2025)
par: Dhayalkar, Sahil Rajesh
Publié: (2025)
Nearly Optimal Differentially Private ReLU Regression
par: Ding, Meng, et autres
Publié: (2025)
par: Ding, Meng, et autres
Publié: (2025)
Symmetric Matrix Completion with ReLU Sampling
par: Liu, Huikang, et autres
Publié: (2024)
par: Liu, Huikang, et autres
Publié: (2024)
Activation-Descent Regularization for Input Optimization of ReLU Networks
par: Yu, Hongzhan, et autres
Publié: (2024)
par: Yu, Hongzhan, et autres
Publié: (2024)
Is ReLU Adversarially Robust?
par: Sooksatra, Korn, et autres
Publié: (2024)
par: Sooksatra, Korn, et autres
Publié: (2024)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
par: Huang, Kexin, et autres
Publié: (2026)
par: Huang, Kexin, et autres
Publié: (2026)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
par: Ji, Wence, et autres
Publié: (2025)
par: Ji, Wence, et autres
Publié: (2025)
Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs
par: Lu, Jinda, et autres
Publié: (2026)
par: Lu, Jinda, et autres
Publié: (2026)
On Negative-aware Preference Optimization for Recommendation
par: Ding, Chenlu, et autres
Publié: (2025)
par: Ding, Chenlu, et autres
Publié: (2025)
Functional dimension of feedforward ReLU neural networks
par: Grigsby, J. Elisenda, et autres
Publié: (2022)
par: Grigsby, J. Elisenda, et autres
Publié: (2022)
Generalization analysis with deep ReLU networks for metric and similarity learning
par: Zhou, Junyu, et autres
Publié: (2024)
par: Zhou, Junyu, et autres
Publié: (2024)
ReLU-Based and DNN-Based Generalized Maximum Score Estimators
par: Chen, Xiaohong, et autres
Publié: (2025)
par: Chen, Xiaohong, et autres
Publié: (2025)
Injectivity capacity of ReLU gates
par: Stojnic, Mihailo
Publié: (2024)
par: Stojnic, Mihailo
Publié: (2024)
On the Principles of ReLU Networks with One Hidden Layer
par: Huang, Changcun
Publié: (2024)
par: Huang, Changcun
Publié: (2024)
Computational Tradeoffs of Optimization-Based Bound Tightening in ReLU Networks
par: Badilla, Fabian, et autres
Publié: (2023)
par: Badilla, Fabian, et autres
Publié: (2023)
ReMoE: Fully Differentiable Mixture-of-Experts with ReLU Routing
par: Wang, Ziteng, et autres
Publié: (2024)
par: Wang, Ziteng, et autres
Publié: (2024)
Detecting Invariant Manifolds in ReLU-Based RNNs
par: Eisenmann, Lukas, et autres
Publié: (2025)
par: Eisenmann, Lukas, et autres
Publié: (2025)
Nearly Optimal Approximation Rates for Deep Super ReLU Networks on Sobolev Spaces
par: Yang, Yahong, et autres
Publié: (2023)
par: Yang, Yahong, et autres
Publié: (2023)
Component-based Sketching for Deep ReLU Nets
par: Wang, Di, et autres
Publié: (2024)
par: Wang, Di, et autres
Publié: (2024)
ReLU-KAN: New Kolmogorov-Arnold Networks that Only Need Matrix Addition, Dot Multiplication, and ReLU
par: Qiu, Qi, et autres
Publié: (2024)
par: Qiu, Qi, et autres
Publié: (2024)
Deep ReLU Networks Have Surprisingly Simple Polytopes
par: Fan, Feng-Lei, et autres
Publié: (2023)
par: Fan, Feng-Lei, et autres
Publié: (2023)
Constraining the outputs of ReLU neural networks
par: Alexandr, Yulia, et autres
Publié: (2025)
par: Alexandr, Yulia, et autres
Publié: (2025)
Complexity of One-Dimensional ReLU DNNs
par: Kogan, Jonathan, et autres
Publié: (2025)
par: Kogan, Jonathan, et autres
Publié: (2025)
The Symmetries of Three-Layer ReLU Networks
par: Gegenfurtner, Johanna Marie, et autres
Publié: (2026)
par: Gegenfurtner, Johanna Marie, et autres
Publié: (2026)
Topological Expressivity of ReLU Neural Networks
par: Ergen, Ekin, et autres
Publié: (2023)
par: Ergen, Ekin, et autres
Publié: (2023)
Stochastic Bandits with ReLU Neural Networks
par: Xu, Kan, et autres
Publié: (2024)
par: Xu, Kan, et autres
Publié: (2024)
On Space Folds of ReLU Neural Networks
par: Lewandowski, Michal, et autres
Publié: (2025)
par: Lewandowski, Michal, et autres
Publié: (2025)
Documents similaires
-
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024) -
Larger or Smaller Reward Margins to Select Preferences for Alignment?
par: Huang, Kexin, et autres
Publié: (2025) -
$β$-DPO: Direct Preference Optimization with Dynamic $β$
par: Wu, Junkang, et autres
Publié: (2024) -
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024) -
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
par: Wu, Junkang, et autres
Publié: (2025)