Saved in:
| Main Authors: | Liu, Ning, Sun, Chuanneng, Klinkner, Kristina, Malmasi, Shervin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2605.08037 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Learning to Staff: Offline Reinforcement Learning and Fine-Tuned LLMs for Warehouse Staffing Optimization
by: Kujanpää, Kalle, et al.
Published: (2026)
by: Kujanpää, Kalle, et al.
Published: (2026)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
by: Rafailov, Rafael, et al.
Published: (2023)
by: Rafailov, Rafael, et al.
Published: (2023)
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
by: Kallus, Nathan
Published: (2025)
by: Kallus, Nathan
Published: (2025)
LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions
by: Sun, Chuanneng, et al.
Published: (2024)
by: Sun, Chuanneng, et al.
Published: (2024)
Large Language Model is Secretly a Protein Sequence Optimizer
by: Wang, Yinkai, et al.
Published: (2025)
by: Wang, Yinkai, et al.
Published: (2025)
Your Transformer is Secretly Linear
by: Razzhigaev, Anton, et al.
Published: (2024)
by: Razzhigaev, Anton, et al.
Published: (2024)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
by: Xu, Wenzhe, et al.
Published: (2026)
by: Xu, Wenzhe, et al.
Published: (2026)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
by: Zhou, Zhanhui, et al.
Published: (2023)
by: Zhou, Zhanhui, et al.
Published: (2023)
Your Learned Constraint is Secretly a Backward Reachable Tube
by: Qadri, Mohamad, et al.
Published: (2025)
by: Qadri, Mohamad, et al.
Published: (2025)
Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior
by: Doyle, Cooper
Published: (2025)
by: Doyle, Cooper
Published: (2025)
Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator
by: Luo, Beier, et al.
Published: (2025)
by: Luo, Beier, et al.
Published: (2025)
Your Dense Retriever is Secretly an Expeditious Reasoner
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
Self-Play Preference Optimization for Language Model Alignment
by: Wu, Yue, et al.
Published: (2024)
by: Wu, Yue, et al.
Published: (2024)
The Jailbreak Tax: How Useful are Your Jailbreak Outputs?
by: Nikolić, Kristina, et al.
Published: (2025)
by: Nikolić, Kristina, et al.
Published: (2025)
Aligning Diffusion Language Models via Unpaired Preference Optimization
by: Jindal, Vaibhav, et al.
Published: (2025)
by: Jindal, Vaibhav, et al.
Published: (2025)
Soft Preference Optimization: Aligning Language Models to Expert Distributions
by: Sharifnassab, Arsalan, et al.
Published: (2024)
by: Sharifnassab, Arsalan, et al.
Published: (2024)
DCRM: A Heuristic to Measure Response Pair Quality in Preference Optimization
by: Huang, Chengyu, et al.
Published: (2025)
by: Huang, Chengyu, et al.
Published: (2025)
Your VAR Model is Secretly an Efficient and Explainable Generative Classifier
by: Chen, Yi-Chung, et al.
Published: (2025)
by: Chen, Yi-Chung, et al.
Published: (2025)
LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation
by: Zhang, Xuan, et al.
Published: (2024)
by: Zhang, Xuan, et al.
Published: (2024)
VAGPO: Vision-augmented Asymmetric Group Preference Optimization for Graph Routing Problems
by: Liu, Shiyan, et al.
Published: (2025)
by: Liu, Shiyan, et al.
Published: (2025)
Towards Automated Machine Learning Research
by: Ardeshir, Shervin
Published: (2024)
by: Ardeshir, Shervin
Published: (2024)
MPPO: Multi Pair-wise Preference Optimization for LLMs with Arbitrary Negative Samples
by: Xie, Shuo, et al.
Published: (2024)
by: Xie, Shuo, et al.
Published: (2024)
Graph Unlearning Meets Influence-aware Negative Preference Optimization
by: Chen, Qiang, et al.
Published: (2025)
by: Chen, Qiang, et al.
Published: (2025)
Boost Your Human Image Generation Model via Direct Preference Optimization
by: Na, Sanghyeon, et al.
Published: (2024)
by: Na, Sanghyeon, et al.
Published: (2024)
Quantifying Representation Reliability in Self-Supervised Learning Models
by: Park, Young-Jin, et al.
Published: (2023)
by: Park, Young-Jin, et al.
Published: (2023)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
by: Cheng, Pengyu, et al.
Published: (2023)
by: Cheng, Pengyu, et al.
Published: (2023)
Teaching Your Models to Understand Code via Focal Preference Alignment
by: Wu, Jie, et al.
Published: (2025)
by: Wu, Jie, et al.
Published: (2025)
Graph Foundation Models: Bridging Language Model Paradigms and Graph Optimization
by: Liang, Yunhao, et al.
Published: (2025)
by: Liang, Yunhao, et al.
Published: (2025)
Scaffold-Conditioned Preference Triplets for Controllable Molecular Optimization with Large Language Models
by: Xiong, Yi, et al.
Published: (2026)
by: Xiong, Yi, et al.
Published: (2026)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
by: Zhang, Yifan, et al.
Published: (2024)
by: Zhang, Yifan, et al.
Published: (2024)
ROPO: Robust Preference Optimization for Large Language Models
by: Liang, Xize, et al.
Published: (2024)
by: Liang, Xize, et al.
Published: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
by: He, Jiafan, et al.
Published: (2024)
by: He, Jiafan, et al.
Published: (2024)
MallowsPO: Fine-Tune Your LLM with Preference Dispersions
by: Chen, Haoxian, et al.
Published: (2024)
by: Chen, Haoxian, et al.
Published: (2024)
EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization
by: Rong, Dingyi, et al.
Published: (2025)
by: Rong, Dingyi, et al.
Published: (2025)
GRPO is Secretly a Process Reward Model
by: Sullivan, Michael, et al.
Published: (2025)
by: Sullivan, Michael, et al.
Published: (2025)
Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization
by: Nguyen, Thanh Thi, et al.
Published: (2025)
by: Nguyen, Thanh Thi, et al.
Published: (2025)
Quantile Regression with Large Language Models for Price Prediction
by: Vedula, Nikhita, et al.
Published: (2025)
by: Vedula, Nikhita, et al.
Published: (2025)
How to Turn Your Knowledge Graph Embeddings into Generative Models
by: Loconte, Lorenzo, et al.
Published: (2023)
by: Loconte, Lorenzo, et al.
Published: (2023)
Lion Secretly Solves Constrained Optimization: As Lyapunov Predicts
by: Chen, Lizhang, et al.
Published: (2023)
by: Chen, Lizhang, et al.
Published: (2023)
Adversarial Curriculum Graph Contrastive Learning with Pair-wise Augmentation
by: Zhao, Xinjian, et al.
Published: (2024)
by: Zhao, Xinjian, et al.
Published: (2024)
Similar Items
-
Learning to Staff: Offline Reinforcement Learning and Fine-Tuned LLMs for Warehouse Staffing Optimization
by: Kujanpää, Kalle, et al.
Published: (2026) -
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
by: Rafailov, Rafael, et al.
Published: (2023) -
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
by: Kallus, Nathan
Published: (2025) -
LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions
by: Sun, Chuanneng, et al.
Published: (2024) -
Large Language Model is Secretly a Protein Sequence Optimizer
by: Wang, Yinkai, et al.
Published: (2025)