Gespeichert in:
| Hauptverfasser: | Liu, Ning, Sun, Chuanneng, Klinkner, Kristina, Malmasi, Shervin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2605.08037 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Learning to Staff: Offline Reinforcement Learning and Fine-Tuned LLMs for Warehouse Staffing Optimization
von: Kujanpää, Kalle, et al.
Veröffentlicht: (2026)
von: Kujanpää, Kalle, et al.
Veröffentlicht: (2026)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023)
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023)
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
von: Kallus, Nathan
Veröffentlicht: (2025)
von: Kallus, Nathan
Veröffentlicht: (2025)
LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions
von: Sun, Chuanneng, et al.
Veröffentlicht: (2024)
von: Sun, Chuanneng, et al.
Veröffentlicht: (2024)
Large Language Model is Secretly a Protein Sequence Optimizer
von: Wang, Yinkai, et al.
Veröffentlicht: (2025)
von: Wang, Yinkai, et al.
Veröffentlicht: (2025)
Your Transformer is Secretly Linear
von: Razzhigaev, Anton, et al.
Veröffentlicht: (2024)
von: Razzhigaev, Anton, et al.
Veröffentlicht: (2024)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
von: Xu, Wenzhe, et al.
Veröffentlicht: (2026)
von: Xu, Wenzhe, et al.
Veröffentlicht: (2026)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023)
Your Learned Constraint is Secretly a Backward Reachable Tube
von: Qadri, Mohamad, et al.
Veröffentlicht: (2025)
von: Qadri, Mohamad, et al.
Veröffentlicht: (2025)
Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior
von: Doyle, Cooper
Veröffentlicht: (2025)
von: Doyle, Cooper
Veröffentlicht: (2025)
Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator
von: Luo, Beier, et al.
Veröffentlicht: (2025)
von: Luo, Beier, et al.
Veröffentlicht: (2025)
Your Dense Retriever is Secretly an Expeditious Reasoner
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
Self-Play Preference Optimization for Language Model Alignment
von: Wu, Yue, et al.
Veröffentlicht: (2024)
von: Wu, Yue, et al.
Veröffentlicht: (2024)
The Jailbreak Tax: How Useful are Your Jailbreak Outputs?
von: Nikolić, Kristina, et al.
Veröffentlicht: (2025)
von: Nikolić, Kristina, et al.
Veröffentlicht: (2025)
Aligning Diffusion Language Models via Unpaired Preference Optimization
von: Jindal, Vaibhav, et al.
Veröffentlicht: (2025)
von: Jindal, Vaibhav, et al.
Veröffentlicht: (2025)
Soft Preference Optimization: Aligning Language Models to Expert Distributions
von: Sharifnassab, Arsalan, et al.
Veröffentlicht: (2024)
von: Sharifnassab, Arsalan, et al.
Veröffentlicht: (2024)
DCRM: A Heuristic to Measure Response Pair Quality in Preference Optimization
von: Huang, Chengyu, et al.
Veröffentlicht: (2025)
von: Huang, Chengyu, et al.
Veröffentlicht: (2025)
Your VAR Model is Secretly an Efficient and Explainable Generative Classifier
von: Chen, Yi-Chung, et al.
Veröffentlicht: (2025)
von: Chen, Yi-Chung, et al.
Veröffentlicht: (2025)
LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation
von: Zhang, Xuan, et al.
Veröffentlicht: (2024)
von: Zhang, Xuan, et al.
Veröffentlicht: (2024)
VAGPO: Vision-augmented Asymmetric Group Preference Optimization for Graph Routing Problems
von: Liu, Shiyan, et al.
Veröffentlicht: (2025)
von: Liu, Shiyan, et al.
Veröffentlicht: (2025)
Towards Automated Machine Learning Research
von: Ardeshir, Shervin
Veröffentlicht: (2024)
von: Ardeshir, Shervin
Veröffentlicht: (2024)
MPPO: Multi Pair-wise Preference Optimization for LLMs with Arbitrary Negative Samples
von: Xie, Shuo, et al.
Veröffentlicht: (2024)
von: Xie, Shuo, et al.
Veröffentlicht: (2024)
Graph Unlearning Meets Influence-aware Negative Preference Optimization
von: Chen, Qiang, et al.
Veröffentlicht: (2025)
von: Chen, Qiang, et al.
Veröffentlicht: (2025)
Boost Your Human Image Generation Model via Direct Preference Optimization
von: Na, Sanghyeon, et al.
Veröffentlicht: (2024)
von: Na, Sanghyeon, et al.
Veröffentlicht: (2024)
Quantifying Representation Reliability in Self-Supervised Learning Models
von: Park, Young-Jin, et al.
Veröffentlicht: (2023)
von: Park, Young-Jin, et al.
Veröffentlicht: (2023)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
von: Cheng, Pengyu, et al.
Veröffentlicht: (2023)
von: Cheng, Pengyu, et al.
Veröffentlicht: (2023)
Teaching Your Models to Understand Code via Focal Preference Alignment
von: Wu, Jie, et al.
Veröffentlicht: (2025)
von: Wu, Jie, et al.
Veröffentlicht: (2025)
Graph Foundation Models: Bridging Language Model Paradigms and Graph Optimization
von: Liang, Yunhao, et al.
Veröffentlicht: (2025)
von: Liang, Yunhao, et al.
Veröffentlicht: (2025)
Scaffold-Conditioned Preference Triplets for Controllable Molecular Optimization with Large Language Models
von: Xiong, Yi, et al.
Veröffentlicht: (2026)
von: Xiong, Yi, et al.
Veröffentlicht: (2026)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
von: Zhang, Yifan, et al.
Veröffentlicht: (2024)
von: Zhang, Yifan, et al.
Veröffentlicht: (2024)
ROPO: Robust Preference Optimization for Large Language Models
von: Liang, Xize, et al.
Veröffentlicht: (2024)
von: Liang, Xize, et al.
Veröffentlicht: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
von: He, Jiafan, et al.
Veröffentlicht: (2024)
von: He, Jiafan, et al.
Veröffentlicht: (2024)
MallowsPO: Fine-Tune Your LLM with Preference Dispersions
von: Chen, Haoxian, et al.
Veröffentlicht: (2024)
von: Chen, Haoxian, et al.
Veröffentlicht: (2024)
EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization
von: Rong, Dingyi, et al.
Veröffentlicht: (2025)
von: Rong, Dingyi, et al.
Veröffentlicht: (2025)
GRPO is Secretly a Process Reward Model
von: Sullivan, Michael, et al.
Veröffentlicht: (2025)
von: Sullivan, Michael, et al.
Veröffentlicht: (2025)
Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization
von: Nguyen, Thanh Thi, et al.
Veröffentlicht: (2025)
von: Nguyen, Thanh Thi, et al.
Veröffentlicht: (2025)
Quantile Regression with Large Language Models for Price Prediction
von: Vedula, Nikhita, et al.
Veröffentlicht: (2025)
von: Vedula, Nikhita, et al.
Veröffentlicht: (2025)
How to Turn Your Knowledge Graph Embeddings into Generative Models
von: Loconte, Lorenzo, et al.
Veröffentlicht: (2023)
von: Loconte, Lorenzo, et al.
Veröffentlicht: (2023)
Lion Secretly Solves Constrained Optimization: As Lyapunov Predicts
von: Chen, Lizhang, et al.
Veröffentlicht: (2023)
von: Chen, Lizhang, et al.
Veröffentlicht: (2023)
Adversarial Curriculum Graph Contrastive Learning with Pair-wise Augmentation
von: Zhao, Xinjian, et al.
Veröffentlicht: (2024)
von: Zhao, Xinjian, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Learning to Staff: Offline Reinforcement Learning and Fine-Tuned LLMs for Warehouse Staffing Optimization
von: Kujanpää, Kalle, et al.
Veröffentlicht: (2026) -
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023) -
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
von: Kallus, Nathan
Veröffentlicht: (2025) -
LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions
von: Sun, Chuanneng, et al.
Veröffentlicht: (2024) -
Large Language Model is Secretly a Protein Sequence Optimizer
von: Wang, Yinkai, et al.
Veröffentlicht: (2025)