Robust Multi-Objective Controlled Decoding of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Son, Seongho, Bankes, William, Yoon, Sangwoong, Ramesh, Shyam Sundhar, Tang, Xiaohang, Bogunovic, Ilija |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RSPO: Regularized Self-Play Alignment of Large Language Models
par: Tang, Xiaohang, et autres
Publié: (2025)
par: Tang, Xiaohang, et autres
Publié: (2025)
LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?
par: Ziomek, Juliusz, et autres
Publié: (2026)
par: Ziomek, Juliusz, et autres
Publié: (2026)
wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models
par: Tang, Xiaohang, et autres
Publié: (2025)
par: Tang, Xiaohang, et autres
Publié: (2025)
Distributionally Robust Model-based Reinforcement Learning with Large State Spaces
par: Ramesh, Shyam Sundhar, et autres
Publié: (2023)
par: Ramesh, Shyam Sundhar, et autres
Publié: (2023)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
par: Tang, Xiaohang, et autres
Publié: (2026)
par: Tang, Xiaohang, et autres
Publié: (2026)
Adversarially Robust Decision Transformer
par: Tang, Xiaohang, et autres
Publié: (2024)
par: Tang, Xiaohang, et autres
Publié: (2024)
This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs
par: Wolf, Lorenz, et autres
Publié: (2025)
par: Wolf, Lorenz, et autres
Publié: (2025)
Right Now, Wrong Then: Non-Stationary Direct Preference Optimization under Preference Drift
par: Son, Seongho, et autres
Publié: (2024)
par: Son, Seongho, et autres
Publié: (2024)
REDUCR: Robust Data Downsampling Using Class Priority Reweighting
par: Bankes, William, et autres
Publié: (2023)
par: Bankes, William, et autres
Publié: (2023)
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
par: Ji, Xiaotong, et autres
Publié: (2025)
par: Ji, Xiaotong, et autres
Publié: (2025)
Overton Pluralistic Reinforcement Learning for Large Language Models
par: Fu, Yu, et autres
Publié: (2026)
par: Fu, Yu, et autres
Publié: (2026)
Group Robust Preference Optimization in Reward-free RLHF
par: Ramesh, Shyam Sundhar, et autres
Publié: (2024)
par: Ramesh, Shyam Sundhar, et autres
Publié: (2024)
PROWL: Prioritized Regret-Driven Optimization for World Model Learning
par: Güzel, Ahmet H., et autres
Publié: (2026)
par: Güzel, Ahmet H., et autres
Publié: (2026)
Maximum Entropy Inverse Reinforcement Learning of Diffusion Models with Energy-Based Models
par: Yoon, Sangwoong, et autres
Publié: (2024)
par: Yoon, Sangwoong, et autres
Publié: (2024)
Multi-level Diagnosis and Evaluation for Robust Tabular Feature Engineering with Large Language Models
par: Lim, Yebin, et autres
Publié: (2025)
par: Lim, Yebin, et autres
Publié: (2025)
Synthetic Data is Sufficient for Zero-Shot Visual Generalization from Offline Data
par: Güzel, Ahmet H., et autres
Publié: (2025)
par: Güzel, Ahmet H., et autres
Publié: (2025)
LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations
par: Lugoloobi, William, et autres
Publié: (2026)
par: Lugoloobi, William, et autres
Publié: (2026)
Multi-Objective Large Language Model Unlearning
par: Pan, Zibin, et autres
Publié: (2024)
par: Pan, Zibin, et autres
Publié: (2024)
MATE: Solving Contextual Markov Decision Processes with Memory of Accumulated Transition Embeddings
par: Hwang, Himchan, et autres
Publié: (2026)
par: Hwang, Himchan, et autres
Publié: (2026)
One Model for All: Multi-Objective Controllable Language Models
par: He, Qiang, et autres
Publié: (2026)
par: He, Qiang, et autres
Publié: (2026)
Robust Bayesian Optimisation with Unbounded Corruptions
par: Ezzerg, Abdelhamid, et autres
Publié: (2025)
par: Ezzerg, Abdelhamid, et autres
Publié: (2025)
Robust Counterfactual Explanations under Model Multiplicity Using Multi-Objective Optimization
par: Kinjo, Keita
Publié: (2025)
par: Kinjo, Keita
Publié: (2025)
DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models
par: Chuang, Yung-Sung, et autres
Publié: (2023)
par: Chuang, Yung-Sung, et autres
Publié: (2023)
Imagined Autocurricula
par: Güzel, Ahmet H., et autres
Publié: (2025)
par: Güzel, Ahmet H., et autres
Publié: (2025)
Sample Efficient Preference Alignment in LLMs via Active Exploration
par: Mehta, Viraj, et autres
Publié: (2023)
par: Mehta, Viraj, et autres
Publié: (2023)
On the Robustness of Reward Models for Language Model Alignment
par: Hong, Jiwoo, et autres
Publié: (2025)
par: Hong, Jiwoo, et autres
Publié: (2025)
Expensive Multi-Objective Bayesian Optimization Based on Diffusion Models
par: Li, Bingdong, et autres
Publié: (2024)
par: Li, Bingdong, et autres
Publié: (2024)
Pareto Multi-Objective Alignment for Language Models
par: He, Qiang, et autres
Publié: (2025)
par: He, Qiang, et autres
Publié: (2025)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
par: Li, Chengao, et autres
Publié: (2025)
par: Li, Chengao, et autres
Publié: (2025)
Controlled Decoding from Language Models
par: Mudgal, Sidharth, et autres
Publié: (2023)
par: Mudgal, Sidharth, et autres
Publié: (2023)
Learning on Graphs with Large Language Models(LLMs): A Deep Dive into Model Robustness
par: Guo, Kai, et autres
Publié: (2024)
par: Guo, Kai, et autres
Publié: (2024)
Revisiting Service Level Objectives and System Level Metrics in Large Language Model Serving
par: Wang, Zhibin, et autres
Publié: (2024)
par: Wang, Zhibin, et autres
Publié: (2024)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
par: Park, Jungwoo, et autres
Publié: (2025)
par: Park, Jungwoo, et autres
Publié: (2025)
Decoding Human Emotions: Analyzing Multi-Channel EEG Data using LSTM Networks
par: Sateesh, Shyam K, et autres
Publié: (2024)
par: Sateesh, Shyam K, et autres
Publié: (2024)
Doubly Robust Alignment for Large Language Models
par: Xu, Erhan, et autres
Publié: (2025)
par: Xu, Erhan, et autres
Publié: (2025)
On Speculative Decoding for Multimodal Large Language Models
par: Gagrani, Mukul, et autres
Publié: (2024)
par: Gagrani, Mukul, et autres
Publié: (2024)
KEEC: Koopman Embedded Equivariant Control
par: Cheng, Xiaoyuan, et autres
Publié: (2023)
par: Cheng, Xiaoyuan, et autres
Publié: (2023)
Entity-level Factual Adaptiveness of Fine-tuning based Abstractive Summarization Models
par: Song, Jongyoon, et autres
Publié: (2024)
par: Song, Jongyoon, et autres
Publié: (2024)
LauraTSE: Target Speaker Extraction using Auto-Regressive Decoder-Only Language Models
par: Tang, Beilong, et autres
Publié: (2025)
par: Tang, Beilong, et autres
Publié: (2025)
Documents similaires
-
RSPO: Regularized Self-Play Alignment of Large Language Models
par: Tang, Xiaohang, et autres
Publié: (2025) -
LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?
par: Ziomek, Juliusz, et autres
Publié: (2026) -
wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models
par: Tang, Xiaohang, et autres
Publié: (2025) -
Distributionally Robust Model-based Reinforcement Learning with Large State Spaces
par: Ramesh, Shyam Sundhar, et autres
Publié: (2023) -
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)