MAVIS: Multi-Objective Alignment via Inference-Time Value-Guided Selection
Fuente:
arXiv
Saved in:
| Main Authors: | Carleton, Jeremy, Mukherjee, Debajoy, Shakkottai, Srinivas, Kalathil, Dileep |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Federated Ensemble-Directed Offline Reinforcement Learning
by: Rengarajan, Desik, et al.
Published: (2023)
by: Rengarajan, Desik, et al.
Published: (2023)
DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback
by: Xiong, Guojun, et al.
Published: (2024)
by: Xiong, Guojun, et al.
Published: (2024)
GSpaRC: Gaussian Splatting for Real-time Reconstruction of RF Channels
by: Nukapotula, Bhavya Sai, et al.
Published: (2025)
by: Nukapotula, Bhavya Sai, et al.
Published: (2025)
PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
by: Bobbili, Sarat Chandra, et al.
Published: (2025)
by: Bobbili, Sarat Chandra, et al.
Published: (2025)
Structured Reinforcement Learning for Media Streaming at the Wireless Edge
by: Bura, Archana, et al.
Published: (2024)
by: Bura, Archana, et al.
Published: (2024)
Transformers are Provably Optimal In-context Estimators for Wireless Communications
by: Kunde, Vishnu Teja, et al.
Published: (2023)
by: Kunde, Vishnu Teja, et al.
Published: (2023)
Risk-Averse Finetuning of Large Language Models
by: Chaudhary, Sapana, et al.
Published: (2025)
by: Chaudhary, Sapana, et al.
Published: (2025)
CONGO: Compressive Online Gradient Optimization
by: Carleton, Jeremy, et al.
Published: (2024)
by: Carleton, Jeremy, et al.
Published: (2024)
Robust LLM Alignment via Distributionally Robust Direct Preference Optimization
by: Xu, Zaiyan, et al.
Published: (2025)
by: Xu, Zaiyan, et al.
Published: (2025)
Adaptive Outer-Loop Control of Quadrotors via Reinforcement Learning
by: Saj, Vishnu, et al.
Published: (2026)
by: Saj, Vishnu, et al.
Published: (2026)
PowerMamba: A Deep State Space Model and Comprehensive Benchmark for Time Series Prediction in Electric Power Systems
by: Menati, Ali, et al.
Published: (2024)
by: Menati, Ali, et al.
Published: (2024)
Inference-Time Search Using Side Information for Diffusion-Based Image Reconstruction
by: Farahbakhsh, Mahdi, et al.
Published: (2025)
by: Farahbakhsh, Mahdi, et al.
Published: (2025)
Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages
by: Kunde, Vishnu Teja, et al.
Published: (2026)
by: Kunde, Vishnu Teja, et al.
Published: (2026)
AttackGNN: Red-Teaming GNNs in Hardware Security Using Reinforcement Learning
by: Gohil, Vasudev, et al.
Published: (2024)
by: Gohil, Vasudev, et al.
Published: (2024)
MODE: Multi-Objective Adaptive Coreset Selection
by: Mukherjee, Tanmoy, et al.
Published: (2025)
by: Mukherjee, Tanmoy, et al.
Published: (2025)
Off-Policy Evaluation Using Information Borrowing and Context-Based Switching
by: Dasgupta, Sutanoy, et al.
Published: (2021)
by: Dasgupta, Sutanoy, et al.
Published: (2021)
Multi-Objective Alignment of Large Language Models Through Hypervolume Maximization
by: Mukherjee, Subhojyoti, et al.
Published: (2024)
by: Mukherjee, Subhojyoti, et al.
Published: (2024)
Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models
by: Cheng, Min, et al.
Published: (2025)
by: Cheng, Min, et al.
Published: (2025)
In-Context Learning for Gradient-Free Receiver Adaptation: Principles, Applications, and Theory
by: Zecchin, Matteo, et al.
Published: (2025)
by: Zecchin, Matteo, et al.
Published: (2025)
Uncovering Cross-Objective Interference in Multi-Objective Alignment
by: Lu, Yining, et al.
Published: (2026)
by: Lu, Yining, et al.
Published: (2026)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
by: Lin, Baijiong, et al.
Published: (2025)
by: Lin, Baijiong, et al.
Published: (2025)
Optimistic World Models: Efficient Exploration in Model-Based Deep Reinforcement Learning
by: Mete, Akshay, et al.
Published: (2026)
by: Mete, Akshay, et al.
Published: (2026)
VC-Soup: Value-Consistency Guided Multi-Value Alignment for Large Language Models
by: Xu, Hefei, et al.
Published: (2026)
by: Xu, Hefei, et al.
Published: (2026)
Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation
by: Xu, Hefei, et al.
Published: (2025)
by: Xu, Hefei, et al.
Published: (2025)
Decoding-Time Language Model Alignment with Multiple Objectives
by: Shi, Ruizhe, et al.
Published: (2024)
by: Shi, Ruizhe, et al.
Published: (2024)
Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
by: Geuter, Jonathan, et al.
Published: (2025)
by: Geuter, Jonathan, et al.
Published: (2025)
Inference-Time Alignment of Diffusion Models via Evolutionary Algorithms
by: Jajal, Purvish, et al.
Published: (2025)
by: Jajal, Purvish, et al.
Published: (2025)
Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment
by: Yuan, Kai, et al.
Published: (2026)
by: Yuan, Kai, et al.
Published: (2026)
ROMA-iQSS: An Objective Alignment Approach via State-Based Value Learning and ROund-Robin Multi-Agent Scheduling
by: Lin, Chi-Hui, et al.
Published: (2024)
by: Lin, Chi-Hui, et al.
Published: (2024)
RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design
by: Kshirsagar, Meghana, et al.
Published: (2026)
by: Kshirsagar, Meghana, et al.
Published: (2026)
Entropy Aware Reward Guidance for Diffusion Language Model Alignment
by: Tejaswi, Atula, et al.
Published: (2026)
by: Tejaswi, Atula, et al.
Published: (2026)
VISPA: Pluralistic Alignment via Automatic Value Selection and Activation
by: Zheng, Shenyan, et al.
Published: (2026)
by: Zheng, Shenyan, et al.
Published: (2026)
Robust Multi-Objective Preference Alignment with Online DPO
by: Gupta, Raghav, et al.
Published: (2025)
by: Gupta, Raghav, et al.
Published: (2025)
Nudging: Inference-time Alignment of LLMs via Guided Decoding
by: Fei, Yu, et al.
Published: (2024)
by: Fei, Yu, et al.
Published: (2024)
Multi-Objective Alignment of Language Models for Personalized Psychotherapy
by: Beikzadeh, Mehrab, et al.
Published: (2026)
by: Beikzadeh, Mehrab, et al.
Published: (2026)
Multi-Objective Preference Optimization: Improving Human Alignment of Generative Models
by: Agnihotri, Akhil, et al.
Published: (2025)
by: Agnihotri, Akhil, et al.
Published: (2025)
Multi-Objective Hyperparameter Selection via Hypothesis Testing on Reliability Graphs
by: Farzaneh, Amirmohammad, et al.
Published: (2025)
by: Farzaneh, Amirmohammad, et al.
Published: (2025)
Optimizing Language Models for Inference Time Objectives using Reinforcement Learning
by: Tang, Yunhao, et al.
Published: (2025)
by: Tang, Yunhao, et al.
Published: (2025)
Provable Multi-Task Representation Learning by Two-Layer ReLU Neural Networks
by: Collins, Liam, et al.
Published: (2023)
by: Collins, Liam, et al.
Published: (2023)
Pareto Multi-Objective Alignment for Language Models
by: He, Qiang, et al.
Published: (2025)
by: He, Qiang, et al.
Published: (2025)
Similar Items
-
Federated Ensemble-Directed Offline Reinforcement Learning
by: Rengarajan, Desik, et al.
Published: (2023) -
DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback
by: Xiong, Guojun, et al.
Published: (2024) -
GSpaRC: Gaussian Splatting for Real-time Reconstruction of RF Channels
by: Nukapotula, Bhavya Sai, et al.
Published: (2025) -
PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
by: Bobbili, Sarat Chandra, et al.
Published: (2025) -
Structured Reinforcement Learning for Media Streaming at the Wireless Edge
by: Bura, Archana, et al.
Published: (2024)