MIRA: Towards Mitigating Reward Hacking in Inference-Time Alignment of T2I Diffusion Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhai, Kevin, Singh, Utsav, Thatipelli, Anirudh, Chakraborty, Souradip, Sahu, Anit Kumar, Huang, Furong, Bedi, Amrit Singh, Shah, Mubarak |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
par: Beetham, James, et autres
Publié: (2024)
par: Beetham, James, et autres
Publié: (2024)
RL with Learnable Textual Feedback: A Bilevel Approach
par: Singh, Utsav, et autres
Publié: (2026)
par: Singh, Utsav, et autres
Publié: (2026)
Towards Realistic Mechanisms That Incentivize Federated Participation and Contribution
par: Bornstein, Marco, et autres
Publié: (2023)
par: Bornstein, Marco, et autres
Publié: (2023)
Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
par: Singh, Utsav, et autres
Publié: (2024)
par: Singh, Utsav, et autres
Publié: (2024)
Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
par: Lee, Jihoon, et autres
Publié: (2025)
par: Lee, Jihoon, et autres
Publié: (2025)
Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems
par: Agrawal, Aakriti, et autres
Publié: (2025)
par: Agrawal, Aakriti, et autres
Publié: (2025)
PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback
par: Chakraborty, Souradip, et autres
Publié: (2023)
par: Chakraborty, Souradip, et autres
Publié: (2023)
REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback
par: Chakraborty, Souradip, et autres
Publié: (2023)
par: Chakraborty, Souradip, et autres
Publié: (2023)
Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away
par: Ghosal, Soumya Suvra, et autres
Publié: (2026)
par: Ghosal, Soumya Suvra, et autres
Publié: (2026)
Transfer Q Star: Principled Decoding for LLM Alignment
par: Chakraborty, Souradip, et autres
Publié: (2024)
par: Chakraborty, Souradip, et autres
Publié: (2024)
Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training
par: Barakat, Anas, et autres
Publié: (2026)
par: Barakat, Anas, et autres
Publié: (2026)
Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time
par: Chehade, Mohamad, et autres
Publié: (2025)
par: Chehade, Mohamad, et autres
Publié: (2025)
MaxMin-RLHF: Alignment with Diverse Human Preferences
par: Chakraborty, Souradip, et autres
Publié: (2024)
par: Chakraborty, Souradip, et autres
Publié: (2024)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
par: Ghosal, Soumya Suvra, et autres
Publié: (2024)
par: Ghosal, Soumya Suvra, et autres
Publié: (2024)
DIPPER: Direct Preference Optimization to Accelerate Primitive-Enabled Hierarchical Reinforcement Learning
par: Singh, Utsav, et autres
Publié: (2024)
par: Singh, Utsav, et autres
Publié: (2024)
BalancedDPO: Adaptive Multi-Metric Alignment
par: Tamboli, Dipesh, et autres
Publié: (2025)
par: Tamboli, Dipesh, et autres
Publié: (2025)
SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge
par: Yousaf, Adeel, et autres
Publié: (2025)
par: Yousaf, Adeel, et autres
Publié: (2025)
Leveraging Pre-Trained Visual Models for AI-Generated Video Detection
par: Veeramachaneni, Keerthi, et autres
Publié: (2025)
par: Veeramachaneni, Keerthi, et autres
Publié: (2025)
Align-Pro: A Principled Approach to Prompt Optimization for LLM Alignment
par: Trivedi, Prashant, et autres
Publié: (2025)
par: Trivedi, Prashant, et autres
Publié: (2025)
On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning
par: Barakat, Anas, et autres
Publié: (2024)
par: Barakat, Anas, et autres
Publié: (2024)
Beyond Text: Utilizing Vocal Cues to Improve Decision Making in LLMs for Robot Navigation Tasks
par: Sun, Xingpeng, et autres
Publié: (2024)
par: Sun, Xingpeng, et autres
Publié: (2024)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
par: Patel, Bhrij, et autres
Publié: (2024)
par: Patel, Bhrij, et autres
Publié: (2024)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
par: Ding, Mucong, et autres
Publié: (2024)
par: Ding, Mucong, et autres
Publié: (2024)
On The Sample Complexity Bounds In Bilevel Reinforcement Learning
par: Gaur, Mudit, et autres
Publié: (2025)
par: Gaur, Mudit, et autres
Publié: (2025)
PROPS: Progressively Private Self-alignment of Large Language Models
par: Teku, Noel, et autres
Publié: (2025)
par: Teku, Noel, et autres
Publié: (2025)
FACT or Fiction: Can Truthful Mechanisms Eliminate Federated Free Riding?
par: Bornstein, Marco, et autres
Publié: (2024)
par: Bornstein, Marco, et autres
Publié: (2024)
VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences
par: Singh, Anukriti, et autres
Publié: (2025)
par: Singh, Anukriti, et autres
Publié: (2025)
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
par: Ghosal, Soumya Suvra, et autres
Publié: (2025)
par: Ghosal, Soumya Suvra, et autres
Publié: (2025)
AI Cap-and-Trade: Efficiency Incentives for Accessibility and Sustainability
par: Bornstein, Marco, et autres
Publié: (2026)
par: Bornstein, Marco, et autres
Publié: (2026)
A lift for input-convex neural network training
par: Siahkoohi, Ali, et autres
Publié: (2026)
par: Siahkoohi, Ali, et autres
Publié: (2026)
Hypernetwork-based approach for grid-independent functional data clustering
par: Thatipelli, Anirudh, et autres
Publié: (2026)
par: Thatipelli, Anirudh, et autres
Publié: (2026)
PIPER: Primitive-Informed Preference-based Hierarchical Reinforcement Learning via Hindsight Relabeling
par: Singh, Utsav, et autres
Publié: (2024)
par: Singh, Utsav, et autres
Publié: (2024)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
par: Wang, Ye, et autres
Publié: (2026)
par: Wang, Ye, et autres
Publié: (2026)
Dystruct: Dynamically Structured Diffusion Language Model Decoding via Bayesian Inference
par: Sun, Bian, et autres
Publié: (2026)
par: Sun, Bian, et autres
Publié: (2026)
On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows
par: Chakraborty, Souradip, et autres
Publié: (2025)
par: Chakraborty, Souradip, et autres
Publié: (2025)
Achieving Zero Constraint Violation for Constrained Reinforcement Learning via Conservative Natural Policy Gradient Primal-Dual Algorithm
par: Bai, Qinbo, et autres
Publié: (2022)
par: Bai, Qinbo, et autres
Publié: (2022)
Auction-Based Regulation for Artificial Intelligence
par: Bornstein, Marco, et autres
Publié: (2024)
par: Bornstein, Marco, et autres
Publié: (2024)
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
par: Deng, Wenlong, et autres
Publié: (2026)
par: Deng, Wenlong, et autres
Publié: (2026)
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025)
par: Fu, Jiayi, et autres
Publié: (2025)
On the Vulnerability of LLM/VLM-Controlled Robotics
par: Wu, Xiyang, et autres
Publié: (2024)
par: Wu, Xiyang, et autres
Publié: (2024)
Documents similaires
-
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
par: Beetham, James, et autres
Publié: (2024) -
RL with Learnable Textual Feedback: A Bilevel Approach
par: Singh, Utsav, et autres
Publié: (2026) -
Towards Realistic Mechanisms That Incentivize Federated Participation and Contribution
par: Bornstein, Marco, et autres
Publié: (2023) -
Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
par: Singh, Utsav, et autres
Publié: (2024) -
Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
par: Lee, Jihoon, et autres
Publié: (2025)