MIRA: Towards Mitigating Reward Hacking in Inference-Time Alignment of T2I Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhai, Kevin, Singh, Utsav, Thatipelli, Anirudh, Chakraborty, Souradip, Sahu, Anit Kumar, Huang, Furong, Bedi, Amrit Singh, Shah, Mubarak |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
di: Beetham, James, et al.
Pubblicazione: (2024)
di: Beetham, James, et al.
Pubblicazione: (2024)
RL with Learnable Textual Feedback: A Bilevel Approach
di: Singh, Utsav, et al.
Pubblicazione: (2026)
di: Singh, Utsav, et al.
Pubblicazione: (2026)
Towards Realistic Mechanisms That Incentivize Federated Participation and Contribution
di: Bornstein, Marco, et al.
Pubblicazione: (2023)
di: Bornstein, Marco, et al.
Pubblicazione: (2023)
Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
di: Singh, Utsav, et al.
Pubblicazione: (2024)
di: Singh, Utsav, et al.
Pubblicazione: (2024)
Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
di: Lee, Jihoon, et al.
Pubblicazione: (2025)
di: Lee, Jihoon, et al.
Pubblicazione: (2025)
Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2023)
Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2026)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2026)
Transfer Q Star: Principled Decoding for LLM Alignment
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training
di: Barakat, Anas, et al.
Pubblicazione: (2026)
di: Barakat, Anas, et al.
Pubblicazione: (2026)
Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time
di: Chehade, Mohamad, et al.
Pubblicazione: (2025)
di: Chehade, Mohamad, et al.
Pubblicazione: (2025)
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
DIPPER: Direct Preference Optimization to Accelerate Primitive-Enabled Hierarchical Reinforcement Learning
di: Singh, Utsav, et al.
Pubblicazione: (2024)
di: Singh, Utsav, et al.
Pubblicazione: (2024)
BalancedDPO: Adaptive Multi-Metric Alignment
di: Tamboli, Dipesh, et al.
Pubblicazione: (2025)
di: Tamboli, Dipesh, et al.
Pubblicazione: (2025)
SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge
di: Yousaf, Adeel, et al.
Pubblicazione: (2025)
di: Yousaf, Adeel, et al.
Pubblicazione: (2025)
Leveraging Pre-Trained Visual Models for AI-Generated Video Detection
di: Veeramachaneni, Keerthi, et al.
Pubblicazione: (2025)
di: Veeramachaneni, Keerthi, et al.
Pubblicazione: (2025)
Align-Pro: A Principled Approach to Prompt Optimization for LLM Alignment
di: Trivedi, Prashant, et al.
Pubblicazione: (2025)
di: Trivedi, Prashant, et al.
Pubblicazione: (2025)
On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning
di: Barakat, Anas, et al.
Pubblicazione: (2024)
di: Barakat, Anas, et al.
Pubblicazione: (2024)
Beyond Text: Utilizing Vocal Cues to Improve Decision Making in LLMs for Robot Navigation Tasks
di: Sun, Xingpeng, et al.
Pubblicazione: (2024)
di: Sun, Xingpeng, et al.
Pubblicazione: (2024)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
di: Ding, Mucong, et al.
Pubblicazione: (2024)
di: Ding, Mucong, et al.
Pubblicazione: (2024)
On The Sample Complexity Bounds In Bilevel Reinforcement Learning
di: Gaur, Mudit, et al.
Pubblicazione: (2025)
di: Gaur, Mudit, et al.
Pubblicazione: (2025)
PROPS: Progressively Private Self-alignment of Large Language Models
di: Teku, Noel, et al.
Pubblicazione: (2025)
di: Teku, Noel, et al.
Pubblicazione: (2025)
FACT or Fiction: Can Truthful Mechanisms Eliminate Federated Free Riding?
di: Bornstein, Marco, et al.
Pubblicazione: (2024)
di: Bornstein, Marco, et al.
Pubblicazione: (2024)
VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences
di: Singh, Anukriti, et al.
Pubblicazione: (2025)
di: Singh, Anukriti, et al.
Pubblicazione: (2025)
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2025)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2025)
AI Cap-and-Trade: Efficiency Incentives for Accessibility and Sustainability
di: Bornstein, Marco, et al.
Pubblicazione: (2026)
di: Bornstein, Marco, et al.
Pubblicazione: (2026)
A lift for input-convex neural network training
di: Siahkoohi, Ali, et al.
Pubblicazione: (2026)
di: Siahkoohi, Ali, et al.
Pubblicazione: (2026)
Hypernetwork-based approach for grid-independent functional data clustering
di: Thatipelli, Anirudh, et al.
Pubblicazione: (2026)
di: Thatipelli, Anirudh, et al.
Pubblicazione: (2026)
PIPER: Primitive-Informed Preference-based Hierarchical Reinforcement Learning via Hindsight Relabeling
di: Singh, Utsav, et al.
Pubblicazione: (2024)
di: Singh, Utsav, et al.
Pubblicazione: (2024)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
di: Wang, Ye, et al.
Pubblicazione: (2026)
di: Wang, Ye, et al.
Pubblicazione: (2026)
Dystruct: Dynamically Structured Diffusion Language Model Decoding via Bayesian Inference
di: Sun, Bian, et al.
Pubblicazione: (2026)
di: Sun, Bian, et al.
Pubblicazione: (2026)
On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows
di: Chakraborty, Souradip, et al.
Pubblicazione: (2025)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2025)
Achieving Zero Constraint Violation for Constrained Reinforcement Learning via Conservative Natural Policy Gradient Primal-Dual Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2022)
di: Bai, Qinbo, et al.
Pubblicazione: (2022)
Auction-Based Regulation for Artificial Intelligence
di: Bornstein, Marco, et al.
Pubblicazione: (2024)
di: Bornstein, Marco, et al.
Pubblicazione: (2024)
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
di: Deng, Wenlong, et al.
Pubblicazione: (2026)
di: Deng, Wenlong, et al.
Pubblicazione: (2026)
Reward Shaping to Mitigate Reward Hacking in RLHF
di: Fu, Jiayi, et al.
Pubblicazione: (2025)
di: Fu, Jiayi, et al.
Pubblicazione: (2025)
On the Vulnerability of LLM/VLM-Controlled Robotics
di: Wu, Xiyang, et al.
Pubblicazione: (2024)
di: Wu, Xiyang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds
di: Beetham, James, et al.
Pubblicazione: (2024) -
RL with Learnable Textual Feedback: A Bilevel Approach
di: Singh, Utsav, et al.
Pubblicazione: (2026) -
Towards Realistic Mechanisms That Incentivize Federated Participation and Contribution
di: Bornstein, Marco, et al.
Pubblicazione: (2023) -
Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
di: Singh, Utsav, et al.
Pubblicazione: (2024) -
Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
di: Lee, Jihoon, et al.
Pubblicazione: (2025)