Robust Reward Alignment via Hypothesis Space Batch Cutting
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Zhixian, Zhang, Haode, Feng, Yizhe, Jin, Wanxin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RoDiF: Robust Direct Fine-Tuning of Diffusion Policies with Corrupted Human Feedback
di: Vatsa, Amitesh, et al.
Pubblicazione: (2026)
di: Vatsa, Amitesh, et al.
Pubblicazione: (2026)
Online Distributionally Robust LLM Alignment via Regression to Relative Reward
di: Sahu, Sharan, et al.
Pubblicazione: (2025)
di: Sahu, Sharan, et al.
Pubblicazione: (2025)
Test-Time Alignment via Hypothesis Reweighting
di: Lee, Yoonho, et al.
Pubblicazione: (2024)
di: Lee, Yoonho, et al.
Pubblicazione: (2024)
Language-Model-Assisted Bi-Level Programming for Reward Learning from Internet Videos
di: Mahesheka, Harsh, et al.
Pubblicazione: (2024)
di: Mahesheka, Harsh, et al.
Pubblicazione: (2024)
Operationalising the Superficial Alignment Hypothesis via Task Complexity
di: Vergara-Browne, Tomás, et al.
Pubblicazione: (2026)
di: Vergara-Browne, Tomás, et al.
Pubblicazione: (2026)
Energy-Based Reward Models for Robust Language Model Alignment
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
Robust Batched Bandits
di: Guo, Yunwen, et al.
Pubblicazione: (2025)
di: Guo, Yunwen, et al.
Pubblicazione: (2025)
Sail into the Headwind: Alignment via Robust Rewards and Dynamic Labels against Reward Hacking
di: Rashidinejad, Paria, et al.
Pubblicazione: (2024)
di: Rashidinejad, Paria, et al.
Pubblicazione: (2024)
Catoni Contextual Bandits are Robust to Heavy-tailed Rewards
di: Ye, Chenlu, et al.
Pubblicazione: (2025)
di: Ye, Chenlu, et al.
Pubblicazione: (2025)
On the Robustness of Reward Models for Language Model Alignment
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
SPO: Multi-Dimensional Preference Sequential Alignment With Implicit Reward Modeling
di: Lou, Xingzhou, et al.
Pubblicazione: (2024)
di: Lou, Xingzhou, et al.
Pubblicazione: (2024)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
di: Li, Jiawei, et al.
Pubblicazione: (2024)
di: Li, Jiawei, et al.
Pubblicazione: (2024)
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
di: Li, Yanshi, et al.
Pubblicazione: (2024)
di: Li, Yanshi, et al.
Pubblicazione: (2024)
Robust Reward Modeling via Causal Rubrics
di: Srivastava, Pragya, et al.
Pubblicazione: (2025)
di: Srivastava, Pragya, et al.
Pubblicazione: (2025)
Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning
di: Rajaram, Sara, et al.
Pubblicazione: (2025)
di: Rajaram, Sara, et al.
Pubblicazione: (2025)
COMBA: Cross Batch Aggregation for Learning Large Graphs with Context Gating State Space Models
di: Shen, Jiajun, et al.
Pubblicazione: (2026)
di: Shen, Jiajun, et al.
Pubblicazione: (2026)
Non-Convex Robust Hypothesis Testing using Sinkhorn Uncertainty Sets
di: Wang, Jie, et al.
Pubblicazione: (2024)
di: Wang, Jie, et al.
Pubblicazione: (2024)
Revisiting the Superficial Alignment Hypothesis
di: Raghavendra, Mohit, et al.
Pubblicazione: (2024)
di: Raghavendra, Mohit, et al.
Pubblicazione: (2024)
PEARL: Zero-shot Cross-task Preference Alignment and Robust Reward Learning for Robotic Manipulation
di: Liu, Runze, et al.
Pubblicazione: (2023)
di: Liu, Runze, et al.
Pubblicazione: (2023)
Bayesian Reward Models for LLM Alignment
di: Yang, Adam X., et al.
Pubblicazione: (2024)
di: Yang, Adam X., et al.
Pubblicazione: (2024)
Hypothesis Spaces for Deep Learning
di: Wang, Rui, et al.
Pubblicazione: (2024)
di: Wang, Rui, et al.
Pubblicazione: (2024)
The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits
di: Cheng, Tianhao, et al.
Pubblicazione: (2026)
di: Cheng, Tianhao, et al.
Pubblicazione: (2026)
Batch Active Learning of Reward Functions from Human Preferences
di: Bıyık, Erdem, et al.
Pubblicazione: (2024)
di: Bıyık, Erdem, et al.
Pubblicazione: (2024)
High-Dimensional Robust Mean Estimation with Untrusted Batches
di: Aliakbarpour, Maryam, et al.
Pubblicazione: (2026)
di: Aliakbarpour, Maryam, et al.
Pubblicazione: (2026)
Improving Group Robustness on Spurious Correlation via Evidential Alignment
di: Ye, Wenqian, et al.
Pubblicazione: (2025)
di: Ye, Wenqian, et al.
Pubblicazione: (2025)
Reward-Robust RLHF in LLMs
di: Yan, Yuzi, et al.
Pubblicazione: (2024)
di: Yan, Yuzi, et al.
Pubblicazione: (2024)
Latent Space Translation via Semantic Alignment
di: Maiorca, Valentino, et al.
Pubblicazione: (2023)
di: Maiorca, Valentino, et al.
Pubblicazione: (2023)
Closed-Form Concept Erasure via Double Projections
di: Zhang, Chi, et al.
Pubblicazione: (2026)
di: Zhang, Chi, et al.
Pubblicazione: (2026)
Diversified Batch Selection for Training Acceleration
di: Hong, Feng, et al.
Pubblicazione: (2024)
di: Hong, Feng, et al.
Pubblicazione: (2024)
Distributed Differentiable Dynamic Game for Multi-robot Coordination
di: Zhou, Yizhi, et al.
Pubblicazione: (2022)
di: Zhou, Yizhi, et al.
Pubblicazione: (2022)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
di: Wang, Chaoqi, et al.
Pubblicazione: (2025)
di: Wang, Chaoqi, et al.
Pubblicazione: (2025)
Federated-inspired Single-cell Batch Integration in Latent Space
di: Nguyen, Quang-Huy, et al.
Pubblicazione: (2026)
di: Nguyen, Quang-Huy, et al.
Pubblicazione: (2026)
Beyond Manual Annotation: A Human-AI Collaborative Framework for Medical Image Segmentation Using Only "Better or Worse" Expert Feedback
di: Zhang, Yizhe
Pubblicazione: (2025)
di: Zhang, Yizhe
Pubblicazione: (2025)
High-Probability Minimax Adaptive Estimation in Besov Spaces via Online-to-Batch
di: Liautaud, Paul, et al.
Pubblicazione: (2026)
di: Liautaud, Paul, et al.
Pubblicazione: (2026)
APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport
di: Li, Zhuo, et al.
Pubblicazione: (2025)
di: Li, Zhuo, et al.
Pubblicazione: (2025)
Distributionally Robust Optimization via Iterative Algorithms in Continuous Probability Spaces
di: Zhu, Linglingzhi, et al.
Pubblicazione: (2024)
di: Zhu, Linglingzhi, et al.
Pubblicazione: (2024)
Latent Space Communication via K-V Cache Alignment
di: Dery, Lucio M., et al.
Pubblicazione: (2026)
di: Dery, Lucio M., et al.
Pubblicazione: (2026)
GETA-3DGS: Automatic Joint Structured Pruning and Quantization for 3D Gaussian Splatting
di: Zhang, Baobing, et al.
Pubblicazione: (2026)
di: Zhang, Baobing, et al.
Pubblicazione: (2026)
Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward
di: Jia, Zhiwei, et al.
Pubblicazione: (2024)
di: Jia, Zhiwei, et al.
Pubblicazione: (2024)
Boosting ASR Robustness via Test-Time Reinforcement Learning with Audio-Text Semantic Rewards
di: Fang, Linghan, et al.
Pubblicazione: (2026)
di: Fang, Linghan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RoDiF: Robust Direct Fine-Tuning of Diffusion Policies with Corrupted Human Feedback
di: Vatsa, Amitesh, et al.
Pubblicazione: (2026) -
Online Distributionally Robust LLM Alignment via Regression to Relative Reward
di: Sahu, Sharan, et al.
Pubblicazione: (2025) -
Test-Time Alignment via Hypothesis Reweighting
di: Lee, Yoonho, et al.
Pubblicazione: (2024) -
Language-Model-Assisted Bi-Level Programming for Reward Learning from Internet Videos
di: Mahesheka, Harsh, et al.
Pubblicazione: (2024) -
Operationalising the Superficial Alignment Hypothesis via Task Complexity
di: Vergara-Browne, Tomás, et al.
Pubblicazione: (2026)