Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Yanshi, Xiong, Shaopan, Chen, Gengru, Li, Xiaoyang, Luo, Yijia, Bu, Xingyuan, Tan, Yingshui, Su, Wenbo, Zheng, Bo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models
von: Tan, Yingshui, et al.
Veröffentlicht: (2025)
von: Tan, Yingshui, et al.
Veröffentlicht: (2025)
Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms
von: Xiao, Zeguan, et al.
Veröffentlicht: (2025)
von: Xiao, Zeguan, et al.
Veröffentlicht: (2025)
Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards
von: Jia, Ruipeng, et al.
Veröffentlicht: (2025)
von: Jia, Ruipeng, et al.
Veröffentlicht: (2025)
Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning
von: Yin, Shuyu, et al.
Veröffentlicht: (2024)
von: Yin, Shuyu, et al.
Veröffentlicht: (2024)
S2J: Bridging the Gap Between Solving and Judging Ability in Generative Reward Models
von: Sun, Shaoning, et al.
Veröffentlicht: (2025)
von: Sun, Shaoning, et al.
Veröffentlicht: (2025)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
von: Su, Yi, et al.
Veröffentlicht: (2025)
von: Su, Yi, et al.
Veröffentlicht: (2025)
Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models
von: Wang, Shuting, et al.
Veröffentlicht: (2025)
von: Wang, Shuting, et al.
Veröffentlicht: (2025)
Bridging the Gap Between Preference Alignment and Machine Unlearning
von: Feng, Xiaohua, et al.
Veröffentlicht: (2025)
von: Feng, Xiaohua, et al.
Veröffentlicht: (2025)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
von: Zhao, Weixiang, et al.
Veröffentlicht: (2025)
von: Zhao, Weixiang, et al.
Veröffentlicht: (2025)
Enter the Void - Planning to Seek Entropy When Reward is Scarce
von: Sundar, Ashish, et al.
Veröffentlicht: (2025)
von: Sundar, Ashish, et al.
Veröffentlicht: (2025)
Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization
von: Li, Yang, et al.
Veröffentlicht: (2025)
von: Li, Yang, et al.
Veröffentlicht: (2025)
ARGS: Alignment as Reward-Guided Search
von: Khanov, Maxim, et al.
Veröffentlicht: (2024)
von: Khanov, Maxim, et al.
Veröffentlicht: (2024)
Rewarded Region Replay (R3) for Policy Learning with Discrete Action Space
von: Li, Bangzheng, et al.
Veröffentlicht: (2024)
von: Li, Bangzheng, et al.
Veröffentlicht: (2024)
Expected Value Alignment for Generative Reward Modeling in Formal Mathematics Verification
von: Ji, Shihao, et al.
Veröffentlicht: (2026)
von: Ji, Shihao, et al.
Veröffentlicht: (2026)
Bridging the Semantic Gap: Contrastive Rewards for Multilingual Text-to-SQL with GRPO
von: Kattamuri, Ashish, et al.
Veröffentlicht: (2025)
von: Kattamuri, Ashish, et al.
Veröffentlicht: (2025)
Bridging the Human to Robot Dexterity Gap through Object-Oriented Rewards
von: Guzey, Irmak, et al.
Veröffentlicht: (2024)
von: Guzey, Irmak, et al.
Veröffentlicht: (2024)
Reward-free Alignment for Conflicting Objectives
von: Chen, Peter, et al.
Veröffentlicht: (2026)
von: Chen, Peter, et al.
Veröffentlicht: (2026)
Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards
von: Zeng, Xia, et al.
Veröffentlicht: (2025)
von: Zeng, Xia, et al.
Veröffentlicht: (2025)
Reward-SQL: Boosting Text-to-SQL via Stepwise Reasoning and Process-Supervised Rewards
von: Zhang, Yuxin, et al.
Veröffentlicht: (2025)
von: Zhang, Yuxin, et al.
Veröffentlicht: (2025)
Robust Reward Alignment via Hypothesis Space Batch Cutting
von: Xie, Zhixian, et al.
Veröffentlicht: (2025)
von: Xie, Zhixian, et al.
Veröffentlicht: (2025)
Bridging the Gap Between Bayesian Deep Learning and Ensemble Weather Forecasts
von: Xiong, Xinlei, et al.
Veröffentlicht: (2025)
von: Xiong, Xinlei, et al.
Veröffentlicht: (2025)
ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants
von: Wang, Pei, et al.
Veröffentlicht: (2026)
von: Wang, Pei, et al.
Veröffentlicht: (2026)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
von: Wang, Bo, et al.
Veröffentlicht: (2025)
von: Wang, Bo, et al.
Veröffentlicht: (2025)
SemiReward: A General Reward Model for Semi-supervised Learning
von: Li, Siyuan, et al.
Veröffentlicht: (2023)
von: Li, Siyuan, et al.
Veröffentlicht: (2023)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
von: Zhou, Hongli, et al.
Veröffentlicht: (2026)
von: Zhou, Hongli, et al.
Veröffentlicht: (2026)
Reward Model Routing in Alignment
von: Wu, Xinle, et al.
Veröffentlicht: (2025)
von: Wu, Xinle, et al.
Veröffentlicht: (2025)
Noise Contrastive Alignment of Language Models with Explicit Rewards
von: Chen, Huayu, et al.
Veröffentlicht: (2024)
von: Chen, Huayu, et al.
Veröffentlicht: (2024)
Contextual Bandits with Non-Stationary Correlated Rewards for User Association in MmWave Vehicular Networks
von: He, Xiaoyang, et al.
Veröffentlicht: (2024)
von: He, Xiaoyang, et al.
Veröffentlicht: (2024)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
von: Long, Yancheng, et al.
Veröffentlicht: (2026)
von: Long, Yancheng, et al.
Veröffentlicht: (2026)
Provably Adaptive Average Reward Reinforcement Learning for Metric Spaces
von: Kar, Avik, et al.
Veröffentlicht: (2024)
von: Kar, Avik, et al.
Veröffentlicht: (2024)
Pareto-Guided Optimal Transport for Multi-Reward Alignment
von: Ba, Ying, et al.
Veröffentlicht: (2026)
von: Ba, Ying, et al.
Veröffentlicht: (2026)
Cascade Reward Sampling for Efficient Decoding-Time Alignment
von: Li, Bolian, et al.
Veröffentlicht: (2024)
von: Li, Bolian, et al.
Veröffentlicht: (2024)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
Bridge the Gap Between Visual and Linguistic Comprehension for Generalized Zero-shot Semantic Segmentation
von: Guo, Xiaoqing, et al.
Veröffentlicht: (2025)
von: Guo, Xiaoqing, et al.
Veröffentlicht: (2025)
The Trajectory Alignment Coefficient in Two Acts: From Reward Tuning to Reward Learning
von: Muslimani, Calarina, et al.
Veröffentlicht: (2026)
von: Muslimani, Calarina, et al.
Veröffentlicht: (2026)
SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence
von: Bu, Yuyan, et al.
Veröffentlicht: (2026)
von: Bu, Yuyan, et al.
Veröffentlicht: (2026)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
von: Zhou, Enyu, et al.
Veröffentlicht: (2024)
von: Zhou, Enyu, et al.
Veröffentlicht: (2024)
Pairwise Calibrated Rewards for Pluralistic Alignment
von: Halpern, Daniel, et al.
Veröffentlicht: (2025)
von: Halpern, Daniel, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models
von: Tan, Yingshui, et al.
Veröffentlicht: (2025) -
Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms
von: Xiao, Zeguan, et al.
Veröffentlicht: (2025) -
Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards
von: Jia, Ruipeng, et al.
Veröffentlicht: (2025) -
Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning
von: Yin, Shuyu, et al.
Veröffentlicht: (2024) -
S2J: Bridging the Gap Between Solving and Judging Ability in Generative Reward Models
von: Sun, Shaoning, et al.
Veröffentlicht: (2025)