Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
Fuente:
arXiv
Salvato in:
| Autori principali: | Tang, Xinyu, Zhan, Yuliang, Li, Zhixun, Zhao, Wayne Xin, Zhang, Zhenduo, Wen, Zujie, Zhang, Zhiqiang, Zhou, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
Enhancing Cross-task Transfer of Large Language Models via Activation Steering
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning
di: Cheng, Xiaoxue, et al.
Pubblicazione: (2025)
di: Cheng, Xiaoxue, et al.
Pubblicazione: (2025)
When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
Rethinking the Evaluation for Conversational Recommendation in the Era of Large Language Models
di: Wang, Xiaolei, et al.
Pubblicazione: (2023)
di: Wang, Xiaolei, et al.
Pubblicazione: (2023)
InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning
di: Yan, Yuchen, et al.
Pubblicazione: (2026)
di: Yan, Yuchen, et al.
Pubblicazione: (2026)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
di: Jiang, Yuxin, et al.
Pubblicazione: (2026)
di: Jiang, Yuxin, et al.
Pubblicazione: (2026)
DAWN-ICL: Strategic Planning of Problem-solving Trajectories for Zero-Shot In-Context Learning
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards
di: Xing, Shangyu, et al.
Pubblicazione: (2025)
di: Xing, Shangyu, et al.
Pubblicazione: (2025)
RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
di: Wang, Peisong, et al.
Pubblicazione: (2025)
di: Wang, Peisong, et al.
Pubblicazione: (2025)
Investigating the Pre-Training Dynamics of In-Context Learning: Task Recognition vs. Task Learning
di: Wang, Xiaolei, et al.
Pubblicazione: (2024)
di: Wang, Xiaolei, et al.
Pubblicazione: (2024)
IFDECORATOR: Wrapping Instruction Following Reinforcement Learning with Verifiable Rewards
di: Guo, Xu, et al.
Pubblicazione: (2025)
di: Guo, Xu, et al.
Pubblicazione: (2025)
Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward
di: Huang, Guanhua, et al.
Pubblicazione: (2025)
di: Huang, Guanhua, et al.
Pubblicazione: (2025)
Auditing Data Membership in Reinforcement Learning With Verifiable Rewards
di: Liu, Yule, et al.
Pubblicazione: (2025)
di: Liu, Yule, et al.
Pubblicazione: (2025)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2025)
Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing Constraint
di: Chen, Zhipeng, et al.
Pubblicazione: (2024)
di: Chen, Zhipeng, et al.
Pubblicazione: (2024)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
di: Zhang, Kaiyi, et al.
Pubblicazione: (2026)
di: Zhang, Kaiyi, et al.
Pubblicazione: (2026)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
di: Nguyen, Hieu Trung, et al.
Pubblicazione: (2026)
di: Nguyen, Hieu Trung, et al.
Pubblicazione: (2026)
L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention
di: Zhan, Yuliang, et al.
Pubblicazione: (2025)
di: Zhan, Yuliang, et al.
Pubblicazione: (2025)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
di: Xu, Ran, et al.
Pubblicazione: (2026)
di: Xu, Ran, et al.
Pubblicazione: (2026)
Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2026)
di: Liu, Shuze Daniel, et al.
Pubblicazione: (2026)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
di: Gunjal, Anisha, et al.
Pubblicazione: (2025)
di: Gunjal, Anisha, et al.
Pubblicazione: (2025)
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
di: Chen, Guanzheng, et al.
Pubblicazione: (2026)
di: Chen, Guanzheng, et al.
Pubblicazione: (2026)
Reward-Shifted Speculative Sampling Is An Efficient Test-Time Weak-to-Strong Aligner
di: Li, Bolian, et al.
Pubblicazione: (2025)
di: Li, Bolian, et al.
Pubblicazione: (2025)
Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation
di: Zhou, Jiang, et al.
Pubblicazione: (2026)
di: Zhou, Jiang, et al.
Pubblicazione: (2026)
Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
di: Ma, Zhengzhao, et al.
Pubblicazione: (2026)
di: Ma, Zhengzhao, et al.
Pubblicazione: (2026)
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
di: Stojanovski, Zafir, et al.
Pubblicazione: (2025)
di: Stojanovski, Zafir, et al.
Pubblicazione: (2025)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
Unleashing the Potential of Large Language Models as Prompt Optimizers: Analogical Analysis with Gradient-based Model Optimizers
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
di: Wang, Li, et al.
Pubblicazione: (2026)
di: Wang, Li, et al.
Pubblicazione: (2026)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable Rewards
di: Lara, Luis, et al.
Pubblicazione: (2026)
di: Lara, Luis, et al.
Pubblicazione: (2026)
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
di: Ren, Mengjie, et al.
Pubblicazione: (2026)
di: Ren, Mengjie, et al.
Pubblicazione: (2026)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
di: Ackermann, Johannes, et al.
Pubblicazione: (2026)
di: Ackermann, Johannes, et al.
Pubblicazione: (2026)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
di: Wang, Zhen, et al.
Pubblicazione: (2025)
di: Wang, Zhen, et al.
Pubblicazione: (2025)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
di: Zhang, Jiajie, et al.
Pubblicazione: (2026)
di: Zhang, Jiajie, et al.
Pubblicazione: (2026)
DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search
di: Wu, Fang, et al.
Pubblicazione: (2025)
di: Wu, Fang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
di: Tang, Xinyu, et al.
Pubblicazione: (2025) -
Enhancing Cross-task Transfer of Large Language Models via Activation Steering
di: Tang, Xinyu, et al.
Pubblicazione: (2025) -
Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning
di: Cheng, Xiaoxue, et al.
Pubblicazione: (2025) -
When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards
di: Fan, Mingyuan, et al.
Pubblicazione: (2026) -
Rethinking the Evaluation for Conversational Recommendation in the Era of Large Language Models
di: Wang, Xiaolei, et al.
Pubblicazione: (2023)