When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards
Fuente:
arXiv
Salvato in:
| Autori principali: | Fan, Mingyuan, Han, Weiguang, Wang, Daixin, Chen, Cen, Zhang, Zhiqiang, Zhou, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
di: Li, Gaotang, et al.
Pubblicazione: (2026)
di: Li, Gaotang, et al.
Pubblicazione: (2026)
Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
Diagnosing and Mitigating System Bias in Self-Rewarding RL
di: Tan, Chuyi, et al.
Pubblicazione: (2025)
di: Tan, Chuyi, et al.
Pubblicazione: (2025)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
di: Pavlenko, Kirill, et al.
Pubblicazione: (2026)
di: Pavlenko, Kirill, et al.
Pubblicazione: (2026)
RAZOR: Sharpening Knowledge by Cutting Bias with Unsupervised Text Rewriting
di: Yang, Shuo, et al.
Pubblicazione: (2024)
di: Yang, Shuo, et al.
Pubblicazione: (2024)
FedMCP: Parameter-Efficient Federated Learning with Model-Contrastive Personalization
di: Zhao, Qianyi, et al.
Pubblicazione: (2024)
di: Zhao, Qianyi, et al.
Pubblicazione: (2024)
What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
di: Wang, Li, et al.
Pubblicazione: (2026)
di: Wang, Li, et al.
Pubblicazione: (2026)
AGR: Age Group fairness Reward for Bias Mitigation in LLMs
di: Cao, Shuirong, et al.
Pubblicazione: (2024)
di: Cao, Shuirong, et al.
Pubblicazione: (2024)
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
di: Feng, Xiao, et al.
Pubblicazione: (2026)
di: Feng, Xiao, et al.
Pubblicazione: (2026)
On-Policy RL with Optimal Reward Baseline
di: Hao, Yaru, et al.
Pubblicazione: (2025)
di: Hao, Yaru, et al.
Pubblicazione: (2025)
When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models
di: Xie, Tong, et al.
Pubblicazione: (2025)
di: Xie, Tong, et al.
Pubblicazione: (2025)
Self-Consistency via Marginal Sharpening
di: Arzhantsev, Aleksei, et al.
Pubblicazione: (2026)
di: Arzhantsev, Aleksei, et al.
Pubblicazione: (2026)
Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward
di: Huang, Guanhua, et al.
Pubblicazione: (2025)
di: Huang, Guanhua, et al.
Pubblicazione: (2025)
On the Trustworthiness Landscape of State-of-the-art Generative Models: A Survey and Outlook
di: Fan, Mingyuan, et al.
Pubblicazione: (2023)
di: Fan, Mingyuan, et al.
Pubblicazione: (2023)
FlowRL: Matching Reward Distributions for LLM Reasoning
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding
di: Xu, Zhangchen, et al.
Pubblicazione: (2025)
di: Xu, Zhangchen, et al.
Pubblicazione: (2025)
DLM-One: Diffusion Language Models for One-Step Sequence Generation
di: Chen, Tianqi, et al.
Pubblicazione: (2025)
di: Chen, Tianqi, et al.
Pubblicazione: (2025)
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
di: Zhang, Dan, et al.
Pubblicazione: (2025)
di: Zhang, Dan, et al.
Pubblicazione: (2025)
Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
di: Zhang, Kaiyi, et al.
Pubblicazione: (2026)
di: Zhang, Kaiyi, et al.
Pubblicazione: (2026)
RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
di: Zha, Kaiwen, et al.
Pubblicazione: (2025)
di: Zha, Kaiwen, et al.
Pubblicazione: (2025)
BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning
di: Hage, Tarjei Paule, et al.
Pubblicazione: (2026)
di: Hage, Tarjei Paule, et al.
Pubblicazione: (2026)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
Self-Improvement in Language Models: The Sharpening Mechanism
di: Huang, Audrey, et al.
Pubblicazione: (2024)
di: Huang, Audrey, et al.
Pubblicazione: (2024)
ToolRL: Reward is All Tool Learning Needs
di: Qian, Cheng, et al.
Pubblicazione: (2025)
di: Qian, Cheng, et al.
Pubblicazione: (2025)
vCache: Verified Semantic Prompt Caching
di: Schroeder, Luis Gaspar, et al.
Pubblicazione: (2025)
di: Schroeder, Luis Gaspar, et al.
Pubblicazione: (2025)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution
di: Pan, Teng, et al.
Pubblicazione: (2026)
di: Pan, Teng, et al.
Pubblicazione: (2026)
DISA: Offline Importance Sampling for Distribution-Matching LLM-RL
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs
di: Hu, Zhiyuan, et al.
Pubblicazione: (2026)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2026)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
di: Ma, Zhengzhao, et al.
Pubblicazione: (2026)
di: Ma, Zhengzhao, et al.
Pubblicazione: (2026)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
di: Xu, Ran, et al.
Pubblicazione: (2026)
di: Xu, Ran, et al.
Pubblicazione: (2026)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
di: Gunjal, Anisha, et al.
Pubblicazione: (2025)
di: Gunjal, Anisha, et al.
Pubblicazione: (2025)
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
di: Tao, Leitian, et al.
Pubblicazione: (2025)
di: Tao, Leitian, et al.
Pubblicazione: (2025)
Cascade Reward Sampling for Efficient Decoding-Time Alignment
di: Li, Bolian, et al.
Pubblicazione: (2024)
di: Li, Bolian, et al.
Pubblicazione: (2024)
Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax
di: Su, Zeli, et al.
Pubblicazione: (2026)
di: Su, Zeli, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
di: Tang, Xinyu, et al.
Pubblicazione: (2025) -
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
di: Li, Gaotang, et al.
Pubblicazione: (2026) -
Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
di: Fan, Mingyuan, et al.
Pubblicazione: (2026) -
Diagnosing and Mitigating System Bias in Self-Rewarding RL
di: Tan, Chuyi, et al.
Pubblicazione: (2025) -
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
di: Zhang, Xin, et al.
Pubblicazione: (2026)