Your Group-Relative Advantage Is Biased
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Fengkai, Chen, Zherui, Wang, Xiaohan, Lu, Xiaodong, Chai, Jiajun, Yin, Guojun, Lin, Wei, Ma, Shuai, Zhuang, Fuzhen, Wang, Deqing, Yang, Yaodong, Li, Jianxin, Ban, Yikun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
por: Lu, Xiaodong, et al.
Publicado: (2026)
por: Lu, Xiaodong, et al.
Publicado: (2026)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
por: Wang, Li, et al.
Publicado: (2026)
por: Wang, Li, et al.
Publicado: (2026)
CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling
por: Liu, Dengcan, et al.
Publicado: (2026)
por: Liu, Dengcan, et al.
Publicado: (2026)
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
por: Dou, Zheng, et al.
Publicado: (2026)
por: Dou, Zheng, et al.
Publicado: (2026)
Heterogeneous Agent Collaborative Reinforcement Learning
por: Zhang, Zhixia, et al.
Publicado: (2026)
por: Zhang, Zhixia, et al.
Publicado: (2026)
Policy Improvement Reinforcement Learning
por: Wang, Huaiyang, et al.
Publicado: (2026)
por: Wang, Huaiyang, et al.
Publicado: (2026)
Does Your Reasoning Model Implicitly Know When to Stop Thinking?
por: Huang, Zixuan, et al.
Publicado: (2026)
por: Huang, Zixuan, et al.
Publicado: (2026)
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
por: Chen, Zehao, et al.
Publicado: (2026)
por: Chen, Zehao, et al.
Publicado: (2026)
Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning
por: Wang, Li, et al.
Publicado: (2026)
por: Wang, Li, et al.
Publicado: (2026)
Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration
por: Wang, Zili, et al.
Publicado: (2026)
por: Wang, Zili, et al.
Publicado: (2026)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
por: Lin, Zihan, et al.
Publicado: (2026)
por: Lin, Zihan, et al.
Publicado: (2026)
SAE as a Crystal Ball: Interpretable Features Predict Cross-domain Transferability of LLMs without Training
por: Zhang, Qi, et al.
Publicado: (2026)
por: Zhang, Qi, et al.
Publicado: (2026)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
por: Huang, Zixuan, et al.
Publicado: (2025)
por: Huang, Zixuan, et al.
Publicado: (2025)
Counterfactual Credit Policy Optimization for Multi-Agent Collaboration
por: Li, Zhongyi, et al.
Publicado: (2026)
por: Li, Zhongyi, et al.
Publicado: (2026)
ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay
por: Hu, Zhexin, et al.
Publicado: (2026)
por: Hu, Zhexin, et al.
Publicado: (2026)
Real-Time Aligned Reward Model beyond Semantics
por: Huang, Zixuan, et al.
Publicado: (2026)
por: Huang, Zixuan, et al.
Publicado: (2026)
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
por: Lin, Zihan, et al.
Publicado: (2025)
por: Lin, Zihan, et al.
Publicado: (2025)
LLMBoost: Make Large Language Models Stronger with Boosting
por: Chen, Zehao, et al.
Publicado: (2025)
por: Chen, Zehao, et al.
Publicado: (2025)
ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models
por: Lin, Zihan, et al.
Publicado: (2025)
por: Lin, Zihan, et al.
Publicado: (2025)
One for Dozens: Adaptive REcommendation for All Domains with Counterfactual Augmentation
por: Luo, Huishi, et al.
Publicado: (2024)
por: Luo, Huishi, et al.
Publicado: (2024)
CDC: Causal Domain Clustering for Multi-Domain Recommendation
por: Luo, Huishi, et al.
Publicado: (2025)
por: Luo, Huishi, et al.
Publicado: (2025)
FLeW: Facet-Level and Adaptive Weighted Representation Learning of Scientific Documents
por: Dou, Zheng, et al.
Publicado: (2025)
por: Dou, Zheng, et al.
Publicado: (2025)
UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment
por: Xie, Hongyan, et al.
Publicado: (2026)
por: Xie, Hongyan, et al.
Publicado: (2026)
ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
por: Chen, Hao, et al.
Publicado: (2025)
por: Chen, Hao, et al.
Publicado: (2025)
Hyperbolic Diffusion Recommender Model
por: Yuan, Meng, et al.
Publicado: (2025)
por: Yuan, Meng, et al.
Publicado: (2025)
TextBridgeGNN: Pre-training Graph Neural Network for Cross-Domain Recommendation via Text-Guided Transfer
por: Chen, Yiwen, et al.
Publicado: (2025)
por: Chen, Yiwen, et al.
Publicado: (2025)
Bridging Social Psychology and LLM Reasoning: Conflict-Aware Meta-Review Generation via Cognitive Alignment
por: Chen, Wei, et al.
Publicado: (2025)
por: Chen, Wei, et al.
Publicado: (2025)
Rethinking Personalization in Large Language Models at the Token Level
por: Zhang, Chenheng, et al.
Publicado: (2026)
por: Zhang, Chenheng, et al.
Publicado: (2026)
Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection
por: Chen, Yiwen, et al.
Publicado: (2026)
por: Chen, Yiwen, et al.
Publicado: (2026)
A Survey on Causal Inference for Recommendation
por: Luo, Huishi, et al.
Publicado: (2023)
por: Luo, Huishi, et al.
Publicado: (2023)
AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment
por: Wei, Zhenlin, et al.
Publicado: (2026)
por: Wei, Zhenlin, et al.
Publicado: (2026)
MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL
por: Xu, Zekun, et al.
Publicado: (2025)
por: Xu, Zekun, et al.
Publicado: (2025)
From Experience to Strategy: Empowering LLM Agents with Trainable Graph Memory
por: Xia, Siyu, et al.
Publicado: (2025)
por: Xia, Siyu, et al.
Publicado: (2025)
FairDgcl: Fairness-aware Recommendation with Dynamic Graph Contrastive Learning
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
por: Guo, Xiaojun, et al.
Publicado: (2025)
por: Guo, Xiaojun, et al.
Publicado: (2025)
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
por: Sun, Jingbo, et al.
Publicado: (2026)
por: Sun, Jingbo, et al.
Publicado: (2026)
$π$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data
por: Zhang, Yaocheng, et al.
Publicado: (2026)
por: Zhang, Yaocheng, et al.
Publicado: (2026)
Are Full Rollouts Necessary for On-Policy Distillation?
por: Zhang, Yaocheng, et al.
Publicado: (2026)
por: Zhang, Yaocheng, et al.
Publicado: (2026)
Training Multi-Image Vision Agents via End2End Reinforcement Learning
por: Dong, Chengqi, et al.
Publicado: (2025)
por: Dong, Chengqi, et al.
Publicado: (2025)
Adaptive Robust Estimator for Multi-Agent Reinforcement Learning
por: Li, Zhongyi, et al.
Publicado: (2026)
por: Li, Zhongyi, et al.
Publicado: (2026)
Ejemplares similares
-
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
por: Lu, Xiaodong, et al.
Publicado: (2026) -
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
por: Wang, Li, et al.
Publicado: (2026) -
CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling
por: Liu, Dengcan, et al.
Publicado: (2026) -
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
por: Dou, Zheng, et al.
Publicado: (2026) -
Heterogeneous Agent Collaborative Reinforcement Learning
por: Zhang, Zhixia, et al.
Publicado: (2026)