Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zeng, Zhiyuan, Huang, Jiameng, Yin, Zhangyue, Liu, Jiashuo, Li, Ziniu, Li, Bingrui, Wu, Yuhao, Zheng, Yining, Zhang, Ge, Huang, Wenhao, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RLoop: An Self-Improving Framework for Reinforcement Learning with Iterative Policy Initialization
von: Zhiyuan, Zeng, et al.
Veröffentlicht: (2025)
von: Zhiyuan, Zeng, et al.
Veröffentlicht: (2025)
Dynamic and Generalizable Process Reward Modeling
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025)
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025)
Aggregation of Reasoning: A Hierarchical Framework for Enhancing Answer Selection in Large Language Models
von: Yin, Zhangyue, et al.
Veröffentlicht: (2024)
von: Yin, Zhangyue, et al.
Veröffentlicht: (2024)
Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
Error Classification of Large Language Models on Math Word Problems: A Dynamically Adaptive Framework
von: Sun, Yuhong, et al.
Veröffentlicht: (2025)
von: Sun, Yuhong, et al.
Veröffentlicht: (2025)
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
Corex: Pushing the Boundaries of Complex Reasoning through Multi-Model Collaboration
von: Sun, Qiushi, et al.
Veröffentlicht: (2023)
von: Sun, Qiushi, et al.
Veröffentlicht: (2023)
VehicleWorld: A Highly Integrated Multi-Device Environment for Intelligent Vehicle Interaction
von: Yang, Jie, et al.
Veröffentlicht: (2025)
von: Yang, Jie, et al.
Veröffentlicht: (2025)
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
von: Li, Yuan, et al.
Veröffentlicht: (2025)
von: Li, Yuan, et al.
Veröffentlicht: (2025)
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
von: Sun, Yuhong, et al.
Veröffentlicht: (2024)
von: Sun, Yuhong, et al.
Veröffentlicht: (2024)
LLatrieval: LLM-Verified Retrieval for Verifiable Generation
von: Li, Xiaonan, et al.
Veröffentlicht: (2023)
von: Li, Xiaonan, et al.
Veröffentlicht: (2023)
Are LLMs Rational Investors? A Study on Detecting and Reducing the Financial Bias in LLMs
von: Zhou, Yuhang, et al.
Veröffentlicht: (2024)
von: Zhou, Yuhang, et al.
Veröffentlicht: (2024)
Turn Waste into Worth: Rectifying Top-$k$ Router of MoE
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)
ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025)
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025)
Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
von: Chen, Peter, et al.
Veröffentlicht: (2025)
von: Chen, Peter, et al.
Veröffentlicht: (2025)
Can GRPO Boost Complex Multimodal Table Understanding?
von: Kang, Xiaoqiang, et al.
Veröffentlicht: (2025)
von: Kang, Xiaoqiang, et al.
Veröffentlicht: (2025)
$λ$-GRPO: Unifying the GRPO Frameworks with Learnable Token Preferences
von: Wang, Yining, et al.
Veröffentlicht: (2025)
von: Wang, Yining, et al.
Veröffentlicht: (2025)
Unified Active Retrieval for Retrieval Augmented Generation
von: Cheng, Qinyuan, et al.
Veröffentlicht: (2024)
von: Cheng, Qinyuan, et al.
Veröffentlicht: (2024)
Multi-hop Reasoning via Early Knowledge Alignment
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering
von: Wang, Yuxin, et al.
Veröffentlicht: (2026)
von: Wang, Yuxin, et al.
Veröffentlicht: (2026)
The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping
von: Liu, Yang, et al.
Veröffentlicht: (2026)
von: Liu, Yang, et al.
Veröffentlicht: (2026)
Can AI Assistants Know What They Don't Know?
von: Cheng, Qinyuan, et al.
Veröffentlicht: (2024)
von: Cheng, Qinyuan, et al.
Veröffentlicht: (2024)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization
von: Li, Peiji, et al.
Veröffentlicht: (2026)
von: Li, Peiji, et al.
Veröffentlicht: (2026)
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
von: Li, Bowen, et al.
Veröffentlicht: (2026)
von: Li, Bowen, et al.
Veröffentlicht: (2026)
Balanced Data Sampling for Language Model Training with Clustering
von: Shao, Yunfan, et al.
Veröffentlicht: (2024)
von: Shao, Yunfan, et al.
Veröffentlicht: (2024)
Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
von: Chen, Xiwen, et al.
Veröffentlicht: (2025)
von: Chen, Xiwen, et al.
Veröffentlicht: (2025)
AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts
von: Fang, Shicheng, et al.
Veröffentlicht: (2026)
von: Fang, Shicheng, et al.
Veröffentlicht: (2026)
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
von: Huang, Yue, et al.
Veröffentlicht: (2024)
von: Huang, Yue, et al.
Veröffentlicht: (2024)
Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
von: Zheng, Jinquan, et al.
Veröffentlicht: (2026)
von: Zheng, Jinquan, et al.
Veröffentlicht: (2026)
SCARV: Structure-Constrained Aggregation for Stable Sample Ranking in Redundant NLP Datasets
von: Zheng, Xu, et al.
Veröffentlicht: (2026)
von: Zheng, Xu, et al.
Veröffentlicht: (2026)
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
von: Li, Ziniu, et al.
Veröffentlicht: (2025)
von: Li, Ziniu, et al.
Veröffentlicht: (2025)
MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting
von: Wei, Kangda, et al.
Veröffentlicht: (2026)
von: Wei, Kangda, et al.
Veröffentlicht: (2026)
ACCIO: Table Understanding Enhanced via Contrastive Learning with Aggregations
von: Cho, Whanhee
Veröffentlicht: (2024)
von: Cho, Whanhee
Veröffentlicht: (2024)
Exploring the Influence of Label Aggregation on Minority Voices: Implications for Dataset Bias and Model Training
von: Pandya, Mugdha, et al.
Veröffentlicht: (2024)
von: Pandya, Mugdha, et al.
Veröffentlicht: (2024)
Subtopic-aware View Sampling and Temporal Aggregation for Long-form Document Matching
von: Zhou, Youchao, et al.
Veröffentlicht: (2024)
von: Zhou, Youchao, et al.
Veröffentlicht: (2024)
Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO
von: Tian, Yu, et al.
Veröffentlicht: (2026)
von: Tian, Yu, et al.
Veröffentlicht: (2026)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
von: Xu, Ningyu, et al.
Veröffentlicht: (2026)
von: Xu, Ningyu, et al.
Veröffentlicht: (2026)
Understanding the Role of LLMs in Multimodal Evaluation Benchmarks
von: Jiang, Botian, et al.
Veröffentlicht: (2024)
von: Jiang, Botian, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
RLoop: An Self-Improving Framework for Reinforcement Learning with Iterative Policy Initialization
von: Zhiyuan, Zeng, et al.
Veröffentlicht: (2025) -
Dynamic and Generalizable Process Reward Modeling
von: Yin, Zhangyue, et al.
Veröffentlicht: (2025) -
Aggregation of Reasoning: A Hierarchical Framework for Enhancing Answer Selection in Large Language Models
von: Yin, Zhangyue, et al.
Veröffentlicht: (2024) -
Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025) -
Error Classification of Large Language Models on Math Word Problems: A Dynamically Adaptive Framework
von: Sun, Yuhong, et al.
Veröffentlicht: (2025)