Diagnosing and Mitigating System Bias in Self-Rewarding RL
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tan, Chuyi, Yuan, Peiwen, Wang, Xinglin, Li, Yiwei, Feng, Shaoxiong, Zhang, Yueqi, Shi, Jiayi, Zhang, Ji, Pan, Boyuan, Hu, Yao, Li, Kan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Silencer: From Discovery to Mitigation of Self-Bias in LLM-as-Benchmark-Generator
par: Yuan, Peiwen, et autres
Publié: (2025)
par: Yuan, Peiwen, et autres
Publié: (2025)
Revisiting Self-Consistency from Dynamic Distributional Alignment Perspective on Answer Aggregation
par: Li, Yiwei, et autres
Publié: (2025)
par: Li, Yiwei, et autres
Publié: (2025)
Make Every Penny Count: Difficulty-Adaptive Self-Consistency for Cost-Efficient Reasoning
par: Wang, Xinglin, et autres
Publié: (2024)
par: Wang, Xinglin, et autres
Publié: (2024)
UniCBE: An Uniformity-driven Comparing Based Evaluation Framework with Unified Multi-Objective Optimization
par: Yuan, Peiwen, et autres
Publié: (2025)
par: Yuan, Peiwen, et autres
Publié: (2025)
Beyond One-Size-Fits-All: Tailored Benchmarks for Efficient Evaluation
par: Yuan, Peiwen, et autres
Publié: (2025)
par: Yuan, Peiwen, et autres
Publié: (2025)
Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling
par: Wang, Xinglin, et autres
Publié: (2025)
par: Wang, Xinglin, et autres
Publié: (2025)
Mind the Quote: Enabling Quotation-Aware Dialogue in LLMs via Plug-and-Play Modules
par: Zhang, Yueqi, et autres
Publié: (2025)
par: Zhang, Yueqi, et autres
Publié: (2025)
From Sub-Ability Diagnosis to Human-Aligned Generation: Bridging the Gap for Text Length Control via MARKERGEN
par: Yuan, Peiwen, et autres
Publié: (2025)
par: Yuan, Peiwen, et autres
Publié: (2025)
LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient
par: Yuan, Peiwen, et autres
Publié: (2025)
par: Yuan, Peiwen, et autres
Publié: (2025)
PatternKV: Flattening KV Representation Expands Quantization Headroom
par: Zhang, Ji, et autres
Publié: (2025)
par: Zhang, Ji, et autres
Publié: (2025)
Do Not Waste Your Rollouts: Recycling Search Experience for Efficient Test-Time Scaling
par: Wang, Xinglin, et autres
Publié: (2026)
par: Wang, Xinglin, et autres
Publié: (2026)
Speculative Decoding for Multi-Sample Inference
par: Li, Yiwei, et autres
Publié: (2025)
par: Li, Yiwei, et autres
Publié: (2025)
Learning More from Less: Unlocking Internal Representations for Benchmark Compression
par: Zhang, Yueqi, et autres
Publié: (2026)
par: Zhang, Yueqi, et autres
Publié: (2026)
InsBank: Evolving Instruction Subset for Ongoing Alignment
par: Shi, Jiayi, et autres
Publié: (2025)
par: Shi, Jiayi, et autres
Publié: (2025)
On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows
par: Wang, Xinglin, et autres
Publié: (2026)
par: Wang, Xinglin, et autres
Publié: (2026)
Focused Large Language Models are Stable Many-Shot Learners
par: Yuan, Peiwen, et autres
Publié: (2024)
par: Yuan, Peiwen, et autres
Publié: (2024)
Integrate the Essence and Eliminate the Dross: Fine-Grained Self-Consistency for Free-Form Language Generation
par: Wang, Xinglin, et autres
Publié: (2024)
par: Wang, Xinglin, et autres
Publié: (2024)
Instruction Embedding: Latent Representations of Instructions Towards Task Identification
par: Li, Yiwei, et autres
Publié: (2024)
par: Li, Yiwei, et autres
Publié: (2024)
CogLM: Tracking Cognitive Development of Large Language Models
par: Wang, Xinglin, et autres
Publié: (2024)
par: Wang, Xinglin, et autres
Publié: (2024)
Poor-Supervised Evaluation for SuperLLM via Mutual Consistency
par: Yuan, Peiwen, et autres
Publié: (2024)
par: Yuan, Peiwen, et autres
Publié: (2024)
BatchEval: Towards Human-like Text Evaluation
par: Yuan, Peiwen, et autres
Publié: (2023)
par: Yuan, Peiwen, et autres
Publié: (2023)
Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning
par: Li, Yiwei, et autres
Publié: (2024)
par: Li, Yiwei, et autres
Publié: (2024)
Generative Dense Retrieval: Memory Can Be a Burden
par: Yuan, Peiwen, et autres
Publié: (2024)
par: Yuan, Peiwen, et autres
Publié: (2024)
Unveiling and Mitigating Bias in Audio Visual Segmentation
par: Sun, Peiwen, et autres
Publié: (2024)
par: Sun, Peiwen, et autres
Publié: (2024)
Stitch and Tell: A Structured Multimodal Data Augmentation Method for Spatial Understanding
par: Yin, Hang, et autres
Publié: (2025)
par: Yin, Hang, et autres
Publié: (2025)
Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
par: Zhao, Kangwen, et autres
Publié: (2025)
par: Zhao, Kangwen, et autres
Publié: (2025)
From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents
par: Gao, Jiaxuan, et autres
Publié: (2026)
par: Gao, Jiaxuan, et autres
Publié: (2026)
SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility
par: Zhi, Xuyang, et autres
Publié: (2026)
par: Zhi, Xuyang, et autres
Publié: (2026)
Dynamic Stochastic Decoding Strategy for Open-Domain Dialogue Generation
par: Li, Yiwei, et autres
Publié: (2024)
par: Li, Yiwei, et autres
Publié: (2024)
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025)
par: Fu, Jiayi, et autres
Publié: (2025)
Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
A Holistic Approach to Understanding and Mitigating the Rising Burden of Maternal Chronic Conditions
par: Binglin Li, et autres
Publié: (2025)
par: Binglin Li, et autres
Publié: (2025)
Can Textual Semantics Mitigate Sounding Object Segmentation Preference?
par: Wang, Yaoting, et autres
Publié: (2024)
par: Wang, Yaoting, et autres
Publié: (2024)
On Designing Effective RL Reward at Training Time for LLM Reasoning
par: Gao, Jiaxuan, et autres
Publié: (2024)
par: Gao, Jiaxuan, et autres
Publié: (2024)
Debias Can be Unreliable: Mitigating Bias Issue in Evaluating Debiasing Recommendation
par: Wang, Chengbing, et autres
Publié: (2024)
par: Wang, Chengbing, et autres
Publié: (2024)
Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents
par: Fan, Zhiyuan, et autres
Publié: (2026)
par: Fan, Zhiyuan, et autres
Publié: (2026)
Mitigating Distribution Shift in Model-based Offline RL via Shifts-aware Reward Learning
par: Luo, Wang, et autres
Publié: (2024)
par: Luo, Wang, et autres
Publié: (2024)
Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs
par: Tan, Xuwei, et autres
Publié: (2026)
par: Tan, Xuwei, et autres
Publié: (2026)
Mitigating Deceptive Alignment via Self-Monitoring
par: Ji, Jiaming, et autres
Publié: (2025)
par: Ji, Jiaming, et autres
Publié: (2025)
When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards
par: Fan, Mingyuan, et autres
Publié: (2026)
par: Fan, Mingyuan, et autres
Publié: (2026)
Documents similaires
-
Silencer: From Discovery to Mitigation of Self-Bias in LLM-as-Benchmark-Generator
par: Yuan, Peiwen, et autres
Publié: (2025) -
Revisiting Self-Consistency from Dynamic Distributional Alignment Perspective on Answer Aggregation
par: Li, Yiwei, et autres
Publié: (2025) -
Make Every Penny Count: Difficulty-Adaptive Self-Consistency for Cost-Efficient Reasoning
par: Wang, Xinglin, et autres
Publié: (2024) -
UniCBE: An Uniformity-driven Comparing Based Evaluation Framework with Unified Multi-Objective Optimization
par: Yuan, Peiwen, et autres
Publié: (2025) -
Beyond One-Size-Fits-All: Tailored Benchmarks for Efficient Evaluation
par: Yuan, Peiwen, et autres
Publié: (2025)