PAPO: Stabilizing Rubric Integration Training via Decoupled Advantage Normalization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tan, Zelin, Yu, Zhouliang, Lin, Bohan, Geng, Zijie, Geng, Hejia, Zhang, Yudong, Zhang, Mulei, Chen, Yang, Hu, Shuyue, Yin, Zhenfei, Zhang, Chen, Bai, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
par: Tan, Zelin, et autres
Publié: (2025)
par: Tan, Zelin, et autres
Publié: (2025)
ReSo: A Reward-driven Self-organizing LLM-based Multi-Agent System for Reasoning Tasks
par: Zhou, Heng, et autres
Publié: (2025)
par: Zhou, Heng, et autres
Publié: (2025)
Composing Recurrent Spiking Neural Networks using Locally-Recurrent Motifs and Risk-Mitigating Architectural Optimization
par: Zhang, Wenrui, et autres
Publié: (2021)
par: Zhang, Wenrui, et autres
Publié: (2021)
HoSNN: Adversarially-Robust Homeostatic Spiking Neural Networks with Adaptive Firing Thresholds
par: Geng, Hejia, et autres
Publié: (2023)
par: Geng, Hejia, et autres
Publié: (2023)
DS2TA: Denoising Spiking Transformer with Attenuated Spatiotemporal Attention
par: Xu, Boxun, et autres
Publié: (2024)
par: Xu, Boxun, et autres
Publié: (2024)
Multi-Task Offloading via Graph Neural Networks in Heterogeneous Multi-access Edge Computing
par: Ma, Mulei
Publié: (2023)
par: Ma, Mulei
Publié: (2023)
LiveSearchBench: An Automatically Constructed Benchmark for Retrieval and Reasoning over Dynamic Knowledge
par: Zhou, Heng, et autres
Publié: (2025)
par: Zhou, Heng, et autres
Publié: (2025)
SUDP: Secret-Use Delegation Protocol for Agentic Systems
par: Yu, Xiaohang, et autres
Publié: (2026)
par: Yu, Xiaohang, et autres
Publié: (2026)
Khan-GCL: Kolmogorov-Arnold Network Based Graph Contrastive Learning with Hard Negatives
par: Wang, Zihu, et autres
Publié: (2025)
par: Wang, Zihu, et autres
Publié: (2025)
Towards Flash Thinking via Decoupled Advantage Policy Optimization
par: Tan, Zezhong, et autres
Publié: (2025)
par: Tan, Zezhong, et autres
Publié: (2025)
Mode Switching-Induced Instability of Multi-source Feed DC Microgrid
par: Jiang, Shanshan, et autres
Publié: (2025)
par: Jiang, Shanshan, et autres
Publié: (2025)
EPIC: A Lightweight LiDAR-Based UAV Exploration Framework for Large-Scale Scenarios
par: Geng, Shuang, et autres
Publié: (2024)
par: Geng, Shuang, et autres
Publié: (2024)
AdamS: Momentum Itself Can Be A Normalizer for LLM Pretraining and Post-training
par: Zhang, Huishuai, et autres
Publié: (2025)
par: Zhang, Huishuai, et autres
Publié: (2025)
Deep Research as Rubric for Reinforcement Learning
par: Mei, Wangyi, et autres
Publié: (2026)
par: Mei, Wangyi, et autres
Publié: (2026)
Unbending strategies shepherd cooperation and suppress extortion in spatial populations
par: Chen, Zijie, et autres
Publié: (2024)
par: Chen, Zijie, et autres
Publié: (2024)
AgentAsk: Multi-Agent Systems Need to Ask
par: Lin, Bohan, et autres
Publié: (2025)
par: Lin, Bohan, et autres
Publié: (2025)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
par: Zhang, Guibin, et autres
Publié: (2025)
par: Zhang, Guibin, et autres
Publié: (2025)
A-PSRO: A Unified Strategy Learning Method with Advantage Function for Normal-form Games
par: Hu, Yudong, et autres
Publié: (2023)
par: Hu, Yudong, et autres
Publié: (2023)
Turning Defects Into Advantages: Structures, Synthesis, and Applications of 2D Amorphous Carbon
par: Yongshuai Wang, et autres
Publié: (2025)
par: Yongshuai Wang, et autres
Publié: (2025)
Single-Agent Scaling Fails Multi-Agent Intelligence: Towards Foundation Models with Native Multi-Agent Intelligence
par: Hu, Shuyue, et autres
Publié: (2025)
par: Hu, Shuyue, et autres
Publié: (2025)
REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
par: Hu, Jian, et autres
Publié: (2025)
par: Hu, Jian, et autres
Publié: (2025)
Beyond GPT-5: Making LLMs Cheaper and Better via Performance-Efficiency Optimized Routing
par: Zhang, Yiqun, et autres
Publié: (2025)
par: Zhang, Yiqun, et autres
Publié: (2025)
Stabilization for Switched Stochastic Systems With Adjustable Convergence Rate: A State‐Dependent Switching Control Strategy
par: Han Geng, et autres
Publié: (2025)
par: Han Geng, et autres
Publié: (2025)
BATE-PAPO COM ARIKA OKRENT
par: Arika Okrent
Publié: (2022)
par: Arika Okrent
Publié: (2022)
BATE-PAPO COM KORY STAMPER
par: Kory Stamper
Publié: (2022)
par: Kory Stamper
Publié: (2022)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
par: Xie, Lipeng, et autres
Publié: (2025)
par: Xie, Lipeng, et autres
Publié: (2025)
ScribbleSense: Generative Scribble-Based Texture Editing with Intent Prediction
par: Zhang, Yudi, et autres
Publié: (2026)
par: Zhang, Yudi, et autres
Publié: (2026)
ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents
par: Li, Zhuofeng, et autres
Publié: (2026)
par: Li, Zhuofeng, et autres
Publié: (2026)
Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts
par: Wan, Guancheng, et autres
Publié: (2025)
par: Wan, Guancheng, et autres
Publié: (2025)
From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models
par: Li, Wenxuan, et autres
Publié: (2026)
par: Li, Wenxuan, et autres
Publié: (2026)
Study of Selective Catalytic Reduction Performance of Ce‐Modified Iron‐Based SAPO‐34 Catalysts
par: Kun Li, et autres
Publié: (2025)
par: Kun Li, et autres
Publié: (2025)
Uncertainty-Aware Normal-Guided Gaussian Splatting for Surface Reconstruction from Sparse Image Sequences
par: Tan, Zhen, et autres
Publié: (2025)
par: Tan, Zhen, et autres
Publié: (2025)
NormAUG: Normalization-guided Augmentation for Domain Generalization
par: Qi, Lei, et autres
Publié: (2023)
par: Qi, Lei, et autres
Publié: (2023)
Decentralized Frequency-Domain Conditions for D-Stability with Application to DC Microgrids
par: Sun, Zelin, et autres
Publié: (2026)
par: Sun, Zelin, et autres
Publié: (2026)
Patch-aware Batch Normalization for Improving Cross-domain Robustness
par: Qi, Lei, et autres
Publié: (2023)
par: Qi, Lei, et autres
Publié: (2023)
Orbital Stability Study of the Taiji Space Gravitational Wave Detector
par: Zhang, Yu-Yang, et autres
Publié: (2024)
par: Zhang, Yu-Yang, et autres
Publié: (2024)
CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
par: Xue, Xiangyuan, et autres
Publié: (2025)
par: Xue, Xiangyuan, et autres
Publié: (2025)
pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training
par: Zhang, Wenzheng, et autres
Publié: (2026)
par: Zhang, Wenzheng, et autres
Publié: (2026)
Learning Compact Representations of LLM Abilities via Item Response Theory
par: Chen, Jianhao, et autres
Publié: (2025)
par: Chen, Jianhao, et autres
Publié: (2025)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
par: Wu, Peilin, et autres
Publié: (2026)
par: Wu, Peilin, et autres
Publié: (2026)
Documents similaires
-
Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
par: Tan, Zelin, et autres
Publié: (2025) -
ReSo: A Reward-driven Self-organizing LLM-based Multi-Agent System for Reasoning Tasks
par: Zhou, Heng, et autres
Publié: (2025) -
Composing Recurrent Spiking Neural Networks using Locally-Recurrent Motifs and Risk-Mitigating Architectural Optimization
par: Zhang, Wenrui, et autres
Publié: (2021) -
HoSNN: Adversarially-Robust Homeostatic Spiking Neural Networks with Adaptive Firing Thresholds
par: Geng, Hejia, et autres
Publié: (2023) -
DS2TA: Denoising Spiking Transformer with Attenuated Spatiotemporal Attention
par: Xu, Boxun, et autres
Publié: (2024)