DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Guochao, Song, Jingyi, Quan, Guofeng, Hao, Chuzhan, Liu, Guohua, Zhang, Yuewei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models
por: Jiang, Guochao, et al.
Publicado: (2025)
por: Jiang, Guochao, et al.
Publicado: (2025)
PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning
por: Feng, Wenfeng, et al.
Publicado: (2025)
por: Feng, Wenfeng, et al.
Publicado: (2025)
RASD: Retrieval-Augmented Speculative Decoding
por: Quan, Guofeng, et al.
Publicado: (2025)
por: Quan, Guofeng, et al.
Publicado: (2025)
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning
por: Hao, Chuzhan, et al.
Publicado: (2025)
por: Hao, Chuzhan, et al.
Publicado: (2025)
Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search
por: Hao, Chuzhan, et al.
Publicado: (2026)
por: Hao, Chuzhan, et al.
Publicado: (2026)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
por: Liu, Shih-Yang, et al.
Publicado: (2026)
por: Liu, Shih-Yang, et al.
Publicado: (2026)
AirRAG: Autonomous Strategic Planning and Reasoning Steer Retrieval Augmented Generation
por: Feng, Wenfeng, et al.
Publicado: (2025)
por: Feng, Wenfeng, et al.
Publicado: (2025)
FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization
por: Xiao, Haiyang, et al.
Publicado: (2026)
por: Xiao, Haiyang, et al.
Publicado: (2026)
Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards
por: Arnal, Charles, et al.
Publicado: (2025)
por: Arnal, Charles, et al.
Publicado: (2025)
No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
por: Le, Thanh-Long V., et al.
Publicado: (2025)
por: Le, Thanh-Long V., et al.
Publicado: (2025)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
por: Fei, Wu, et al.
Publicado: (2025)
por: Fei, Wu, et al.
Publicado: (2025)
GAGPO: Generalized Advantage Grouped Policy Optimization
por: Zhu, Siyuan, et al.
Publicado: (2026)
por: Zhu, Siyuan, et al.
Publicado: (2026)
FlowKV: A Disaggregated Inference Framework with Low-Latency KV Cache Transfer and Load-Aware Scheduling
por: Li, Weiqing, et al.
Publicado: (2025)
por: Li, Weiqing, et al.
Publicado: (2025)
LIRE: listwise reward enhancement for preference alignment
por: Zhu, Mingye, et al.
Publicado: (2024)
por: Zhu, Mingye, et al.
Publicado: (2024)
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
por: Lu, Yining, et al.
Publicado: (2025)
por: Lu, Yining, et al.
Publicado: (2025)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
por: Yao, Jiarui, et al.
Publicado: (2025)
por: Yao, Jiarui, et al.
Publicado: (2025)
Mixture-of-LoRAs: An Efficient Multitask Tuning for Large Language Models
por: Feng, Wenfeng, et al.
Publicado: (2024)
por: Feng, Wenfeng, et al.
Publicado: (2024)
Skip-Connected Policy Optimization for Implicit Advantage
por: Teng, Fengwei, et al.
Publicado: (2026)
por: Teng, Fengwei, et al.
Publicado: (2026)
REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
por: Hu, Jian, et al.
Publicado: (2025)
por: Hu, Jian, et al.
Publicado: (2025)
Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs
por: Huang, Yiming, et al.
Publicado: (2026)
por: Huang, Yiming, et al.
Publicado: (2026)
Stabilizing Efficient Reasoning with Step-Level Advantage Selection
por: Wang, Han, et al.
Publicado: (2026)
por: Wang, Han, et al.
Publicado: (2026)
Think Dense, Not Long: Dynamic Decoupled Conditional Advantage for Efficient Reasoning
por: Peng, Keqin, et al.
Publicado: (2026)
por: Peng, Keqin, et al.
Publicado: (2026)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
por: Bai, Yang, et al.
Publicado: (2026)
por: Bai, Yang, et al.
Publicado: (2026)
TACO-RL: Task Aware Prompt Compression Optimization with Reinforcement Learning
por: Shandilya, Shivam, et al.
Publicado: (2024)
por: Shandilya, Shivam, et al.
Publicado: (2024)
Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages
por: Kunde, Vishnu Teja, et al.
Publicado: (2026)
por: Kunde, Vishnu Teja, et al.
Publicado: (2026)
Reinforcement Learning for Compositional Generalization with Outcome-Level Optimization
por: Fu, Xiyan, et al.
Publicado: (2026)
por: Fu, Xiyan, et al.
Publicado: (2026)
ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression
por: Bian, Tingcheng, et al.
Publicado: (2026)
por: Bian, Tingcheng, et al.
Publicado: (2026)
FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning
por: Qiu, Zhaopeng, et al.
Publicado: (2026)
por: Qiu, Zhaopeng, et al.
Publicado: (2026)
Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation
por: Min, Do June, et al.
Publicado: (2024)
por: Min, Do June, et al.
Publicado: (2024)
On the Role of Preference Variance in Preference Optimization
por: Guo, Jiacheng, et al.
Publicado: (2025)
por: Guo, Jiacheng, et al.
Publicado: (2025)
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
por: Shen, Junhao, et al.
Publicado: (2026)
por: Shen, Junhao, et al.
Publicado: (2026)
Episodic Reinforcement Learning with Expanded State-reward Space
por: Liang, Dayang, et al.
Publicado: (2024)
por: Liang, Dayang, et al.
Publicado: (2024)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
por: Wang, Huaijie, et al.
Publicado: (2024)
por: Wang, Huaijie, et al.
Publicado: (2024)
UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
por: Zhao, Yang, et al.
Publicado: (2025)
por: Zhao, Yang, et al.
Publicado: (2025)
Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts
por: Zhang, Di, et al.
Publicado: (2025)
por: Zhang, Di, et al.
Publicado: (2025)
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
por: Liu, Zexi, et al.
Publicado: (2025)
por: Liu, Zexi, et al.
Publicado: (2025)
Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR
por: Gu, Hengrui, et al.
Publicado: (2026)
por: Gu, Hengrui, et al.
Publicado: (2026)
Sample-efficient LLM Optimization with Reset Replay
por: Liu, Zichuan, et al.
Publicado: (2025)
por: Liu, Zichuan, et al.
Publicado: (2025)
MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning
por: Chen, Guoxin, et al.
Publicado: (2025)
por: Chen, Guoxin, et al.
Publicado: (2025)
Multi-Reference Preference Optimization for Large Language Models
por: Le, Hung, et al.
Publicado: (2024)
por: Le, Hung, et al.
Publicado: (2024)
Ejemplares similares
-
VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models
por: Jiang, Guochao, et al.
Publicado: (2025) -
PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning
por: Feng, Wenfeng, et al.
Publicado: (2025) -
RASD: Retrieval-Augmented Speculative Decoding
por: Quan, Guofeng, et al.
Publicado: (2025) -
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning
por: Hao, Chuzhan, et al.
Publicado: (2025) -
Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search
por: Hao, Chuzhan, et al.
Publicado: (2026)