GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Han, Zheng, Ruibin, Yi, Zexuan, Zhang, Zhuo, Peng, Hanyang, Wang, Hui, Yuan, Zike, Ke, Cai, Chen, Shiwei, Yang, Jiacheng, Li, Yangning, Li, Xiang, Yan, Jiangyue, Liu, Yaoqi, Jing, Liwen, Qi, Jiayin, Xu, Ruifeng, Fang, Binxing, Yu, Yue |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhanced Evolutionary Multi-Objective Deep Reinforcement Learning for Reliable and Efficient Wireless Rechargeable Sensor Networks
par: Tong, Bowei, et autres
Publié: (2025)
par: Tong, Bowei, et autres
Publié: (2025)
From Long to Lean: Performance-aware and Adaptive Chain-of-Thought Compression via Multi-round Refinement
par: Yan, Jianzhi, et autres
Publié: (2025)
par: Yan, Jianzhi, et autres
Publié: (2025)
Bit-by-Bit: Progressive QAT Strategy with Outlier Channel Splitting for Stable Low-Bit LLMs
par: Xu, Binxing, et autres
Publié: (2026)
par: Xu, Binxing, et autres
Publié: (2026)
Toward Closed-loop Molecular Discovery via Language Model, Property Alignment and Strategic Search
par: Ji, Junkai, et autres
Publié: (2025)
par: Ji, Junkai, et autres
Publié: (2025)
An Efficient Evolutionary Algorithm for Few-for-Many Optimization
par: Shang, Ke, et autres
Publié: (2026)
par: Shang, Ke, et autres
Publié: (2026)
EXPO: Stable Reinforcement Learning with Expressive Policies
par: Dong, Perry, et autres
Publié: (2025)
par: Dong, Perry, et autres
Publié: (2025)
Embracing the Present: The Impact of Temporal Orientation on Tourists' Mood State
par: Qiaoqiao Deng, et autres
Publié: (2026)
par: Qiaoqiao Deng, et autres
Publié: (2026)
Finite-Time Analysis of On-Policy Heterogeneous Federated Reinforcement Learning
par: Zhang, Chenyu, et autres
Publié: (2024)
par: Zhang, Chenyu, et autres
Publié: (2024)
ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning
par: Zhao, Yiran, et autres
Publié: (2026)
par: Zhao, Yiran, et autres
Publié: (2026)
Application of LLM Guided Reinforcement Learning in Formation Control with Collision Avoidance
par: Yao, Chenhao, et autres
Publié: (2025)
par: Yao, Chenhao, et autres
Publié: (2025)
Human-in-the-Loop Policy Optimization for Preference-Based Multi-Objective Reinforcement Learning
par: Li, Ke, et autres
Publié: (2024)
par: Li, Ke, et autres
Publié: (2024)
Towards Effective In-context Cross-domain Knowledge Transfer via Domain-invariant-neurons-based Retrieval
par: Yan, Jianzhi, et autres
Publié: (2026)
par: Yan, Jianzhi, et autres
Publié: (2026)
Correcting Large Language Model Behavior via Influence Function
par: Zhang, Han, et autres
Publié: (2024)
par: Zhang, Han, et autres
Publié: (2024)
Learning Robust Policies via Interpretable Hamilton-Jacobi Reachability-Guided Disturbances
par: Hu, Hanyang, et autres
Publié: (2024)
par: Hu, Hanyang, et autres
Publié: (2024)
Embodied AI-empowered Low Altitude Economy: Integrated Sensing, Communications, Computation, and Control (ISC3)
par: Yang, Yaoqi, et autres
Publié: (2024)
par: Yang, Yaoqi, et autres
Publié: (2024)
Reinforcing Action Policies by Prophesying
par: Zhang, Jiahui, et autres
Publié: (2025)
par: Zhang, Jiahui, et autres
Publié: (2025)
Reinforced Inverse Scattering
par: Jiang, Hanyang, et autres
Publié: (2022)
par: Jiang, Hanyang, et autres
Publié: (2022)
Policy Regularization on Globally Accessible States in Cross-Dynamics Reinforcement Learning
par: Xue, Zhenghai, et autres
Publié: (2025)
par: Xue, Zhenghai, et autres
Publié: (2025)
Mechanistic Investigation of Exercise Interventions in Rodent Models of Alzheimer’s Disease and Prospects for Clinical Translation
par: Tianhang Peng, et autres
Publié: (2026)
par: Tianhang Peng, et autres
Publié: (2026)
Characteristics and Source Analysis of Dissolved Organic Matter Components in the Dadu River Under Cascade Hydropower Development
par: Yitong Ding, et autres
Publié: (2026)
par: Yitong Ding, et autres
Publié: (2026)
Group-Agent Reinforcement Learning with Heterogeneous Agents
par: Wu, Kaiyue, et autres
Publié: (2025)
par: Wu, Kaiyue, et autres
Publié: (2025)
ShipTraj-R1: Reinforcing Ship Trajectory Prediction in Large Language Models via Group Relative Policy Optimization
par: Zhan, Yang, et autres
Publié: (2026)
par: Zhan, Yang, et autres
Publié: (2026)
CoCoEdit: Content-Consistent Image Editing via Region Regularized Reinforcement Learning
par: Wu, Yuhui, et autres
Publié: (2026)
par: Wu, Yuhui, et autres
Publié: (2026)
QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
par: Gu, Hao, et autres
Publié: (2026)
par: Gu, Hao, et autres
Publié: (2026)
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
A Correlated Data-Driven Collaborative Beamforming Approach for Energy-efficient IoT Data Transmission
par: Li, Yangning, et autres
Publié: (2025)
par: Li, Yangning, et autres
Publié: (2025)
Source Prompt Disentangled Inversion for Boosting Image Editability with Diffusion Models
par: Li, Ruibin, et autres
Publié: (2024)
par: Li, Ruibin, et autres
Publié: (2024)
Polymer‐Assisted Nucleation for Stable Single‐Crystal Perovskite Thin Films
par: Jiangyue Xi, et autres
Publié: (2024)
par: Jiangyue Xi, et autres
Publié: (2024)
FedHPD: Heterogeneous Federated Reinforcement Learning via Policy Distillation
par: Jiang, Wenzheng, et autres
Publié: (2025)
par: Jiang, Wenzheng, et autres
Publié: (2025)
Self-Training with Pseudo-Label Scorer for Aspect Sentiment Quad Prediction
par: Zhang, Yice, et autres
Publié: (2024)
par: Zhang, Yice, et autres
Publié: (2024)
Polar Brauer categories, infinitesimal braids and Lie superalgebra representations
par: Lehrer, Gustav, et autres
Publié: (2024)
par: Lehrer, Gustav, et autres
Publié: (2024)
Sem-RaDiff: Diffusion-Based 3D Radar Semantic Perception in Cluttered Agricultural Environments
par: Zhang, Ruibin, et autres
Publié: (2025)
par: Zhang, Ruibin, et autres
Publié: (2025)
Braided symmetric algebras and a first fundamental theorem of invariant theory for ${\rm U}_q(G_2)$
par: Hu, Hongmei, et autres
Publié: (2025)
par: Hu, Hongmei, et autres
Publié: (2025)
Research on Intelligent Vehicle Operation Risk Assessment and Early Warning Based on Predictive Risk Field
par: Ruibin Zhang, et autres
Publié: (2024)
par: Ruibin Zhang, et autres
Publié: (2024)
Sample Weight Averaging for Stable Prediction
par: Yu, Han, et autres
Publié: (2025)
par: Yu, Han, et autres
Publié: (2025)
Generating Diverse Training Samples for Relation Extraction with Large Language Models
par: Li, Zexuan, et autres
Publié: (2025)
par: Li, Zexuan, et autres
Publié: (2025)
M-BRe: Discovering Training Samples for Relation Extraction from Unlabeled Texts with Large Language Models
par: Li, Zexuan, et autres
Publié: (2025)
par: Li, Zexuan, et autres
Publié: (2025)
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
par: Yao, Yihang, et autres
Publié: (2023)
par: Yao, Yihang, et autres
Publié: (2023)
Collapsing of K3 Surfaces and Special Kähler Structures
par: Ouyang, Zexuan
Publié: (2025)
par: Ouyang, Zexuan
Publié: (2025)
The Front-door Criterion in the Potential Outcome Framework
par: Chen, Zexuan
Publié: (2024)
par: Chen, Zexuan
Publié: (2024)
Documents similaires
-
Enhanced Evolutionary Multi-Objective Deep Reinforcement Learning for Reliable and Efficient Wireless Rechargeable Sensor Networks
par: Tong, Bowei, et autres
Publié: (2025) -
From Long to Lean: Performance-aware and Adaptive Chain-of-Thought Compression via Multi-round Refinement
par: Yan, Jianzhi, et autres
Publié: (2025) -
Bit-by-Bit: Progressive QAT Strategy with Outlier Channel Splitting for Stable Low-Bit LLMs
par: Xu, Binxing, et autres
Publié: (2026) -
Toward Closed-loop Molecular Discovery via Language Model, Property Alignment and Strategic Search
par: Ji, Junkai, et autres
Publié: (2025) -
An Efficient Evolutionary Algorithm for Few-for-Many Optimization
par: Shang, Ke, et autres
Publié: (2026)