Heterogeneous Agent Collaborative Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zhixia, Huang, Zixuan, Li, Gongxun, Wang, Huaiyang, Yuan, Chengyi, Xia, Xin, Wang, Deqing, Zhuang, Fuzhen, Ma, Shuai, Ding, Ning, Yang, Yaodong, Li, Jianxin, Ban, Yikun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Policy Improvement Reinforcement Learning
di: Wang, Huaiyang, et al.
Pubblicazione: (2026)
di: Wang, Huaiyang, et al.
Pubblicazione: (2026)
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
di: Chen, Zehao, et al.
Pubblicazione: (2026)
di: Chen, Zehao, et al.
Pubblicazione: (2026)
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
di: Dou, Zheng, et al.
Pubblicazione: (2026)
di: Dou, Zheng, et al.
Pubblicazione: (2026)
Does Your Reasoning Model Implicitly Know When to Stop Thinking?
di: Huang, Zixuan, et al.
Pubblicazione: (2026)
di: Huang, Zixuan, et al.
Pubblicazione: (2026)
Your Group-Relative Advantage Is Biased
di: Yang, Fengkai, et al.
Pubblicazione: (2026)
di: Yang, Fengkai, et al.
Pubblicazione: (2026)
Counterfactual Credit Policy Optimization for Multi-Agent Collaboration
di: Li, Zhongyi, et al.
Pubblicazione: (2026)
di: Li, Zhongyi, et al.
Pubblicazione: (2026)
LLMBoost: Make Large Language Models Stronger with Boosting
di: Chen, Zehao, et al.
Pubblicazione: (2025)
di: Chen, Zehao, et al.
Pubblicazione: (2025)
Real-Time Aligned Reward Model beyond Semantics
di: Huang, Zixuan, et al.
Pubblicazione: (2026)
di: Huang, Zixuan, et al.
Pubblicazione: (2026)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment
di: Xie, Hongyan, et al.
Pubblicazione: (2026)
di: Xie, Hongyan, et al.
Pubblicazione: (2026)
Adaptive Robust Estimator for Multi-Agent Reinforcement Learning
di: Li, Zhongyi, et al.
Pubblicazione: (2026)
di: Li, Zhongyi, et al.
Pubblicazione: (2026)
Bridging Social Psychology and LLM Reasoning: Conflict-Aware Meta-Review Generation via Cognitive Alignment
di: Chen, Wei, et al.
Pubblicazione: (2025)
di: Chen, Wei, et al.
Pubblicazione: (2025)
Data-Free Continual Learning of Server Models in Model-Heterogeneous Cloud-Device Collaboration
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
Hyperbolic Diffusion Recommender Model
di: Yuan, Meng, et al.
Pubblicazione: (2025)
di: Yuan, Meng, et al.
Pubblicazione: (2025)
One for Dozens: Adaptive REcommendation for All Domains with Counterfactual Augmentation
di: Luo, Huishi, et al.
Pubblicazione: (2024)
di: Luo, Huishi, et al.
Pubblicazione: (2024)
CDC: Causal Domain Clustering for Multi-Domain Recommendation
di: Luo, Huishi, et al.
Pubblicazione: (2025)
di: Luo, Huishi, et al.
Pubblicazione: (2025)
FLeW: Facet-Level and Adaptive Weighted Representation Learning of Scientific Documents
di: Dou, Zheng, et al.
Pubblicazione: (2025)
di: Dou, Zheng, et al.
Pubblicazione: (2025)
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection
di: Chen, Yiwen, et al.
Pubblicazione: (2026)
di: Chen, Yiwen, et al.
Pubblicazione: (2026)
Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
di: Xie, Hongyan, et al.
Pubblicazione: (2025)
di: Xie, Hongyan, et al.
Pubblicazione: (2025)
FairDgcl: Fairness-aware Recommendation with Dynamic Graph Contrastive Learning
di: Chen, Wei, et al.
Pubblicazione: (2024)
di: Chen, Wei, et al.
Pubblicazione: (2024)
RKKY-like interactions between two magnetic skyrmions
di: Hu, Xuchong, et al.
Pubblicazione: (2026)
di: Hu, Xuchong, et al.
Pubblicazione: (2026)
TextBridgeGNN: Pre-training Graph Neural Network for Cross-Domain Recommendation via Text-Guided Transfer
di: Chen, Yiwen, et al.
Pubblicazione: (2025)
di: Chen, Yiwen, et al.
Pubblicazione: (2025)
Heterogeneity in Multi-Agent Reinforcement Learning
di: Hu, Tianyi, et al.
Pubblicazione: (2025)
di: Hu, Tianyi, et al.
Pubblicazione: (2025)
Federated Reasoning Distillation Framework with Model Learnability-Aware Data Allocation
di: Guo, Wei, et al.
Pubblicazione: (2026)
di: Guo, Wei, et al.
Pubblicazione: (2026)
A Survey on Causal Inference for Recommendation
di: Luo, Huishi, et al.
Pubblicazione: (2023)
di: Luo, Huishi, et al.
Pubblicazione: (2023)
Quantum Entanglement and Teleportation of Magnons in Coupled Spin Chains
di: Xia, Zian, et al.
Pubblicazione: (2026)
di: Xia, Zian, et al.
Pubblicazione: (2026)
Maximum Entropy Heterogeneous-Agent Reinforcement Learning
di: Liu, Jiarong, et al.
Pubblicazione: (2023)
di: Liu, Jiarong, et al.
Pubblicazione: (2023)
TAMO: Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent with Multi-Modality Observation Data in Cloud-Native Systems
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
SynGR: Unleashing the Potential of Cross-Modal Synergy for Generative Recommendation
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
Towards Efficient Collaboration via Graph Modeling in Reinforcement Learning
di: Fan, Wenzhe, et al.
Pubblicazione: (2024)
di: Fan, Wenzhe, et al.
Pubblicazione: (2024)
Reinforced Collaboration in Multi-Agent Flow Networks
di: Wang, Zheng, et al.
Pubblicazione: (2026)
di: Wang, Zheng, et al.
Pubblicazione: (2026)
Learning Adaptive Distribution Alignment with Neural Characteristic Function for Graph Domain Adaptation
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
Vulnerable Agent Identification in Large-Scale Multi-Agent Reinforcement Learning
di: Li, Simin, et al.
Pubblicazione: (2025)
di: Li, Simin, et al.
Pubblicazione: (2025)
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
ORCA: Mitigating Over-Reliance for Multi-Task Dwell Time Prediction with Causal Decoupling
di: Luo, Huishi, et al.
Pubblicazione: (2025)
di: Luo, Huishi, et al.
Pubblicazione: (2025)
Exploration-free Algorithms for Multi-group Mean Estimation
di: Wei, Ziyi, et al.
Pubblicazione: (2025)
di: Wei, Ziyi, et al.
Pubblicazione: (2025)
K-Score: Kalman Filter as a Principled Alternative to Reward Normalization in Reinforcement Learning
di: Xia, Zixuan, et al.
Pubblicazione: (2026)
di: Xia, Zixuan, et al.
Pubblicazione: (2026)
LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation
di: Chen, Yiwen, et al.
Pubblicazione: (2026)
di: Chen, Yiwen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Policy Improvement Reinforcement Learning
di: Wang, Huaiyang, et al.
Pubblicazione: (2026) -
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
di: Chen, Zehao, et al.
Pubblicazione: (2026) -
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
di: Dou, Zheng, et al.
Pubblicazione: (2026) -
Does Your Reasoning Model Implicitly Know When to Stop Thinking?
di: Huang, Zixuan, et al.
Pubblicazione: (2026) -
Your Group-Relative Advantage Is Biased
di: Yang, Fengkai, et al.
Pubblicazione: (2026)