Saved in:
| Main Authors: | Li, Zhongyi, Tian, Wan, Ban, Yikun, Chen, Jinju, Zhang, Huiming, Liu, Yang, Zhuang, Fuzhen |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2603.21563 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Adaptive Robust Estimator for Multi-Agent Reinforcement Learning
by: Li, Zhongyi, et al.
Published: (2026)
by: Li, Zhongyi, et al.
Published: (2026)
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
by: Chen, Zehao, et al.
Published: (2026)
by: Chen, Zehao, et al.
Published: (2026)
Sharper Generalization Bounds for Transformer
by: Li, Yawen, et al.
Published: (2026)
by: Li, Yawen, et al.
Published: (2026)
Graph Dimension Attention Networks for Enterprise Credit Assessment
by: Wei, Shaopeng, et al.
Published: (2024)
by: Wei, Shaopeng, et al.
Published: (2024)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
by: Lu, Xiaodong, et al.
Published: (2026)
by: Lu, Xiaodong, et al.
Published: (2026)
Counterfactual Multi-Agent Policy Gradients
by: Foerster, Jakob, et al.
Published: (2017)
by: Foerster, Jakob, et al.
Published: (2017)
Federated Reasoning Distillation Framework with Model Learnability-Aware Data Allocation
by: Guo, Wei, et al.
Published: (2026)
by: Guo, Wei, et al.
Published: (2026)
Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
by: Yang, Wei, et al.
Published: (2026)
by: Yang, Wei, et al.
Published: (2026)
Examining Agents' Bias Amplification versus Suppression in Multi-Agent Systems
by: Wu, Zejian Eric, et al.
Published: (2026)
by: Wu, Zejian Eric, et al.
Published: (2026)
TAMO: Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent with Multi-Modality Observation Data in Cloud-Native Systems
by: Zhang, Xiao, et al.
Published: (2025)
by: Zhang, Xiao, et al.
Published: (2025)
Does Your Reasoning Model Implicitly Know When to Stop Thinking?
by: Huang, Zixuan, et al.
Published: (2026)
by: Huang, Zixuan, et al.
Published: (2026)
Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization
by: Kapoor, Aditya, et al.
Published: (2024)
by: Kapoor, Aditya, et al.
Published: (2024)
Real-Time Aligned Reward Model beyond Semantics
by: Huang, Zixuan, et al.
Published: (2026)
by: Huang, Zixuan, et al.
Published: (2026)
Who Deserves the Reward? SHARP: Shapley Credit-based Optimization for Multi-Agent System
by: Li, Yanming, et al.
Published: (2026)
by: Li, Yanming, et al.
Published: (2026)
Maestro: Learning to Collaborate via Conditional Listwise Policy Optimization for Multi-Agent LLMs
by: Yang, Wei, et al.
Published: (2025)
by: Yang, Wei, et al.
Published: (2025)
LLMBoost: Make Large Language Models Stronger with Boosting
by: Chen, Zehao, et al.
Published: (2025)
by: Chen, Zehao, et al.
Published: (2025)
SentinelNet: Safeguarding Multi-Agent Collaboration Through Credit-Based Dynamic Threat Detection
by: Feng, Yang, et al.
Published: (2025)
by: Feng, Yang, et al.
Published: (2025)
DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment
by: Jin, Hongbo, et al.
Published: (2026)
by: Jin, Hongbo, et al.
Published: (2026)
Tail-Aware Information-Theoretic Generalization for RLHF and SGLD
by: Zhang, Huiming, et al.
Published: (2026)
by: Zhang, Huiming, et al.
Published: (2026)
Weak-Link Optimization for Multi-Agent Reasoning and Collaboration
by: Bian, Haoyu, et al.
Published: (2026)
by: Bian, Haoyu, et al.
Published: (2026)
Data-Free Continual Learning of Server Models in Model-Heterogeneous Cloud-Device Collaboration
by: Zhang, Xiao, et al.
Published: (2025)
by: Zhang, Xiao, et al.
Published: (2025)
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
by: Fang, Yangyi, et al.
Published: (2026)
by: Fang, Yangyi, et al.
Published: (2026)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
by: Khandoga, Mykola, et al.
Published: (2026)
by: Khandoga, Mykola, et al.
Published: (2026)
Multi-Aspect Cross-modal Quantization for Generative Recommendation
by: Zhang, Fuwei, et al.
Published: (2025)
by: Zhang, Fuwei, et al.
Published: (2025)
Adaptive Confidence Gating in Multi-Agent Collaboration for Efficient and Optimized Code Generation
by: Zhang, Haoji, et al.
Published: (2026)
by: Zhang, Haoji, et al.
Published: (2026)
\textsc{MasFACT}: Continual Multi-Agent Topology Learning via Geometry-Aware Posterior Transfer
by: Wang, Xuefei, et al.
Published: (2026)
by: Wang, Xuefei, et al.
Published: (2026)
Unifying Temporal and Structural Credit Assignment in LLM-Based Multi-Agent Prompt Optimization
by: Li, Wenwu, et al.
Published: (2026)
by: Li, Wenwu, et al.
Published: (2026)
FCKT: Fine-Grained Cross-Task Knowledge Transfer with Semantic Contrastive Learning for Targeted Sentiment Analysis
by: Chen, Wei, et al.
Published: (2025)
by: Chen, Wei, et al.
Published: (2025)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
by: Huang, Zixuan, et al.
Published: (2025)
by: Huang, Zixuan, et al.
Published: (2025)
Multi-Agent Guided Policy Optimization
by: Li, Yueheng, et al.
Published: (2025)
by: Li, Yueheng, et al.
Published: (2025)
MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization
by: Han, Yichen, et al.
Published: (2025)
by: Han, Yichen, et al.
Published: (2025)
Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning
by: Chen, Xudong, et al.
Published: (2026)
by: Chen, Xudong, et al.
Published: (2026)
Bridging Social Psychology and LLM Reasoning: Conflict-Aware Meta-Review Generation via Cognitive Alignment
by: Chen, Wei, et al.
Published: (2025)
by: Chen, Wei, et al.
Published: (2025)
FairDgcl: Fairness-aware Recommendation with Dynamic Graph Contrastive Learning
by: Chen, Wei, et al.
Published: (2024)
by: Chen, Wei, et al.
Published: (2024)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
by: Ding, Fei, et al.
Published: (2026)
by: Ding, Fei, et al.
Published: (2026)
HMACE: Heterogeneous Multi-Agent Collaborative Evolution for Combinatorial Optimization
by: Yan, Yuping, et al.
Published: (2026)
by: Yan, Yuping, et al.
Published: (2026)
PaAno: Patch-Based Representation Learning for Time-Series Anomaly Detection
by: Park, Jinju, et al.
Published: (2026)
by: Park, Jinju, et al.
Published: (2026)
Intelligent Collaborative Optimization for Rubber Tyre Film Production Based on Multi-path Differentiated Clipping Proximal Policy Optimization
by: Ruan, Yinghao, et al.
Published: (2025)
by: Ruan, Yinghao, et al.
Published: (2025)
Counterfactual Self-Questioning for Stable Policy Optimization in Language Models
by: Parab, Mandar
Published: (2025)
by: Parab, Mandar
Published: (2025)
Similar Items
-
Adaptive Robust Estimator for Multi-Agent Reinforcement Learning
by: Li, Zhongyi, et al.
Published: (2026) -
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
by: Chen, Zehao, et al.
Published: (2026) -
Sharper Generalization Bounds for Transformer
by: Li, Yawen, et al.
Published: (2026) -
Graph Dimension Attention Networks for Enterprise Credit Assessment
by: Wei, Shaopeng, et al.
Published: (2024) -
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
by: Lu, Xiaodong, et al.
Published: (2026)