Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Wei, Cao, Defu, Pang, Jiacheng, Weng, Muyan, Liu, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TemporalBench: A Benchmark for Evaluating LLM-Based Agents on Contextual and Event-Informed Time Series Tasks
di: Weng, Muyan, et al.
Pubblicazione: (2026)
di: Weng, Muyan, et al.
Pubblicazione: (2026)
Maestro: Learning to Collaborate via Conditional Listwise Policy Optimization for Multi-Agent LLMs
di: Yang, Wei, et al.
Pubblicazione: (2025)
di: Yang, Wei, et al.
Pubblicazione: (2025)
When LLM Meets Time Series: Can LLMs Perform Multi-Step Time Series Reasoning and Inference
di: Ye, Wen, et al.
Pubblicazione: (2025)
di: Ye, Wen, et al.
Pubblicazione: (2025)
Counterfactual Credit Policy Optimization for Multi-Agent Collaboration
di: Li, Zhongyi, et al.
Pubblicazione: (2026)
di: Li, Zhongyi, et al.
Pubblicazione: (2026)
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
di: Zhou, Huilin, et al.
Pubblicazione: (2026)
di: Zhou, Huilin, et al.
Pubblicazione: (2026)
Intelligent Collaborative Optimization for Rubber Tyre Film Production Based on Multi-path Differentiated Clipping Proximal Policy Optimization
di: Ruan, Yinghao, et al.
Pubblicazione: (2025)
di: Ruan, Yinghao, et al.
Pubblicazione: (2025)
Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs
di: Liu, Jinbo, et al.
Pubblicazione: (2025)
di: Liu, Jinbo, et al.
Pubblicazione: (2025)
Foundation Models for Demand Forecasting via Dual-Strategy Ensembling
di: Yang, Wei, et al.
Pubblicazione: (2025)
di: Yang, Wei, et al.
Pubblicazione: (2025)
HALO: Learning Human-Robot Collaboration via Heterogeneous-Agent Lyapunov Policy Optimization
di: Zhang, Hao, et al.
Pubblicazione: (2026)
di: Zhang, Hao, et al.
Pubblicazione: (2026)
Adapting Like Humans: A Metacognitive Agent with Test-time Reasoning
di: Li, Yang, et al.
Pubblicazione: (2025)
di: Li, Yang, et al.
Pubblicazione: (2025)
DNN Task Assignment in UAV Networks: A Generative AI Enhanced Multi-Agent Reinforcement Learning Approach
di: Tang, Xin, et al.
Pubblicazione: (2024)
di: Tang, Xin, et al.
Pubblicazione: (2024)
Adaptive Confidence Gating in Multi-Agent Collaboration for Efficient and Optimized Code Generation
di: Zhang, Haoji, et al.
Pubblicazione: (2026)
di: Zhang, Haoji, et al.
Pubblicazione: (2026)
Truly Self-Improving Agents Require Intrinsic Metacognitive Learning
di: Liu, Tennison, et al.
Pubblicazione: (2025)
di: Liu, Tennison, et al.
Pubblicazione: (2025)
Multi-Agent LLMs for Adaptive Acquisition in Bayesian Optimization
di: Carbonati, Andrea, et al.
Pubblicazione: (2026)
di: Carbonati, Andrea, et al.
Pubblicazione: (2026)
AMA: Adaptive Memory via Multi-Agent Collaboration
di: Huang, Weiquan, et al.
Pubblicazione: (2026)
di: Huang, Weiquan, et al.
Pubblicazione: (2026)
HMACE: Heterogeneous Multi-Agent Collaborative Evolution for Combinatorial Optimization
di: Yan, Yuping, et al.
Pubblicazione: (2026)
di: Yan, Yuping, et al.
Pubblicazione: (2026)
A Survey of Reasoning and Agentic Systems in Time Series with Large Language Models
di: Chang, Ching, et al.
Pubblicazione: (2025)
di: Chang, Ching, et al.
Pubblicazione: (2025)
Learning to Deliberate: Meta-policy Collaboration for Agentic LLMs with Multi-agent Reinforcement Learning
di: Yang, Wei, et al.
Pubblicazione: (2025)
di: Yang, Wei, et al.
Pubblicazione: (2025)
Self-Monitoring Benefits from Structural Integration: Lessons from Metacognition in Continuous-Time Multi-Timescale Agents
di: Xie, Ying
Pubblicazione: (2026)
di: Xie, Ying
Pubblicazione: (2026)
TS-Reasoner: Domain-Oriented Time Series Inference Agents for Reasoning and Automated Analysis
di: Ye, Wen, et al.
Pubblicazione: (2024)
di: Ye, Wen, et al.
Pubblicazione: (2024)
Multi-Agent Collaboration Mechanisms: A Survey of LLMs
di: Tran, Khanh-Tung, et al.
Pubblicazione: (2025)
di: Tran, Khanh-Tung, et al.
Pubblicazione: (2025)
TCAndon-Router: Adaptive Reasoning Router for Multi-Agent Collaboration
di: Zhao, Jiuzhou, et al.
Pubblicazione: (2026)
di: Zhao, Jiuzhou, et al.
Pubblicazione: (2026)
Weak-Link Optimization for Multi-Agent Reasoning and Collaboration
di: Bian, Haoyu, et al.
Pubblicazione: (2026)
di: Bian, Haoyu, et al.
Pubblicazione: (2026)
Adaptive Event-Triggered Policy Gradient for Multi-Agent Reinforcement Learning
di: Siddique, Umer, et al.
Pubblicazione: (2025)
di: Siddique, Umer, et al.
Pubblicazione: (2025)
Evidence for Limited Metacognition in LLMs
di: Ackerman, Christopher
Pubblicazione: (2025)
di: Ackerman, Christopher
Pubblicazione: (2025)
Action-Adaptive Continual Learning: Enabling Policy Generalization under Dynamic Action Spaces
di: Pan, Chaofan, et al.
Pubblicazione: (2025)
di: Pan, Chaofan, et al.
Pubblicazione: (2025)
Collaborative Belief Reasoning with LLMs for Efficient Multi-Agent Collaboration
di: Wang, Zhimin, et al.
Pubblicazione: (2025)
di: Wang, Zhimin, et al.
Pubblicazione: (2025)
Decentralized and Lifelong-Adaptive Multi-Agent Collaborative Learning
di: Tang, Shuo, et al.
Pubblicazione: (2024)
di: Tang, Shuo, et al.
Pubblicazione: (2024)
Cognition to Control - Multi-Agent Learning for Human-Humanoid Collaborative Transport
di: Zhang, Hao, et al.
Pubblicazione: (2026)
di: Zhang, Hao, et al.
Pubblicazione: (2026)
MetaCogAgent: A Metacognitive Multi-Agent LLM Framework with Self-Aware Task Delegation
di: Wang, Chenyu, et al.
Pubblicazione: (2026)
di: Wang, Chenyu, et al.
Pubblicazione: (2026)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
AgentRec: Next-Generation LLM-Powered Multi-Agent Collaborative Recommendation with Adaptive Intelligence
di: Ma, Bo, et al.
Pubblicazione: (2025)
di: Ma, Bo, et al.
Pubblicazione: (2025)
ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents
di: Yang, Linyi, et al.
Pubblicazione: (2025)
di: Yang, Linyi, et al.
Pubblicazione: (2025)
MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization
di: Han, Yichen, et al.
Pubblicazione: (2025)
di: Han, Yichen, et al.
Pubblicazione: (2025)
PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering
di: Liu, Yu, et al.
Pubblicazione: (2026)
di: Liu, Yu, et al.
Pubblicazione: (2026)
PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection
di: Cheng, Siyuan, et al.
Pubblicazione: (2026)
di: Cheng, Siyuan, et al.
Pubblicazione: (2026)
MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization
di: Zhang, Lanxue, et al.
Pubblicazione: (2025)
di: Zhang, Lanxue, et al.
Pubblicazione: (2025)
Exploring the Potential of Metacognitive Support Agents for Human-AI Co-Creation
di: Gmeiner, Frederic, et al.
Pubblicazione: (2025)
di: Gmeiner, Frederic, et al.
Pubblicazione: (2025)
Joint Agent Memory and Exploration Learning via Novelty Signals
di: Tian, Shizuo, et al.
Pubblicazione: (2026)
di: Tian, Shizuo, et al.
Pubblicazione: (2026)
Conversational Time Series Foundation Models: Towards Explainable and Effective Forecasting
di: Cao, Defu, et al.
Pubblicazione: (2025)
di: Cao, Defu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TemporalBench: A Benchmark for Evaluating LLM-Based Agents on Contextual and Event-Informed Time Series Tasks
di: Weng, Muyan, et al.
Pubblicazione: (2026) -
Maestro: Learning to Collaborate via Conditional Listwise Policy Optimization for Multi-Agent LLMs
di: Yang, Wei, et al.
Pubblicazione: (2025) -
When LLM Meets Time Series: Can LLMs Perform Multi-Step Time Series Reasoning and Inference
di: Ye, Wen, et al.
Pubblicazione: (2025) -
Counterfactual Credit Policy Optimization for Multi-Agent Collaboration
di: Li, Zhongyi, et al.
Pubblicazione: (2026) -
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
di: Zhou, Huilin, et al.
Pubblicazione: (2026)