Advancing Language Multi-Agent Learning with Credit Re-Assignment for Interactive Environment Generalization
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Zhitao, Liu, Zijun, Li, Peng, Fung, Yi R., Yan, Ming, Zhang, Ji, Huang, Fei, Liu, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy
por: Yang, Zonghan, et al.
Publicado: (2024)
por: Yang, Zonghan, et al.
Publicado: (2024)
Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
por: Liu, Zijun, et al.
Publicado: (2025)
por: Liu, Zijun, et al.
Publicado: (2025)
ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education
por: He, Zhitao, et al.
Publicado: (2025)
por: He, Zhitao, et al.
Publicado: (2025)
RebuttalAgent: Strategic Persuasion in Academic Rebuttal via Theory of Mind
por: He, Zhitao, et al.
Publicado: (2026)
por: He, Zhitao, et al.
Publicado: (2026)
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
por: Zhang, Yaocheng, et al.
Publicado: (2025)
por: Zhang, Yaocheng, et al.
Publicado: (2025)
MMBoundary: Advancing MLLM Knowledge Boundary Awareness through Reasoning Step Confidence Calibration
por: He, Zhitao, et al.
Publicado: (2025)
por: He, Zhitao, et al.
Publicado: (2025)
On Stable Long-Form Generation: Benchmarking and Mitigating Length Volatility
por: He, Zhitao, et al.
Publicado: (2026)
por: He, Zhitao, et al.
Publicado: (2026)
Enabling Weak LLMs to Judge Response Reliability via Meta Ranking
por: Liu, Zijun, et al.
Publicado: (2024)
por: Liu, Zijun, et al.
Publicado: (2024)
MAC-Tuning: LLM Multi-Compositional Problem Reasoning with Enhanced Knowledge Boundary Awareness
por: Huang, Junsheng, et al.
Publicado: (2025)
por: Huang, Junsheng, et al.
Publicado: (2025)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
por: Liu, Jiayu, et al.
Publicado: (2025)
por: Liu, Jiayu, et al.
Publicado: (2025)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
por: Zhang, Chenchen
Publicado: (2026)
por: Zhang, Chenchen
Publicado: (2026)
MARS-SQL: A multi-agent reinforcement learning framework for Text-to-SQL
por: Yang, Haolin, et al.
Publicado: (2025)
por: Yang, Haolin, et al.
Publicado: (2025)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
por: Ding, Fei, et al.
Publicado: (2026)
por: Ding, Fei, et al.
Publicado: (2026)
Re-ReST: Reflection-Reinforced Self-Training for Language Agents
por: Dou, Zi-Yi, et al.
Publicado: (2024)
por: Dou, Zi-Yi, et al.
Publicado: (2024)
OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
por: Hu, Xiaomeng, et al.
Publicado: (2026)
por: Hu, Xiaomeng, et al.
Publicado: (2026)
LLMArena: Assessing Capabilities of Large Language Models in Dynamic Multi-Agent Environments
por: Chen, Junzhe, et al.
Publicado: (2024)
por: Chen, Junzhe, et al.
Publicado: (2024)
MATP-BENCH: Can MLLM Be a Good Automated Theorem Prover for Multimodal Problems?
por: He, Zhitao, et al.
Publicado: (2025)
por: He, Zhitao, et al.
Publicado: (2025)
Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks
por: He, Jiayi, et al.
Publicado: (2024)
por: He, Jiayi, et al.
Publicado: (2024)
A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration
por: Liu, Zijun, et al.
Publicado: (2023)
por: Liu, Zijun, et al.
Publicado: (2023)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
por: Khandoga, Mykola, et al.
Publicado: (2026)
por: Khandoga, Mykola, et al.
Publicado: (2026)
MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue
por: Zhang, Naifan, et al.
Publicado: (2026)
por: Zhang, Naifan, et al.
Publicado: (2026)
RePPL: Recalibrating Perplexity by Uncertainty in Semantic Propagation and Language Generation for Explainable QA Hallucination Detection
por: Huang, Yiming, et al.
Publicado: (2025)
por: Huang, Yiming, et al.
Publicado: (2025)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
por: Guo, Yiran, et al.
Publicado: (2025)
por: Guo, Yiran, et al.
Publicado: (2025)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
por: Monsefi, Amin Karimi, et al.
Publicado: (2026)
por: Monsefi, Amin Karimi, et al.
Publicado: (2026)
Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning
por: Lei, Xuanyu, et al.
Publicado: (2025)
por: Lei, Xuanyu, et al.
Publicado: (2025)
Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
por: Yang, Kailai, et al.
Publicado: (2025)
por: Yang, Kailai, et al.
Publicado: (2025)
Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers
por: Hu, Senkang, et al.
Publicado: (2026)
por: Hu, Senkang, et al.
Publicado: (2026)
Towards Unified Alignment Between Agents, Humans, and Environment
por: Yang, Zonghan, et al.
Publicado: (2024)
por: Yang, Zonghan, et al.
Publicado: (2024)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
por: Li, Ziheng, et al.
Publicado: (2026)
por: Li, Ziheng, et al.
Publicado: (2026)
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
por: Tang, Wenjie, et al.
Publicado: (2026)
por: Tang, Wenjie, et al.
Publicado: (2026)
RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents
por: Li, Mingchen, et al.
Publicado: (2026)
por: Li, Mingchen, et al.
Publicado: (2026)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
por: Jiang, Xitai, et al.
Publicado: (2026)
por: Jiang, Xitai, et al.
Publicado: (2026)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
por: Xie, Guofu, et al.
Publicado: (2025)
por: Xie, Guofu, et al.
Publicado: (2025)
APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation
por: Chen, Kun, et al.
Publicado: (2026)
por: Chen, Kun, et al.
Publicado: (2026)
CultureCLIP: Empowering CLIP with Cultural Awareness through Synthetic Images and Contextualized Captions
por: Huang, Yuchen, et al.
Publicado: (2025)
por: Huang, Yuchen, et al.
Publicado: (2025)
Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
por: Tran, Hieu, et al.
Publicado: (2025)
por: Tran, Hieu, et al.
Publicado: (2025)
Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking
por: Ju, Feng, et al.
Publicado: (2025)
por: Ju, Feng, et al.
Publicado: (2025)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
por: Yang, Matthew Y. R., et al.
Publicado: (2026)
por: Yang, Matthew Y. R., et al.
Publicado: (2026)
Reducing Distraction in Long-Context Language Models by Focused Learning
por: Wu, Zijun, et al.
Publicado: (2024)
por: Wu, Zijun, et al.
Publicado: (2024)
Multi-Agent Simulator Drives Language Models for Legal Intensive Interaction
por: Yue, Shengbin, et al.
Publicado: (2025)
por: Yue, Shengbin, et al.
Publicado: (2025)
Ejemplares similares
-
ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy
por: Yang, Zonghan, et al.
Publicado: (2024) -
Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
por: Liu, Zijun, et al.
Publicado: (2025) -
ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education
por: He, Zhitao, et al.
Publicado: (2025) -
RebuttalAgent: Strategic Persuasion in Academic Rebuttal via Theory of Mind
por: He, Zhitao, et al.
Publicado: (2026) -
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
por: Zhang, Yaocheng, et al.
Publicado: (2025)