Reinforcing Language Agents via Policy Optimization with Action Decomposition
Fuente:
arXiv
Salvato in:
| Autori principali: | Wen, Muning, Wan, Ziyu, Zhang, Weinan, Wang, Jun, Wen, Ying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
di: Wen, Muning, et al.
Pubblicazione: (2024)
di: Wen, Muning, et al.
Pubblicazione: (2024)
MARFT: Multi-Agent Reinforcement Fine-Tuning
di: Liao, Junwei, et al.
Pubblicazione: (2025)
di: Liao, Junwei, et al.
Pubblicazione: (2025)
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
di: Feng, Xidong, et al.
Pubblicazione: (2023)
di: Feng, Xidong, et al.
Pubblicazione: (2023)
PMAT: Optimizing Action Generation Order in Multi-Agent Reinforcement Learning
di: Hu, Kun, et al.
Pubblicazione: (2025)
di: Hu, Kun, et al.
Pubblicazione: (2025)
Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity
di: Yang, Yingxuan, et al.
Pubblicazione: (2026)
di: Yang, Yingxuan, et al.
Pubblicazione: (2026)
Autonomous Goal Detection and Cessation in Reinforcement Learning: A Case Study on Source Term Estimation
di: Shi, Yiwei, et al.
Pubblicazione: (2024)
di: Shi, Yiwei, et al.
Pubblicazione: (2024)
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
di: Wan, Ziyu, et al.
Pubblicazione: (2025)
di: Wan, Ziyu, et al.
Pubblicazione: (2025)
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024)
di: Feng, Xidong, et al.
Pubblicazione: (2024)
Hammer: Robust Function-Calling for On-Device Language Models via Function Masking
di: Lin, Qiqiang, et al.
Pubblicazione: (2024)
di: Lin, Qiqiang, et al.
Pubblicazione: (2024)
Score-Based Diffusion Policy Compatible with Reinforcement Learning via Optimal Transport
di: Sun, Mingyang, et al.
Pubblicazione: (2025)
di: Sun, Mingyang, et al.
Pubblicazione: (2025)
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024)
di: Feng, Xidong, et al.
Pubblicazione: (2024)
Towards Cold-Start Drafting and Continual Refining: A Value-Driven Memory Approach with Application to NPU Kernel Synthesis
di: Zheng, Yujie, et al.
Pubblicazione: (2026)
di: Zheng, Yujie, et al.
Pubblicazione: (2026)
Dual Action Policy for Robust Sim-to-Real Reinforcement Learning
di: Terence, Ng Wen Zheng, et al.
Pubblicazione: (2024)
di: Terence, Ng Wen Zheng, et al.
Pubblicazione: (2024)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
di: Zhang, Tianle, et al.
Pubblicazione: (2024)
di: Zhang, Tianle, et al.
Pubblicazione: (2024)
Explainable Reinforcement Learning via Temporal Policy Decomposition
di: Ruggeri, Franco, et al.
Pubblicazione: (2025)
di: Ruggeri, Franco, et al.
Pubblicazione: (2025)
Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning
di: Hazra, Somnath, et al.
Pubblicazione: (2025)
di: Hazra, Somnath, et al.
Pubblicazione: (2025)
DiffTORI: Differentiable Trajectory Optimization for Deep Reinforcement and Imitation Learning
di: Wan, Weikang, et al.
Pubblicazione: (2024)
di: Wan, Weikang, et al.
Pubblicazione: (2024)
Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
di: Peng, Xiyue, et al.
Pubblicazione: (2024)
di: Peng, Xiyue, et al.
Pubblicazione: (2024)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
di: Liu, Zongkai, et al.
Pubblicazione: (2024)
Robust Gymnasium: A Unified Modular Benchmark for Robust Reinforcement Learning
di: Gu, Shangding, et al.
Pubblicazione: (2025)
di: Gu, Shangding, et al.
Pubblicazione: (2025)
Agentic Reinforced Policy Optimization
di: Dong, Guanting, et al.
Pubblicazione: (2025)
di: Dong, Guanting, et al.
Pubblicazione: (2025)
Coefficient Decomposition for Spectral Graph Convolution
di: Huang, Feng, et al.
Pubblicazione: (2024)
di: Huang, Feng, et al.
Pubblicazione: (2024)
Calibration-Aware Policy Optimization for Reasoning LLMs
di: Wang, Ziqi, et al.
Pubblicazione: (2026)
di: Wang, Ziqi, et al.
Pubblicazione: (2026)
Adaptive Social Learning via Mode Policy Optimization for Language Agents
di: Wang, Minzheng, et al.
Pubblicazione: (2025)
di: Wang, Minzheng, et al.
Pubblicazione: (2025)
Position: Agentic AI System Is a Foreseeable Pathway to AGI
di: Liao, Junwei, et al.
Pubblicazione: (2026)
di: Liao, Junwei, et al.
Pubblicazione: (2026)
BackSlash: Rate Constrained Optimized Training of Large Language Models
di: Wu, Jun, et al.
Pubblicazione: (2025)
di: Wu, Jun, et al.
Pubblicazione: (2025)
Towards Monotonic Improvement in In-Context Reinforcement Learning
di: Zhang, Wenhao, et al.
Pubblicazione: (2025)
di: Zhang, Wenhao, et al.
Pubblicazione: (2025)
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
di: Patel, Nirmal, et al.
Pubblicazione: (2026)
di: Patel, Nirmal, et al.
Pubblicazione: (2026)
Tree Search for LLM Agent Reinforcement Learning
di: Ji, Yuxiang, et al.
Pubblicazione: (2025)
di: Ji, Yuxiang, et al.
Pubblicazione: (2025)
Integrating Policy Summaries with Reward Decomposition for Explaining Reinforcement Learning Agents
di: Septon, Yael, et al.
Pubblicazione: (2022)
di: Septon, Yael, et al.
Pubblicazione: (2022)
SAMG: Offline-to-Online Reinforcement Learning via State-Action-Conditional Offline Model Guidance
di: Zhang, Liyu, et al.
Pubblicazione: (2024)
di: Zhang, Liyu, et al.
Pubblicazione: (2024)
ML-Master: Towards AI-for-AI via Integration of Exploration and Reasoning
di: Liu, Zexi, et al.
Pubblicazione: (2025)
di: Liu, Zexi, et al.
Pubblicazione: (2025)
Skewed Memorization in Large Language Models: Quantification and Decomposition
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
Model-based Multi-agent Reinforcement Learning: Recent Progress and Prospects
di: Wang, Xihuai, et al.
Pubblicazione: (2022)
di: Wang, Xihuai, et al.
Pubblicazione: (2022)
Optimal Policy Sparsification and Low Rank Decomposition for Deep Reinforcement Learning
di: Goddla, Vikram
Pubblicazione: (2024)
di: Goddla, Vikram
Pubblicazione: (2024)
Policy and World Modeling Co-Training for Language Agents
di: Lu, Ning, et al.
Pubblicazione: (2026)
di: Lu, Ning, et al.
Pubblicazione: (2026)
Co-Evolution of Policy and Internal Reward for Language Agents
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
StaRPO: Stability-Augmented Reinforcement Policy Optimization
di: Zhang, Jinghan, et al.
Pubblicazione: (2026)
di: Zhang, Jinghan, et al.
Pubblicazione: (2026)
Offline Reinforcement Learning with Penalized Action Noise Injection
di: Oh, JunHyeok, et al.
Pubblicazione: (2025)
di: Oh, JunHyeok, et al.
Pubblicazione: (2025)
Discretizing Continuous Action Space with Unimodal Probability Distributions for On-Policy Reinforcement Learning
di: Zhu, Yuanyang, et al.
Pubblicazione: (2024)
di: Zhu, Yuanyang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
di: Wen, Muning, et al.
Pubblicazione: (2024) -
MARFT: Multi-Agent Reinforcement Fine-Tuning
di: Liao, Junwei, et al.
Pubblicazione: (2025) -
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
di: Feng, Xidong, et al.
Pubblicazione: (2023) -
PMAT: Optimizing Action Generation Order in Multi-Agent Reinforcement Learning
di: Hu, Kun, et al.
Pubblicazione: (2025) -
Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity
di: Yang, Yingxuan, et al.
Pubblicazione: (2026)