Tree Search for LLM Agent Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Ji, Yuxiang, Ma, Ziyu, Wang, Yong, Chen, Guanhua, Chu, Xiangxiang, Wu, Liaoni |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization
by: Ji, Yuxiang, et al.
Published: (2026)
by: Ji, Yuxiang, et al.
Published: (2026)
D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning
by: Zhang, Ru, et al.
Published: (2026)
by: Zhang, Ru, et al.
Published: (2026)
GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
by: Chu, Xiangxiang, et al.
Published: (2025)
by: Chu, Xiangxiang, et al.
Published: (2025)
Ranking-aware Reinforcement Learning for Ordinal Ranking
by: Hao, Aiming, et al.
Published: (2026)
by: Hao, Aiming, et al.
Published: (2026)
AdaCuRL: Adaptive Curriculum Reinforcement Learning with Invalid Sample Mitigation and Historical Revisiting
by: Li, Renda, et al.
Published: (2025)
by: Li, Renda, et al.
Published: (2025)
Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
by: Zhu, Mingkang, et al.
Published: (2025)
by: Zhu, Mingkang, et al.
Published: (2025)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
by: Yang, Shidong, et al.
Published: (2026)
by: Yang, Shidong, et al.
Published: (2026)
Reinforcement Learning for Long-Horizon Interactive LLM Agents
by: Chen, Kevin, et al.
Published: (2025)
by: Chen, Kevin, et al.
Published: (2025)
Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates
by: Li, Yibo, et al.
Published: (2026)
by: Li, Yibo, et al.
Published: (2026)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
by: Wen, Muning, et al.
Published: (2024)
by: Wen, Muning, et al.
Published: (2024)
LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
by: Wu, Yubin, et al.
Published: (2026)
by: Wu, Yubin, et al.
Published: (2026)
SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training
by: He, Zhongyu, et al.
Published: (2026)
by: He, Zhongyu, et al.
Published: (2026)
Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning
by: Sun, Zexu, et al.
Published: (2025)
by: Sun, Zexu, et al.
Published: (2025)
HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents
by: Li, Guankai, et al.
Published: (2026)
by: Li, Guankai, et al.
Published: (2026)
Bayes Adaptive Monte Carlo Tree Search for Offline Model-based Reinforcement Learning
by: Chen, Jiayu, et al.
Published: (2024)
by: Chen, Jiayu, et al.
Published: (2024)
TreeIRL: Safe Urban Driving with Tree Search and Inverse Reinforcement Learning
by: Tomov, Momchil S., et al.
Published: (2025)
by: Tomov, Momchil S., et al.
Published: (2025)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
by: Qu, Yun, et al.
Published: (2024)
by: Qu, Yun, et al.
Published: (2024)
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning
by: Hao, Chuzhan, et al.
Published: (2025)
by: Hao, Chuzhan, et al.
Published: (2025)
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
by: Liu, Zexi, et al.
Published: (2025)
by: Liu, Zexi, et al.
Published: (2025)
MIRA: Memory-Integrated Reinforcement Learning Agent with Limited LLM Guidance
by: Nourzad, Narjes, et al.
Published: (2026)
by: Nourzad, Narjes, et al.
Published: (2026)
Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
by: Zhen, Shuai, et al.
Published: (2026)
by: Zhen, Shuai, et al.
Published: (2026)
Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems
by: Feng, Lang, et al.
Published: (2026)
by: Feng, Lang, et al.
Published: (2026)
Data-Centric Interpretability for LLM-based Multi-Agent Reinforcement Learning
by: Yan, John, et al.
Published: (2026)
by: Yan, John, et al.
Published: (2026)
CurvZO: Adaptive Curvature-Guided Sparse Zeroth-Order Optimization for Efficient LLM Fine-Tuning
by: Wang, Shuo, et al.
Published: (2026)
by: Wang, Shuo, et al.
Published: (2026)
SELA: Tree-Search Enhanced LLM Agents for Automated Machine Learning
by: Chi, Yizhou, et al.
Published: (2024)
by: Chi, Yizhou, et al.
Published: (2024)
Spend Less, Reason Better: Budget-Aware Value Tree Search for LLM Agents
by: Li, Yushu, et al.
Published: (2026)
by: Li, Yushu, et al.
Published: (2026)
Towards Revealing the Effectiveness of Small-Scale Fine-tuning in R1-style Reinforcement Learning
by: Chen, Yutong, et al.
Published: (2025)
by: Chen, Yutong, et al.
Published: (2025)
Learning Agentic Policy from Action Guidance
by: Ji, Yuxiang, et al.
Published: (2026)
by: Ji, Yuxiang, et al.
Published: (2026)
REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge
by: Zhang, Yasi, et al.
Published: (2026)
by: Zhang, Yasi, et al.
Published: (2026)
RLBayes: a Bayesian Network Structure Learning Algorithm via Reinforcement Learning-Based Search Strategy
by: Wang, Mingcan, et al.
Published: (2025)
by: Wang, Mingcan, et al.
Published: (2025)
HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation
by: Xiong, Feng, et al.
Published: (2025)
by: Xiong, Feng, et al.
Published: (2025)
SUB-PLAY: Adversarial Policies against Partially Observed Multi-Agent Reinforcement Learning Systems
by: Ma, Oubo, et al.
Published: (2024)
by: Ma, Oubo, et al.
Published: (2024)
OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems
by: Li, Xiaozhe, et al.
Published: (2025)
by: Li, Xiaozhe, et al.
Published: (2025)
End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
by: Chen, Guanzhong, et al.
Published: (2025)
by: Chen, Guanzhong, et al.
Published: (2025)
Personalized Path Recourse for Reinforcement Learning Agents
by: Hong, Dat, et al.
Published: (2023)
by: Hong, Dat, et al.
Published: (2023)
Dynamic Sight Range Selection in Multi-Agent Reinforcement Learning
by: Liao, Wei-Chen, et al.
Published: (2025)
by: Liao, Wei-Chen, et al.
Published: (2025)
DiffTORI: Differentiable Trajectory Optimization for Deep Reinforcement and Imitation Learning
by: Wan, Weikang, et al.
Published: (2024)
by: Wan, Weikang, et al.
Published: (2024)
Heterogeneity-aware Personalized Federated Learning via Adaptive Dual-Agent Reinforcement Learning
by: Chen, Xi, et al.
Published: (2025)
by: Chen, Xi, et al.
Published: (2025)
Tree Search in DAG Space with Model-based Reinforcement Learning for Causal Discovery
by: Darvariu, Victor-Alexandru, et al.
Published: (2023)
by: Darvariu, Victor-Alexandru, et al.
Published: (2023)
TGPO: Tree-Guided Preference Optimization for Robust Web Agent Reinforcement Learning
by: Chen, Ziyuan, et al.
Published: (2025)
by: Chen, Ziyuan, et al.
Published: (2025)
Similar Items
-
Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization
by: Ji, Yuxiang, et al.
Published: (2026) -
D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning
by: Zhang, Ru, et al.
Published: (2026) -
GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
by: Chu, Xiangxiang, et al.
Published: (2025) -
Ranking-aware Reinforcement Learning for Ordinal Ranking
by: Hao, Aiming, et al.
Published: (2026) -
AdaCuRL: Adaptive Curriculum Reinforcement Learning with Invalid Sample Mitigation and Historical Revisiting
by: Li, Renda, et al.
Published: (2025)