DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Junshuo, Huang, Chengrui, Guo, Feng, Li, Zihan, Shi, Ke, Jiang, Menghua, Yu, Jiguo, Shang, Shuo, Gao, Shen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HTAA: Enhancing LLM Planning via Hybrid Toolset Agentization & Adaptation
par: Huang, Chengrui, et autres
Publié: (2026)
par: Huang, Chengrui, et autres
Publié: (2026)
Beyond Superficial Forgetting: Thorough Unlearning through Knowledge Density Estimation and Block Re-insertion
par: Guo, Feng, et autres
Publié: (2025)
par: Guo, Feng, et autres
Publié: (2025)
TOOL4POI: A Tool-Augmented LLM Framework for Next POI Recommendation
par: Wang, Dongsheng, et autres
Publié: (2025)
par: Wang, Dongsheng, et autres
Publié: (2025)
TTPA: Token-level Tool-use Preference Alignment Training Framework with Fine-grained Evaluation
par: Huang, Chengrui, et autres
Publié: (2025)
par: Huang, Chengrui, et autres
Publié: (2025)
Neural Solver Selection for Combinatorial Optimization
par: Gao, Chengrui, et autres
Publié: (2024)
par: Gao, Chengrui, et autres
Publié: (2024)
360$^\circ$REA: Towards A Reusable Experience Accumulation with 360° Assessment for Multi-Agent System
par: Gao, Shen, et autres
Publié: (2024)
par: Gao, Shen, et autres
Publié: (2024)
FAVE: Flow-based Average Velocity Establishment for Sequential Recommendation
par: Shi, Ke, et autres
Publié: (2026)
par: Shi, Ke, et autres
Publié: (2026)
Generative Next POI Recommendation with Semantic ID
par: Wang, Dongsheng, et autres
Publié: (2025)
par: Wang, Dongsheng, et autres
Publié: (2025)
Towards Generalizable Neural Solvers for Vehicle Routing Problems via Ensemble with Transferrable Local Policy
par: Gao, Chengrui, et autres
Publié: (2023)
par: Gao, Chengrui, et autres
Publié: (2023)
What Affects the Stability of Tool Learning? An Empirical Study on the Robustness of Tool Learning Frameworks
par: Huang, Chengrui, et autres
Publié: (2024)
par: Huang, Chengrui, et autres
Publié: (2024)
Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity
par: Yang, Yingxuan, et autres
Publié: (2026)
par: Yang, Yingxuan, et autres
Publié: (2026)
LLM-DMD: Large Language Model-based Power System Dynamic Model Discovery
par: Shen, Chao, et autres
Publié: (2026)
par: Shen, Chao, et autres
Publié: (2026)
RAPO: Expanding Exploration for LLM Agents via Retrieval-Augmented Policy Optimization
par: Zhang, Siwei, et autres
Publié: (2026)
par: Zhang, Siwei, et autres
Publié: (2026)
Research on Model Parallelism and Data Parallelism Optimization Methods in Large Language Model-Based Recommendation Systems
par: Yang, Haowei, et autres
Publié: (2025)
par: Yang, Haowei, et autres
Publié: (2025)
DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning
par: Wan, Zhongwei, et autres
Publié: (2026)
par: Wan, Zhongwei, et autres
Publié: (2026)
Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story
par: De Paola, Vincenzo, et autres
Publié: (2025)
par: De Paola, Vincenzo, et autres
Publié: (2025)
OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling
par: Li, Zhong, et autres
Publié: (2026)
par: Li, Zhong, et autres
Publié: (2026)
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
par: Kang, Minki, et autres
Publié: (2026)
par: Kang, Minki, et autres
Publié: (2026)
SRAP-Agent: Simulating and Optimizing Scarce Resource Allocation Policy with LLM-based Agent
par: Ji, Jiarui, et autres
Publié: (2024)
par: Ji, Jiarui, et autres
Publié: (2024)
Look Before You Leap: Autonomous Exploration for LLM Agents
par: Ye, Ziang, et autres
Publié: (2026)
par: Ye, Ziang, et autres
Publié: (2026)
CulFiT: A Fine-grained Cultural-aware LLM Training Paradigm via Multilingual Critique Data Synthesis
par: Feng, Ruixiang, et autres
Publié: (2025)
par: Feng, Ruixiang, et autres
Publié: (2025)
Dynamic Survival Prediction using Longitudinal Images based on Transformer
par: Liu, Bingfan, et autres
Publié: (2025)
par: Liu, Bingfan, et autres
Publié: (2025)
PoseMamba: Monocular 3D Human Pose Estimation with Bidirectional Global-Local Spatio-Temporal State Space Model
par: Huang, Yunlong, et autres
Publié: (2024)
par: Huang, Yunlong, et autres
Publié: (2024)
Group-in-Group Policy Optimization for LLM Agent Training
par: Feng, Lang, et autres
Publié: (2025)
par: Feng, Lang, et autres
Publié: (2025)
Factorized Latent Reasoning for LLM-based Recommendation
par: Gao, Tianqi, et autres
Publié: (2026)
par: Gao, Tianqi, et autres
Publié: (2026)
More Than One Teacher: Adaptive Multi-Guidance Policy Optimization for Diverse Exploration
par: Yuan, Xiaoyang, et autres
Publié: (2025)
par: Yuan, Xiaoyang, et autres
Publié: (2025)
Improving Parallel Program Performance with LLM Optimizers via Agent-System Interfaces
par: Wei, Anjiang, et autres
Publié: (2024)
par: Wei, Anjiang, et autres
Publié: (2024)
EvoTool: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection
par: Yang, Shuo, et autres
Publié: (2026)
par: Yang, Shuo, et autres
Publié: (2026)
Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents
par: Song, Yifan, et autres
Publié: (2024)
par: Song, Yifan, et autres
Publié: (2024)
PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization
par: Huang, Renhong, et autres
Publié: (2026)
par: Huang, Renhong, et autres
Publié: (2026)
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
par: Li, Yibo, et autres
Publié: (2026)
par: Li, Yibo, et autres
Publié: (2026)
Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning
par: Huang, Yiming, et autres
Publié: (2026)
par: Huang, Yiming, et autres
Publié: (2026)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
par: Shen, Guobin, et autres
Publié: (2026)
par: Shen, Guobin, et autres
Publié: (2026)
Embodied Multi-Modal Agent trained by an LLM from a Parallel TextWorld
par: Yang, Yijun, et autres
Publié: (2023)
par: Yang, Yijun, et autres
Publié: (2023)
Simulating Financial Market via Large Language Model based Agents
par: Gao, Shen, et autres
Publié: (2024)
par: Gao, Shen, et autres
Publié: (2024)
ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection
par: Gao, Changjiang, et autres
Publié: (2026)
par: Gao, Changjiang, et autres
Publié: (2026)
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
par: Zhu, Dingwei, et autres
Publié: (2025)
par: Zhu, Dingwei, et autres
Publié: (2025)
Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning
par: Luo, Yu, et autres
Publié: (2026)
par: Luo, Yu, et autres
Publié: (2026)
Optimizing Sequential Multi-Step Tasks with Parallel LLM Agents
par: Zhang, Enhao, et autres
Publié: (2025)
par: Zhang, Enhao, et autres
Publié: (2025)
SetPO: Set-Level Policy Optimization for Diversity-Preserving LLM Reasoning
par: Li, Chenyi, et autres
Publié: (2026)
par: Li, Chenyi, et autres
Publié: (2026)
Documents similaires
-
HTAA: Enhancing LLM Planning via Hybrid Toolset Agentization & Adaptation
par: Huang, Chengrui, et autres
Publié: (2026) -
Beyond Superficial Forgetting: Thorough Unlearning through Knowledge Density Estimation and Block Re-insertion
par: Guo, Feng, et autres
Publié: (2025) -
TOOL4POI: A Tool-Augmented LLM Framework for Next POI Recommendation
par: Wang, Dongsheng, et autres
Publié: (2025) -
TTPA: Token-level Tool-use Preference Alignment Training Framework with Fine-grained Evaluation
par: Huang, Chengrui, et autres
Publié: (2025) -
Neural Solver Selection for Combinatorial Optimization
par: Gao, Chengrui, et autres
Publié: (2024)