Rethinking the Design of Reinforcement Learning-Based Deep Research Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Wan, Yi, Wang, Jiuqi, Li, Liam, Liu, Jinsong, Zhu, Ruihao, Zhu, Zheqing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
An Empirical Study of Deep Reinforcement Learning in Continuing Tasks
por: Wan, Yi, et al.
Publicado: (2025)
por: Wan, Yi, et al.
Publicado: (2025)
Reward Learning From Preference With Ties
por: Liu, Jinsong, et al.
Publicado: (2024)
por: Liu, Jinsong, et al.
Publicado: (2024)
Pearl: A Production-ready Reinforcement Learning Agent
por: Zhu, Zheqing, et al.
Publicado: (2023)
por: Zhu, Zheqing, et al.
Publicado: (2023)
Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories
por: Wang, Jiaming, et al.
Publicado: (2026)
por: Wang, Jiaming, et al.
Publicado: (2026)
Investigating and Extending Homans' Social Exchange Theory with Large Language Model based Agents
por: Wang, Lei, et al.
Publicado: (2025)
por: Wang, Lei, et al.
Publicado: (2025)
Almost Sure Convergence of Linear Temporal Difference Learning with Arbitrary Features
por: Wang, Jiuqi, et al.
Publicado: (2024)
por: Wang, Jiuqi, et al.
Publicado: (2024)
Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design
por: Choi, Jaemoo, et al.
Publicado: (2026)
por: Choi, Jaemoo, et al.
Publicado: (2026)
Rethinking Agentic Reinforcement Learning In Large Language Models
por: Cui, Fangming, et al.
Publicado: (2026)
por: Cui, Fangming, et al.
Publicado: (2026)
Rethinking Plasticity in Deep Reinforcement Learning
por: He, Zhiqiang
Publicado: (2026)
por: He, Zhiqiang
Publicado: (2026)
PECL: A Heterogeneous Parallel Multi-Domain Network for Radar-Based Human Activity Recognition
por: Yan, Jiuqi, et al.
Publicado: (2025)
por: Yan, Jiuqi, et al.
Publicado: (2025)
Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design
por: Zhu, Bin, et al.
Publicado: (2026)
por: Zhu, Bin, et al.
Publicado: (2026)
Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes
por: Blaser, Ethan, et al.
Publicado: (2026)
por: Blaser, Ethan, et al.
Publicado: (2026)
Deep Reinforcement Learning Xiangqi Player with Monte Carlo Tree Search
por: Yilmaz, Berk, et al.
Publicado: (2025)
por: Yilmaz, Berk, et al.
Publicado: (2025)
Concept Learning for Cooperative Multi-Agent Reinforcement Learning
por: Ge, Zhonghan, et al.
Publicado: (2025)
por: Ge, Zhonghan, et al.
Publicado: (2025)
Cooperative Edge Caching Based on Elastic Federated and Multi-Agent Deep Reinforcement Learning in Next-Generation Network
por: Wu, Qiong, et al.
Publicado: (2024)
por: Wu, Qiong, et al.
Publicado: (2024)
Multi-Agent Deep Reinforcement Learning for Distributed and Autonomous Platoon Coordination via Speed-regulation over Large-scale Transportation Networks
por: Wei, Dixiao, et al.
Publicado: (2024)
por: Wei, Dixiao, et al.
Publicado: (2024)
Trusted Routing for Blockchain-Empowered UAV Networks via Multi-Agent Deep Reinforcement Learning
por: Jia, Ziye, et al.
Publicado: (2025)
por: Jia, Ziye, et al.
Publicado: (2025)
Multi-Agent Target Assignment and Path Finding for Intelligent Warehouse: A Cooperative Multi-Agent Deep Reinforcement Learning Perspective
por: Liu, Qi, et al.
Publicado: (2024)
por: Liu, Qi, et al.
Publicado: (2024)
Robust and Efficient Communication in Multi-Agent Reinforcement Learning
por: Liu, Zejiao, et al.
Publicado: (2025)
por: Liu, Zejiao, et al.
Publicado: (2025)
Experience Replay Addresses Loss of Plasticity in Continual Learning
por: Wang, Jiuqi, et al.
Publicado: (2025)
por: Wang, Jiuqi, et al.
Publicado: (2025)
Demystifying the Physics of Deep Reinforcement Learning-Based Autonomous Vehicle Decision-Making
por: Wan, Hanxi, et al.
Publicado: (2024)
por: Wan, Hanxi, et al.
Publicado: (2024)
Go Beyond Black-box Policies: Rethinking the Design of Learning Agent for Interpretable and Verifiable HVAC Control
por: An, Zhiyu, et al.
Publicado: (2024)
por: An, Zhiyu, et al.
Publicado: (2024)
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL
por: Yao, Yi, et al.
Publicado: (2026)
por: Yao, Yi, et al.
Publicado: (2026)
DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents
por: Ning, Yansong, et al.
Publicado: (2025)
por: Ning, Yansong, et al.
Publicado: (2025)
DeepSafeMPC: Deep Learning-Based Model Predictive Control for Safe Multi-Agent Reinforcement Learning
por: Wang, Xuefeng, et al.
Publicado: (2024)
por: Wang, Xuefeng, et al.
Publicado: (2024)
IQL-TD-MPC: Implicit Q-Learning for Hierarchical Model Predictive Control
por: Chitnis, Rohan, et al.
Publicado: (2023)
por: Chitnis, Rohan, et al.
Publicado: (2023)
Rethink Deep Learning with Invariance in Data Representation
por: Qi, Shuren, et al.
Publicado: (2024)
por: Qi, Shuren, et al.
Publicado: (2024)
BehaviorGuard: Online Backdoor Defense for Deep Reinforcement Learning
por: Yu, Yinbo, et al.
Publicado: (2026)
por: Yu, Yinbo, et al.
Publicado: (2026)
Deep Reinforcement Learning for Traffic Light Control in Intelligent Transportation Systems
por: Zhu, Ming, et al.
Publicado: (2023)
por: Zhu, Ming, et al.
Publicado: (2023)
Deep Reinforcement Learning from Hierarchical Preference Design
por: Bukharin, Alexander, et al.
Publicado: (2023)
por: Bukharin, Alexander, et al.
Publicado: (2023)
ICCU: In-Context Continual Unlearning via Pattern-Induced Refusal Rules
por: Pan, Ruihao, et al.
Publicado: (2026)
por: Pan, Ruihao, et al.
Publicado: (2026)
MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks
por: Su, Shiqian, et al.
Publicado: (2026)
por: Su, Shiqian, et al.
Publicado: (2026)
Reaching Consensus in Cooperative Multi-Agent Reinforcement Learning with Goal Imagination
por: Wang, Liangzhou, et al.
Publicado: (2024)
por: Wang, Liangzhou, et al.
Publicado: (2024)
Counteractive RL: Rethinking Core Principles for Efficient and Scalable Deep Reinforcement Learning
por: Korkmaz, Ezgi
Publicado: (2026)
por: Korkmaz, Ezgi
Publicado: (2026)
Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning
por: Yang, Pei, et al.
Publicado: (2025)
por: Yang, Pei, et al.
Publicado: (2025)
MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning
por: An, Zhiyu, et al.
Publicado: (2025)
por: An, Zhiyu, et al.
Publicado: (2025)
Reachability Verification Based Reliability Assessment for Deep Reinforcement Learning Controlled Robotics and Autonomous Systems
por: Dong, Yi, et al.
Publicado: (2022)
por: Dong, Yi, et al.
Publicado: (2022)
LARP: Language-Agent Role Play for Open-World Games
por: Yan, Ming, et al.
Publicado: (2023)
por: Yan, Ming, et al.
Publicado: (2023)
Perspectives for Direct Interpretability in Multi-Agent Deep Reinforcement Learning
por: Poupart, Yoann, et al.
Publicado: (2025)
por: Poupart, Yoann, et al.
Publicado: (2025)
SocialGFs: Learning Social Gradient Fields for Multi-Agent Reinforcement Learning
por: Long, Qian, et al.
Publicado: (2024)
por: Long, Qian, et al.
Publicado: (2024)
Ejemplares similares
-
An Empirical Study of Deep Reinforcement Learning in Continuing Tasks
por: Wan, Yi, et al.
Publicado: (2025) -
Reward Learning From Preference With Ties
por: Liu, Jinsong, et al.
Publicado: (2024) -
Pearl: A Production-ready Reinforcement Learning Agent
por: Zhu, Zheqing, et al.
Publicado: (2023) -
Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories
por: Wang, Jiaming, et al.
Publicado: (2026) -
Investigating and Extending Homans' Social Exchange Theory with Large Language Model based Agents
por: Wang, Lei, et al.
Publicado: (2025)