Agentic Reinforced Policy Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Guanting, Mao, Hangyu, Ma, Kai, Bao, Licheng, Chen, Yifei, Wang, Zhongyuan, Chen, Zhongxia, Du, Jiazhen, Wang, Huiyang, Zhang, Fuzheng, Zhou, Guorui, Zhu, Yutao, Wen, Ji-Rong, Dou, Zhicheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Agentic Entropy-Balanced Policy Optimization
par: Dong, Guanting, et autres
Publié: (2025)
par: Dong, Guanting, et autres
Publié: (2025)
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
par: Dong, Guanting, et autres
Publié: (2025)
par: Dong, Guanting, et autres
Publié: (2025)
Revisiting RAG Ensemble: A Theoretical and Mechanistic Analysis of Multi-RAG System Collaboration
par: Chen, Yifei, et autres
Publié: (2025)
par: Chen, Yifei, et autres
Publié: (2025)
Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning
par: Chen, Yifei, et autres
Publié: (2025)
par: Chen, Yifei, et autres
Publié: (2025)
ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration
par: Chen, Yifei, et autres
Publié: (2026)
par: Chen, Yifei, et autres
Publié: (2026)
GPG: Generalized Policy Gradient Theorem for Transformer-based Policies
par: Mao, Hangyu, et autres
Publié: (2025)
par: Mao, Hangyu, et autres
Publié: (2025)
Understand What LLM Needs: Dual Preference Alignment for Retrieval-Augmented Generation
par: Dong, Guanting, et autres
Publié: (2024)
par: Dong, Guanting, et autres
Publié: (2024)
DMQR-RAG: Diverse Multi-Query Rewriting for RAG
par: Li, Zhicong, et autres
Publié: (2024)
par: Li, Zhicong, et autres
Publié: (2024)
From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning
par: Deng, Zhirui, et autres
Publié: (2024)
par: Deng, Zhirui, et autres
Publié: (2024)
EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis
par: Song, Xiaoshuai, et autres
Publié: (2026)
par: Song, Xiaoshuai, et autres
Publié: (2026)
Progressive Multimodal Reasoning via Active Retrieval
par: Dong, Guanting, et autres
Publié: (2024)
par: Dong, Guanting, et autres
Publié: (2024)
Toward General Instruction-Following Alignment for Retrieval-Augmented Generation
par: Dong, Guanting, et autres
Publié: (2024)
par: Dong, Guanting, et autres
Publié: (2024)
ToolScope: An Agentic Framework for Vision-Guided and Long-Horizon Tool Use
par: Deng, Mengjie, et autres
Publié: (2025)
par: Deng, Mengjie, et autres
Publié: (2025)
Query-oriented Data Augmentation for Session Search
par: Chen, Haonan, et autres
Publié: (2024)
par: Chen, Haonan, et autres
Publié: (2024)
SmartSearch: Process Reward-Guided Query Refinement for Search Agents
par: Wen, Tongyu, et autres
Publié: (2026)
par: Wen, Tongyu, et autres
Publié: (2026)
One Token Can Help! Learning Scalable and Pluggable Virtual Tokens for Retrieval-Augmented Large Language Models
par: Zhu, Yutao, et autres
Publié: (2024)
par: Zhu, Yutao, et autres
Publié: (2024)
DualRAG: A Dual-Process Approach to Integrate Reasoning and Retrieval for Multi-Hop Question Answering
par: Cheng, Rong, et autres
Publié: (2025)
par: Cheng, Rong, et autres
Publié: (2025)
RecThinker: An Agentic Framework for Tool-Augmented Reasoning in Recommendation
par: Zhang, Haobo, et autres
Publié: (2026)
par: Zhang, Haobo, et autres
Publié: (2026)
WebThinker: Empowering Large Reasoning Models with Deep Research Capability
par: Li, Xiaoxi, et autres
Publié: (2025)
par: Li, Xiaoxi, et autres
Publié: (2025)
Search-o1: Agentic Search-Enhanced Large Reasoning Models
par: Li, Xiaoxi, et autres
Publié: (2025)
par: Li, Xiaoxi, et autres
Publié: (2025)
INTERS: Unlocking the Power of Large Language Models in Search with Instruction Tuning
par: Zhu, Yutao, et autres
Publié: (2024)
par: Zhu, Yutao, et autres
Publié: (2024)
DeepAgent: A General Reasoning Agent with Scalable Toolsets
par: Li, Xiaoxi, et autres
Publié: (2025)
par: Li, Xiaoxi, et autres
Publié: (2025)
ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning
par: Cheng, Yiruo, et autres
Publié: (2026)
par: Cheng, Yiruo, et autres
Publié: (2026)
UFO: a Unified and Flexible Framework for Evaluating Factuality of Large Language Models
par: Huang, Zhaoheng, et autres
Publié: (2024)
par: Huang, Zhaoheng, et autres
Publié: (2024)
RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
par: Zhang, Hongzhi, et autres
Publié: (2025)
par: Zhang, Hongzhi, et autres
Publié: (2025)
FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research
par: Jin, Jiajie, et autres
Publié: (2024)
par: Jin, Jiajie, et autres
Publié: (2024)
HtmlRAG: HTML is Better Than Plain Text for Modeling Retrieved Knowledge in RAG Systems
par: Tan, Jiejun, et autres
Publié: (2024)
par: Tan, Jiejun, et autres
Publié: (2024)
Single LLM, Multiple Roles: A Unified Retrieval-Augmented Generation Framework Using Role-Specific Token Optimization
par: Zhu, Yutao, et autres
Publié: (2025)
par: Zhu, Yutao, et autres
Publié: (2025)
Small Models, Big Insights: Leveraging Slim Proxy Models To Decide When and What to Retrieve for LLMs
par: Tan, Jiejun, et autres
Publié: (2024)
par: Tan, Jiejun, et autres
Publié: (2024)
General Table Question Answering via Answer-Formula Joint Generation
par: Wang, Zhongyuan, et autres
Publié: (2025)
par: Wang, Zhongyuan, et autres
Publié: (2025)
OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain
par: Wang, Shuting, et autres
Publié: (2024)
par: Wang, Shuting, et autres
Publié: (2024)
Agentic-R: Learning to Retrieve for Agentic Search
par: Liu, Wenhan, et autres
Publié: (2026)
par: Liu, Wenhan, et autres
Publié: (2026)
CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmentation Generation
par: Cheng, Yiruo, et autres
Publié: (2024)
par: Cheng, Yiruo, et autres
Publié: (2024)
Towards Mixed-Modal Retrieval for Universal Retrieval-Augmented Generation
par: Zhang, Chenghao, et autres
Publié: (2025)
par: Zhang, Chenghao, et autres
Publié: (2025)
DemoRank: Selecting Effective Demonstrations for Large Language Models in Ranking Task
par: Liu, Wenhan, et autres
Publié: (2024)
par: Liu, Wenhan, et autres
Publié: (2024)
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
par: Su, Zhenpeng, et autres
Publié: (2025)
par: Su, Zhenpeng, et autres
Publié: (2025)
CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning
par: Su, Zhenpeng, et autres
Publié: (2025)
par: Su, Zhenpeng, et autres
Publié: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
RichRAG: Crafting Rich Responses for Multi-faceted Queries in Retrieval-Augmented Generation
par: Wang, Shuting, et autres
Publié: (2024)
par: Wang, Shuting, et autres
Publié: (2024)
Session-level Normalization and Click-through Data Enhancement for Session-based Evaluation
par: Chen, Haonan, et autres
Publié: (2024)
par: Chen, Haonan, et autres
Publié: (2024)
Documents similaires
-
Agentic Entropy-Balanced Policy Optimization
par: Dong, Guanting, et autres
Publié: (2025) -
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
par: Dong, Guanting, et autres
Publié: (2025) -
Revisiting RAG Ensemble: A Theoretical and Mechanistic Analysis of Multi-RAG System Collaboration
par: Chen, Yifei, et autres
Publié: (2025) -
Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning
par: Chen, Yifei, et autres
Publié: (2025) -
ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration
par: Chen, Yifei, et autres
Publié: (2026)