DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Gu, Chenyang, Pu, Yewen, Yang, Bruce, Li, Xiaofan, Gao, Huan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
di: Li, Chen, et al.
Pubblicazione: (2025)
di: Li, Chen, et al.
Pubblicazione: (2025)
Hypothesis Search: Inductive Reasoning with Language Models
di: Wang, Ruocheng, et al.
Pubblicazione: (2023)
di: Wang, Ruocheng, et al.
Pubblicazione: (2023)
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
di: Kang, Minki, et al.
Pubblicazione: (2026)
di: Kang, Minki, et al.
Pubblicazione: (2026)
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
di: Zong, Zefang, et al.
Pubblicazione: (2026)
di: Zong, Zefang, et al.
Pubblicazione: (2026)
Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training
di: Xia, Tianle, et al.
Pubblicazione: (2026)
di: Xia, Tianle, et al.
Pubblicazione: (2026)
Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning
di: Mo, Fengran, et al.
Pubblicazione: (2026)
di: Mo, Fengran, et al.
Pubblicazione: (2026)
LRAS: Advanced Legal Reasoning with Agentic Search
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
GraphSearch: Agentic Search-Augmented Reasoning for Zero-Shot Graph Learning
di: Liu, Jiajin, et al.
Pubblicazione: (2026)
di: Liu, Jiajin, et al.
Pubblicazione: (2026)
Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?
di: Hsu, Tz-Huan, et al.
Pubblicazione: (2026)
di: Hsu, Tz-Huan, et al.
Pubblicazione: (2026)
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
di: Hou, Bohan, et al.
Pubblicazione: (2026)
di: Hou, Bohan, et al.
Pubblicazione: (2026)
IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
di: He, Yinhan, et al.
Pubblicazione: (2026)
di: He, Yinhan, et al.
Pubblicazione: (2026)
ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
di: Xiong, Xuan, et al.
Pubblicazione: (2026)
di: Xiong, Xuan, et al.
Pubblicazione: (2026)
Search-o1: Agentic Search-Enhanced Large Reasoning Models
di: Li, Xiaoxi, et al.
Pubblicazione: (2025)
di: Li, Xiaoxi, et al.
Pubblicazione: (2025)
Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
di: Shao, Chenyang, et al.
Pubblicazione: (2025)
di: Shao, Chenyang, et al.
Pubblicazione: (2025)
Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities
di: Kotoge, Rikuto, et al.
Pubblicazione: (2025)
di: Kotoge, Rikuto, et al.
Pubblicazione: (2025)
A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping
di: Chen, Dingwei, et al.
Pubblicazione: (2026)
di: Chen, Dingwei, et al.
Pubblicazione: (2026)
Agentic Reinforced Policy Optimization
di: Dong, Guanting, et al.
Pubblicazione: (2025)
di: Dong, Guanting, et al.
Pubblicazione: (2025)
StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
di: Wang, Daoyu, et al.
Pubblicazione: (2026)
di: Wang, Daoyu, et al.
Pubblicazione: (2026)
WideSearch: Benchmarking Agentic Broad Info-Seeking
di: Wong, Ryan, et al.
Pubblicazione: (2025)
di: Wong, Ryan, et al.
Pubblicazione: (2025)
Table-as-Search: Formulate Long-Horizon Agentic Information Seeking as Table Completion
di: Lan, Tian, et al.
Pubblicazione: (2026)
di: Lan, Tian, et al.
Pubblicazione: (2026)
Agentic Reinforcement Learning for Search is Unsafe
di: Yang, Yushi, et al.
Pubblicazione: (2025)
di: Yang, Yushi, et al.
Pubblicazione: (2025)
Search-Based LLMs for Code Optimization
di: Gao, Shuzheng, et al.
Pubblicazione: (2024)
di: Gao, Shuzheng, et al.
Pubblicazione: (2024)
Agentic Entropy-Balanced Policy Optimization
di: Dong, Guanting, et al.
Pubblicazione: (2025)
di: Dong, Guanting, et al.
Pubblicazione: (2025)
From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents
di: Zhang, Weizhi, et al.
Pubblicazione: (2025)
di: Zhang, Weizhi, et al.
Pubblicazione: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
di: Ding, Yifeng, et al.
Pubblicazione: (2025)
di: Ding, Yifeng, et al.
Pubblicazione: (2025)
CodeComp: Structural KV Cache Compression for Agentic Coding
di: Chen, Qiujiang, et al.
Pubblicazione: (2026)
di: Chen, Qiujiang, et al.
Pubblicazione: (2026)
Agentic-R: Learning to Retrieve for Agentic Search
di: Liu, Wenhan, et al.
Pubblicazione: (2026)
di: Liu, Wenhan, et al.
Pubblicazione: (2026)
GraphSearch: An Agentic Deep Searching Workflow for Graph Retrieval-Augmented Generation
di: Yang, Cehao, et al.
Pubblicazione: (2025)
di: Yang, Cehao, et al.
Pubblicazione: (2025)
IE as Cache: Information Extraction Enhanced Agentic Reasoning
di: Lv, Hang, et al.
Pubblicazione: (2026)
di: Lv, Hang, et al.
Pubblicazione: (2026)
Demystifying Reinforcement Learning in Agentic Reasoning
di: Yu, Zhaochen, et al.
Pubblicazione: (2025)
di: Yu, Zhaochen, et al.
Pubblicazione: (2025)
Efficient Reasoning with Hidden Thinking
di: Shen, Xuan, et al.
Pubblicazione: (2025)
di: Shen, Xuan, et al.
Pubblicazione: (2025)
DeepRead: Document Structure-Aware Reasoning to Enhance Agentic Search
di: Li, Zhanli, et al.
Pubblicazione: (2026)
di: Li, Zhanli, et al.
Pubblicazione: (2026)
SIGMA: Search-Augmented On-Demand Knowledge Integration for Agentic Mathematical Reasoning
di: Asgarov, Ali, et al.
Pubblicazione: (2025)
di: Asgarov, Ali, et al.
Pubblicazione: (2025)
Agentic Policy Optimization via Instruction-Policy Co-Evolution
di: Zhou, Han, et al.
Pubblicazione: (2025)
di: Zhou, Han, et al.
Pubblicazione: (2025)
CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordance
di: Liu, Haochen, et al.
Pubblicazione: (2026)
di: Liu, Haochen, et al.
Pubblicazione: (2026)
CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
di: Shi, Dachuan, et al.
Pubblicazione: (2026)
di: Shi, Dachuan, et al.
Pubblicazione: (2026)
LBM: Hierarchical Large Auto-Bidding Model via Reasoning and Acting
di: Li, Yewen, et al.
Pubblicazione: (2026)
di: Li, Yewen, et al.
Pubblicazione: (2026)
On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement
di: Deng, Wenlong, et al.
Pubblicazione: (2025)
di: Deng, Wenlong, et al.
Pubblicazione: (2025)
HiPO: Hybrid Policy Optimization for Dynamic Reasoning in LLMs
di: Deng, Ken, et al.
Pubblicazione: (2025)
di: Deng, Ken, et al.
Pubblicazione: (2025)
Perception-Aware Policy Optimization for Multimodal Reasoning
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
di: Li, Chen, et al.
Pubblicazione: (2025) -
Hypothesis Search: Inductive Reasoning with Language Models
di: Wang, Ruocheng, et al.
Pubblicazione: (2023) -
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
di: Kang, Minki, et al.
Pubblicazione: (2026) -
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
di: Zong, Zefang, et al.
Pubblicazione: (2026) -
Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training
di: Xia, Tianle, et al.
Pubblicazione: (2026)