Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Guoqing, Dai, Sunhao, Ye, Guangze, Gan, Zeyu, Yao, Wei, Deng, Yong, Wu, Xiaofeng, Ying, Zhenzhe |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data
por: Venus Team, et al.
Publicado: (2026)
por: Venus Team, et al.
Publicado: (2026)
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
por: Deng, Yong, et al.
Publicado: (2025)
por: Deng, Yong, et al.
Publicado: (2025)
Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers
por: Xin, Ran, et al.
Publicado: (2025)
por: Xin, Ran, et al.
Publicado: (2025)
MARPO: A Reflective Policy Optimization for Multi Agent Reinforcement Learning
por: Wu, Cuiling, et al.
Publicado: (2025)
por: Wu, Cuiling, et al.
Publicado: (2025)
RAMA: Retrieval-Augmented Multi-Agent Framework for Misinformation Detection in Multimodal Fact-Checking
por: Yang, Shuo, et al.
Publicado: (2025)
por: Yang, Shuo, et al.
Publicado: (2025)
Careful Queries, Credible Results: Teaching RAG Models Advanced Web Search Tools with Reinforcement Learning
por: Dai, Yuqin, et al.
Publicado: (2025)
por: Dai, Yuqin, et al.
Publicado: (2025)
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
por: Zong, Zefang, et al.
Publicado: (2026)
por: Zong, Zefang, et al.
Publicado: (2026)
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
por: Feng, Mingqian, et al.
Publicado: (2026)
por: Feng, Mingqian, et al.
Publicado: (2026)
SimpleProc: Fully Procedural Synthetic Data from Simple Rules for Multi-View Stereo
por: Ma, Zeyu, et al.
Publicado: (2026)
por: Ma, Zeyu, et al.
Publicado: (2026)
Test-Time Policy Adaptation for Enhanced Multi-Turn Interactions with LLMs
por: Wei, Chenxing, et al.
Publicado: (2025)
por: Wei, Chenxing, et al.
Publicado: (2025)
ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue
por: Cao, Ruike, et al.
Publicado: (2026)
por: Cao, Ruike, et al.
Publicado: (2026)
SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search Agent
por: Zhong, Wenlin, et al.
Publicado: (2026)
por: Zhong, Wenlin, et al.
Publicado: (2026)
Distributed Consensus Control of Feedforward Nonlinear Time‐Delay Multi‐Agent Systems With Switching Topologies: A Time‐Varying Gain Approach
por: Xiaofeng Xu, et al.
Publicado: (2026)
por: Xiaofeng Xu, et al.
Publicado: (2026)
Compress to Focus: Efficient Coordinate Compression for Policy Optimization in Multi-Turn GUI Agents
por: Song, Yurun, et al.
Publicado: (2026)
por: Song, Yurun, et al.
Publicado: (2026)
GraphTracer: Graph-Guided Failure Tracing in LLM Agents for Robust Multi-Turn Deep Search
por: Zhang, Heng, et al.
Publicado: (2025)
por: Zhang, Heng, et al.
Publicado: (2025)
Expectation Confirmation Preference Optimization for Multi-Turn Conversational Recommendation Agent
por: Feng, Xueyang, et al.
Publicado: (2025)
por: Feng, Xueyang, et al.
Publicado: (2025)
Reinforcement Learning for Long-Horizon Multi-Turn Search Agents
por: Kalyan, Vivek, et al.
Publicado: (2025)
por: Kalyan, Vivek, et al.
Publicado: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
por: Ding, Yifeng, et al.
Publicado: (2025)
por: Ding, Yifeng, et al.
Publicado: (2025)
Simple Yet Effective: An Information-Theoretic Approach to Multi-LLM Uncertainty Quantification
por: Kruse, Maya, et al.
Publicado: (2025)
por: Kruse, Maya, et al.
Publicado: (2025)
Disentangled Modeling of Preferences and Social Influence for Group Recommendation
por: Ye, Guangze, et al.
Publicado: (2025)
por: Ye, Guangze, et al.
Publicado: (2025)
Revisiting Clustering of Neural Bandits: Selective Reinitialization for Mitigating Loss of Plasticity
por: Su, Zhiyuan, et al.
Publicado: (2025)
por: Su, Zhiyuan, et al.
Publicado: (2025)
Towards a Theoretical Understanding of Synthetic Data in LLM Post-Training: A Reverse-Bottleneck Perspective
por: Gan, Zeyu, et al.
Publicado: (2024)
por: Gan, Zeyu, et al.
Publicado: (2024)
IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning
por: Liang, Zihan, et al.
Publicado: (2026)
por: Liang, Zihan, et al.
Publicado: (2026)
Direct Multi-Turn Preference Optimization for Language Agents
por: Shi, Wentao, et al.
Publicado: (2024)
por: Shi, Wentao, et al.
Publicado: (2024)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
por: Zhong, Haitian, et al.
Publicado: (2026)
por: Zhong, Haitian, et al.
Publicado: (2026)
ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn Conversation
por: Wang, Zhebo, et al.
Publicado: (2026)
por: Wang, Zhebo, et al.
Publicado: (2026)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
por: Djuhera, Aladin, et al.
Publicado: (2026)
por: Djuhera, Aladin, et al.
Publicado: (2026)
On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement
por: Deng, Wenlong, et al.
Publicado: (2025)
por: Deng, Wenlong, et al.
Publicado: (2025)
Simple Policy Optimization
por: Xie, Zhengpeng, et al.
Publicado: (2024)
por: Xie, Zhengpeng, et al.
Publicado: (2024)
Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward
por: Hu, Senkang, et al.
Publicado: (2026)
por: Hu, Senkang, et al.
Publicado: (2026)
Length-Induced Embedding Collapse in PLM-based Models
por: Zhou, Yuqi, et al.
Publicado: (2024)
por: Zhou, Yuqi, et al.
Publicado: (2024)
UOEP: User-Oriented Exploration Policy for Enhancing Long-Term User Experiences in Recommender Systems
por: Zhang, Changshuo, et al.
Publicado: (2024)
por: Zhang, Changshuo, et al.
Publicado: (2024)
Words & Weights: Streamlining Multi-Turn Interactions via Co-Adaptation
por: Wei, Chenxing, et al.
Publicado: (2026)
por: Wei, Chenxing, et al.
Publicado: (2026)
Learning to Retrieve from Agent Trajectories
por: Zhou, Yuqi, et al.
Publicado: (2026)
por: Zhou, Yuqi, et al.
Publicado: (2026)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
por: Li, MingSheng, et al.
Publicado: (2025)
por: Li, MingSheng, et al.
Publicado: (2025)
NExT-Search: Rebuilding User Feedback Ecosystem for Generative AI Search
por: Dai, Sunhao, et al.
Publicado: (2025)
por: Dai, Sunhao, et al.
Publicado: (2025)
MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games
por: Xie, Yunfei, et al.
Publicado: (2026)
por: Xie, Yunfei, et al.
Publicado: (2026)
RecMem: Recurrence-based Memory Consolidation for Efficient and Effective Long-Running LLM Agents
por: Dai, Zijie, et al.
Publicado: (2026)
por: Dai, Zijie, et al.
Publicado: (2026)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
por: Wei, Quan, et al.
Publicado: (2025)
por: Wei, Quan, et al.
Publicado: (2025)
FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation
por: Zhang, Chenxi, et al.
Publicado: (2026)
por: Zhang, Chenxi, et al.
Publicado: (2026)
Ejemplares similares
-
DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data
por: Venus Team, et al.
Publicado: (2026) -
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
por: Deng, Yong, et al.
Publicado: (2025) -
Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers
por: Xin, Ran, et al.
Publicado: (2025) -
MARPO: A Reflective Policy Optimization for Multi Agent Reinforcement Learning
por: Wu, Cuiling, et al.
Publicado: (2025) -
RAMA: Retrieval-Augmented Multi-Agent Framework for Misinformation Detection in Multimodal Fact-Checking
por: Yang, Shuo, et al.
Publicado: (2025)