SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search Agent
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhong, Wenlin, Yang, Jinluan, Wu, Yiquan, Liu, Yi, Yao, Jianhang, Kuang, Kun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
P2S: Probabilistic Process Supervision for General-Domain Reasoning Question Answering
di: Zhong, Wenlin, et al.
Pubblicazione: (2026)
di: Zhong, Wenlin, et al.
Pubblicazione: (2026)
Universal Legal Article Prediction via Tight Collaboration between Supervised Classification Model and LLM
di: Chi, Xiao, et al.
Pubblicazione: (2025)
di: Chi, Xiao, et al.
Pubblicazione: (2025)
PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs
di: Huang, Yuting, et al.
Pubblicazione: (2026)
di: Huang, Yuting, et al.
Pubblicazione: (2026)
TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training
di: Yang, Jinluan, et al.
Pubblicazione: (2026)
di: Yang, Jinluan, et al.
Pubblicazione: (2026)
DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing
di: Cao, Qian, et al.
Pubblicazione: (2026)
di: Cao, Qian, et al.
Pubblicazione: (2026)
Rewrite to Jailbreak: Discover Learnable and Transferable Implicit Harmfulness Instruction
di: Huang, Yuting, et al.
Pubblicazione: (2025)
di: Huang, Yuting, et al.
Pubblicazione: (2025)
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
di: He, Guanzhong, et al.
Pubblicazione: (2025)
di: He, Guanzhong, et al.
Pubblicazione: (2025)
Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning
di: Chen, Yiqun, et al.
Pubblicazione: (2026)
di: Chen, Yiqun, et al.
Pubblicazione: (2026)
WisdomInterrogatory (LuWen): An Open-Source Legal Large Language Model Technical Report
di: Wu, Yiquan, et al.
Pubblicazione: (2026)
di: Wu, Yiquan, et al.
Pubblicazione: (2026)
LRAS: Advanced Legal Reasoning with Agentic Search
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
di: Wang, Guoqing, et al.
Pubblicazione: (2025)
di: Wang, Guoqing, et al.
Pubblicazione: (2025)
Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders
di: Wu, Xuansheng, et al.
Pubblicazione: (2025)
di: Wu, Xuansheng, et al.
Pubblicazione: (2025)
ExpertWeaver: Unlocking the Inherent MoE in Dense LLMs with GLU Activation Patterns
di: Zhao, Ziyu, et al.
Pubblicazione: (2026)
di: Zhao, Ziyu, et al.
Pubblicazione: (2026)
From Graph to Word Bag: Introducing Domain Knowledge to Confusing Charge Prediction
di: Li, Ang, et al.
Pubblicazione: (2024)
di: Li, Ang, et al.
Pubblicazione: (2024)
SSRL: Self-Search Reinforcement Learning
di: Fan, Yuchen, et al.
Pubblicazione: (2025)
di: Fan, Yuchen, et al.
Pubblicazione: (2025)
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
di: Wei, Zhepei, et al.
Pubblicazione: (2025)
di: Wei, Zhepei, et al.
Pubblicazione: (2025)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
di: Zhang, Jiajie, et al.
Pubblicazione: (2026)
di: Zhang, Jiajie, et al.
Pubblicazione: (2026)
AppealCase: A Dataset and Benchmark for Civil Case Appeal Scenarios
di: Huang, Yuting, et al.
Pubblicazione: (2025)
di: Huang, Yuting, et al.
Pubblicazione: (2025)
Legal$Δ$: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain
di: Dai, Xin, et al.
Pubblicazione: (2025)
di: Dai, Xin, et al.
Pubblicazione: (2025)
Re-ReST: Reflection-Reinforced Self-Training for Language Agents
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
Embracing Imperfection: Simulating Students with Diverse Cognitive Levels Using LLM-based Agents
di: Wu, Tao, et al.
Pubblicazione: (2025)
di: Wu, Tao, et al.
Pubblicazione: (2025)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
di: Yang, Rui, et al.
Pubblicazione: (2026)
di: Yang, Rui, et al.
Pubblicazione: (2026)
Teaching Embodied Reinforcement Learning Agents: Informativeness and Diversity of Language Use
di: Xi, Jiajun, et al.
Pubblicazione: (2024)
di: Xi, Jiajun, et al.
Pubblicazione: (2024)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
di: Yue, Murong, et al.
Pubblicazione: (2024)
di: Yue, Murong, et al.
Pubblicazione: (2024)
InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
di: Luo, Kun, et al.
Pubblicazione: (2025)
di: Luo, Kun, et al.
Pubblicazione: (2025)
EvolveSearch: An Iterative Self-Evolving Search Agent
di: Zhang, Dingchu, et al.
Pubblicazione: (2025)
di: Zhang, Dingchu, et al.
Pubblicazione: (2025)
Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization
di: Chen, Zhengyu, et al.
Pubblicazione: (2025)
di: Chen, Zhengyu, et al.
Pubblicazione: (2025)
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning
di: Qi, Zehan, et al.
Pubblicazione: (2024)
di: Qi, Zehan, et al.
Pubblicazione: (2024)
Reinforcement Learning for Long-Horizon Multi-Turn Search Agents
di: Kalyan, Vivek, et al.
Pubblicazione: (2025)
di: Kalyan, Vivek, et al.
Pubblicazione: (2025)
SE-Search: Self-Evolving Search Agent via Memory and Dense Reward
di: Li, Jian, et al.
Pubblicazione: (2026)
di: Li, Jian, et al.
Pubblicazione: (2026)
BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning
di: Zhao, Yubao, et al.
Pubblicazione: (2026)
di: Zhao, Yubao, et al.
Pubblicazione: (2026)
ClaimGen-CN: A Large-scale Chinese Dataset for Legal Claim Generation
di: Zhou, Siying, et al.
Pubblicazione: (2025)
di: Zhou, Siying, et al.
Pubblicazione: (2025)
Agentic Reinforcement Learning for Search is Unsafe
di: Yang, Yushi, et al.
Pubblicazione: (2025)
di: Yang, Yushi, et al.
Pubblicazione: (2025)
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
di: Xiao, Teng, et al.
Pubblicazione: (2026)
di: Xiao, Teng, et al.
Pubblicazione: (2026)
The Tool Illusion: Rethinking Tool Use in Web Agents
di: Lou, Renze, et al.
Pubblicazione: (2026)
di: Lou, Renze, et al.
Pubblicazione: (2026)
ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs
di: Ding, Hongxin, et al.
Pubblicazione: (2025)
di: Ding, Hongxin, et al.
Pubblicazione: (2025)
RETQA: A Large-Scale Open-Domain Tabular Question Answering Dataset for Real Estate Sector
di: Wang, Zhensheng, et al.
Pubblicazione: (2024)
di: Wang, Zhensheng, et al.
Pubblicazione: (2024)
Causal Agent based on Large Language Model
di: Han, Kairong, et al.
Pubblicazione: (2024)
di: Han, Kairong, et al.
Pubblicazione: (2024)
Automatic Slide Updating with User-Defined Dynamic Templates and Natural Language Instructions
di: Zhou, Kun, et al.
Pubblicazione: (2026)
di: Zhou, Kun, et al.
Pubblicazione: (2026)
IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning
di: Liang, Zihan, et al.
Pubblicazione: (2026)
di: Liang, Zihan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
P2S: Probabilistic Process Supervision for General-Domain Reasoning Question Answering
di: Zhong, Wenlin, et al.
Pubblicazione: (2026) -
Universal Legal Article Prediction via Tight Collaboration between Supervised Classification Model and LLM
di: Chi, Xiao, et al.
Pubblicazione: (2025) -
PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs
di: Huang, Yuting, et al.
Pubblicazione: (2026) -
TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training
di: Yang, Jinluan, et al.
Pubblicazione: (2026) -
DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing
di: Cao, Qian, et al.
Pubblicazione: (2026)