Cycle-Consistent Search: Question Reconstructability as a Proxy Reward for Search Agent Training
Fuente:
arXiv
Salvato in:
| Autori principali: | An, Sohyun, Yuan, Shuibenyang, Lee, Hayeon, Hsieh, Cho-Jui, Min, Alexander |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation
di: An, Sohyun, et al.
Pubblicazione: (2026)
di: An, Sohyun, et al.
Pubblicazione: (2026)
AI Co-Scientist for Ranking: Discovering Novel Search Ranking Models alongside LLM-based AI Agents with Cloud Computing Access
di: Wu, Liwei, et al.
Pubblicazione: (2026)
di: Wu, Liwei, et al.
Pubblicazione: (2026)
Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
di: An, Sohyun, et al.
Pubblicazione: (2025)
di: An, Sohyun, et al.
Pubblicazione: (2025)
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
di: Lee, Hyomin, et al.
Pubblicazione: (2026)
di: Lee, Hyomin, et al.
Pubblicazione: (2026)
SmartSearch: Process Reward-Guided Query Refinement for Search Agents
di: Wen, Tongyu, et al.
Pubblicazione: (2026)
di: Wen, Tongyu, et al.
Pubblicazione: (2026)
Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs
di: Hong, Yunqi, et al.
Pubblicazione: (2025)
di: Hong, Yunqi, et al.
Pubblicazione: (2025)
One Prompt is not Enough: Automated Construction of a Mixture-of-Expert Prompts
di: Wang, Ruochen, et al.
Pubblicazione: (2024)
di: Wang, Ruochen, et al.
Pubblicazione: (2024)
IRIS: Intrinsic Reward Image Synthesis
di: Chen, Yihang, et al.
Pubblicazione: (2025)
di: Chen, Yihang, et al.
Pubblicazione: (2025)
Exploring Expert Failures Improves LLM Agent Tuning
di: Lan, Li-Cheng, et al.
Pubblicazione: (2025)
di: Lan, Li-Cheng, et al.
Pubblicazione: (2025)
Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents
di: Wang, Yiding, et al.
Pubblicazione: (2025)
di: Wang, Yiding, et al.
Pubblicazione: (2025)
AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2026)
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2026)
Certified Training with Branch-and-Bound for Lyapunov-stable Neural Control
di: Shi, Zhouxing, et al.
Pubblicazione: (2024)
di: Shi, Zhouxing, et al.
Pubblicazione: (2024)
OptiProxy-NAS: Optimization Proxy based End-to-End Neural Architecture Search
di: Lyu, Bo, et al.
Pubblicazione: (2025)
di: Lyu, Bo, et al.
Pubblicazione: (2025)
Accelerating Large Language Model Pretraining via LFR Pedagogy: Learn, Focus, and Review
di: Prakriya, Neha, et al.
Pubblicazione: (2024)
di: Prakriya, Neha, et al.
Pubblicazione: (2024)
ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
di: Li, Xirui, et al.
Pubblicazione: (2026)
di: Li, Xirui, et al.
Pubblicazione: (2026)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
di: Li, Xirui, et al.
Pubblicazione: (2024)
di: Li, Xirui, et al.
Pubblicazione: (2024)
InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
di: Luo, Kun, et al.
Pubblicazione: (2025)
di: Luo, Kun, et al.
Pubblicazione: (2025)
RF-Agent: Automated Reward Function Design via Language Agent Tree Search
di: Gao, Ning, et al.
Pubblicazione: (2026)
di: Gao, Ning, et al.
Pubblicazione: (2026)
Enhancing Large Language Models with Reward-guided Tree Search for Knowledge Graph Question and Answering
di: Long, Xiao, et al.
Pubblicazione: (2025)
di: Long, Xiao, et al.
Pubblicazione: (2025)
Expanding Search Space with Diverse Prompting Agents: An Efficient Sampling Approach for LLM Mathematical Reasoning
di: Lee, Gisang, et al.
Pubblicazione: (2024)
di: Lee, Gisang, et al.
Pubblicazione: (2024)
Plan Before Search: Search Agents Need Plan
di: Qian, Zhipeng, et al.
Pubblicazione: (2026)
di: Qian, Zhipeng, et al.
Pubblicazione: (2026)
Dr. Zero: Self-Evolving Search Agents without Training Data
di: Yue, Zhenrui, et al.
Pubblicazione: (2026)
di: Yue, Zhenrui, et al.
Pubblicazione: (2026)
Enhancing LLM Reasoning with Reward-guided Tree Search
di: Jiang, Jinhao, et al.
Pubblicazione: (2024)
di: Jiang, Jinhao, et al.
Pubblicazione: (2024)
QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Models
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2025)
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2025)
ProductAgent: Benchmarking Conversational Product Search Agent with Asking Clarification Questions
di: Ye, Jingheng, et al.
Pubblicazione: (2024)
di: Ye, Jingheng, et al.
Pubblicazione: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
di: Wang, Yihan, et al.
Pubblicazione: (2024)
di: Wang, Yihan, et al.
Pubblicazione: (2024)
Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2024)
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2024)
DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
Bidirectional Bounded-Suboptimal Heuristic Search with Consistent Heuristics
di: Shperberg, Shahaf S., et al.
Pubblicazione: (2025)
di: Shperberg, Shahaf S., et al.
Pubblicazione: (2025)
UniDEC : Unified Dual Encoder and Classifier Training for Extreme Multi-Label Classification
di: Kharbanda, Siddhant, et al.
Pubblicazione: (2024)
di: Kharbanda, Siddhant, et al.
Pubblicazione: (2024)
When Is Enough Not Enough? Illusory Completion in Search Agents
di: Ko, Dayoon, et al.
Pubblicazione: (2026)
di: Ko, Dayoon, et al.
Pubblicazione: (2026)
ARGS: Alignment as Reward-Guided Search
di: Khanov, Maxim, et al.
Pubblicazione: (2024)
di: Khanov, Maxim, et al.
Pubblicazione: (2024)
Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents
di: Chuang, Yun-Shiuan, et al.
Pubblicazione: (2026)
di: Chuang, Yun-Shiuan, et al.
Pubblicazione: (2026)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
di: Cui, Justin, et al.
Pubblicazione: (2024)
di: Cui, Justin, et al.
Pubblicazione: (2024)
IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning
di: Liang, Zihan, et al.
Pubblicazione: (2026)
di: Liang, Zihan, et al.
Pubblicazione: (2026)
Dominating vs. Dominated: Generative Collapse in Diffusion Models
di: Jeong, Hayeon, et al.
Pubblicazione: (2025)
di: Jeong, Hayeon, et al.
Pubblicazione: (2025)
Evaluating the Search Agent in a Parallel World
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents
di: Liu, Yizhou, et al.
Pubblicazione: (2026)
di: Liu, Yizhou, et al.
Pubblicazione: (2026)
LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble
di: Lee, Yujeong, et al.
Pubblicazione: (2024)
di: Lee, Yujeong, et al.
Pubblicazione: (2024)
One-Forcing: Towards Stable One-Step Autoregressive Video Generation
di: Feng, Jiaqi, et al.
Pubblicazione: (2026)
di: Feng, Jiaqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation
di: An, Sohyun, et al.
Pubblicazione: (2026) -
AI Co-Scientist for Ranking: Discovering Novel Search Ranking Models alongside LLM-based AI Agents with Cloud Computing Access
di: Wu, Liwei, et al.
Pubblicazione: (2026) -
Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
di: An, Sohyun, et al.
Pubblicazione: (2025) -
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
di: Lee, Hyomin, et al.
Pubblicazione: (2026) -
SmartSearch: Process Reward-Guided Query Refinement for Search Agents
di: Wen, Tongyu, et al.
Pubblicazione: (2026)