Cycle-Consistent Search: Question Reconstructability as a Proxy Reward for Search Agent Training
Fuente:
arXiv
Guardado en:
| Autores principales: | An, Sohyun, Yuan, Shuibenyang, Lee, Hayeon, Hsieh, Cho-Jui, Min, Alexander |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation
por: An, Sohyun, et al.
Publicado: (2026)
por: An, Sohyun, et al.
Publicado: (2026)
AI Co-Scientist for Ranking: Discovering Novel Search Ranking Models alongside LLM-based AI Agents with Cloud Computing Access
por: Wu, Liwei, et al.
Publicado: (2026)
por: Wu, Liwei, et al.
Publicado: (2026)
Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
por: An, Sohyun, et al.
Publicado: (2025)
por: An, Sohyun, et al.
Publicado: (2025)
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
por: Lee, Hyomin, et al.
Publicado: (2026)
por: Lee, Hyomin, et al.
Publicado: (2026)
SmartSearch: Process Reward-Guided Query Refinement for Search Agents
por: Wen, Tongyu, et al.
Publicado: (2026)
por: Wen, Tongyu, et al.
Publicado: (2026)
Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs
por: Hong, Yunqi, et al.
Publicado: (2025)
por: Hong, Yunqi, et al.
Publicado: (2025)
One Prompt is not Enough: Automated Construction of a Mixture-of-Expert Prompts
por: Wang, Ruochen, et al.
Publicado: (2024)
por: Wang, Ruochen, et al.
Publicado: (2024)
IRIS: Intrinsic Reward Image Synthesis
por: Chen, Yihang, et al.
Publicado: (2025)
por: Chen, Yihang, et al.
Publicado: (2025)
Exploring Expert Failures Improves LLM Agent Tuning
por: Lan, Li-Cheng, et al.
Publicado: (2025)
por: Lan, Li-Cheng, et al.
Publicado: (2025)
Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents
por: Wang, Yiding, et al.
Publicado: (2025)
por: Wang, Yiding, et al.
Publicado: (2025)
AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment
por: Kao, Kuei-Chun, et al.
Publicado: (2026)
por: Kao, Kuei-Chun, et al.
Publicado: (2026)
Certified Training with Branch-and-Bound for Lyapunov-stable Neural Control
por: Shi, Zhouxing, et al.
Publicado: (2024)
por: Shi, Zhouxing, et al.
Publicado: (2024)
OptiProxy-NAS: Optimization Proxy based End-to-End Neural Architecture Search
por: Lyu, Bo, et al.
Publicado: (2025)
por: Lyu, Bo, et al.
Publicado: (2025)
Accelerating Large Language Model Pretraining via LFR Pedagogy: Learn, Focus, and Review
por: Prakriya, Neha, et al.
Publicado: (2024)
por: Prakriya, Neha, et al.
Publicado: (2024)
ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
por: Li, Xirui, et al.
Publicado: (2026)
por: Li, Xirui, et al.
Publicado: (2026)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
por: Li, Xirui, et al.
Publicado: (2024)
por: Li, Xirui, et al.
Publicado: (2024)
InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
por: Luo, Kun, et al.
Publicado: (2025)
por: Luo, Kun, et al.
Publicado: (2025)
RF-Agent: Automated Reward Function Design via Language Agent Tree Search
por: Gao, Ning, et al.
Publicado: (2026)
por: Gao, Ning, et al.
Publicado: (2026)
Enhancing Large Language Models with Reward-guided Tree Search for Knowledge Graph Question and Answering
por: Long, Xiao, et al.
Publicado: (2025)
por: Long, Xiao, et al.
Publicado: (2025)
Expanding Search Space with Diverse Prompting Agents: An Efficient Sampling Approach for LLM Mathematical Reasoning
por: Lee, Gisang, et al.
Publicado: (2024)
por: Lee, Gisang, et al.
Publicado: (2024)
Plan Before Search: Search Agents Need Plan
por: Qian, Zhipeng, et al.
Publicado: (2026)
por: Qian, Zhipeng, et al.
Publicado: (2026)
Dr. Zero: Self-Evolving Search Agents without Training Data
por: Yue, Zhenrui, et al.
Publicado: (2026)
por: Yue, Zhenrui, et al.
Publicado: (2026)
Enhancing LLM Reasoning with Reward-guided Tree Search
por: Jiang, Jinhao, et al.
Publicado: (2024)
por: Jiang, Jinhao, et al.
Publicado: (2024)
QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Models
por: Kao, Kuei-Chun, et al.
Publicado: (2025)
por: Kao, Kuei-Chun, et al.
Publicado: (2025)
ProductAgent: Benchmarking Conversational Product Search Agent with Asking Clarification Questions
por: Ye, Jingheng, et al.
Publicado: (2024)
por: Ye, Jingheng, et al.
Publicado: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
por: Wang, Yihan, et al.
Publicado: (2024)
por: Wang, Yihan, et al.
Publicado: (2024)
Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?
por: Kao, Kuei-Chun, et al.
Publicado: (2024)
por: Kao, Kuei-Chun, et al.
Publicado: (2024)
DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
Bidirectional Bounded-Suboptimal Heuristic Search with Consistent Heuristics
por: Shperberg, Shahaf S., et al.
Publicado: (2025)
por: Shperberg, Shahaf S., et al.
Publicado: (2025)
UniDEC : Unified Dual Encoder and Classifier Training for Extreme Multi-Label Classification
por: Kharbanda, Siddhant, et al.
Publicado: (2024)
por: Kharbanda, Siddhant, et al.
Publicado: (2024)
When Is Enough Not Enough? Illusory Completion in Search Agents
por: Ko, Dayoon, et al.
Publicado: (2026)
por: Ko, Dayoon, et al.
Publicado: (2026)
ARGS: Alignment as Reward-Guided Search
por: Khanov, Maxim, et al.
Publicado: (2024)
por: Khanov, Maxim, et al.
Publicado: (2024)
Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents
por: Chuang, Yun-Shiuan, et al.
Publicado: (2026)
por: Chuang, Yun-Shiuan, et al.
Publicado: (2026)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
por: Cui, Justin, et al.
Publicado: (2024)
por: Cui, Justin, et al.
Publicado: (2024)
IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning
por: Liang, Zihan, et al.
Publicado: (2026)
por: Liang, Zihan, et al.
Publicado: (2026)
Dominating vs. Dominated: Generative Collapse in Diffusion Models
por: Jeong, Hayeon, et al.
Publicado: (2025)
por: Jeong, Hayeon, et al.
Publicado: (2025)
Evaluating the Search Agent in a Parallel World
por: Chen, Jiawei, et al.
Publicado: (2026)
por: Chen, Jiawei, et al.
Publicado: (2026)
Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents
por: Liu, Yizhou, et al.
Publicado: (2026)
por: Liu, Yizhou, et al.
Publicado: (2026)
LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble
por: Lee, Yujeong, et al.
Publicado: (2024)
por: Lee, Yujeong, et al.
Publicado: (2024)
One-Forcing: Towards Stable One-Step Autoregressive Video Generation
por: Feng, Jiaqi, et al.
Publicado: (2026)
por: Feng, Jiaqi, et al.
Publicado: (2026)
Ejemplares similares
-
FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation
por: An, Sohyun, et al.
Publicado: (2026) -
AI Co-Scientist for Ranking: Discovering Novel Search Ranking Models alongside LLM-based AI Agents with Cloud Computing Access
por: Wu, Liwei, et al.
Publicado: (2026) -
Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
por: An, Sohyun, et al.
Publicado: (2025) -
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
por: Lee, Hyomin, et al.
Publicado: (2026) -
SmartSearch: Process Reward-Guided Query Refinement for Search Agents
por: Wen, Tongyu, et al.
Publicado: (2026)