Saved in:
| Main Authors: | He, Hang, Yue, Chuhuai, Dong, Chengqi, Tian, Mingxue, Chen, Hao, Liu, Zhenfeng, Chai, Jiajun, Wang, Xiaohan, Zhang, Yufei, Liao, Qun, Yin, Guojun, Lin, Wei, Wan, Chengcheng, Sun, Haiying, Su, Ting |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2512.07436 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Promoting Efficient Reasoning with Verifiable Stepwise Reward
by: Yue, Chuhuai, et al.
Published: (2025)
by: Yue, Chuhuai, et al.
Published: (2025)
MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL
by: Xu, Zekun, et al.
Published: (2025)
by: Xu, Zekun, et al.
Published: (2025)
Training Multi-Image Vision Agents via End2End Reinforcement Learning
by: Dong, Chengqi, et al.
Published: (2025)
by: Dong, Chengqi, et al.
Published: (2025)
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
by: Zeng, Wenwen, et al.
Published: (2026)
by: Zeng, Wenwen, et al.
Published: (2026)
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
by: Sun, Jingbo, et al.
Published: (2026)
by: Sun, Jingbo, et al.
Published: (2026)
RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use
by: Chai, Jiajun, et al.
Published: (2025)
by: Chai, Jiajun, et al.
Published: (2025)
ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
by: Chen, Hao, et al.
Published: (2025)
by: Chen, Hao, et al.
Published: (2025)
Automated detection of atomicity violations in large-scale systems
by: He, Hang, et al.
Published: (2025)
by: He, Hang, et al.
Published: (2025)
Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration
by: Wang, Zili, et al.
Published: (2026)
by: Wang, Zili, et al.
Published: (2026)
Local Well‐Posedness to the Magneto‐Micropolar Boundary Layer Equations in Gevrey Space
by: Zhong Tan, et al.
Published: (2024)
by: Zhong Tan, et al.
Published: (2024)
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
by: Hou, Bohan, et al.
Published: (2026)
by: Hou, Bohan, et al.
Published: (2026)
AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning
by: Mei, Lang, et al.
Published: (2025)
by: Mei, Lang, et al.
Published: (2025)
VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild
by: Inc, Xiaohongshu
Published: (2026)
by: Inc, Xiaohongshu
Published: (2026)
AgentSearchBench: A Benchmark for AI Agent Search in the Wild
by: Wu, Bin, et al.
Published: (2026)
by: Wu, Bin, et al.
Published: (2026)
ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models
by: Lin, Zihan, et al.
Published: (2025)
by: Lin, Zihan, et al.
Published: (2025)
ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay
by: Hu, Zhexin, et al.
Published: (2026)
by: Hu, Zhexin, et al.
Published: (2026)
SAE as a Crystal Ball: Interpretable Features Predict Cross-domain Transferability of LLMs without Training
by: Zhang, Qi, et al.
Published: (2026)
by: Zhang, Qi, et al.
Published: (2026)
LocalGPT: Benchmarking and Advancing Large Language Models for Local Life Services in Meituan
by: Lan, Xiaochong, et al.
Published: (2025)
by: Lan, Xiaochong, et al.
Published: (2025)
Enhancing Local Life Service Recommendation with Agentic Reasoning in Large Language Model
by: Cao, Shiteng, et al.
Published: (2026)
by: Cao, Shiteng, et al.
Published: (2026)
BinPRE: Enhancing Field Inference in Binary Analysis Based Protocol Reverse Engineering
by: Jiang, Jiayi, et al.
Published: (2024)
by: Jiang, Jiayi, et al.
Published: (2024)
Large-Scale Multi-Robot Coverage Path Planning via Local Search
by: Tang, Jingtao, et al.
Published: (2023)
by: Tang, Jingtao, et al.
Published: (2023)
WideSearch: Benchmarking Agentic Broad Info-Seeking
by: Wong, Ryan, et al.
Published: (2025)
by: Wong, Ryan, et al.
Published: (2025)
Local Search GFlowNets
by: Kim, Minsu, et al.
Published: (2023)
by: Kim, Minsu, et al.
Published: (2023)
Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning
by: Wang, Li, et al.
Published: (2026)
by: Wang, Li, et al.
Published: (2026)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
by: Wang, Li, et al.
Published: (2026)
by: Wang, Li, et al.
Published: (2026)
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
by: Lin, Zihan, et al.
Published: (2025)
by: Lin, Zihan, et al.
Published: (2025)
Beyond Retrieval: A Multitask Benchmark and Model for Code Search
by: Xue, Siqiao, et al.
Published: (2026)
by: Xue, Siqiao, et al.
Published: (2026)
LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning
by: Gao, Zihan, et al.
Published: (2025)
by: Gao, Zihan, et al.
Published: (2025)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
by: Yang, Jie, et al.
Published: (2026)
by: Yang, Jie, et al.
Published: (2026)
Modeling the Dynamic Process of Inventions for Reducing Knowledge Search Costs
by: Ren, Haiying, et al.
Published: (2024)
by: Ren, Haiying, et al.
Published: (2024)
ScholarSearch: Benchmarking Scholar Searching Ability of LLMs
by: Zhou, Junting, et al.
Published: (2025)
by: Zhou, Junting, et al.
Published: (2025)
SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval
by: Li, Ningyuan, et al.
Published: (2026)
by: Li, Ningyuan, et al.
Published: (2026)
NAS-Bench-Graph: Benchmarking Graph Neural Architecture Search
by: Qin, Yijian, et al.
Published: (2022)
by: Qin, Yijian, et al.
Published: (2022)
Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization
by: Yu, Tao, et al.
Published: (2026)
by: Yu, Tao, et al.
Published: (2026)
ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue
by: Zhang, Daoxuan, et al.
Published: (2026)
by: Zhang, Daoxuan, et al.
Published: (2026)
On the Smoothed Complexity of Combinatorial Local Search
by: Giannakopoulos, Yiannis, et al.
Published: (2022)
by: Giannakopoulos, Yiannis, et al.
Published: (2022)
Local Search k-means++ with Foresight
by: Conrads, Theo, et al.
Published: (2024)
by: Conrads, Theo, et al.
Published: (2024)
Learning with Local Search MCMC Layers
by: Vivier-Ardisson, Germain, et al.
Published: (2025)
by: Vivier-Ardisson, Germain, et al.
Published: (2025)
Spectral Lower Bounds for Local Search
by: Brânzei, Simina, et al.
Published: (2024)
by: Brânzei, Simina, et al.
Published: (2024)
Hierarchical Clustering via Local Search
by: Jowhari, Hossein
Published: (2024)
by: Jowhari, Hossein
Published: (2024)
Similar Items
-
Promoting Efficient Reasoning with Verifiable Stepwise Reward
by: Yue, Chuhuai, et al.
Published: (2025) -
MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL
by: Xu, Zekun, et al.
Published: (2025) -
Training Multi-Image Vision Agents via End2End Reinforcement Learning
by: Dong, Chengqi, et al.
Published: (2025) -
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
by: Zeng, Wenwen, et al.
Published: (2026) -
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
by: Sun, Jingbo, et al.
Published: (2026)