E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Weiyang, Shi, Zesheng, Zhao, Liye, Ma, Jiayuan, Zhu, Zeen, He, Junxian, Zhang, Min, Li, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
par: Guo, Weiyang, et autres
Publié: (2026)
par: Guo, Weiyang, et autres
Publié: (2026)
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
par: Zhang, Luan, et autres
Publié: (2026)
par: Zhang, Luan, et autres
Publié: (2026)
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
par: Qu, Changle, et autres
Publié: (2026)
par: Qu, Changle, et autres
Publié: (2026)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
par: Wu, Junde, et autres
Publié: (2025)
par: Wu, Junde, et autres
Publié: (2025)
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
par: Zeng, Weihao, et autres
Publié: (2024)
par: Zeng, Weihao, et autres
Publié: (2024)
Jailbreak-R1: Exploring the Jailbreak Capabilities of LLMs via Reinforcement Learning
par: Guo, Weiyang, et autres
Publié: (2025)
par: Guo, Weiyang, et autres
Publié: (2025)
DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management
par: Su, Xuerui, et autres
Publié: (2025)
par: Su, Xuerui, et autres
Publié: (2025)
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
par: Zhang, Situo, et autres
Publié: (2026)
par: Zhang, Situo, et autres
Publié: (2026)
Skill Weaving: Efficient LLM Improvement via Modular Skillpacks
par: Li, Zhuo, et autres
Publié: (2026)
par: Li, Zhuo, et autres
Publié: (2026)
Non-myopic Generation of Language Models for Reasoning and Planning
par: Ma, Chang, et autres
Publié: (2024)
par: Ma, Chang, et autres
Publié: (2024)
Safety Alignment via Constrained Knowledge Unlearning
par: Shi, Zesheng, et autres
Publié: (2025)
par: Shi, Zesheng, et autres
Publié: (2025)
JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models
par: Chi, Ce, et autres
Publié: (2025)
par: Chi, Ce, et autres
Publié: (2025)
Guided by Trajectories: Repairing and Rewarding Tool-Use Trajectories for Tool-Integrated Reasoning
par: Gong, Siyu, et autres
Publié: (2026)
par: Gong, Siyu, et autres
Publié: (2026)
Dissecting Tool-Integrated Reasoning: An Empirical Study and Analysis
par: Zhao, Yufeng, et autres
Publié: (2025)
par: Zhao, Yufeng, et autres
Publié: (2025)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
par: Huang, Kexin, et autres
Publié: (2026)
par: Huang, Kexin, et autres
Publié: (2026)
MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning
par: Chen, Jiawei, et autres
Publié: (2025)
par: Chen, Jiawei, et autres
Publié: (2025)
Dr. RTL: Autonomous Agentic RTL Optimization through Tool-Grounded Self-Improvement
par: Fang, Wenji, et autres
Publié: (2026)
par: Fang, Wenji, et autres
Publié: (2026)
DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use
par: Chen, Aili, et autres
Publié: (2026)
par: Chen, Aili, et autres
Publié: (2026)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
par: Xu, Beining, et autres
Publié: (2025)
par: Xu, Beining, et autres
Publié: (2025)
Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs
par: Li, Junxian, et autres
Publié: (2025)
par: Li, Junxian, et autres
Publié: (2025)
EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning Tools
par: Zhang, Boer, et autres
Publié: (2026)
par: Zhang, Boer, et autres
Publié: (2026)
MedCoAct: Confidence-Aware Multi-Agent Collaboration for Complete Clinical Decision
par: Zheng, Hongjie, et autres
Publié: (2025)
par: Zheng, Hongjie, et autres
Publié: (2025)
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
par: Li, Wu, et autres
Publié: (2026)
par: Li, Wu, et autres
Publié: (2026)
AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation
par: Jiang, Xi, et autres
Publié: (2026)
par: Jiang, Xi, et autres
Publié: (2026)
Understanding Tool-Integrated Reasoning
par: Lin, Heng, et autres
Publié: (2025)
par: Lin, Heng, et autres
Publié: (2025)
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
par: He, Yang, et autres
Publié: (2026)
par: He, Yang, et autres
Publié: (2026)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
par: Guo, Weiyang, et autres
Publié: (2025)
par: Guo, Weiyang, et autres
Publié: (2025)
Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning
par: Shen, Xintian, et autres
Publié: (2026)
par: Shen, Xintian, et autres
Publié: (2026)
Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
par: Ma, Xilai, et autres
Publié: (2026)
par: Ma, Xilai, et autres
Publié: (2026)
CAREAgent: Clinical Agent with Structured Reasoning and Tool-Integrated for Order Generation
par: Hou, Ruihui, et autres
Publié: (2026)
par: Hou, Ruihui, et autres
Publié: (2026)
Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models
par: Hong, Zesheng, et autres
Publié: (2026)
par: Hong, Zesheng, et autres
Publié: (2026)
CodeI/O: Condensing Reasoning Patterns via Code Input-Output Prediction
par: Li, Junlong, et autres
Publié: (2025)
par: Li, Junlong, et autres
Publié: (2025)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
par: Wu, Feijie, et autres
Publié: (2025)
par: Wu, Feijie, et autres
Publié: (2025)
Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
par: Chen, Zhipeng, et autres
Publié: (2025)
par: Chen, Zhipeng, et autres
Publié: (2025)
ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
par: Yang, Chen, et autres
Publié: (2025)
par: Yang, Chen, et autres
Publié: (2025)
Evolutionary Discovery of Heuristic Policies for Traffic Signal Control
par: Wang, Ruibing, et autres
Publié: (2025)
par: Wang, Ruibing, et autres
Publié: (2025)
From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning
par: Huang, Yuzhen, et autres
Publié: (2025)
par: Huang, Yuzhen, et autres
Publié: (2025)
Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
par: Singh, Joykirat, et autres
Publié: (2025)
par: Singh, Joykirat, et autres
Publié: (2025)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
par: Wang, Jianing, et autres
Publié: (2026)
par: Wang, Jianing, et autres
Publié: (2026)
Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning
par: Zhang, Hang, et autres
Publié: (2026)
par: Zhang, Hang, et autres
Publié: (2026)
Documents similaires
-
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
par: Guo, Weiyang, et autres
Publié: (2026) -
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
par: Zhang, Luan, et autres
Publié: (2026) -
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
par: Qu, Changle, et autres
Publié: (2026) -
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
par: Wu, Junde, et autres
Publié: (2025) -
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
par: Zeng, Weihao, et autres
Publié: (2024)