E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Weiyang, Shi, Zesheng, Zhao, Liye, Ma, Jiayuan, Zhu, Zeen, He, Junxian, Zhang, Min, Li, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
por: Guo, Weiyang, et al.
Publicado: (2026)
por: Guo, Weiyang, et al.
Publicado: (2026)
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
por: Zhang, Luan, et al.
Publicado: (2026)
por: Zhang, Luan, et al.
Publicado: (2026)
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
por: Qu, Changle, et al.
Publicado: (2026)
por: Qu, Changle, et al.
Publicado: (2026)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
por: Wu, Junde, et al.
Publicado: (2025)
por: Wu, Junde, et al.
Publicado: (2025)
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
por: Zeng, Weihao, et al.
Publicado: (2024)
por: Zeng, Weihao, et al.
Publicado: (2024)
Jailbreak-R1: Exploring the Jailbreak Capabilities of LLMs via Reinforcement Learning
por: Guo, Weiyang, et al.
Publicado: (2025)
por: Guo, Weiyang, et al.
Publicado: (2025)
DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management
por: Su, Xuerui, et al.
Publicado: (2025)
por: Su, Xuerui, et al.
Publicado: (2025)
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
por: Zhang, Situo, et al.
Publicado: (2026)
por: Zhang, Situo, et al.
Publicado: (2026)
Skill Weaving: Efficient LLM Improvement via Modular Skillpacks
por: Li, Zhuo, et al.
Publicado: (2026)
por: Li, Zhuo, et al.
Publicado: (2026)
Non-myopic Generation of Language Models for Reasoning and Planning
por: Ma, Chang, et al.
Publicado: (2024)
por: Ma, Chang, et al.
Publicado: (2024)
Safety Alignment via Constrained Knowledge Unlearning
por: Shi, Zesheng, et al.
Publicado: (2025)
por: Shi, Zesheng, et al.
Publicado: (2025)
JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models
por: Chi, Ce, et al.
Publicado: (2025)
por: Chi, Ce, et al.
Publicado: (2025)
Guided by Trajectories: Repairing and Rewarding Tool-Use Trajectories for Tool-Integrated Reasoning
por: Gong, Siyu, et al.
Publicado: (2026)
por: Gong, Siyu, et al.
Publicado: (2026)
Dissecting Tool-Integrated Reasoning: An Empirical Study and Analysis
por: Zhao, Yufeng, et al.
Publicado: (2025)
por: Zhao, Yufeng, et al.
Publicado: (2025)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
por: Huang, Kexin, et al.
Publicado: (2026)
por: Huang, Kexin, et al.
Publicado: (2026)
MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning
por: Chen, Jiawei, et al.
Publicado: (2025)
por: Chen, Jiawei, et al.
Publicado: (2025)
Dr. RTL: Autonomous Agentic RTL Optimization through Tool-Grounded Self-Improvement
por: Fang, Wenji, et al.
Publicado: (2026)
por: Fang, Wenji, et al.
Publicado: (2026)
DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use
por: Chen, Aili, et al.
Publicado: (2026)
por: Chen, Aili, et al.
Publicado: (2026)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
por: Xu, Beining, et al.
Publicado: (2025)
por: Xu, Beining, et al.
Publicado: (2025)
Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs
por: Li, Junxian, et al.
Publicado: (2025)
por: Li, Junxian, et al.
Publicado: (2025)
EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning Tools
por: Zhang, Boer, et al.
Publicado: (2026)
por: Zhang, Boer, et al.
Publicado: (2026)
MedCoAct: Confidence-Aware Multi-Agent Collaboration for Complete Clinical Decision
por: Zheng, Hongjie, et al.
Publicado: (2025)
por: Zheng, Hongjie, et al.
Publicado: (2025)
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
por: Li, Wu, et al.
Publicado: (2026)
por: Li, Wu, et al.
Publicado: (2026)
AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation
por: Jiang, Xi, et al.
Publicado: (2026)
por: Jiang, Xi, et al.
Publicado: (2026)
Understanding Tool-Integrated Reasoning
por: Lin, Heng, et al.
Publicado: (2025)
por: Lin, Heng, et al.
Publicado: (2025)
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
por: He, Yang, et al.
Publicado: (2026)
por: He, Yang, et al.
Publicado: (2026)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
por: Guo, Weiyang, et al.
Publicado: (2025)
por: Guo, Weiyang, et al.
Publicado: (2025)
Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning
por: Shen, Xintian, et al.
Publicado: (2026)
por: Shen, Xintian, et al.
Publicado: (2026)
Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
por: Ma, Xilai, et al.
Publicado: (2026)
por: Ma, Xilai, et al.
Publicado: (2026)
CAREAgent: Clinical Agent with Structured Reasoning and Tool-Integrated for Order Generation
por: Hou, Ruihui, et al.
Publicado: (2026)
por: Hou, Ruihui, et al.
Publicado: (2026)
Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models
por: Hong, Zesheng, et al.
Publicado: (2026)
por: Hong, Zesheng, et al.
Publicado: (2026)
CodeI/O: Condensing Reasoning Patterns via Code Input-Output Prediction
por: Li, Junlong, et al.
Publicado: (2025)
por: Li, Junlong, et al.
Publicado: (2025)
PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning
por: Wu, Feijie, et al.
Publicado: (2025)
por: Wu, Feijie, et al.
Publicado: (2025)
Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
por: Chen, Zhipeng, et al.
Publicado: (2025)
por: Chen, Zhipeng, et al.
Publicado: (2025)
ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
por: Yang, Chen, et al.
Publicado: (2025)
por: Yang, Chen, et al.
Publicado: (2025)
Evolutionary Discovery of Heuristic Policies for Traffic Signal Control
por: Wang, Ruibing, et al.
Publicado: (2025)
por: Wang, Ruibing, et al.
Publicado: (2025)
From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning
por: Huang, Yuzhen, et al.
Publicado: (2025)
por: Huang, Yuzhen, et al.
Publicado: (2025)
Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
por: Singh, Joykirat, et al.
Publicado: (2025)
por: Singh, Joykirat, et al.
Publicado: (2025)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
por: Wang, Jianing, et al.
Publicado: (2026)
por: Wang, Jianing, et al.
Publicado: (2026)
Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning
por: Zhang, Hang, et al.
Publicado: (2026)
por: Zhang, Hang, et al.
Publicado: (2026)
Ejemplares similares
-
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
por: Guo, Weiyang, et al.
Publicado: (2026) -
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
por: Zhang, Luan, et al.
Publicado: (2026) -
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
por: Qu, Changle, et al.
Publicado: (2026) -
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
por: Wu, Junde, et al.
Publicado: (2025) -
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
por: Zeng, Weihao, et al.
Publicado: (2024)