Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Agarwal, Aradhye, Siyan, Gurdit, Pandya, Yash, Singh, Joykirat, Nambi, Akshay, Awadallah, Ahmed |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
par: Singh, Joykirat, et autres
Publié: (2025)
par: Singh, Joykirat, et autres
Publié: (2025)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
par: Singh, Joykirat, et autres
Publié: (2025)
par: Singh, Joykirat, et autres
Publié: (2025)
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
par: Singh, Joykirat, et autres
Publié: (2024)
par: Singh, Joykirat, et autres
Publié: (2024)
Fara-7B: An Efficient Agentic Model for Computer Use
par: Awadallah, Ahmed, et autres
Publié: (2025)
par: Awadallah, Ahmed, et autres
Publié: (2025)
Scaling Agentic Capabilities, Not Context: Efficient Reinforcement Finetuning for Large Toolspaces
par: Gupta, Karan, et autres
Publié: (2026)
par: Gupta, Karan, et autres
Publié: (2026)
PromptWizard: Task-Aware Prompt Optimization Framework
par: Agarwal, Eshaan, et autres
Publié: (2024)
par: Agarwal, Eshaan, et autres
Publié: (2024)
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning
par: Kumar, Somnath, et autres
Publié: (2024)
par: Kumar, Somnath, et autres
Publié: (2024)
Step-by-Step Unmasking for Parameter-Efficient Fine-tuning of Large Language Models
par: Agarwal, Aradhye, et autres
Publié: (2024)
par: Agarwal, Aradhye, et autres
Publié: (2024)
Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression
par: Singh, Joykirat, et autres
Publié: (2025)
par: Singh, Joykirat, et autres
Publié: (2025)
The Art of Scaling Test-Time Compute for Large Language Models
par: Agarwal, Aradhye, et autres
Publié: (2025)
par: Agarwal, Aradhye, et autres
Publié: (2025)
First Finish Search: Efficient Test-Time Scaling in Large Language Models
par: Agarwal, Aradhye, et autres
Publié: (2025)
par: Agarwal, Aradhye, et autres
Publié: (2025)
Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty
par: Singh, Joykirat, et autres
Publié: (2026)
par: Singh, Joykirat, et autres
Publié: (2026)
WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs
par: Han, Seungju, et autres
Publié: (2024)
par: Han, Seungju, et autres
Publié: (2024)
Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use
par: Goldie, Anna, et autres
Publié: (2025)
par: Goldie, Anna, et autres
Publié: (2025)
Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning
par: Xu, Ningning, et autres
Publié: (2025)
par: Xu, Ningning, et autres
Publié: (2025)
Mechanistic Behavior Editing of Language Models
par: Singh, Joykirat, et autres
Publié: (2024)
par: Singh, Joykirat, et autres
Publié: (2024)
Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
par: Bajpai, Ashutosh, et autres
Publié: (2026)
par: Bajpai, Ashutosh, et autres
Publié: (2026)
SpatialMath: Spatial Comprehension-Infused Symbolic Reasoning for Mathematical Problem-Solving
par: Bajpai, Ashutosh, et autres
Publié: (2026)
par: Bajpai, Ashutosh, et autres
Publié: (2026)
StepTool: Enhancing Multi-Step Tool Usage in LLMs via Step-Grained Reinforcement Learning
par: Yu, Yuanqing, et autres
Publié: (2024)
par: Yu, Yuanqing, et autres
Publié: (2024)
When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals
par: Anonto, Riad Ahmed, et autres
Publié: (2025)
par: Anonto, Riad Ahmed, et autres
Publié: (2025)
AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG
par: You, Qijie, et autres
Publié: (2026)
par: You, Qijie, et autres
Publié: (2026)
How to think step-by-step: A mechanistic understanding of chain-of-thought reasoning
par: Dutta, Subhabrata, et autres
Publié: (2024)
par: Dutta, Subhabrata, et autres
Publié: (2024)
BingoGuard: LLM Content Moderation Tools with Risk Levels
par: Yin, Fan, et autres
Publié: (2025)
par: Yin, Fan, et autres
Publié: (2025)
Agentic Tool Use in Large Language Models
par: Hu, Jinchao, et autres
Publié: (2026)
par: Hu, Jinchao, et autres
Publié: (2026)
GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces
par: Geng, Xinyu, et autres
Publié: (2026)
par: Geng, Xinyu, et autres
Publié: (2026)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
par: Jiang, Dongfu, et autres
Publié: (2025)
par: Jiang, Dongfu, et autres
Publié: (2025)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
par: Wu, Junde, et autres
Publié: (2025)
par: Wu, Junde, et autres
Publié: (2025)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
par: Asif, Sadia, et autres
Publié: (2026)
par: Asif, Sadia, et autres
Publié: (2026)
ToolRM: Towards Agentic Tool-Use Reward Modeling
par: Li, Renhao, et autres
Publié: (2025)
par: Li, Renhao, et autres
Publié: (2025)
EROS: Entity-Driven Controlled Policy Document Summarization
par: Singh, Joykirat, et autres
Publié: (2024)
par: Singh, Joykirat, et autres
Publié: (2024)
AI for Climate Finance: Agentic Retrieval and Multi-Step Reasoning for Early Warning System Investments
par: Vaghefi, Saeid Ario, et autres
Publié: (2025)
par: Vaghefi, Saeid Ario, et autres
Publié: (2025)
PBEBench: A Multi-Step Programming by Examples Reasoning Benchmark inspired by Historical Linguistics
par: Naik, Atharva, et autres
Publié: (2025)
par: Naik, Atharva, et autres
Publié: (2025)
AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
par: Zou, Jiaru, et autres
Publié: (2025)
par: Zou, Jiaru, et autres
Publié: (2025)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
par: Fan, Zhiting, et autres
Publié: (2025)
par: Fan, Zhiting, et autres
Publié: (2025)
Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems
par: Chen, Justin Chih-Yao, et autres
Publié: (2026)
par: Chen, Justin Chih-Yao, et autres
Publié: (2026)
ASTER: Agentic Scaling with Tool-integrated Extended Reasoning
par: Zhang, Xuqin, et autres
Publié: (2026)
par: Zhang, Xuqin, et autres
Publié: (2026)
Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
par: Xie, Tengyang, et autres
Publié: (2024)
par: Xie, Tengyang, et autres
Publié: (2024)
SplitReason: Learning To Offload Reasoning
par: Akhauri, Yash, et autres
Publié: (2025)
par: Akhauri, Yash, et autres
Publié: (2025)
Self-DC: When to Reason and When to Act? Self Divide-and-Conquer for Compositional Unknown Questions
par: Wang, Hongru, et autres
Publié: (2024)
par: Wang, Hongru, et autres
Publié: (2024)
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
par: Xu, Ruotao, et autres
Publié: (2026)
par: Xu, Ruotao, et autres
Publié: (2026)
Documents similaires
-
Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
par: Singh, Joykirat, et autres
Publié: (2025) -
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
par: Singh, Joykirat, et autres
Publié: (2025) -
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
par: Singh, Joykirat, et autres
Publié: (2024) -
Fara-7B: An Efficient Agentic Model for Computer Use
par: Awadallah, Ahmed, et autres
Publié: (2025) -
Scaling Agentic Capabilities, Not Context: Efficient Reinforcement Finetuning for Large Toolspaces
par: Gupta, Karan, et autres
Publié: (2026)