SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cuadron, Alejandro, Yu, Pengfei, Liu, Yang, Gupta, Arpit |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
par: Zhen, Shuai, et autres
Publié: (2026)
par: Zhen, Shuai, et autres
Publié: (2026)
HashAttention: Semantic Sparsity for Faster Inference
par: Desai, Aditya, et autres
Publié: (2024)
par: Desai, Aditya, et autres
Publié: (2024)
Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment
par: Wang, Haozhong, et autres
Publié: (2026)
par: Wang, Haozhong, et autres
Publié: (2026)
CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation
par: Feng, Yushi, et autres
Publié: (2026)
par: Feng, Yushi, et autres
Publié: (2026)
Learnware of Language Models: Specialized Small Language Models Can Do Big
par: Tan, Zhi-Hao, et autres
Publié: (2025)
par: Tan, Zhi-Hao, et autres
Publié: (2025)
RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inference
par: Gautam, Arpit Singh, et autres
Publié: (2026)
par: Gautam, Arpit Singh, et autres
Publié: (2026)
GuardReasoner: Towards Reasoning-based LLM Safeguards
par: Liu, Yue, et autres
Publié: (2025)
par: Liu, Yue, et autres
Publié: (2025)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
par: Tan, Sijun, et autres
Publié: (2024)
par: Tan, Sijun, et autres
Publié: (2024)
vAttention: Verified Sparse Attention
par: Desai, Aditya, et autres
Publié: (2025)
par: Desai, Aditya, et autres
Publié: (2025)
SABER: Switchable and Balanced Training for Efficient LLM Reasoning
par: Zhao, Kai, et autres
Publié: (2025)
par: Zhao, Kai, et autres
Publié: (2025)
Winning Big with Small Models: Knowledge Distillation vs. Self-Training for Reducing Hallucination in Product QA Agents
par: Lewis, Ashley, et autres
Publié: (2025)
par: Lewis, Ashley, et autres
Publié: (2025)
Verifiability-First Agents: Provable Observability and Lightweight Audit Agents for Controlling Autonomous LLM Systems
par: Gupta, Abhivansh
Publié: (2025)
par: Gupta, Abhivansh
Publié: (2025)
Bootstrapped Mixed Rewards for RL Post-Training: Injecting Canonical Action Order
par: Gupta, Prakhar, et autres
Publié: (2025)
par: Gupta, Prakhar, et autres
Publié: (2025)
Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement
par: Xiong, Weimin, et autres
Publié: (2024)
par: Xiong, Weimin, et autres
Publié: (2024)
One-Step Graph-Structured Neural Flows for Irregular Multivariate Time Series Classification
par: Gao, Mengzhou, et autres
Publié: (2026)
par: Gao, Mengzhou, et autres
Publié: (2026)
When LLM Meets Time Series: Can LLMs Perform Multi-Step Time Series Reasoning and Inference
par: Ye, Wen, et autres
Publié: (2025)
par: Ye, Wen, et autres
Publié: (2025)
QDeepGR4J: Quantile-based ensemble of deep learning and GR4J hybrid rainfall-runoff models for extreme flow prediction with uncertainty quantification
par: Kapoor, Arpit, et autres
Publié: (2025)
par: Kapoor, Arpit, et autres
Publié: (2025)
Uncertainty in Action: Confidence Elicitation in Embodied Agents
par: Yu, Tianjiao, et autres
Publié: (2025)
par: Yu, Tianjiao, et autres
Publié: (2025)
Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents
par: Song, Yifan, et autres
Publié: (2024)
par: Song, Yifan, et autres
Publié: (2024)
SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
par: Rahman, Salman, et autres
Publié: (2025)
par: Rahman, Salman, et autres
Publié: (2025)
An Example Safety Case for Safeguards Against Misuse
par: Clymer, Joshua, et autres
Publié: (2025)
par: Clymer, Joshua, et autres
Publié: (2025)
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
par: Wang, Hanlin, et autres
Publié: (2025)
par: Wang, Hanlin, et autres
Publié: (2025)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
par: Xu, Yinglun, et autres
Publié: (2023)
par: Xu, Yinglun, et autres
Publié: (2023)
GoAgent: Group-of-Agents Communication Topology Generation for LLM-based Multi-Agent Systems
par: Chen, Hongjiang, et autres
Publié: (2026)
par: Chen, Hongjiang, et autres
Publié: (2026)
PoPE: Legendre Orthogonal Polynomials Based Position Encoding for Large Language Models
par: Aggarwal, Arpit
Publié: (2024)
par: Aggarwal, Arpit
Publié: (2024)
PropGuard: Safeguarding LLM-MAS via Propagation-Aware Exploration and Remediation
par: Yan, Bingyu, et autres
Publié: (2026)
par: Yan, Bingyu, et autres
Publié: (2026)
Bellman Error Centering
par: Chen, Xingguo, et autres
Publié: (2025)
par: Chen, Xingguo, et autres
Publié: (2025)
PFGuard: A Generative Framework with Privacy and Fairness Safeguards
par: Kim, Soyeon, et autres
Publié: (2024)
par: Kim, Soyeon, et autres
Publié: (2024)
Multi-Agent Decision Transformers for Dynamic Dispatching in Material Handling Systems Leveraging Enterprise Big Data
par: Lee, Xian Yeow, et autres
Publié: (2024)
par: Lee, Xian Yeow, et autres
Publié: (2024)
Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation
par: Halawi, Danny, et autres
Publié: (2024)
par: Halawi, Danny, et autres
Publié: (2024)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
par: Rezaei, Mohammad, et autres
Publié: (2026)
par: Rezaei, Mohammad, et autres
Publié: (2026)
Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning
par: Yang, Zhicheng, et autres
Publié: (2026)
par: Yang, Zhicheng, et autres
Publié: (2026)
FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
par: Li, Qizheng, et autres
Publié: (2026)
par: Li, Qizheng, et autres
Publié: (2026)
Step-by-Step Causality: Transparent Causal Discovery with Multi-Agent Tree-Query and Adversarial Confidence Estimation
par: Ding, Ziyi, et autres
Publié: (2026)
par: Ding, Ziyi, et autres
Publié: (2026)
Agent-Omit: Adaptive Context Omission for Efficient LLM Agents
par: Ning, Yansong, et autres
Publié: (2026)
par: Ning, Yansong, et autres
Publié: (2026)
GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents
par: Wu, Xiongbin, et autres
Publié: (2026)
par: Wu, Xiongbin, et autres
Publié: (2026)
Think like a Scientist: Physics-guided LLM Agent for Equation Discovery
par: Yang, Jianke, et autres
Publié: (2026)
par: Yang, Jianke, et autres
Publié: (2026)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
par: Liu, Yixin, et autres
Publié: (2025)
par: Liu, Yixin, et autres
Publié: (2025)
Agentic Unlearning: When LLM Agent Meets Machine Unlearning
par: Wang, Bin, et autres
Publié: (2026)
par: Wang, Bin, et autres
Publié: (2026)
Reinforcement Learning With Sparse-Executing Actions via Sparsity Regularization
par: Pang, Jing-Cheng, et autres
Publié: (2021)
par: Pang, Jing-Cheng, et autres
Publié: (2021)
Documents similaires
-
Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
par: Zhen, Shuai, et autres
Publié: (2026) -
HashAttention: Semantic Sparsity for Faster Inference
par: Desai, Aditya, et autres
Publié: (2024) -
Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment
par: Wang, Haozhong, et autres
Publié: (2026) -
CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation
par: Feng, Yushi, et autres
Publié: (2026) -
Learnware of Language Models: Specialized Small Language Models Can Do Big
par: Tan, Zhi-Hao, et autres
Publié: (2025)