AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Ruipeng, Chen, Yuxin, Wang, Yukai, Wu, Chang, Fang, Junfeng, Cai, Xiaodong, Gu, Qi, Su, Hui, Zhang, An, Wang, Xiang, Cai, Xunliang, Chua, Tat-Seng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
We Should Identify and Mitigate Third-Party Safety Risks in MCP-Powered Agent Systems
von: Fang, Junfeng, et al.
Veröffentlicht: (2025)
von: Fang, Junfeng, et al.
Veröffentlicht: (2025)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
von: Fang, Junfeng, et al.
Veröffentlicht: (2025)
von: Fang, Junfeng, et al.
Veröffentlicht: (2025)
On Generative Agents in Recommendation
von: Zhang, An, et al.
Veröffentlicht: (2023)
von: Zhang, An, et al.
Veröffentlicht: (2023)
AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
von: Shi, Wentao, et al.
Veröffentlicht: (2026)
von: Shi, Wentao, et al.
Veröffentlicht: (2026)
DRAFT: Task Decoupled Latent Reasoning for Agent Safety
von: Wang, Lin, et al.
Veröffentlicht: (2026)
von: Wang, Lin, et al.
Veröffentlicht: (2026)
Learning to Self-Verify Makes Language Models Better Reasoners
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
von: He, Wei, et al.
Veröffentlicht: (2025)
von: He, Wei, et al.
Veröffentlicht: (2025)
TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training
von: Yang, Jinluan, et al.
Veröffentlicht: (2026)
von: Yang, Jinluan, et al.
Veröffentlicht: (2026)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
von: Guo, Zhengkang, et al.
Veröffentlicht: (2026)
von: Guo, Zhengkang, et al.
Veröffentlicht: (2026)
Large Language Models Empowered Personalized Web Agents
von: Cai, Hongru, et al.
Veröffentlicht: (2024)
von: Cai, Hongru, et al.
Veröffentlicht: (2024)
Hello Again! LLM-powered Personalized Agent for Long-term Dialogue
von: Li, Hao, et al.
Veröffentlicht: (2024)
von: Li, Hao, et al.
Veröffentlicht: (2024)
Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
von: Zhang, An, et al.
Veröffentlicht: (2024)
von: Zhang, An, et al.
Veröffentlicht: (2024)
ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation
von: Zheng, Jingnan, et al.
Veröffentlicht: (2024)
von: Zheng, Jingnan, et al.
Veröffentlicht: (2024)
Look Before You Leap: Autonomous Exploration for LLM Agents
von: Ye, Ziang, et al.
Veröffentlicht: (2026)
von: Ye, Ziang, et al.
Veröffentlicht: (2026)
Towards Human-centered Proactive Conversational Agents
von: Deng, Yang, et al.
Veröffentlicht: (2024)
von: Deng, Yang, et al.
Veröffentlicht: (2024)
An Executable Benchmarking Suite for Tool-Using Agents
von: Zhong, Zhiqing, et al.
Veröffentlicht: (2026)
von: Zhong, Zhiqing, et al.
Veröffentlicht: (2026)
Language Representations Can be What Recommenders Need: Findings and Potentials
von: Sheng, Leheng, et al.
Veröffentlicht: (2024)
von: Sheng, Leheng, et al.
Veröffentlicht: (2024)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024)
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024)
EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents
von: Liu, Yunqi, et al.
Veröffentlicht: (2026)
von: Liu, Yunqi, et al.
Veröffentlicht: (2026)
Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
von: Shi, Yaorui, et al.
Veröffentlicht: (2026)
von: Shi, Yaorui, et al.
Veröffentlicht: (2026)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
von: Jin, Zhe, et al.
Veröffentlicht: (2025)
von: Jin, Zhe, et al.
Veröffentlicht: (2025)
NextMem: Towards Latent Factual Memory for LLM-based Agents
von: Zhang, Zeyu, et al.
Veröffentlicht: (2026)
von: Zhang, Zeyu, et al.
Veröffentlicht: (2026)
Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment
von: Zheng, Jingnan, et al.
Veröffentlicht: (2026)
von: Zheng, Jingnan, et al.
Veröffentlicht: (2026)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
von: Chu, Meng, et al.
Veröffentlicht: (2023)
von: Chu, Meng, et al.
Veröffentlicht: (2023)
GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis
von: Yu, Bo, et al.
Veröffentlicht: (2026)
von: Yu, Bo, et al.
Veröffentlicht: (2026)
Ask-before-Plan: Proactive Language Agents for Real-World Planning
von: Zhang, Xuan, et al.
Veröffentlicht: (2024)
von: Zhang, Xuan, et al.
Veröffentlicht: (2024)
SCTc-TE: A Comprehensive Formulation and Benchmark for Temporal Event Forecasting
von: Ma, Yunshan, et al.
Veröffentlicht: (2023)
von: Ma, Yunshan, et al.
Veröffentlicht: (2023)
Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
von: Shi, Yaorui, et al.
Veröffentlicht: (2025)
von: Shi, Yaorui, et al.
Veröffentlicht: (2025)
Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
von: Deng, Yang, et al.
Veröffentlicht: (2023)
von: Deng, Yang, et al.
Veröffentlicht: (2023)
DataSciBench: An LLM Agent Benchmark for Data Science
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
von: Zhong, Yangyang, et al.
Veröffentlicht: (2025)
von: Zhong, Yangyang, et al.
Veröffentlicht: (2025)
AgentRefine: Enhancing Agent Generalization through Refinement Tuning
von: Fu, Dayuan, et al.
Veröffentlicht: (2025)
von: Fu, Dayuan, et al.
Veröffentlicht: (2025)
Prospect Personalized Recommendation on Large Language Model-based Agent Platform
von: Zhang, Jizhi, et al.
Veröffentlicht: (2024)
von: Zhang, Jizhi, et al.
Veröffentlicht: (2024)
Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models
von: Shi, Enyi, et al.
Veröffentlicht: (2026)
von: Shi, Enyi, et al.
Veröffentlicht: (2026)
On the Multi-turn Instruction Following for Conversational Web Agents
von: Deng, Yang, et al.
Veröffentlicht: (2024)
von: Deng, Yang, et al.
Veröffentlicht: (2024)
Bridging Jensen Gap for Max-Min Group Fairness Optimization in Recommendation
von: Xu, Chen, et al.
Veröffentlicht: (2025)
von: Xu, Chen, et al.
Veröffentlicht: (2025)
A Study of Implicit Ranking Unfairness in Large Language Models
von: Xu, Chen, et al.
Veröffentlicht: (2023)
von: Xu, Chen, et al.
Veröffentlicht: (2023)
Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation
von: Jin, Kaiming, et al.
Veröffentlicht: (2026)
von: Jin, Kaiming, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments
von: Chen, Yuxin, et al.
Veröffentlicht: (2026) -
We Should Identify and Mitigate Third-Party Safety Risks in MCP-Powered Agent Systems
von: Fang, Junfeng, et al.
Veröffentlicht: (2025) -
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
von: Fang, Junfeng, et al.
Veröffentlicht: (2025) -
On Generative Agents in Recommendation
von: Zhang, An, et al.
Veröffentlicht: (2023) -
AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
von: Shi, Wentao, et al.
Veröffentlicht: (2026)