Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Pandey, Mukund |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluation Framework for AI Systems in "the Wild"
par: Jabbour, Sarah, et autres
Publié: (2025)
par: Jabbour, Sarah, et autres
Publié: (2025)
Auto-Eval Judge: Towards a General Agentic Framework for Task Completion Evaluation
par: Bhonsle, Roshita, et autres
Publié: (2025)
par: Bhonsle, Roshita, et autres
Publié: (2025)
From Failure Modes to Reliability Awareness in Generative and Agentic AI System
par: Janet, et autres
Publié: (2025)
par: Janet, et autres
Publié: (2025)
An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc
par: Zhang, Hong, et autres
Publié: (2026)
par: Zhang, Hong, et autres
Publié: (2026)
Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems
par: Mehta, Sushant
Publié: (2025)
par: Mehta, Sushant
Publié: (2025)
Detecting Silent Failures in Multi-Agentic AI Trajectories
par: Pathak, Divya, et autres
Publié: (2025)
par: Pathak, Divya, et autres
Publié: (2025)
A Unified Framework for the Evaluation of LLM Agentic Capabilities
par: Zhu, Pengyu, et autres
Publié: (2026)
par: Zhu, Pengyu, et autres
Publié: (2026)
Holistic Evaluation and Failure Diagnosis of AI Agents
par: Madvil, Netta, et autres
Publié: (2026)
par: Madvil, Netta, et autres
Publié: (2026)
Beyond Task Completion: An Assessment Framework for Evaluating Agentic AI Systems
par: Akshathala, Sreemaee, et autres
Publié: (2025)
par: Akshathala, Sreemaee, et autres
Publié: (2025)
Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges
par: Chhabra, Anshuman, et autres
Publié: (2025)
par: Chhabra, Anshuman, et autres
Publié: (2025)
LightAgent: Production-level Open-source Agentic AI Framework
par: Cai, Weige, et autres
Publié: (2025)
par: Cai, Weige, et autres
Publié: (2025)
Creative Adversarial Testing (CAT): A Novel Framework for Evaluating Goal-Oriented Agentic AI Systems
par: Dhrif, Hassen
Publié: (2025)
par: Dhrif, Hassen
Publié: (2025)
RAIL in the Wild: Operationalizing Responsible AI Evaluation Using Anthropic's Value Dataset
par: Verma, Sumit, et autres
Publié: (2025)
par: Verma, Sumit, et autres
Publié: (2025)
The Auton Agentic AI Framework
par: Cao, Sheng, et autres
Publié: (2026)
par: Cao, Sheng, et autres
Publié: (2026)
DAO-AI: Evaluating Collective Decision-Making through Agentic AI in Decentralized Governance
par: Capponi, Agostino, et autres
Publié: (2025)
par: Capponi, Agostino, et autres
Publié: (2025)
Agentic Design Patterns: A System-Theoretic Framework
par: Dao, Minh-Dung, et autres
Publié: (2026)
par: Dao, Minh-Dung, et autres
Publié: (2026)
Zero-Direction Probing: A Linear-Algebraic Framework for Deep Analysis of Large-Language-Model Drift
par: Pandey, Amit
Publié: (2025)
par: Pandey, Amit
Publié: (2025)
AEMA: Verifiable Evaluation Framework for Trustworthy and Controlled Agentic LLM Systems
par: Lee, YenTing, et autres
Publié: (2026)
par: Lee, YenTing, et autres
Publié: (2026)
Library Drift: Diagnosing and Fixing a Silent Failure Mode in Self-Evolving LLM Skill Libraries
par: Zhang, Xing, et autres
Publié: (2026)
par: Zhang, Xing, et autres
Publié: (2026)
AgentCompass: Towards Reliable Evaluation of Agentic Workflows in Production
par: Kartik, NVJK, et autres
Publié: (2025)
par: Kartik, NVJK, et autres
Publié: (2025)
WildSpoof Challenge Evaluation Plan
par: Wu, Yihan, et autres
Publié: (2025)
par: Wu, Yihan, et autres
Publié: (2025)
Reproducible, Explainable, and Effective Evaluations of Agentic AI for Software Engineering
par: Li, Jingyue, et autres
Publié: (2026)
par: Li, Jingyue, et autres
Publié: (2026)
Proper Scoring Rules for Agentic Uncertainty Quantification
par: Raghu, Suresh, et autres
Publié: (2026)
par: Raghu, Suresh, et autres
Publié: (2026)
Performant LLM Agentic Framework for Conversational AI
par: Casella, Alex, et autres
Publié: (2025)
par: Casella, Alex, et autres
Publié: (2025)
Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier
par: Henry, Jazmia
Publié: (2026)
par: Henry, Jazmia
Publié: (2026)
A Conceptual Framework for AI Capability Evaluations
par: Carro, María Victoria, et autres
Publié: (2025)
par: Carro, María Victoria, et autres
Publié: (2025)
Control Plane as a Tool: A Scalable Design Pattern for Agentic AI Systems
par: Kandasamy, Sivasathivel
Publié: (2025)
par: Kandasamy, Sivasathivel
Publié: (2025)
Failure Modes in LLM Systems: A System-Level Taxonomy for Reliable AI Applications
par: Vinay, Vaishali
Publié: (2025)
par: Vinay, Vaishali
Publié: (2025)
GuidelineGuard: An Agentic Framework for Medical Note Evaluation with Guideline Adherence
par: Shahriyear, MD Ragib
Publié: (2024)
par: Shahriyear, MD Ragib
Publié: (2024)
Ethical AI: Towards Defining a Collective Evaluation Framework
par: Sharma, Aasish Kumar, et autres
Publié: (2025)
par: Sharma, Aasish Kumar, et autres
Publié: (2025)
DREAM: Deep Research Evaluation with Agentic Metrics
par: Avraham, Elad Ben, et autres
Publié: (2026)
par: Avraham, Elad Ben, et autres
Publié: (2026)
Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems
par: Shukla, Manish
Publié: (2025)
par: Shukla, Manish
Publié: (2025)
Inherited Goal Drift: Contextual Pressure Can Undermine Agentic Goals
par: Menon, Achyutha, et autres
Publié: (2026)
par: Menon, Achyutha, et autres
Publié: (2026)
Agentic AI Frameworks: Architectures, Protocols, and Design Challenges
par: Derouiche, Hana, et autres
Publié: (2025)
par: Derouiche, Hana, et autres
Publié: (2025)
Digital Twin and Agentic AI for Wild Fire Disaster Management: Intelligent Virtual Situation Room
par: Morsali, Mohammad, et autres
Publié: (2026)
par: Morsali, Mohammad, et autres
Publié: (2026)
AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
Agentic Architect: An Agentic AI Framework for Architecture Design Exploration and Optimization
par: Blasberg, Alexander, et autres
Publié: (2026)
par: Blasberg, Alexander, et autres
Publié: (2026)
Results-Actionability Gap: Understanding How Practitioners Evaluate LLM Products in the Wild
par: van der Maden, Willem, et autres
Publié: (2026)
par: van der Maden, Willem, et autres
Publié: (2026)
Agentic Systems in Radiology: Design, Applications, Evaluation, and Challenges
par: Bluethgen, Christian, et autres
Publié: (2025)
par: Bluethgen, Christian, et autres
Publié: (2025)
Stochasticity in Agentic Evaluations: Quantifying Inconsistency with Intraclass Correlation
par: Mustahsan, Zairah, et autres
Publié: (2025)
par: Mustahsan, Zairah, et autres
Publié: (2025)
Documents similaires
-
Evaluation Framework for AI Systems in "the Wild"
par: Jabbour, Sarah, et autres
Publié: (2025) -
Auto-Eval Judge: Towards a General Agentic Framework for Task Completion Evaluation
par: Bhonsle, Roshita, et autres
Publié: (2025) -
From Failure Modes to Reliability Awareness in Generative and Agentic AI System
par: Janet, et autres
Publié: (2025) -
An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc
par: Zhang, Hong, et autres
Publié: (2026) -
Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems
par: Mehta, Sushant
Publié: (2025)