Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems
Fuente:
arXiv
Salvato in:
| Autore principale: | Mehta, Sushant |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems
di: Mehta, Sushant
Pubblicazione: (2026)
di: Mehta, Sushant
Pubblicazione: (2026)
Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models
di: Mehta, Sushant
Pubblicazione: (2025)
di: Mehta, Sushant
Pubblicazione: (2025)
When Are Learning Biases Equivalent? A Unifying Framework for Fairness, Robustness, and Distribution Shift
di: Mehta, Sushant
Pubblicazione: (2025)
di: Mehta, Sushant
Pubblicazione: (2025)
MATRAG: Multi-Agent Transparent Retrieval-Augmented Generation for Explainable Recommendations
di: Mehta, Sushant
Pubblicazione: (2026)
di: Mehta, Sushant
Pubblicazione: (2026)
The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments
di: Ritchie, Logan, et al.
Pubblicazione: (2026)
di: Ritchie, Logan, et al.
Pubblicazione: (2026)
Scaling Laws and In-Context Learning: A Unified Theoretical Framework
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
Beyond Task Completion: An Assessment Framework for Evaluating Agentic AI Systems
di: Akshathala, Sreemaee, et al.
Pubblicazione: (2025)
di: Akshathala, Sreemaee, et al.
Pubblicazione: (2025)
ADR: An Agentic Detection System for Enterprise Agentic AI Security
di: Li, Chenning, et al.
Pubblicazione: (2026)
di: Li, Chenning, et al.
Pubblicazione: (2026)
Beyond Text-to-SQL: An Agentic LLM System for Governed Enterprise Analytics APIs
di: Singh, Gundeep, et al.
Pubblicazione: (2026)
di: Singh, Gundeep, et al.
Pubblicazione: (2026)
EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments
di: Mehta, Sushant, et al.
Pubblicazione: (2026)
di: Mehta, Sushant, et al.
Pubblicazione: (2026)
Memoria: A Scalable Agentic Memory Framework for Personalized Conversational AI
di: Sarin, Samarth, et al.
Pubblicazione: (2025)
di: Sarin, Samarth, et al.
Pubblicazione: (2025)
Unifying Mixture of Experts and Multi-Head Latent Attention for Efficient Language Models
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
VIGIL: Towards Edge-Extended Agentic AI for Enterprise IT Support
di: Ahuja, Sarthak, et al.
Pubblicazione: (2026)
di: Ahuja, Sarthak, et al.
Pubblicazione: (2026)
Beyond Accuracy: A Decision-Theoretic Framework for Allocation-Aware Healthcare AI
di: Ferzana, Rifa
Pubblicazione: (2026)
di: Ferzana, Rifa
Pubblicazione: (2026)
Agentic AI-Driven Technical Troubleshooting for Enterprise Systems: A Novel Weighted Retrieval-Augmented Generation Paradigm
di: Khanda, Rajat
Pubblicazione: (2024)
di: Khanda, Rajat
Pubblicazione: (2024)
Agentic Enterprise: AI-Centric User to User-Centric AI
di: Narechania, Arpit, et al.
Pubblicazione: (2025)
di: Narechania, Arpit, et al.
Pubblicazione: (2025)
Latent Multi-Head Attention for Small Language Models
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
Beyond Accuracy: Evaluating Forecasting Models by Multi-Echelon Inventory Cost
di: Marik, Swata, et al.
Pubblicazione: (2026)
di: Marik, Swata, et al.
Pubblicazione: (2026)
EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings
di: Malay, Shiva Krishna Reddy, et al.
Pubblicazione: (2026)
di: Malay, Shiva Krishna Reddy, et al.
Pubblicazione: (2026)
Creative Adversarial Testing (CAT): A Novel Framework for Evaluating Goal-Oriented Agentic AI Systems
di: Dhrif, Hassen
Pubblicazione: (2025)
di: Dhrif, Hassen
Pubblicazione: (2025)
Beyond SMILES: Evaluating Agentic Systems for Drug Discovery
di: Wijaya, Edward
Pubblicazione: (2026)
di: Wijaya, Edward
Pubblicazione: (2026)
Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier
di: Henry, Jazmia
Pubblicazione: (2026)
di: Henry, Jazmia
Pubblicazione: (2026)
An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc
di: Zhang, Hong, et al.
Pubblicazione: (2026)
di: Zhang, Hong, et al.
Pubblicazione: (2026)
Riemann-Bench: A Benchmark for Moonshot Mathematics
di: Garre, Suhaas, et al.
Pubblicazione: (2026)
di: Garre, Suhaas, et al.
Pubblicazione: (2026)
Compliance Brain Assistant: Conversational Agentic AI for Assisting Compliance Tasks in Enterprise Environments
di: Zhu, Shitong, et al.
Pubblicazione: (2025)
di: Zhu, Shitong, et al.
Pubblicazione: (2025)
Hypergraph Enterprise Agentic Reasoner over Heterogeneous Business Systems
di: Wang, Ling, et al.
Pubblicazione: (2026)
di: Wang, Ling, et al.
Pubblicazione: (2026)
AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases
di: Suresh, Susheel, et al.
Pubblicazione: (2026)
di: Suresh, Susheel, et al.
Pubblicazione: (2026)
The Auton Agentic AI Framework
di: Cao, Sheng, et al.
Pubblicazione: (2026)
di: Cao, Sheng, et al.
Pubblicazione: (2026)
Beyond Autonomy: A Dynamic Tiered AgentRunner Framework for Governable and Resilient Enterprise AI Execution
di: Pan, Kai, et al.
Pubblicazione: (2026)
di: Pan, Kai, et al.
Pubblicazione: (2026)
Context Kubernetes: Declarative Orchestration of Enterprise Knowledge for Agentic AI Systems
di: Mouzouni, Charafeddine
Pubblicazione: (2026)
di: Mouzouni, Charafeddine
Pubblicazione: (2026)
Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search
di: Chen, Yiqun, et al.
Pubblicazione: (2026)
di: Chen, Yiqun, et al.
Pubblicazione: (2026)
REGAL: A Registry-Driven Architecture for Deterministic Grounding of Agentic AI in Enterprise Telemetry
di: Agrawal, Yuvraj
Pubblicazione: (2026)
di: Agrawal, Yuvraj
Pubblicazione: (2026)
Zero Data Retention in LLM-based Enterprise AI Assistants: A Comparative Study of Market Leading Agentic AI Products
di: Gupta, Komal, et al.
Pubblicazione: (2025)
di: Gupta, Komal, et al.
Pubblicazione: (2025)
Small Language Models for Agentic Systems: A Survey of Architectures, Capabilities, and Deployment Trade offs
di: Sharma, Raghav, et al.
Pubblicazione: (2025)
di: Sharma, Raghav, et al.
Pubblicazione: (2025)
A Blueprint Architecture of Compound AI Systems for Enterprise
di: Kandogan, Eser, et al.
Pubblicazione: (2024)
di: Kandogan, Eser, et al.
Pubblicazione: (2024)
Structured Context Engineering for File-Native Agentic Systems: Evaluating Schema Accuracy, Format Effectiveness, and Multi-File Navigation at Scale
di: McMillan, Damon
Pubblicazione: (2026)
di: McMillan, Damon
Pubblicazione: (2026)
Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework
di: Pandey, Mukund
Pubblicazione: (2026)
di: Pandey, Mukund
Pubblicazione: (2026)
Fairness in Agentic AI: A Unified Framework for Ethical and Equitable Multi-Agent System
di: Ranjan, Rajesh, et al.
Pubblicazione: (2025)
di: Ranjan, Rajesh, et al.
Pubblicazione: (2025)
AEMA: Verifiable Evaluation Framework for Trustworthy and Controlled Agentic LLM Systems
di: Lee, YenTing, et al.
Pubblicazione: (2026)
di: Lee, YenTing, et al.
Pubblicazione: (2026)
Multi-level Value Alignment in Agentic AI Systems: Survey and Perspectives
di: Zeng, Wei, et al.
Pubblicazione: (2025)
di: Zeng, Wei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems
di: Mehta, Sushant
Pubblicazione: (2026) -
Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models
di: Mehta, Sushant
Pubblicazione: (2025) -
When Are Learning Biases Equivalent? A Unifying Framework for Fairness, Robustness, and Distribution Shift
di: Mehta, Sushant
Pubblicazione: (2025) -
MATRAG: Multi-Agent Transparent Retrieval-Augmented Generation for Explainable Recommendations
di: Mehta, Sushant
Pubblicazione: (2026) -
The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments
di: Ritchie, Logan, et al.
Pubblicazione: (2026)