Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Shukla, Manish |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Layered Chain-of-Thought Prompting for Multi-Agent LLM Systems: A Comprehensive Approach to Explainable Large Language Models
par: Sanwal, Manish
Publié: (2025)
par: Sanwal, Manish
Publié: (2025)
ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems
par: Zhang, Yifei, et autres
Publié: (2026)
par: Zhang, Yifei, et autres
Publié: (2026)
Responsible Agentic AI Requires Explicit Provenance
par: Hu, Jinwei, et autres
Publié: (2026)
par: Hu, Jinwei, et autres
Publié: (2026)
Toward the Autonomous AI Doctor: Quantitative Benchmarking of an Autonomous Agentic AI Versus Board-Certified Clinicians in a Real World Setting
par: Hayat, Hashim, et autres
Publié: (2025)
par: Hayat, Hashim, et autres
Publié: (2025)
Hallucination Mitigation using Agentic AI Natural Language-Based Frameworks
par: Gosmar, Diego, et autres
Publié: (2025)
par: Gosmar, Diego, et autres
Publié: (2025)
A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems
par: Fang, Jinyuan, et autres
Publié: (2025)
par: Fang, Jinyuan, et autres
Publié: (2025)
CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution
par: Zehle, Tom
Publié: (2026)
par: Zehle, Tom
Publié: (2026)
System of Agentic AI for the Discovery of Metal-Organic Frameworks
par: Inizan, Theo Jaffrelot, et autres
Publié: (2025)
par: Inizan, Theo Jaffrelot, et autres
Publié: (2025)
Toward Real-World Chinese Psychological Support Dialogues: CPsDD Dataset and a Co-Evolving Multi-Agent System
par: Shi, Yuanchen, et autres
Publié: (2025)
par: Shi, Yuanchen, et autres
Publié: (2025)
Team of Thoughts: Efficient Test-time Scaling of Agentic Systems through Orchestrated Tool Calling
par: Wong, Jeffrey T. H., et autres
Publié: (2026)
par: Wong, Jeffrey T. H., et autres
Publié: (2026)
Unsupervised Cycle Detection in Agentic Applications
par: George, Felix, et autres
Publié: (2025)
par: George, Felix, et autres
Publié: (2025)
Adaptive Multi-Agent Response Refinement in Conversational Systems
par: Jeong, Soyeong, et autres
Publié: (2025)
par: Jeong, Soyeong, et autres
Publié: (2025)
Training-Free Agentic AI: Probabilistic Control and Coordination in Multi-Agent LLM Systems
par: Hosseini, Mohammad Parsa, et autres
Publié: (2026)
par: Hosseini, Mohammad Parsa, et autres
Publié: (2026)
PAARS: Persona Aligned Agentic Retail Shoppers
par: Mansour, Saab, et autres
Publié: (2025)
par: Mansour, Saab, et autres
Publié: (2025)
How Real Is AI Tutoring? Comparing Simulated and Human Dialogues in One-on-One Instruction
par: Li, Ruijia, et autres
Publié: (2025)
par: Li, Ruijia, et autres
Publié: (2025)
An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks
par: Stefan, Gabriel, et autres
Publié: (2026)
par: Stefan, Gabriel, et autres
Publié: (2026)
Unmasking Conversational Bias in AI Multiagent Systems
par: Coppolillo, Erica, et autres
Publié: (2025)
par: Coppolillo, Erica, et autres
Publié: (2025)
Agentic AI: The Era of Semantic Decoding
par: Peyrard, Maxime, et autres
Publié: (2024)
par: Peyrard, Maxime, et autres
Publié: (2024)
Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models
par: Mittal, Avni, et autres
Publié: (2026)
par: Mittal, Avni, et autres
Publié: (2026)
Advancing Agentic Systems: Dynamic Task Decomposition, Tool Integration and Evaluation using Novel Metrics and Dataset
par: Gabriel, Adrian Garret, et autres
Publié: (2024)
par: Gabriel, Adrian Garret, et autres
Publié: (2024)
Agentic AI for Human Resources: LLM-Driven Candidate Assessment
par: Yuksel, Kamer Ali, et autres
Publié: (2026)
par: Yuksel, Kamer Ali, et autres
Publié: (2026)
AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering
par: Wang, Ziqing, et autres
Publié: (2025)
par: Wang, Ziqing, et autres
Publié: (2025)
DeepResearch$^{\text{Eco}}$: A Recursive Agentic Workflow for Complex Scientific Question Answering in Ecology
par: D'Souza, Jennifer, et autres
Publié: (2025)
par: D'Souza, Jennifer, et autres
Publié: (2025)
Prompt Stability Matters: Evaluating and Optimizing Auto-Generated Prompt in General-Purpose Systems
par: Chen, Ke, et autres
Publié: (2025)
par: Chen, Ke, et autres
Publié: (2025)
MAPLE: A Sub-Agent Architecture for Memory, Learning, and Personalization in Agentic AI Systems
par: Piskala, Deepak Babu
Publié: (2026)
par: Piskala, Deepak Babu
Publié: (2026)
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
par: Li, Zhuofeng, et autres
Publié: (2025)
par: Li, Zhuofeng, et autres
Publié: (2025)
Cognitive Duality for Adaptive Web Agents
par: Liu, Jiarun, et autres
Publié: (2025)
par: Liu, Jiarun, et autres
Publié: (2025)
Adaptive Memory Admission Control for LLM Agents
par: Zhang, Guilin, et autres
Publié: (2026)
par: Zhang, Guilin, et autres
Publié: (2026)
AI-AI Esthetic Collaboration with Explicit Semiotic Awareness and Emergent Grammar Development
par: Moldovan, Nicanor I.
Publié: (2025)
par: Moldovan, Nicanor I.
Publié: (2025)
Towards a Science of Collective AI: LLM-based Multi-Agent Systems Need a Transition from Blind Trial-and-Error to Rigorous Science
par: Fan, Jingru, et autres
Publié: (2026)
par: Fan, Jingru, et autres
Publié: (2026)
Embodied Multi-Agent Coordination by Aligning World Models Through Dialogue
par: Dongre, Vardhan, et autres
Publié: (2026)
par: Dongre, Vardhan, et autres
Publié: (2026)
Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs
par: Mieczkowski, Elizabeth, et autres
Publié: (2026)
par: Mieczkowski, Elizabeth, et autres
Publié: (2026)
Every 28 Days the AI Dreams of Soft Skin and Burning Stars: Scaffolding AI Agents with Hormones and Emotions
par: Levinson, Leigh, et autres
Publié: (2025)
par: Levinson, Leigh, et autres
Publié: (2025)
WorldView-Bench: A Benchmark for Evaluating Global Cultural Perspectives in Large Language Models
par: Mushtaq, Abdullah, et autres
Publié: (2025)
par: Mushtaq, Abdullah, et autres
Publié: (2025)
AgentSwing: Adaptive Parallel Context Management Routing for Long-Horizon Web Agents
par: Feng, Zhaopeng, et autres
Publié: (2026)
par: Feng, Zhaopeng, et autres
Publié: (2026)
CACA Agent: Capability Collaboration based AI Agent
par: Xu, Peng, et autres
Publié: (2024)
par: Xu, Peng, et autres
Publié: (2024)
One Panel Does Not Fit All: Case-Adaptive Multi-Agent Deliberation for Clinical Prediction
par: Lu, Yuxing, et autres
Publié: (2026)
par: Lu, Yuxing, et autres
Publié: (2026)
Multi-Agent System for AI-Assisted Extraction of Narrative Arcs in TV Series
par: Balestri, Roberto, et autres
Publié: (2025)
par: Balestri, Roberto, et autres
Publié: (2025)
Don't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM Agents
par: Sethi, Khushal
Publié: (2026)
par: Sethi, Khushal
Publié: (2026)
Formal Policy Enforcement for Real-World Agentic Systems
par: Palumbo, Nils, et autres
Publié: (2026)
par: Palumbo, Nils, et autres
Publié: (2026)
Documents similaires
-
Layered Chain-of-Thought Prompting for Multi-Agent LLM Systems: A Comprehensive Approach to Explainable Large Language Models
par: Sanwal, Manish
Publié: (2025) -
ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems
par: Zhang, Yifei, et autres
Publié: (2026) -
Responsible Agentic AI Requires Explicit Provenance
par: Hu, Jinwei, et autres
Publié: (2026) -
Toward the Autonomous AI Doctor: Quantitative Benchmarking of an Autonomous Agentic AI Versus Board-Certified Clinicians in a Real World Setting
par: Hayat, Hashim, et autres
Publié: (2025) -
Hallucination Mitigation using Agentic AI Natural Language-Based Frameworks
par: Gosmar, Diego, et autres
Publié: (2025)