SAGE: A Service Agent Graph-guided Evaluation Benchmark
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Ling, Dai, Yuqin, Wang, Ziyin, Gao, Ning, Zhang, Wei, Wang, Chaozheng, Wang, Yujie, He, Wei, Wang, Jinpeng, Xiong, Deiyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue
di: Gao, Ning, et al.
Pubblicazione: (2026)
di: Gao, Ning, et al.
Pubblicazione: (2026)
Unlocking Proactivity in Task-Oriented Dialogue
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue
di: Dai, Yuqin, et al.
Pubblicazione: (2026)
di: Dai, Yuqin, et al.
Pubblicazione: (2026)
SAGE: Multi-Agent Self-Evolution for LLM Reasoning
di: Peng, Yulin, et al.
Pubblicazione: (2026)
di: Peng, Yulin, et al.
Pubblicazione: (2026)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
di: Li, Zongjie, et al.
Pubblicazione: (2026)
di: Li, Zongjie, et al.
Pubblicazione: (2026)
SAGE: A Self-Evolving Agentic Graph-Memory Engine for Structure-Aware Associative Memory
di: Wang, Juntong, et al.
Pubblicazione: (2026)
di: Wang, Juntong, et al.
Pubblicazione: (2026)
SAGE: Strategy-Adaptive Generation Engine for Query Rewriting
di: Wang, Teng, et al.
Pubblicazione: (2025)
di: Wang, Teng, et al.
Pubblicazione: (2025)
AutoAgent: Evolving Cognition and Elastic Memory Orchestration for Adaptive Agents
di: Wang, Xiaoxing, et al.
Pubblicazione: (2026)
di: Wang, Xiaoxing, et al.
Pubblicazione: (2026)
Structured Personality Control and Adaptation for LLM Agents
di: Wang, Jinpeng, et al.
Pubblicazione: (2026)
di: Wang, Jinpeng, et al.
Pubblicazione: (2026)
Split and Merge: Aligning Position Biases in LLM-based Evaluators
di: Li, Zongjie, et al.
Pubblicazione: (2023)
di: Li, Zongjie, et al.
Pubblicazione: (2023)
CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving
di: Zhang, Jianyi, et al.
Pubblicazione: (2025)
di: Zhang, Jianyi, et al.
Pubblicazione: (2025)
MEDMKG: Benchmarking Medical Knowledge Exploitation with Multimodal Knowledge Graph
di: Wang, Xiaochen, et al.
Pubblicazione: (2025)
di: Wang, Xiaochen, et al.
Pubblicazione: (2025)
Hierarchical Intent-guided Optimization with Pluggable LLM-Driven Semantics for Session-based Recommendation
di: Chen, Jinpeng, et al.
Pubblicazione: (2025)
di: Chen, Jinpeng, et al.
Pubblicazione: (2025)
SAGE: A Realistic Benchmark for Semantic Understanding
di: Goel, Samarth, et al.
Pubblicazione: (2025)
di: Goel, Samarth, et al.
Pubblicazione: (2025)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
UMoE: Unifying Attention and FFN with Shared Experts
di: Yang, Yuanhang, et al.
Pubblicazione: (2025)
di: Yang, Yuanhang, et al.
Pubblicazione: (2025)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation
di: Wang, Ning, et al.
Pubblicazione: (2025)
di: Wang, Ning, et al.
Pubblicazione: (2025)
NEWSAGENT: Benchmarking Multimodal Agents as Journalists with Real-World Newswriting Tasks
di: Chien, Yen-Che, et al.
Pubblicazione: (2025)
di: Chien, Yen-Che, et al.
Pubblicazione: (2025)
Towards Objectively Benchmarking Social Intelligence for Language Agents at Action Level
di: Wang, Chenxu, et al.
Pubblicazione: (2024)
di: Wang, Chenxu, et al.
Pubblicazione: (2024)
Safety Control of Service Robots with LLMs and Embodied Knowledge Graphs
di: Qi, Yong, et al.
Pubblicazione: (2024)
di: Qi, Yong, et al.
Pubblicazione: (2024)
Balanced Anomaly-guided Ego-graph Diffusion Model for Inductive Graph Anomaly Detection
di: Wei, Chunyu, et al.
Pubblicazione: (2026)
di: Wei, Chunyu, et al.
Pubblicazione: (2026)
SAGE: Scalable AI Governance & Evaluation
di: Le, Benjamin, et al.
Pubblicazione: (2026)
di: Le, Benjamin, et al.
Pubblicazione: (2026)
AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
di: Shi, Wentao, et al.
Pubblicazione: (2026)
di: Shi, Wentao, et al.
Pubblicazione: (2026)
InterDreamer: Zero-Shot Text to 3D Dynamic Human-Object Interaction
di: Xu, Sirui, et al.
Pubblicazione: (2024)
di: Xu, Sirui, et al.
Pubblicazione: (2024)
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
di: Wang, Shouju, et al.
Pubblicazione: (2026)
di: Wang, Shouju, et al.
Pubblicazione: (2026)
EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents
di: Liu, Yunqi, et al.
Pubblicazione: (2026)
di: Liu, Yunqi, et al.
Pubblicazione: (2026)
TestAgent: Automatic Benchmarking and Exploratory Interaction for Evaluating LLMs in Vertical Domains
di: Wang, Wanying, et al.
Pubblicazione: (2024)
di: Wang, Wanying, et al.
Pubblicazione: (2024)
Noise Distribution Decomposition based Multi-Agent Distributional Reinforcement Learning
di: Geng, Wei, et al.
Pubblicazione: (2023)
di: Geng, Wei, et al.
Pubblicazione: (2023)
Learning to Ask: When LLM Agents Meet Unclear Instruction
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation
di: Yuan, Ruifeng, et al.
Pubblicazione: (2026)
di: Yuan, Ruifeng, et al.
Pubblicazione: (2026)
LinkSAGE: Optimizing Job Matching Using Graph Neural Networks
di: Liu, Ping, et al.
Pubblicazione: (2024)
di: Liu, Ping, et al.
Pubblicazione: (2024)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
di: Xiong, Zixin, et al.
Pubblicazione: (2026)
di: Xiong, Zixin, et al.
Pubblicazione: (2026)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
di: Zhang, Qian, et al.
Pubblicazione: (2026)
di: Zhang, Qian, et al.
Pubblicazione: (2026)
AgentLAB: Benchmarking LLM Agents against Long-Horizon Attacks
di: Jiang, Tanqiu, et al.
Pubblicazione: (2026)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2026)
MELA: Multilingual Evaluation of Linguistic Acceptability
di: Zhang, Ziyin, et al.
Pubblicazione: (2023)
di: Zhang, Ziyin, et al.
Pubblicazione: (2023)
Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions
di: Xu, Yue, et al.
Pubblicazione: (2026)
di: Xu, Yue, et al.
Pubblicazione: (2026)
TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents
di: Chen, Weiyi, et al.
Pubblicazione: (2026)
di: Chen, Weiyi, et al.
Pubblicazione: (2026)
GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding
di: Zhang, Ziyin, et al.
Pubblicazione: (2024)
di: Zhang, Ziyin, et al.
Pubblicazione: (2024)
BIS: NL2SQL Service Evaluation Benchmark for Business Intelligence Scenarios
di: Caglayan, Bora, et al.
Pubblicazione: (2024)
di: Caglayan, Bora, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue
di: Gao, Ning, et al.
Pubblicazione: (2026) -
Unlocking Proactivity in Task-Oriented Dialogue
di: Zhang, Hongbin, et al.
Pubblicazione: (2026) -
SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue
di: Dai, Yuqin, et al.
Pubblicazione: (2026) -
SAGE: Multi-Agent Self-Evolution for LLM Reasoning
di: Peng, Yulin, et al.
Pubblicazione: (2026) -
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
di: Li, Zongjie, et al.
Pubblicazione: (2026)