KGCE: Knowledge-Augmented Dual-Graph Evaluator for Cross-Platform Educational Agent Benchmarking with Multimodal Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Zixian, Liu, Sihao, Zhao, Yuqi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents
par: Xu, Tianqi, et autres
Publié: (2024)
par: Xu, Tianqi, et autres
Publié: (2024)
EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents
par: Liu, Yunqi, et autres
Publié: (2026)
par: Liu, Yunqi, et autres
Publié: (2026)
SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation
par: Zhao, Jiahao, et autres
Publié: (2026)
par: Zhao, Jiahao, et autres
Publié: (2026)
PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
par: Hu, Sihao, et autres
Publié: (2024)
par: Hu, Sihao, et autres
Publié: (2024)
Graph-Augmented Large Language Model Agents: Current Progress and Future Prospects
par: Liu, Yixin, et autres
Publié: (2025)
par: Liu, Yixin, et autres
Publié: (2025)
MEDMKG: Benchmarking Medical Knowledge Exploitation with Multimodal Knowledge Graph
par: Wang, Xiaochen, et autres
Publié: (2025)
par: Wang, Xiaochen, et autres
Publié: (2025)
Knowledge Graph Augmented Large Language Models for Disease Prediction
par: Wang, Ruiyu, et autres
Publié: (2025)
par: Wang, Ruiyu, et autres
Publié: (2025)
Annotation Guidelines-Based Knowledge Augmentation: Towards Enhancing Large Language Models for Educational Text Classification
par: Liu, Shiqi, et autres
Publié: (2024)
par: Liu, Shiqi, et autres
Publié: (2024)
UrbanKGent: A Unified Large Language Model Agent Framework for Urban Knowledge Graph Construction
par: Ning, Yansong, et autres
Publié: (2024)
par: Ning, Yansong, et autres
Publié: (2024)
Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models
par: Jia, Yifan, et autres
Publié: (2025)
par: Jia, Yifan, et autres
Publié: (2025)
A Survey on Large Language Model-Based Game Agents
par: Hu, Sihao, et autres
Publié: (2024)
par: Hu, Sihao, et autres
Publié: (2024)
Automated Construction of Medical Indicator Knowledge Graphs Using Retrieval Augmented Large Language Models
par: Wang, Zhengda, et autres
Publié: (2025)
par: Wang, Zhengda, et autres
Publié: (2025)
Cross-Modal Attention Network with Dual Graph Learning in Multimodal Recommendation
par: Dai, Ji, et autres
Publié: (2026)
par: Dai, Ji, et autres
Publié: (2026)
KGPA: Robustness Evaluation for Large Language Models via Cross-Domain Knowledge Graphs
par: Pei, Aihua, et autres
Publié: (2024)
par: Pei, Aihua, et autres
Publié: (2024)
Enhancing Large Language Models (LLMs) for Telecom using Dynamic Knowledge Graphs and Explainable Retrieval-Augmented Generation
par: Yuan, Dun, et autres
Publié: (2026)
par: Yuan, Dun, et autres
Publié: (2026)
MindBridge: Scalable and Cross-Model Knowledge Editing via Memory-Augmented Modality
par: Li, Shuaike, et autres
Publié: (2025)
par: Li, Shuaike, et autres
Publié: (2025)
Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models
par: Zhang, Yang, et autres
Publié: (2026)
par: Zhang, Yang, et autres
Publié: (2026)
Learning to Plan for Retrieval-Augmented Large Language Models from Knowledge Graphs
par: Wang, Junjie, et autres
Publié: (2024)
par: Wang, Junjie, et autres
Publié: (2024)
ElecBench: a Power Dispatch Evaluation Benchmark for Large Language Models
par: Zhou, Xiyuan, et autres
Publié: (2024)
par: Zhou, Xiyuan, et autres
Publié: (2024)
DCGL: Dual-Channel Graph Learning with Large Language Models for Knowledge-Aware Recommendation
par: Zou, Xinchi, et autres
Publié: (2026)
par: Zou, Xinchi, et autres
Publié: (2026)
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
par: Wang, Shouju, et autres
Publié: (2026)
par: Wang, Shouju, et autres
Publié: (2026)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
par: Li, Jingyao, et autres
Publié: (2025)
par: Li, Jingyao, et autres
Publié: (2025)
TeachAnything: A Multimodal Crowdsourcing Platform for Training Embodied AI Agents in Symmetrical Reality
par: Liu, Zidong, et autres
Publié: (2026)
par: Liu, Zidong, et autres
Publié: (2026)
Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs
par: Chen, Yurun, et autres
Publié: (2025)
par: Chen, Yurun, et autres
Publié: (2025)
Retrieval-Augmented Language Model for Extreme Multi-Label Knowledge Graph Link Prediction
par: Lin, Yu-Hsiang, et autres
Publié: (2024)
par: Lin, Yu-Hsiang, et autres
Publié: (2024)
Evaluating Tool-Augmented Agents in Remote Sensing Platforms
par: Singh, Simranjit, et autres
Publié: (2024)
par: Singh, Simranjit, et autres
Publié: (2024)
Assessing the Code Clone Detection Capability of Large Language Models
par: Zhang, Zixian, et autres
Publié: (2024)
par: Zhang, Zixian, et autres
Publié: (2024)
Rethinking and Benchmarking Large Language Models for Graph Reasoning
par: Hu, Yuwei, et autres
Publié: (2025)
par: Hu, Yuwei, et autres
Publié: (2025)
MediaClaw: Multimodal Intelligent-Agent Platform Technical Report
par: Zhao, Shaoan, et autres
Publié: (2026)
par: Zhao, Shaoan, et autres
Publié: (2026)
Evaluating Knowledge Graph Based Retrieval Augmented Generation Methods under Knowledge Incompleteness
par: Zhou, Dongzhuoran, et autres
Publié: (2025)
par: Zhou, Dongzhuoran, et autres
Publié: (2025)
Integrating Object Detection Modality into Visual Language Model for Enhanced Autonomous Driving Agent
par: He, Linfeng, et autres
Publié: (2024)
par: He, Linfeng, et autres
Publié: (2024)
USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models
par: Zheng, Baolin, et autres
Publié: (2025)
par: Zheng, Baolin, et autres
Publié: (2025)
RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents
par: Yang, Jingyi, et autres
Publié: (2025)
par: Yang, Jingyi, et autres
Publié: (2025)
MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents
par: Zhao, Pengxiang, et autres
Publié: (2025)
par: Zhao, Pengxiang, et autres
Publié: (2025)
Knowledge Graph Enhanced Language Agents for Recommendation
par: Guo, Taicheng, et autres
Publié: (2024)
par: Guo, Taicheng, et autres
Publié: (2024)
ELMM: Efficient Lightweight Multimodal Large Language Models for Multimodal Knowledge Graph Completion
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis
par: Yu, Bo, et autres
Publié: (2026)
par: Yu, Bo, et autres
Publié: (2026)
Knowledge Graph-Guided Retrieval Augmented Generation
par: Zhu, Xiangrong, et autres
Publié: (2025)
par: Zhu, Xiangrong, et autres
Publié: (2025)
Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation
par: Liu, Ming, et autres
Publié: (2025)
par: Liu, Ming, et autres
Publié: (2025)
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
par: Jia, Boyu, et autres
Publié: (2025)
par: Jia, Boyu, et autres
Publié: (2025)
Documents similaires
-
CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents
par: Xu, Tianqi, et autres
Publié: (2024) -
EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents
par: Liu, Yunqi, et autres
Publié: (2026) -
SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation
par: Zhao, Jiahao, et autres
Publié: (2026) -
PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
par: Hu, Sihao, et autres
Publié: (2024) -
Graph-Augmented Large Language Model Agents: Current Progress and Future Prospects
par: Liu, Yixin, et autres
Publié: (2025)