Evaluating Progress in Graph Foundation Models: A Comprehensive Benchmark and New Insights
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Xingtong, Ye, Shenghua, Liang, Ruijuan, Zhou, Chang, Cheng, Hong, Zhang, Xinming, Fang, Yuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GCoT: Chain-of-Thought Prompt Learning for Graphs
di: Yu, Xingtong, et al.
Pubblicazione: (2025)
di: Yu, Xingtong, et al.
Pubblicazione: (2025)
SAMGPT: Text-free Graph Foundation Model for Multi-domain Pre-training and Cross-domain Adaptation
di: Yu, Xingtong, et al.
Pubblicazione: (2025)
di: Yu, Xingtong, et al.
Pubblicazione: (2025)
Event-Aware Prompt Learning for Dynamic Graphs
di: Yu, Xingtong, et al.
Pubblicazione: (2025)
di: Yu, Xingtong, et al.
Pubblicazione: (2025)
GraphReAct: Reasoning and Acting for Multi-step Graph Inference
di: Yu, Xingtong, et al.
Pubblicazione: (2026)
di: Yu, Xingtong, et al.
Pubblicazione: (2026)
MultiGPrompt for Multi-Task Pre-Training and Prompting on Graphs
di: Yu, Xingtong, et al.
Pubblicazione: (2023)
di: Yu, Xingtong, et al.
Pubblicazione: (2023)
HeTGB: A Comprehensive Benchmark for Heterophilic Text-Attributed Graphs
di: Li, Shujie, et al.
Pubblicazione: (2025)
di: Li, Shujie, et al.
Pubblicazione: (2025)
Text-Free Multi-domain Graph Pre-training: Toward Graph Foundation Models
di: Yu, Xingtong, et al.
Pubblicazione: (2024)
di: Yu, Xingtong, et al.
Pubblicazione: (2024)
Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models
di: Islam, Mohammed Saidul, et al.
Pubblicazione: (2026)
di: Islam, Mohammed Saidul, et al.
Pubblicazione: (2026)
What Shapes a Creative Machine Mind? Comprehensively Benchmarking Creativity in Foundation Models
di: He, Zicong, et al.
Pubblicazione: (2025)
di: He, Zicong, et al.
Pubblicazione: (2025)
GraCoRe: Benchmarking Graph Comprehension and Complex Reasoning in Large Language Models
di: Yuan, Zike, et al.
Pubblicazione: (2024)
di: Yuan, Zike, et al.
Pubblicazione: (2024)
Benchmarking Cognitive Domains for LLMs: Insights from Taiwanese Hakka Culture
di: Chang, Chen-Chi, et al.
Pubblicazione: (2024)
di: Chang, Chen-Chi, et al.
Pubblicazione: (2024)
Language Models can Evaluate Themselves via Probability Discrepancy
di: Xia, Tingyu, et al.
Pubblicazione: (2024)
di: Xia, Tingyu, et al.
Pubblicazione: (2024)
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
di: Li, Zhong-Zhi, et al.
Pubblicazione: (2024)
di: Li, Zhong-Zhi, et al.
Pubblicazione: (2024)
The Science of Evaluating Foundation Models
di: Yuan, Jiayi, et al.
Pubblicazione: (2025)
di: Yuan, Jiayi, et al.
Pubblicazione: (2025)
Falcon: A Comprehensive Chinese Text-to-SQL Benchmark for Enterprise-Grade Evaluation
di: Luo, Wenzhen, et al.
Pubblicazione: (2025)
di: Luo, Wenzhen, et al.
Pubblicazione: (2025)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
TEG-DB: A Comprehensive Dataset and Benchmark of Textual-Edge Graphs
di: Li, Zhuofeng, et al.
Pubblicazione: (2024)
di: Li, Zhuofeng, et al.
Pubblicazione: (2024)
Towards Foundation Models for Knowledge Graph Reasoning
di: Galkin, Mikhail, et al.
Pubblicazione: (2023)
di: Galkin, Mikhail, et al.
Pubblicazione: (2023)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
di: Zheng, Yu, et al.
Pubblicazione: (2025)
di: Zheng, Yu, et al.
Pubblicazione: (2025)
Parameters vs. Context: Fine-Grained Control of Knowledge Reliance in Language Models
di: Bi, Baolong, et al.
Pubblicazione: (2025)
di: Bi, Baolong, et al.
Pubblicazione: (2025)
StruEdit: Structured Outputs Enable the Fast and Accurate Knowledge Editing for Large Language Models
di: Bi, Baolong, et al.
Pubblicazione: (2024)
di: Bi, Baolong, et al.
Pubblicazione: (2024)
Large Language Models in the Clinic: A Comprehensive Benchmark
di: Liu, Fenglin, et al.
Pubblicazione: (2024)
di: Liu, Fenglin, et al.
Pubblicazione: (2024)
EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection
di: Xu, Ancheng, et al.
Pubblicazione: (2025)
di: Xu, Ancheng, et al.
Pubblicazione: (2025)
A Comprehensive Evaluation of Large Language Models on Benchmark Biomedical Text Processing Tasks
di: Jahan, Israt, et al.
Pubblicazione: (2023)
di: Jahan, Israt, et al.
Pubblicazione: (2023)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
di: Chen, Kedi, et al.
Pubblicazione: (2024)
di: Chen, Kedi, et al.
Pubblicazione: (2024)
Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
di: Zheng, Shunfeng, et al.
Pubblicazione: (2025)
di: Zheng, Shunfeng, et al.
Pubblicazione: (2025)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
di: Guo, Pei-Fu, et al.
Pubblicazione: (2026)
di: Guo, Pei-Fu, et al.
Pubblicazione: (2026)
Span-level Detection of AI-generated Scientific Text via Contrastive Learning and Structural Calibration
di: Yin, Zhen, et al.
Pubblicazione: (2025)
di: Yin, Zhen, et al.
Pubblicazione: (2025)
UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science
di: Zhang, Jie, et al.
Pubblicazione: (2026)
di: Zhang, Jie, et al.
Pubblicazione: (2026)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
di: Li, Ce, et al.
Pubblicazione: (2025)
di: Li, Ce, et al.
Pubblicazione: (2025)
PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology
di: Zhao, Yimin, et al.
Pubblicazione: (2026)
di: Zhao, Yimin, et al.
Pubblicazione: (2026)
VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents
di: Wu, Weihao, et al.
Pubblicazione: (2025)
di: Wu, Weihao, et al.
Pubblicazione: (2025)
Beyond Completion: A Foundation Model for General Knowledge Graph Reasoning
di: Hua, Yin, et al.
Pubblicazione: (2025)
di: Hua, Yin, et al.
Pubblicazione: (2025)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
di: Wei, Jianhui, et al.
Pubblicazione: (2025)
di: Wei, Jianhui, et al.
Pubblicazione: (2025)
A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems
di: Fang, Jinyuan, et al.
Pubblicazione: (2025)
di: Fang, Jinyuan, et al.
Pubblicazione: (2025)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
di: Tang, Wenjie, et al.
Pubblicazione: (2025)
di: Tang, Wenjie, et al.
Pubblicazione: (2025)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023)
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023)
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
di: Harsh, Reetu Raj, et al.
Pubblicazione: (2026)
di: Harsh, Reetu Raj, et al.
Pubblicazione: (2026)
Documenti analoghi
-
GCoT: Chain-of-Thought Prompt Learning for Graphs
di: Yu, Xingtong, et al.
Pubblicazione: (2025) -
SAMGPT: Text-free Graph Foundation Model for Multi-domain Pre-training and Cross-domain Adaptation
di: Yu, Xingtong, et al.
Pubblicazione: (2025) -
Event-Aware Prompt Learning for Dynamic Graphs
di: Yu, Xingtong, et al.
Pubblicazione: (2025) -
GraphReAct: Reasoning and Acting for Multi-step Graph Inference
di: Yu, Xingtong, et al.
Pubblicazione: (2026) -
MultiGPrompt for Multi-Task Pre-Training and Prompting on Graphs
di: Yu, Xingtong, et al.
Pubblicazione: (2023)