GraCoRe: Benchmarking Graph Comprehension and Complex Reasoning in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yuan, Zike, Liu, Ming, Wang, Hui, Qin, Bing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
ReGraM: Region-First Knowledge Graph Reasoning for Medical Question Answering
von: Lee, Chaerin, et al.
Veröffentlicht: (2026)
von: Lee, Chaerin, et al.
Veröffentlicht: (2026)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
von: Xiong, Kai, et al.
Veröffentlicht: (2025)
von: Xiong, Kai, et al.
Veröffentlicht: (2025)
MA-GTS: A Multi-Agent Framework for Solving Complex Graph Problems in Real-World Applications
von: Yuan, Zike, et al.
Veröffentlicht: (2025)
von: Yuan, Zike, et al.
Veröffentlicht: (2025)
Large Language Models in the Clinic: A Comprehensive Benchmark
von: Liu, Fenglin, et al.
Veröffentlicht: (2024)
von: Liu, Fenglin, et al.
Veröffentlicht: (2024)
GraLMatch: Matching Groups of Entities with Graphs and Language Models
von: Pardo, Fernando De Meer, et al.
Veröffentlicht: (2024)
von: Pardo, Fernando De Meer, et al.
Veröffentlicht: (2024)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
von: Xu, Xin, et al.
Veröffentlicht: (2025)
von: Xu, Xin, et al.
Veröffentlicht: (2025)
A Comprehensive Evaluation on Event Reasoning of Large Language Models
von: Tao, Zhengwei, et al.
Veröffentlicht: (2024)
von: Tao, Zhengwei, et al.
Veröffentlicht: (2024)
Ontology-Guided Reverse Thinking Makes Large Language Models Stronger on Knowledge Graph Question Answering
von: Liu, Runxuan, et al.
Veröffentlicht: (2025)
von: Liu, Runxuan, et al.
Veröffentlicht: (2025)
Structured Chemistry Reasoning with Large Language Models
von: Ouyang, Siru, et al.
Veröffentlicht: (2023)
von: Ouyang, Siru, et al.
Veröffentlicht: (2023)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
von: Li, Jindong, et al.
Veröffentlicht: (2025)
von: Li, Jindong, et al.
Veröffentlicht: (2025)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
von: Li, Ce, et al.
Veröffentlicht: (2025)
von: Li, Ce, et al.
Veröffentlicht: (2025)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning
von: Luo, Linhao, et al.
Veröffentlicht: (2023)
von: Luo, Linhao, et al.
Veröffentlicht: (2023)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
von: Yue, Wenjing, et al.
Veröffentlicht: (2024)
von: Yue, Wenjing, et al.
Veröffentlicht: (2024)
Efficient Long CoT Reasoning in Small Language Models
von: Wang, Zhaoyang, et al.
Veröffentlicht: (2025)
von: Wang, Zhaoyang, et al.
Veröffentlicht: (2025)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
von: Zhou, Qiji, et al.
Veröffentlicht: (2024)
von: Zhou, Qiji, et al.
Veröffentlicht: (2024)
ReCo: Reliable Causal Chain Reasoning via Structural Causal Recurrent Neural Networks
von: Xiong, Kai, et al.
Veröffentlicht: (2022)
von: Xiong, Kai, et al.
Veröffentlicht: (2022)
Large Language Model Benchmarks in Medical Tasks
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)
von: Yan, Lawrence K. Q., et al.
Veröffentlicht: (2024)
Brainstorming Brings Power to Large Language Models of Knowledge Reasoning
von: Qin, Zining, et al.
Veröffentlicht: (2024)
von: Qin, Zining, et al.
Veröffentlicht: (2024)
FiDeLiS: Faithful Reasoning in Large Language Model for Knowledge Graph Question Answering
von: Sui, Yuan, et al.
Veröffentlicht: (2024)
von: Sui, Yuan, et al.
Veröffentlicht: (2024)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
von: Wang, Yiqi, et al.
Veröffentlicht: (2024)
von: Wang, Yiqi, et al.
Veröffentlicht: (2024)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
von: Zhu, Yakun, et al.
Veröffentlicht: (2025)
von: Zhu, Yakun, et al.
Veröffentlicht: (2025)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
von: Ning, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Ning, Zhiyuan, et al.
Veröffentlicht: (2025)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
von: Xu, Hainiu, et al.
Veröffentlicht: (2024)
von: Xu, Hainiu, et al.
Veröffentlicht: (2024)
Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
von: Jiang, Jin, et al.
Veröffentlicht: (2025)
von: Jiang, Jin, et al.
Veröffentlicht: (2025)
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
von: Liu, Junlin, et al.
Veröffentlicht: (2026)
von: Liu, Junlin, et al.
Veröffentlicht: (2026)
A Survey on Large Language Models for Mathematical Reasoning
von: Wang, Peng-Yuan, et al.
Veröffentlicht: (2025)
von: Wang, Peng-Yuan, et al.
Veröffentlicht: (2025)
Meaningful Learning: Enhancing Abstract Reasoning in Large Language Models via Generic Fact Guidance
von: Xiong, Kai, et al.
Veröffentlicht: (2024)
von: Xiong, Kai, et al.
Veröffentlicht: (2024)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality
von: Cheng, Aileen, et al.
Veröffentlicht: (2025)
von: Cheng, Aileen, et al.
Veröffentlicht: (2025)
Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning
von: Zhang, Chuang, et al.
Veröffentlicht: (2026)
von: Zhang, Chuang, et al.
Veröffentlicht: (2026)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating
von: Deng, Chao, et al.
Veröffentlicht: (2024)
von: Deng, Chao, et al.
Veröffentlicht: (2024)
Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring
von: Guan, Weixin, et al.
Veröffentlicht: (2026)
von: Guan, Weixin, et al.
Veröffentlicht: (2026)
KwaiAgents: Generalized Information-seeking Agent System with Large Language Models
von: Pan, Haojie, et al.
Veröffentlicht: (2023)
von: Pan, Haojie, et al.
Veröffentlicht: (2023)
JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models
von: Liu, Shuyi, et al.
Veröffentlicht: (2025)
von: Liu, Shuyi, et al.
Veröffentlicht: (2025)
DiReCT: Diagnostic Reasoning for Clinical Notes via Large Language Models
von: Wang, Bowen, et al.
Veröffentlicht: (2024)
von: Wang, Bowen, et al.
Veröffentlicht: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
von: Guo, Pei-Fu, et al.
Veröffentlicht: (2026)
von: Guo, Pei-Fu, et al.
Veröffentlicht: (2026)
Large Language Models and Cognitive Science: A Comprehensive Review of Similarities, Differences, and Challenges
von: Niu, Qian, et al.
Veröffentlicht: (2024)
von: Niu, Qian, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
von: Chu, Zheng, et al.
Veröffentlicht: (2023) -
ReGraM: Region-First Knowledge Graph Reasoning for Medical Question Answering
von: Lee, Chaerin, et al.
Veröffentlicht: (2026) -
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
von: Xiong, Kai, et al.
Veröffentlicht: (2025) -
MA-GTS: A Multi-Agent Framework for Solving Complex Graph Problems in Real-World Applications
von: Yuan, Zike, et al.
Veröffentlicht: (2025) -
Large Language Models in the Clinic: A Comprehensive Benchmark
von: Liu, Fenglin, et al.
Veröffentlicht: (2024)