CLR-Bench: Evaluating Large Language Models in College-level Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Dong, Junnan, Hong, Zijin, Bei, Yuanchen, Huang, Feiran, Wang, Xinrun, Huang, Xiao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
A Survey of Graph Retrieval-Augmented Generation for Customized Large Language Models
von: Zhang, Qinggang, et al.
Veröffentlicht: (2025)
von: Zhang, Qinggang, et al.
Veröffentlicht: (2025)
Structure Guided Large Language Model for SQL Generation
von: Zhang, Qinggang, et al.
Veröffentlicht: (2024)
von: Zhang, Qinggang, et al.
Veröffentlicht: (2024)
Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL
von: Hong, Zijin, et al.
Veröffentlicht: (2024)
von: Hong, Zijin, et al.
Veröffentlicht: (2024)
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
von: Hong, Zijin, et al.
Veröffentlicht: (2025)
von: Hong, Zijin, et al.
Veröffentlicht: (2025)
GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation
von: Xiao, Yilin, et al.
Veröffentlicht: (2025)
von: Xiao, Yilin, et al.
Veröffentlicht: (2025)
Entity Alignment with Noisy Annotations from Large Language Models
von: Chen, Shengyuan, et al.
Veröffentlicht: (2024)
von: Chen, Shengyuan, et al.
Veröffentlicht: (2024)
Cost-efficient Knowledge-based Question Answering with Large Language Models
von: Dong, Junnan, et al.
Veröffentlicht: (2024)
von: Dong, Junnan, et al.
Veröffentlicht: (2024)
KnowGPT: Knowledge Graph based Prompting for Large Language Models
von: Zhang, Qinggang, et al.
Veröffentlicht: (2023)
von: Zhang, Qinggang, et al.
Veröffentlicht: (2023)
Logical Reasoning with Relation Network for Inductive Knowledge Graph Completion
von: Zhang, Qinggang, et al.
Veröffentlicht: (2024)
von: Zhang, Qinggang, et al.
Veröffentlicht: (2024)
LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed
von: Yang, Chang, et al.
Veröffentlicht: (2024)
von: Yang, Chang, et al.
Veröffentlicht: (2024)
Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
von: Wang, Boxuan, et al.
Veröffentlicht: (2025)
von: Wang, Boxuan, et al.
Veröffentlicht: (2025)
ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models in Chemistry
von: Huang, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Huang, Zhiyuan, et al.
Veröffentlicht: (2025)
SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models
von: Monti, Sebastiano, et al.
Veröffentlicht: (2026)
von: Monti, Sebastiano, et al.
Veröffentlicht: (2026)
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
von: Xie, Tinghao, et al.
Veröffentlicht: (2024)
von: Xie, Tinghao, et al.
Veröffentlicht: (2024)
Evaluating and Enhancing Large Language Models for Conversational Reasoning on Knowledge Graphs
von: Huang, Yuxuan
Veröffentlicht: (2023)
von: Huang, Yuxuan
Veröffentlicht: (2023)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
von: Wang, Xiaoxuan, et al.
Veröffentlicht: (2023)
von: Wang, Xiaoxuan, et al.
Veröffentlicht: (2023)
Rethinking and Benchmarking Large Language Models for Graph Reasoning
von: Hu, Yuwei, et al.
Veröffentlicht: (2025)
von: Hu, Yuwei, et al.
Veröffentlicht: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
Reflection-Bench: Evaluating Epistemic Agency in Large Language Models
von: Li, Lingyu, et al.
Veröffentlicht: (2024)
von: Li, Lingyu, et al.
Veröffentlicht: (2024)
GIEBench: Towards Holistic Evaluation of Group Identity-based Empathy for Large Language Models
von: Wang, Leyan, et al.
Veröffentlicht: (2024)
von: Wang, Leyan, et al.
Veröffentlicht: (2024)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
von: Sabour, Sahand, et al.
Veröffentlicht: (2024)
von: Sabour, Sahand, et al.
Veröffentlicht: (2024)
Cold-Start Recommendation towards the Era of Large Language Models (LLMs): A Comprehensive Survey and Roadmap
von: Zhang, Weizhi, et al.
Veröffentlicht: (2025)
von: Zhang, Weizhi, et al.
Veröffentlicht: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
von: Wu, Yao, et al.
Veröffentlicht: (2026)
von: Wu, Yao, et al.
Veröffentlicht: (2026)
WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
von: Yin, Qiyue, et al.
Veröffentlicht: (2025)
von: Yin, Qiyue, et al.
Veröffentlicht: (2025)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
von: Yan, Bei, et al.
Veröffentlicht: (2024)
von: Yan, Bei, et al.
Veröffentlicht: (2024)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
von: Parmar, Mihir, et al.
Veröffentlicht: (2024)
von: Parmar, Mihir, et al.
Veröffentlicht: (2024)
HNCSE: Advancing Sentence Embeddings via Hybrid Contrastive Learning with Hard Negatives
von: Liu, Wenxiao, et al.
Veröffentlicht: (2024)
von: Liu, Wenxiao, et al.
Veröffentlicht: (2024)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
von: Dong, Junnan, et al.
Veröffentlicht: (2024)
von: Dong, Junnan, et al.
Veröffentlicht: (2024)
Translate-and-Revise: Boosting Large Language Models for Constrained Translation
von: Huang, Pengcheng, et al.
Veröffentlicht: (2024)
von: Huang, Pengcheng, et al.
Veröffentlicht: (2024)
LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
von: Wang, Jingyuan, et al.
Veröffentlicht: (2025)
von: Wang, Jingyuan, et al.
Veröffentlicht: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning
von: Xu, Caijun, et al.
Veröffentlicht: (2026)
von: Xu, Caijun, et al.
Veröffentlicht: (2026)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
von: Zhang, Junkai, et al.
Veröffentlicht: (2025)
von: Zhang, Junkai, et al.
Veröffentlicht: (2025)
METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
von: Li, Pengfeng, et al.
Veröffentlicht: (2026)
von: Li, Pengfeng, et al.
Veröffentlicht: (2026)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
InFoBench: Evaluating Instruction Following Ability in Large Language Models
von: Qin, Yiwei, et al.
Veröffentlicht: (2024)
von: Qin, Yiwei, et al.
Veröffentlicht: (2024)
Generative Evaluation of Complex Reasoning in Large Language Models
von: Lin, Haowei, et al.
Veröffentlicht: (2025)
von: Lin, Haowei, et al.
Veröffentlicht: (2025)
CryptoX : Compositional Reasoning Evaluation of Large Language Models
von: Shi, Jiajun, et al.
Veröffentlicht: (2025)
von: Shi, Jiajun, et al.
Veröffentlicht: (2025)
KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language Models
von: Zhang, Xiao, et al.
Veröffentlicht: (2026)
von: Zhang, Xiao, et al.
Veröffentlicht: (2026)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
A Survey of Graph Retrieval-Augmented Generation for Customized Large Language Models
von: Zhang, Qinggang, et al.
Veröffentlicht: (2025) -
Structure Guided Large Language Model for SQL Generation
von: Zhang, Qinggang, et al.
Veröffentlicht: (2024) -
Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL
von: Hong, Zijin, et al.
Veröffentlicht: (2024) -
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
von: Hong, Zijin, et al.
Veröffentlicht: (2025) -
GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation
von: Xiao, Yilin, et al.
Veröffentlicht: (2025)