CLR-Bench: Evaluating Large Language Models in College-level Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Dong, Junnan, Hong, Zijin, Bei, Yuanchen, Huang, Feiran, Wang, Xinrun, Huang, Xiao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Survey of Graph Retrieval-Augmented Generation for Customized Large Language Models
por: Zhang, Qinggang, et al.
Publicado: (2025)
por: Zhang, Qinggang, et al.
Publicado: (2025)
Structure Guided Large Language Model for SQL Generation
por: Zhang, Qinggang, et al.
Publicado: (2024)
por: Zhang, Qinggang, et al.
Publicado: (2024)
Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL
por: Hong, Zijin, et al.
Publicado: (2024)
por: Hong, Zijin, et al.
Publicado: (2024)
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
por: Hong, Zijin, et al.
Publicado: (2025)
por: Hong, Zijin, et al.
Publicado: (2025)
GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation
por: Xiao, Yilin, et al.
Publicado: (2025)
por: Xiao, Yilin, et al.
Publicado: (2025)
Entity Alignment with Noisy Annotations from Large Language Models
por: Chen, Shengyuan, et al.
Publicado: (2024)
por: Chen, Shengyuan, et al.
Publicado: (2024)
Cost-efficient Knowledge-based Question Answering with Large Language Models
por: Dong, Junnan, et al.
Publicado: (2024)
por: Dong, Junnan, et al.
Publicado: (2024)
KnowGPT: Knowledge Graph based Prompting for Large Language Models
por: Zhang, Qinggang, et al.
Publicado: (2023)
por: Zhang, Qinggang, et al.
Publicado: (2023)
Logical Reasoning with Relation Network for Inductive Knowledge Graph Completion
por: Zhang, Qinggang, et al.
Publicado: (2024)
por: Zhang, Qinggang, et al.
Publicado: (2024)
LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed
por: Yang, Chang, et al.
Publicado: (2024)
por: Yang, Chang, et al.
Publicado: (2024)
Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
por: Wang, Boxuan, et al.
Publicado: (2025)
por: Wang, Boxuan, et al.
Publicado: (2025)
ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models in Chemistry
por: Huang, Zhiyuan, et al.
Publicado: (2025)
por: Huang, Zhiyuan, et al.
Publicado: (2025)
SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models
por: Monti, Sebastiano, et al.
Publicado: (2026)
por: Monti, Sebastiano, et al.
Publicado: (2026)
SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal
por: Xie, Tinghao, et al.
Publicado: (2024)
por: Xie, Tinghao, et al.
Publicado: (2024)
Evaluating and Enhancing Large Language Models for Conversational Reasoning on Knowledge Graphs
por: Huang, Yuxuan
Publicado: (2023)
por: Huang, Yuxuan
Publicado: (2023)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
por: Wang, Xiaoxuan, et al.
Publicado: (2023)
por: Wang, Xiaoxuan, et al.
Publicado: (2023)
Rethinking and Benchmarking Large Language Models for Graph Reasoning
por: Hu, Yuwei, et al.
Publicado: (2025)
por: Hu, Yuwei, et al.
Publicado: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
por: Chu, Zheng, et al.
Publicado: (2023)
por: Chu, Zheng, et al.
Publicado: (2023)
Reflection-Bench: Evaluating Epistemic Agency in Large Language Models
por: Li, Lingyu, et al.
Publicado: (2024)
por: Li, Lingyu, et al.
Publicado: (2024)
GIEBench: Towards Holistic Evaluation of Group Identity-based Empathy for Large Language Models
por: Wang, Leyan, et al.
Publicado: (2024)
por: Wang, Leyan, et al.
Publicado: (2024)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
por: Sabour, Sahand, et al.
Publicado: (2024)
por: Sabour, Sahand, et al.
Publicado: (2024)
Cold-Start Recommendation towards the Era of Large Language Models (LLMs): A Comprehensive Survey and Roadmap
por: Zhang, Weizhi, et al.
Publicado: (2025)
por: Zhang, Weizhi, et al.
Publicado: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
por: Wu, Yao, et al.
Publicado: (2026)
por: Wu, Yao, et al.
Publicado: (2026)
WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
por: Yin, Qiyue, et al.
Publicado: (2025)
por: Yin, Qiyue, et al.
Publicado: (2025)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
por: Yan, Bei, et al.
Publicado: (2024)
por: Yan, Bei, et al.
Publicado: (2024)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
por: Parmar, Mihir, et al.
Publicado: (2024)
por: Parmar, Mihir, et al.
Publicado: (2024)
HNCSE: Advancing Sentence Embeddings via Hybrid Contrastive Learning with Hard Negatives
por: Liu, Wenxiao, et al.
Publicado: (2024)
por: Liu, Wenxiao, et al.
Publicado: (2024)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
por: Dong, Junnan, et al.
Publicado: (2024)
por: Dong, Junnan, et al.
Publicado: (2024)
Translate-and-Revise: Boosting Large Language Models for Constrained Translation
por: Huang, Pengcheng, et al.
Publicado: (2024)
por: Huang, Pengcheng, et al.
Publicado: (2024)
LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
por: Wang, Jingyuan, et al.
Publicado: (2025)
por: Wang, Jingyuan, et al.
Publicado: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
por: Liu, Xiao, et al.
Publicado: (2023)
por: Liu, Xiao, et al.
Publicado: (2023)
SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning
por: Xu, Caijun, et al.
Publicado: (2026)
por: Xu, Caijun, et al.
Publicado: (2026)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
por: Zhang, Junkai, et al.
Publicado: (2025)
por: Zhang, Junkai, et al.
Publicado: (2025)
METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
por: Li, Pengfeng, et al.
Publicado: (2026)
por: Li, Pengfeng, et al.
Publicado: (2026)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
por: Yao, Xuan, et al.
Publicado: (2025)
por: Yao, Xuan, et al.
Publicado: (2025)
InFoBench: Evaluating Instruction Following Ability in Large Language Models
por: Qin, Yiwei, et al.
Publicado: (2024)
por: Qin, Yiwei, et al.
Publicado: (2024)
Generative Evaluation of Complex Reasoning in Large Language Models
por: Lin, Haowei, et al.
Publicado: (2025)
por: Lin, Haowei, et al.
Publicado: (2025)
CryptoX : Compositional Reasoning Evaluation of Large Language Models
por: Shi, Jiajun, et al.
Publicado: (2025)
por: Shi, Jiajun, et al.
Publicado: (2025)
KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language Models
por: Zhang, Xiao, et al.
Publicado: (2026)
por: Zhang, Xiao, et al.
Publicado: (2026)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
por: Srivastava, Gaurav, et al.
Publicado: (2025)
por: Srivastava, Gaurav, et al.
Publicado: (2025)
Ejemplares similares
-
A Survey of Graph Retrieval-Augmented Generation for Customized Large Language Models
por: Zhang, Qinggang, et al.
Publicado: (2025) -
Structure Guided Large Language Model for SQL Generation
por: Zhang, Qinggang, et al.
Publicado: (2024) -
Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL
por: Hong, Zijin, et al.
Publicado: (2024) -
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
por: Hong, Zijin, et al.
Publicado: (2025) -
GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation
por: Xiao, Yilin, et al.
Publicado: (2025)