Can AI Master Construction Management (CM)? Benchmarking State-of-the-Art Large Language Models on CM Certification Exams
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xiong, Ruoxin, Wang, Yanyu, Gunhan, Suat, Zhu, Yimin, Berryman, Charles |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
EnviroExam: Benchmarking Environmental Science Knowledge of Large Language Models
von: Huang, Yu, et al.
Veröffentlicht: (2024)
von: Huang, Yu, et al.
Veröffentlicht: (2024)
SciMaster: Towards General-Purpose Scientific AI Agents, Part I. X-Master as Foundation: Can We Lead on Humanity's Last Exam?
von: Chai, Jingyi, et al.
Veröffentlicht: (2025)
von: Chai, Jingyi, et al.
Veröffentlicht: (2025)
CM-Align: Consistency-based Multilingual Alignment for Large Language Models
von: Zhang, Xue, et al.
Veröffentlicht: (2025)
von: Zhang, Xue, et al.
Veröffentlicht: (2025)
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
von: Jiang, Jiyue, et al.
Veröffentlicht: (2025)
von: Jiang, Jiyue, et al.
Veröffentlicht: (2025)
LASP: Surveying the State-of-the-Art in Large Language Model-Assisted AI Planning
von: Li, Haoming, et al.
Veröffentlicht: (2024)
von: Li, Haoming, et al.
Veröffentlicht: (2024)
Alvorada-Bench: Can Language Models Solve Brazilian University Entrance Exams?
von: Godoy, Henrique
Veröffentlicht: (2025)
von: Godoy, Henrique
Veröffentlicht: (2025)
Can Large Language Models Play Text Games Well? Current State-of-the-Art and Open Questions
von: Tsai, Chen Feng, et al.
Veröffentlicht: (2023)
von: Tsai, Chen Feng, et al.
Veröffentlicht: (2023)
PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology
von: Zhao, Yimin, et al.
Veröffentlicht: (2026)
von: Zhao, Yimin, et al.
Veröffentlicht: (2026)
What Is Missing: Interpretable Ratings for Large Language Model Outputs
von: Stranges, Nicholas, et al.
Veröffentlicht: (2026)
von: Stranges, Nicholas, et al.
Veröffentlicht: (2026)
Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
von: Zhang, Hanlei, et al.
Veröffentlicht: (2025)
von: Zhang, Hanlei, et al.
Veröffentlicht: (2025)
GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art
von: Lei, Yiming, et al.
Veröffentlicht: (2025)
von: Lei, Yiming, et al.
Veröffentlicht: (2025)
Large Language Models in Cybersecurity: State-of-the-Art
von: Motlagh, Farzad Nourmohammadzadeh, et al.
Veröffentlicht: (2024)
von: Motlagh, Farzad Nourmohammadzadeh, et al.
Veröffentlicht: (2024)
Measuring what Matters: Construct Validity in Large Language Model Benchmarks
von: Bean, Andrew M., et al.
Veröffentlicht: (2025)
von: Bean, Andrew M., et al.
Veröffentlicht: (2025)
Efficient Language Adaptive Pre-training: Extending State-of-the-Art Large Language Models for Polish
von: Ruciński, Szymon
Veröffentlicht: (2024)
von: Ruciński, Szymon
Veröffentlicht: (2024)
Readme_AI: Dynamic Context Construction for Large Language Models
von: Vyas, Millie, et al.
Veröffentlicht: (2025)
von: Vyas, Millie, et al.
Veröffentlicht: (2025)
Playing With AI: How Do State-Of-The-Art Large Language Models Perform in the 1977 Text-Based Adventure Game Zork?
von: Gerrits, Berry
Veröffentlicht: (2026)
von: Gerrits, Berry
Veröffentlicht: (2026)
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
von: Panpatil, Siddhant, et al.
Veröffentlicht: (2025)
von: Panpatil, Siddhant, et al.
Veröffentlicht: (2025)
Can LLMs Master Math? Investigating Large Language Models on Math Stack Exchange
von: Satpute, Ankit, et al.
Veröffentlicht: (2024)
von: Satpute, Ankit, et al.
Veröffentlicht: (2024)
Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams
von: Cui, Yiming, et al.
Veröffentlicht: (2025)
von: Cui, Yiming, et al.
Veröffentlicht: (2025)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
von: Tang, Zecheng, et al.
Veröffentlicht: (2026)
von: Tang, Zecheng, et al.
Veröffentlicht: (2026)
Can Large Language Models Analyze Graphs like Professionals? A Benchmark, Datasets and Models
von: Li, Xin, et al.
Veröffentlicht: (2024)
von: Li, Xin, et al.
Veröffentlicht: (2024)
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges
von: Li, Zongxia, et al.
Veröffentlicht: (2025)
von: Li, Zongxia, et al.
Veröffentlicht: (2025)
The Computational Learning of Construction Grammars: State of the Art and Prospective Roadmap
von: Doumen, Jonas, et al.
Veröffentlicht: (2024)
von: Doumen, Jonas, et al.
Veröffentlicht: (2024)
Construct, Align, and Reason: Large Ontology Models for Enterprise Knowledge Management
von: Zhang, Yao, et al.
Veröffentlicht: (2026)
von: Zhang, Yao, et al.
Veröffentlicht: (2026)
Towards a Benchmark for Large Language Models for Business Process Management Tasks
von: Busch, Kiran, et al.
Veröffentlicht: (2024)
von: Busch, Kiran, et al.
Veröffentlicht: (2024)
Large Visual-Language Models Are Also Good Classifiers: A Study of In-Context Multimodal Fake News Detection
von: Jiang, Ye, et al.
Veröffentlicht: (2024)
von: Jiang, Ye, et al.
Veröffentlicht: (2024)
ToMBench: Benchmarking Theory of Mind in Large Language Models
von: Chen, Zhuang, et al.
Veröffentlicht: (2024)
von: Chen, Zhuang, et al.
Veröffentlicht: (2024)
Can Large Language Models Derive New Knowledge? A Dynamic Benchmark for Biological Knowledge Discovery
von: Yang, Chaoqun, et al.
Veröffentlicht: (2026)
von: Yang, Chaoqun, et al.
Veröffentlicht: (2026)
AyurParam: A State-of-the-Art Bilingual Language Model for Ayurveda
von: Nauman, Mohd, et al.
Veröffentlicht: (2025)
von: Nauman, Mohd, et al.
Veröffentlicht: (2025)
ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents
von: Kang, Hao, et al.
Veröffentlicht: (2024)
von: Kang, Hao, et al.
Veröffentlicht: (2024)
Instruction Tuning Vs. In-Context Learning: Revisiting Large Language Models in Few-Shot Computational Social Science
von: Wang, Taihang, et al.
Veröffentlicht: (2024)
von: Wang, Taihang, et al.
Veröffentlicht: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024)
von: Liu, Yan, et al.
Veröffentlicht: (2024)
GAUSS: Benchmarking Structured Mathematical Skills for Large Language Models
von: Zhang, Yue, et al.
Veröffentlicht: (2025)
von: Zhang, Yue, et al.
Veröffentlicht: (2025)
OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models
von: Zheng, Hao, et al.
Veröffentlicht: (2025)
von: Zheng, Hao, et al.
Veröffentlicht: (2025)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
von: Zhu, Jie, et al.
Veröffentlicht: (2024)
von: Zhu, Jie, et al.
Veröffentlicht: (2024)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
von: Zhu, Yakun, et al.
Veröffentlicht: (2025)
von: Zhu, Yakun, et al.
Veröffentlicht: (2025)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
von: Xiong, Zixin, et al.
Veröffentlicht: (2026)
von: Xiong, Zixin, et al.
Veröffentlicht: (2026)
Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
von: Nezhurina, Marianna, et al.
Veröffentlicht: (2024)
von: Nezhurina, Marianna, et al.
Veröffentlicht: (2024)
PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation
von: Carrillo-Larco, Rodrigo M., et al.
Veröffentlicht: (2025)
von: Carrillo-Larco, Rodrigo M., et al.
Veröffentlicht: (2025)
Benchmarking Multi-National Value Alignment for Large Language Models
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
EnviroExam: Benchmarking Environmental Science Knowledge of Large Language Models
von: Huang, Yu, et al.
Veröffentlicht: (2024) -
SciMaster: Towards General-Purpose Scientific AI Agents, Part I. X-Master as Foundation: Can We Lead on Humanity's Last Exam?
von: Chai, Jingyi, et al.
Veröffentlicht: (2025) -
CM-Align: Consistency-based Multilingual Alignment for Large Language Models
von: Zhang, Xue, et al.
Veröffentlicht: (2025) -
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
von: Jiang, Jiyue, et al.
Veröffentlicht: (2025) -
LASP: Surveying the State-of-the-Art in Large Language Model-Assisted AI Planning
von: Li, Haoming, et al.
Veröffentlicht: (2024)