CEQuest: Benchmarking Large Language Models for Construction Estimation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Yanzhao, Wang, Lufan, Liu, Rui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Benchmarking Benchmark Leakage in Large Language Models
di: Xu, Ruijie, et al.
Pubblicazione: (2024)
di: Xu, Ruijie, et al.
Pubblicazione: (2024)
PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation
di: Carrillo-Larco, Rodrigo M., et al.
Pubblicazione: (2025)
di: Carrillo-Larco, Rodrigo M., et al.
Pubblicazione: (2025)
Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
di: Liu, Yixin, et al.
Pubblicazione: (2023)
di: Liu, Yixin, et al.
Pubblicazione: (2023)
CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models
di: Wang, Song, et al.
Pubblicazione: (2024)
di: Wang, Song, et al.
Pubblicazione: (2024)
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
di: Li, Jianling, et al.
Pubblicazione: (2025)
di: Li, Jianling, et al.
Pubblicazione: (2025)
MUCAR: Benchmarking Multilingual Cross-Modal Ambiguity Resolution for Multimodal Large Language Models
di: Wang, Xiaolong, et al.
Pubblicazione: (2025)
di: Wang, Xiaolong, et al.
Pubblicazione: (2025)
Benchmarking Uncertainty Quantification Methods for Large Language Models with LM-Polygraph
di: Vashurin, Roman, et al.
Pubblicazione: (2024)
di: Vashurin, Roman, et al.
Pubblicazione: (2024)
GLBench: A Comprehensive Benchmark for Graph with Large Language Models
di: Li, Yuhan, et al.
Pubblicazione: (2024)
di: Li, Yuhan, et al.
Pubblicazione: (2024)
CLUE: Concept-Level Uncertainty Estimation for Large Language Models
di: Wang, Yu-Hsiang, et al.
Pubblicazione: (2024)
di: Wang, Yu-Hsiang, et al.
Pubblicazione: (2024)
Do Large Language Model Benchmarks Test Reliability?
di: Vendrow, Joshua, et al.
Pubblicazione: (2025)
di: Vendrow, Joshua, et al.
Pubblicazione: (2025)
Benchmarking Large Language Model Uncertainty for Prompt Optimization
di: Guo, Pei-Fu, et al.
Pubblicazione: (2024)
di: Guo, Pei-Fu, et al.
Pubblicazione: (2024)
Benchmarking Large Language Models for Math Reasoning Tasks
di: Seßler, Kathrin, et al.
Pubblicazione: (2024)
di: Seßler, Kathrin, et al.
Pubblicazione: (2024)
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
di: Wang, Ruhan, et al.
Pubblicazione: (2026)
di: Wang, Ruhan, et al.
Pubblicazione: (2026)
Zero-Shot Decision Tree Construction via Large Language Models
di: Carrasco, Lucas, et al.
Pubblicazione: (2025)
di: Carrasco, Lucas, et al.
Pubblicazione: (2025)
Concept Unlearning in Large Language Models via Self-Constructed Knowledge Triplets
di: Yamashita, Tomoya, et al.
Pubblicazione: (2025)
di: Yamashita, Tomoya, et al.
Pubblicazione: (2025)
Game of LLMs: Discovering Structural Constructs in Activities using Large Language Models
di: Hiremath, Shruthi K., et al.
Pubblicazione: (2024)
di: Hiremath, Shruthi K., et al.
Pubblicazione: (2024)
Spatial-Temporal Large Language Model for Traffic Prediction
di: Liu, Chenxi, et al.
Pubblicazione: (2024)
di: Liu, Chenxi, et al.
Pubblicazione: (2024)
metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models
di: Kipnis, Alex, et al.
Pubblicazione: (2024)
di: Kipnis, Alex, et al.
Pubblicazione: (2024)
A Critical Review of Causal Reasoning Benchmarks for Large Language Models
di: Yang, Linying, et al.
Pubblicazione: (2024)
di: Yang, Linying, et al.
Pubblicazione: (2024)
Pareto Optimal Learning for Estimating Large Language Model Errors
di: Zhao, Theodore, et al.
Pubblicazione: (2023)
di: Zhao, Theodore, et al.
Pubblicazione: (2023)
TurnBack: A Geospatial Route Cognition Benchmark for Large Language Models through Reverse Route
di: Luo, Hongyi, et al.
Pubblicazione: (2025)
di: Luo, Hongyi, et al.
Pubblicazione: (2025)
Linear Dynamics in the RLVR Training of Large Language Models
di: Wang, Tianle, et al.
Pubblicazione: (2026)
di: Wang, Tianle, et al.
Pubblicazione: (2026)
AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
AutoBencher: Towards Declarative Benchmark Construction
di: Li, Xiang Lisa, et al.
Pubblicazione: (2024)
di: Li, Xiang Lisa, et al.
Pubblicazione: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
Inference-Cost-Aware Dynamic Tree Construction for Efficient Inference in Large Language Models
di: Hong, Yinrong, et al.
Pubblicazione: (2025)
di: Hong, Yinrong, et al.
Pubblicazione: (2025)
Performance Law of Large Language Models
di: Wu, Chuhan, et al.
Pubblicazione: (2024)
di: Wu, Chuhan, et al.
Pubblicazione: (2024)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
di: Komanduri, Aneesh, et al.
Pubblicazione: (2025)
di: Komanduri, Aneesh, et al.
Pubblicazione: (2025)
On the Thinking-Language Modeling Gap in Large Language Models
di: Liu, Chenxi, et al.
Pubblicazione: (2025)
di: Liu, Chenxi, et al.
Pubblicazione: (2025)
RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering
di: Müller, Philip, et al.
Pubblicazione: (2026)
di: Müller, Philip, et al.
Pubblicazione: (2026)
DetoxBench: Benchmarking Large Language Models for Multitask Fraud & Abuse Detection
di: Chakraborty, Joymallya, et al.
Pubblicazione: (2024)
di: Chakraborty, Joymallya, et al.
Pubblicazione: (2024)
Mitigating Geospatial Knowledge Hallucination in Large Language Models: Benchmarking and Dynamic Factuality Aligning
di: Wang, Shengyuan, et al.
Pubblicazione: (2025)
di: Wang, Shengyuan, et al.
Pubblicazione: (2025)
From Construction to Injection: Edit-Based Fingerprints for Large Language Models
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Large Language Models for Biomedical Knowledge Graph Construction: Information extraction from EMR notes
di: Arsenyan, Vahan, et al.
Pubblicazione: (2023)
di: Arsenyan, Vahan, et al.
Pubblicazione: (2023)
Fine-tuning Large Language Models for Domain-specific Machine Translation
di: Zheng, Jiawei, et al.
Pubblicazione: (2024)
di: Zheng, Jiawei, et al.
Pubblicazione: (2024)
FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models
di: Ye, Rui, et al.
Pubblicazione: (2024)
di: Ye, Rui, et al.
Pubblicazione: (2024)
FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models
di: Mateega, Spencer, et al.
Pubblicazione: (2025)
di: Mateega, Spencer, et al.
Pubblicazione: (2025)
DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models
di: Tiwari, Utkarsh, et al.
Pubblicazione: (2025)
di: Tiwari, Utkarsh, et al.
Pubblicazione: (2025)
Benchmarking Large Language Models for Persian: A Preliminary Study Focusing on ChatGPT
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Benchmarking Benchmark Leakage in Large Language Models
di: Xu, Ruijie, et al.
Pubblicazione: (2024) -
PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation
di: Carrillo-Larco, Rodrigo M., et al.
Pubblicazione: (2025) -
Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
di: Liu, Yixin, et al.
Pubblicazione: (2023) -
CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models
di: Wang, Song, et al.
Pubblicazione: (2024) -
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
di: Li, Jianling, et al.
Pubblicazione: (2025)