PCEval: A Benchmark for Evaluating Physical Computing Capabilities of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Inpyo, Jeon, Eunji, Lee, Jangwon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
di: Li, Ce, et al.
Pubblicazione: (2025)
di: Li, Ce, et al.
Pubblicazione: (2025)
A Multi-faceted Analysis of Cognitive Abilities: Evaluating Prompt Methods with Large Language Models on the CONSORT Checklist
di: Jeon, Sohyeon, et al.
Pubblicazione: (2025)
di: Jeon, Sohyeon, et al.
Pubblicazione: (2025)
Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
di: Pauli, Amalie Brogaard, et al.
Pubblicazione: (2024)
di: Pauli, Amalie Brogaard, et al.
Pubblicazione: (2024)
ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing
di: Wang, Jinzhi, et al.
Pubblicazione: (2025)
di: Wang, Jinzhi, et al.
Pubblicazione: (2025)
Representing the Under-Represented: Cultural and Core Capability Benchmarks for Developing Thai Large Language Models
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
di: Kim, Dahyun, et al.
Pubblicazione: (2024)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
di: Saxena, Yash, et al.
Pubblicazione: (2024)
di: Saxena, Yash, et al.
Pubblicazione: (2024)
CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics
di: Somasekharan, Nithin, et al.
Pubblicazione: (2025)
di: Somasekharan, Nithin, et al.
Pubblicazione: (2025)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
di: Jung, Dahyun, et al.
Pubblicazione: (2025)
di: Jung, Dahyun, et al.
Pubblicazione: (2025)
Instance-Aligned Captions for Explainable Video Anomaly Detection
di: Song, Inpyo, et al.
Pubblicazione: (2026)
di: Song, Inpyo, et al.
Pubblicazione: (2026)
Exploring and Benchmarking the Planning Capabilities of Large Language Models
di: Bohnet, Bernd, et al.
Pubblicazione: (2024)
di: Bohnet, Bernd, et al.
Pubblicazione: (2024)
SQLBench: A Comprehensive Evaluation for Text-to-SQL Capabilities of Large Language Models
di: Zhang, Bin, et al.
Pubblicazione: (2024)
di: Zhang, Bin, et al.
Pubblicazione: (2024)
DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues
di: Jang, Kyochul, et al.
Pubblicazione: (2025)
di: Jang, Kyochul, et al.
Pubblicazione: (2025)
Evaluating the Elementary Multilingual Capabilities of Large Language Models with MultiQ
di: Holtermann, Carolin, et al.
Pubblicazione: (2024)
di: Holtermann, Carolin, et al.
Pubblicazione: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
di: Yu, Linhao, et al.
Pubblicazione: (2024)
di: Yu, Linhao, et al.
Pubblicazione: (2024)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models
di: Zbeeb, Mohammad, et al.
Pubblicazione: (2025)
di: Zbeeb, Mohammad, et al.
Pubblicazione: (2025)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023)
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
di: Lee, Jaeho, et al.
Pubblicazione: (2025)
di: Lee, Jaeho, et al.
Pubblicazione: (2025)
Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games
di: Malik, Saumya
Pubblicazione: (2024)
di: Malik, Saumya
Pubblicazione: (2024)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
di: Toraman, Çağrı, et al.
Pubblicazione: (2026)
di: Toraman, Çağrı, et al.
Pubblicazione: (2026)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation
di: Oh, Jungwoo, et al.
Pubblicazione: (2026)
di: Oh, Jungwoo, et al.
Pubblicazione: (2026)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
CTBench: A Comprehensive Benchmark for Evaluating Language Model Capabilities in Clinical Trial Design
di: Neehal, Nafis, et al.
Pubblicazione: (2024)
di: Neehal, Nafis, et al.
Pubblicazione: (2024)
DebugBench: Evaluating Debugging Capability of Large Language Models
di: Tian, Runchu, et al.
Pubblicazione: (2024)
di: Tian, Runchu, et al.
Pubblicazione: (2024)
EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models
di: Su, Jiamin, et al.
Pubblicazione: (2025)
di: Su, Jiamin, et al.
Pubblicazione: (2025)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
di: Wang, Wentian, et al.
Pubblicazione: (2024)
di: Wang, Wentian, et al.
Pubblicazione: (2024)
GraphInstruct: Empowering Large Language Models with Graph Understanding and Reasoning Capability
di: Luo, Zihan, et al.
Pubblicazione: (2024)
di: Luo, Zihan, et al.
Pubblicazione: (2024)
Real-time Traffic Accident Anticipation with Feature Reuse
di: Song, Inpyo, et al.
Pubblicazione: (2025)
di: Song, Inpyo, et al.
Pubblicazione: (2025)
Bounding-Box Trajectories Matter for Video Anomaly Detection
di: Song, Inpyo, et al.
Pubblicazione: (2026)
di: Song, Inpyo, et al.
Pubblicazione: (2026)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
di: Fu, Lingyue, et al.
Pubblicazione: (2023)
di: Fu, Lingyue, et al.
Pubblicazione: (2023)
FunctionChat-Bench: Comprehensive Evaluation of Language Models' Generative Capabilities in Korean Tool-use Dialogs
di: Lee, Shinbok, et al.
Pubblicazione: (2024)
di: Lee, Shinbok, et al.
Pubblicazione: (2024)
Evaluating Interventional Reasoning Capabilities of Large Language Models
di: Kasetty, Tejas, et al.
Pubblicazione: (2024)
di: Kasetty, Tejas, et al.
Pubblicazione: (2024)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
di: Wong, Annie, et al.
Pubblicazione: (2025)
di: Wong, Annie, et al.
Pubblicazione: (2025)
Do Large Language Models Know What They Are Capable Of?
di: Barkan, Casey O., et al.
Pubblicazione: (2025)
di: Barkan, Casey O., et al.
Pubblicazione: (2025)
Exploring Large Language Models for Multimodal Sentiment Analysis: Challenges, Benchmarks, and Future Directions
di: Song, Shezheng
Pubblicazione: (2024)
di: Song, Shezheng
Pubblicazione: (2024)
On the Use of Large Language Models to Generate Capability Ontologies
di: da Silva, Luis Miguel Vieira, et al.
Pubblicazione: (2024)
di: da Silva, Luis Miguel Vieira, et al.
Pubblicazione: (2024)
Documenti analoghi
-
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
di: Li, Ce, et al.
Pubblicazione: (2025) -
A Multi-faceted Analysis of Cognitive Abilities: Evaluating Prompt Methods with Large Language Models on the CONSORT Checklist
di: Jeon, Sohyeon, et al.
Pubblicazione: (2025) -
Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024) -
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
di: Xu, Hainiu, et al.
Pubblicazione: (2024) -
Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
di: Pauli, Amalie Brogaard, et al.
Pubblicazione: (2024)