PetroBench: A Benchmark for Large Language Models in Petroleum Engineering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xiang, Zhang, Tingting, Wang, Sen, Wu, Ying, Meng, Heng, Zhou, Peng, Li, Peng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
par: Zhou, Xiyuan, et autres
Publié: (2025)
par: Zhou, Xiyuan, et autres
Publié: (2025)
CogBench: A Large Language Model Benchmark for Multilingual Speech-Based Cognitive Impairment Assessment
par: Feng, Rui, et autres
Publié: (2025)
par: Feng, Rui, et autres
Publié: (2025)
SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition
par: Xu, Peiran, et autres
Publié: (2025)
par: Xu, Peiran, et autres
Publié: (2025)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
par: Yuan, Botai, et autres
Publié: (2025)
par: Yuan, Botai, et autres
Publié: (2025)
SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy
par: Xiao, Peiyao, et autres
Publié: (2026)
par: Xiao, Peiyao, et autres
Publié: (2026)
ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models
par: Wang, Yuhang, et autres
Publié: (2026)
par: Wang, Yuhang, et autres
Publié: (2026)
LoCoBench: A Benchmark for Long-Context Large Language Models in Complex Software Engineering
par: Qiu, Jielin, et autres
Publié: (2025)
par: Qiu, Jielin, et autres
Publié: (2025)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
par: Zhou, Chengfeng, et autres
Publié: (2025)
par: Zhou, Chengfeng, et autres
Publié: (2025)
BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting
par: Wang, Zhensheng, et autres
Publié: (2026)
par: Wang, Zhensheng, et autres
Publié: (2026)
SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth
par: Xing, Wenpeng, et autres
Publié: (2025)
par: Xing, Wenpeng, et autres
Publié: (2025)
DrafterBench: Benchmarking Large Language Models for Tasks Automation in Civil Engineering
par: Li, Yinsheng, et autres
Publié: (2025)
par: Li, Yinsheng, et autres
Publié: (2025)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
par: Yin, Wenjing, et autres
Publié: (2025)
par: Yin, Wenjing, et autres
Publié: (2025)
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
ItinBench: Benchmarking Planning Across Multiple Cognitive Dimensions with Large Language Models
par: Wang, Tianlong, et autres
Publié: (2026)
par: Wang, Tianlong, et autres
Publié: (2026)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
par: Zhou, Pengfei, et autres
Publié: (2025)
par: Zhou, Pengfei, et autres
Publié: (2025)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
par: LI, Yizhi, et autres
Publié: (2024)
par: LI, Yizhi, et autres
Publié: (2024)
Genshin: General Shield for Natural Language Processing with Large Language Models
par: Peng, Xiao, et autres
Publié: (2024)
par: Peng, Xiao, et autres
Publié: (2024)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
par: Wu, Yao, et autres
Publié: (2026)
par: Wu, Yao, et autres
Publié: (2026)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
par: Bao, Han, et autres
Publié: (2024)
par: Bao, Han, et autres
Publié: (2024)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
par: Zhu, Fengbin, et autres
Publié: (2024)
par: Zhu, Fengbin, et autres
Publié: (2024)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
par: Xiong, Zixin, et autres
Publié: (2026)
par: Xiong, Zixin, et autres
Publié: (2026)
ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing
par: Wang, Jinzhi, et autres
Publié: (2025)
par: Wang, Jinzhi, et autres
Publié: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
par: Shen, Yongliang, et autres
Publié: (2023)
par: Shen, Yongliang, et autres
Publié: (2023)
Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
par: Zheng, Yushuo, et autres
Publié: (2026)
par: Zheng, Yushuo, et autres
Publié: (2026)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
par: Tang, Zecheng, et autres
Publié: (2026)
par: Tang, Zecheng, et autres
Publié: (2026)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
par: Cao, Hongye, et autres
Publié: (2025)
par: Cao, Hongye, et autres
Publié: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering
par: Hu, Ruida, et autres
Publié: (2024)
par: Hu, Ruida, et autres
Publié: (2024)
ElecBench: a Power Dispatch Evaluation Benchmark for Large Language Models
par: Zhou, Xiyuan, et autres
Publié: (2024)
par: Zhou, Xiyuan, et autres
Publié: (2024)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
par: Zhang, Wenjing, et autres
Publié: (2024)
par: Zhang, Wenjing, et autres
Publié: (2024)
Does Unification Come at a Cost? Uni-SafeBench: A Safety Benchmark for Unified Multimodal Large Models
par: Peng, Zixiang, et autres
Publié: (2026)
par: Peng, Zixiang, et autres
Publié: (2026)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
par: Hu, He, et autres
Publié: (2025)
par: Hu, He, et autres
Publié: (2025)
MANGO: A Benchmark for Evaluating Mapping and Navigation Abilities of Large Language Models
par: Ding, Peng, et autres
Publié: (2024)
par: Ding, Peng, et autres
Publié: (2024)
Reflection-Bench: Evaluating Epistemic Agency in Large Language Models
par: Li, Lingyu, et autres
Publié: (2024)
par: Li, Lingyu, et autres
Publié: (2024)
CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics
par: Wang, Weida, et autres
Publié: (2025)
par: Wang, Weida, et autres
Publié: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
par: Zhuang, Wanru, et autres
Publié: (2025)
par: Zhuang, Wanru, et autres
Publié: (2025)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
par: Zhou, Yutong, et autres
Publié: (2024)
par: Zhou, Yutong, et autres
Publié: (2024)
Documents similaires
-
EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
par: Zhou, Xiyuan, et autres
Publié: (2025) -
CogBench: A Large Language Model Benchmark for Multilingual Speech-Based Cognitive Impairment Assessment
par: Feng, Rui, et autres
Publié: (2025) -
SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition
par: Xu, Peiran, et autres
Publié: (2025) -
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
par: Zhang, Junkai, et autres
Publié: (2025) -
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
par: Yuan, Botai, et autres
Publié: (2025)