WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Yongan, Hu, Qingchen, Du, Xianda, Wang, Jiayin, Mo, Fengran, Sieber, Renee |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
WeatherArchive-Bench: Benchmarking Retrieval-Augmented Reasoning for Historical Weather Archives
por: Yu, Yongan, et al.
Publicado: (2025)
por: Yu, Yongan, et al.
Publicado: (2025)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
por: Liu, Zheyuan, et al.
Publicado: (2026)
por: Liu, Zheyuan, et al.
Publicado: (2026)
A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models
por: Wang, Jiayin, et al.
Publicado: (2024)
por: Wang, Jiayin, et al.
Publicado: (2024)
Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models
por: Zhang, Shuo, et al.
Publicado: (2025)
por: Zhang, Shuo, et al.
Publicado: (2025)
FedCoT: Communication-Efficient Federated Reasoning Enhancement for Large Language Models
por: Li, Chuan, et al.
Publicado: (2025)
por: Li, Chuan, et al.
Publicado: (2025)
Multilingual Collaborative Defense for Large Language Models
por: Li, Hongliang, et al.
Publicado: (2025)
por: Li, Hongliang, et al.
Publicado: (2025)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
por: Zhang, Yazhou, et al.
Publicado: (2024)
por: Zhang, Yazhou, et al.
Publicado: (2024)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
por: Toraman, Çağrı, et al.
Publicado: (2026)
por: Toraman, Çağrı, et al.
Publicado: (2026)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
por: Liu, Ziqiang, et al.
Publicado: (2024)
por: Liu, Ziqiang, et al.
Publicado: (2024)
THiNK: Can Large Language Models Think-aloud?
por: Yu, Yongan, et al.
Publicado: (2025)
por: Yu, Yongan, et al.
Publicado: (2025)
SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth
por: Xing, Wenpeng, et al.
Publicado: (2025)
por: Xing, Wenpeng, et al.
Publicado: (2025)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
por: Zheng, Yu, et al.
Publicado: (2025)
por: Zheng, Yu, et al.
Publicado: (2025)
Learning to Route Queries to Heads for Attention-based Re-ranking with Large Language Models
por: Tian, Yuxing, et al.
Publicado: (2026)
por: Tian, Yuxing, et al.
Publicado: (2026)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
por: Du, Mengfei, et al.
Publicado: (2024)
por: Du, Mengfei, et al.
Publicado: (2024)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
por: Wu, Yao, et al.
Publicado: (2026)
por: Wu, Yao, et al.
Publicado: (2026)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
por: Hu, He, et al.
Publicado: (2025)
por: Hu, He, et al.
Publicado: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
por: Cui, Justin, et al.
Publicado: (2024)
por: Cui, Justin, et al.
Publicado: (2024)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
por: Zhou, Chengfeng, et al.
Publicado: (2025)
por: Zhou, Chengfeng, et al.
Publicado: (2025)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
por: Lee, Jaeho, et al.
Publicado: (2025)
por: Lee, Jaeho, et al.
Publicado: (2025)
InFoBench: Evaluating Instruction Following Ability in Large Language Models
por: Qin, Yiwei, et al.
Publicado: (2024)
por: Qin, Yiwei, et al.
Publicado: (2024)
PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology
por: Zhao, Yimin, et al.
Publicado: (2026)
por: Zhao, Yimin, et al.
Publicado: (2026)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
por: LI, Yizhi, et al.
Publicado: (2024)
por: LI, Yizhi, et al.
Publicado: (2024)
LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression
por: Kundu, Souvik, et al.
Publicado: (2025)
por: Kundu, Souvik, et al.
Publicado: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
por: Shen, Yongliang, et al.
Publicado: (2023)
por: Shen, Yongliang, et al.
Publicado: (2023)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
por: Liu, Mianxin, et al.
Publicado: (2024)
por: Liu, Mianxin, et al.
Publicado: (2024)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
por: Chung, Tsz Ting, et al.
Publicado: (2025)
por: Chung, Tsz Ting, et al.
Publicado: (2025)
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
por: Lai, Peichao, et al.
Publicado: (2025)
por: Lai, Peichao, et al.
Publicado: (2025)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
por: Yang, Shuo, et al.
Publicado: (2025)
por: Yang, Shuo, et al.
Publicado: (2025)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
por: Xiong, Zixin, et al.
Publicado: (2026)
por: Xiong, Zixin, et al.
Publicado: (2026)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
por: Li, Lijun, et al.
Publicado: (2024)
por: Li, Lijun, et al.
Publicado: (2024)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
por: Zhu, Jie, et al.
Publicado: (2024)
por: Zhu, Jie, et al.
Publicado: (2024)
StakeBench: Evaluating Language Understanding Grounded in Market Commitment
por: Pei, Yunhua, et al.
Publicado: (2026)
por: Pei, Yunhua, et al.
Publicado: (2026)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
por: Feng, Jie, et al.
Publicado: (2024)
por: Feng, Jie, et al.
Publicado: (2024)
UGMathBench: A Diverse and Dynamic Benchmark for Undergraduate-Level Mathematical Reasoning with Large Language Models
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
IrokoBench: A New Benchmark for African Languages in the Age of Large Language Models
por: Adelani, David Ifeoluwa, et al.
Publicado: (2024)
por: Adelani, David Ifeoluwa, et al.
Publicado: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
por: Bai, Ge, et al.
Publicado: (2024)
por: Bai, Ge, et al.
Publicado: (2024)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
por: Zong, Xuanjun, et al.
Publicado: (2025)
por: Zong, Xuanjun, et al.
Publicado: (2025)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
por: Sabour, Sahand, et al.
Publicado: (2024)
por: Sabour, Sahand, et al.
Publicado: (2024)
ConsintBench: Evaluating Language Models on Real-World Consumer Intent Understanding
por: Li, Xiaozhe, et al.
Publicado: (2025)
por: Li, Xiaozhe, et al.
Publicado: (2025)
Ejemplares similares
-
WeatherArchive-Bench: Benchmarking Retrieval-Augmented Reasoning for Historical Weather Archives
por: Yu, Yongan, et al.
Publicado: (2025) -
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
por: Liu, Zheyuan, et al.
Publicado: (2026) -
A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models
por: Wang, Jiayin, et al.
Publicado: (2024) -
Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models
por: Zhang, Shuo, et al.
Publicado: (2025) -
FedCoT: Communication-Efficient Federated Reasoning Enhancement for Large Language Models
por: Li, Chuan, et al.
Publicado: (2025)