AtmosSci-Bench: Evaluating the Recent Advance of Large Language Model for Atmospheric Science
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Chenyue, Deng, Wen, Lu, Mengqian, Yuan, Binhang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
On the Opportunities of (Re)-Exploring Atmospheric Science by Foundation Models: A Case Study
by: Zhang, Lujia, et al.
Published: (2024)
by: Zhang, Lujia, et al.
Published: (2024)
CLIMATEAGENT: Multi-Agent Orchestration for Complex Climate Data Science Workflows
by: Kim, Hyeonjae, et al.
Published: (2025)
by: Kim, Hyeonjae, et al.
Published: (2025)
SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond
by: Zhu, Xiangyang, et al.
Published: (2026)
by: Zhu, Xiangyang, et al.
Published: (2026)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
by: Wang, Xiaoxuan, et al.
Published: (2023)
by: Wang, Xiaoxuan, et al.
Published: (2023)
DataSciBench: An LLM Agent Benchmark for Data Science
by: Zhang, Dan, et al.
Published: (2025)
by: Zhang, Dan, et al.
Published: (2025)
CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics
by: Wang, Weida, et al.
Published: (2025)
by: Wang, Weida, et al.
Published: (2025)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
by: Feng, Jie, et al.
Published: (2024)
by: Feng, Jie, et al.
Published: (2024)
StyleBench: Evaluating thinking styles in Large Language Models
by: Guo, Junyu, et al.
Published: (2025)
by: Guo, Junyu, et al.
Published: (2025)
S2SServiceBench: A Multimodal Benchmark for Last-Mile S2S Climate Services
by: Li, Chenyue, et al.
Published: (2026)
by: Li, Chenyue, et al.
Published: (2026)
PromptBench: A Unified Library for Evaluation of Large Language Models
by: Zhu, Kaijie, et al.
Published: (2023)
by: Zhu, Kaijie, et al.
Published: (2023)
Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation
by: Chen, Simin, et al.
Published: (2025)
by: Chen, Simin, et al.
Published: (2025)
Recent Advances in Predictive Modeling with Electronic Health Records
by: Wang, Jiaqi, et al.
Published: (2024)
by: Wang, Jiaqi, et al.
Published: (2024)
ChessQA: Evaluating Large Language Models for Chess Understanding
by: Wen, Qianfeng, et al.
Published: (2025)
by: Wen, Qianfeng, et al.
Published: (2025)
Recent Advances in Generative AI and Large Language Models: Current Status, Challenges, and Perspectives
by: Hagos, Desta Haileselassie, et al.
Published: (2024)
by: Hagos, Desta Haileselassie, et al.
Published: (2024)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
by: Song, Xiaoshuai, et al.
Published: (2024)
by: Song, Xiaoshuai, et al.
Published: (2024)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
by: Lee, Jaeho, et al.
Published: (2025)
by: Lee, Jaeho, et al.
Published: (2025)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
by: Srivastava, Gaurav, et al.
Published: (2025)
by: Srivastava, Gaurav, et al.
Published: (2025)
CORM: Cache Optimization with Recent Message for Large Language Model Inference
by: Dai, Jincheng, et al.
Published: (2024)
by: Dai, Jincheng, et al.
Published: (2024)
EscapeBench: Towards Advancing Creative Intelligence of Language Model Agents
by: Qian, Cheng, et al.
Published: (2024)
by: Qian, Cheng, et al.
Published: (2024)
PalmBench: A Comprehensive Benchmark of Compressed Large Language Models on Mobile Platforms
by: Li, Yilong, et al.
Published: (2024)
by: Li, Yilong, et al.
Published: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
by: Liu, Xiao, et al.
Published: (2023)
by: Liu, Xiao, et al.
Published: (2023)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
by: Sharma, Aman, et al.
Published: (2026)
by: Sharma, Aman, et al.
Published: (2026)
TutorBench: A Benchmark To Assess Tutoring Capabilities Of Large Language Models
by: Srinivasa, Rakshith S, et al.
Published: (2025)
by: Srinivasa, Rakshith S, et al.
Published: (2025)
GWT: Scalable Optimizer State Compression for Large Language Model Training
by: Wen, Ziqing, et al.
Published: (2025)
by: Wen, Ziqing, et al.
Published: (2025)
Graph Prompting for Graph Learning Models: Recent Advances and Future Directions
by: Fu, Xingbo, et al.
Published: (2025)
by: Fu, Xingbo, et al.
Published: (2025)
PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
by: Sehwag, Udari Madhushani, et al.
Published: (2025)
by: Sehwag, Udari Madhushani, et al.
Published: (2025)
CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
by: Ma, Mingyu Derek, et al.
Published: (2024)
by: Ma, Mingyu Derek, et al.
Published: (2024)
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
by: Fu, Wei, et al.
Published: (2025)
by: Fu, Wei, et al.
Published: (2025)
Advancing Generative Artificial Intelligence and Large Language Models for Demand Side Management with Internet of Electric Vehicles
by: Zhang, Hanwen, et al.
Published: (2025)
by: Zhang, Hanwen, et al.
Published: (2025)
The Structural Scalpel: Automated Contiguous Layer Pruning for Large Language Models
by: Lu, Yao, et al.
Published: (2025)
by: Lu, Yao, et al.
Published: (2025)
REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model
by: Li, Bo, et al.
Published: (2025)
by: Li, Bo, et al.
Published: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
by: Guo, Jiawei, et al.
Published: (2024)
by: Guo, Jiawei, et al.
Published: (2024)
MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation
by: Huang, Qian, et al.
Published: (2023)
by: Huang, Qian, et al.
Published: (2023)
Mars-Bench: A Benchmark for Evaluating Foundation Models for Mars Science Tasks
by: Purohit, Mirali, et al.
Published: (2025)
by: Purohit, Mirali, et al.
Published: (2025)
Effectiveness Assessment of Recent Large Vision-Language Models
by: Jiang, Yao, et al.
Published: (2024)
by: Jiang, Yao, et al.
Published: (2024)
AfroBench: How Good are Large Language Models on African Languages?
by: Ojo, Jessica, et al.
Published: (2023)
by: Ojo, Jessica, et al.
Published: (2023)
FEVO: Financial Knowledge Expansion and Reasoning Evolution for Large Language Models
by: Pang, Bo, et al.
Published: (2025)
by: Pang, Bo, et al.
Published: (2025)
Recent Advances in Generative AI for Healthcare Applications
by: Shokrollahi, Yasin, et al.
Published: (2023)
by: Shokrollahi, Yasin, et al.
Published: (2023)
Art and Science of Quantizing Large-Scale Models: A Comprehensive Overview
by: Wang, Yanshu, et al.
Published: (2024)
by: Wang, Yanshu, et al.
Published: (2024)
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
by: Zhao, Yujie, et al.
Published: (2026)
by: Zhao, Yujie, et al.
Published: (2026)
Similar Items
-
On the Opportunities of (Re)-Exploring Atmospheric Science by Foundation Models: A Case Study
by: Zhang, Lujia, et al.
Published: (2024) -
CLIMATEAGENT: Multi-Agent Orchestration for Complex Climate Data Science Workflows
by: Kim, Hyeonjae, et al.
Published: (2025) -
SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond
by: Zhu, Xiangyang, et al.
Published: (2026) -
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
by: Wang, Xiaoxuan, et al.
Published: (2023) -
DataSciBench: An LLM Agent Benchmark for Data Science
by: Zhang, Dan, et al.
Published: (2025)