ClimaQA: An Automated Evaluation Framework for Climate Question Answering Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Manivannan, Veeramakali Vignesh, Jafari, Yasaman, Eranky, Srikar, Ho, Spencer, Yu, Rose, Watson-Parris, Duncan, Ma, Yian, Bergen, Leon, Berg-Kirkpatrick, Taylor |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Zephyrus: An Agentic Framework for Weather Science
di: Varambally, Sumanth, et al.
Pubblicazione: (2025)
di: Varambally, Sumanth, et al.
Pubblicazione: (2025)
Adapting While Learning: Grounding LLMs for Scientific Problems with Intelligent Tool Usage Adaptation
di: Lyu, Bohan, et al.
Pubblicazione: (2024)
di: Lyu, Bohan, et al.
Pubblicazione: (2024)
Studying the Soupability of Documents in State Space Models
di: Jafari, Yasaman, et al.
Pubblicazione: (2025)
di: Jafari, Yasaman, et al.
Pubblicazione: (2025)
MORL-Prompt: An Empirical Analysis of Multi-Objective Reinforcement Learning for Discrete Prompt Optimization
di: Jafari, Yasaman, et al.
Pubblicazione: (2024)
di: Jafari, Yasaman, et al.
Pubblicazione: (2024)
ClimaQA_SLO - Slovenian Climate Question-Answering Benchmark
di: Ferk Ovčjak, Monika, et al.
Pubblicazione: (2025)
di: Ferk Ovčjak, Monika, et al.
Pubblicazione: (2025)
Single-Pass Document Scanning for Question Answering
di: Cao, Weili, et al.
Pubblicazione: (2025)
di: Cao, Weili, et al.
Pubblicazione: (2025)
U-Cast: A Surprisingly Simple and Efficient Frontier Probabilistic AI Weather Forecaster
di: Cachay, Salva Rühling, et al.
Pubblicazione: (2026)
di: Cachay, Salva Rühling, et al.
Pubblicazione: (2026)
Exploring Randomly Wired Neural Networks for Climate Model Emulation
di: Yik, William, et al.
Pubblicazione: (2022)
di: Yik, William, et al.
Pubblicazione: (2022)
WaveSim: A Wavelet-based Multi-scale Similarity Metric for Weather and Climate Fields
di: Accarino, Gabriele, et al.
Pubblicazione: (2025)
di: Accarino, Gabriele, et al.
Pubblicazione: (2025)
FaIRGP: A Bayesian Energy Balance Model for Surface Temperatures Emulation
di: Bouabid, Shahine, et al.
Pubblicazione: (2023)
di: Bouabid, Shahine, et al.
Pubblicazione: (2023)
Discovering Latent Causal Graphs from Spatiotemporal Data
di: Wang, Kun, et al.
Pubblicazione: (2024)
di: Wang, Kun, et al.
Pubblicazione: (2024)
PolQA: Polish Question Answering Dataset
di: Rybak, Piotr, et al.
Pubblicazione: (2022)
di: Rybak, Piotr, et al.
Pubblicazione: (2022)
VoQA: Visual-only Question Answering
di: An, Jianing, et al.
Pubblicazione: (2025)
di: An, Jianing, et al.
Pubblicazione: (2025)
Are you really listening? Boosting Perceptual Awareness in Music-QA Benchmarks
di: Zang, Yongyi, et al.
Pubblicazione: (2025)
di: Zang, Yongyi, et al.
Pubblicazione: (2025)
Multi-Fidelity Residual Neural Processes for Scalable Surrogate Modeling
di: Niu, Ruijia, et al.
Pubblicazione: (2024)
di: Niu, Ruijia, et al.
Pubblicazione: (2024)
The impact of internal variability on benchmarking deep learning climate emulators
di: Lütjens, Björn, et al.
Pubblicazione: (2024)
di: Lütjens, Björn, et al.
Pubblicazione: (2024)
Readability $\ne$ Learnability: Rethinking the Role of Simplicity in Training Small Language Models
di: Lee, Ivan, et al.
Pubblicazione: (2025)
di: Lee, Ivan, et al.
Pubblicazione: (2025)
Dynamic-KGQA: A Scalable Framework for Generating Adaptive Question Answering Datasets
di: Dammu, Preetam Prabhu Srikar, et al.
Pubblicazione: (2025)
di: Dammu, Preetam Prabhu Srikar, et al.
Pubblicazione: (2025)
EmotionCaps: Enhancing Audio Captioning Through Emotion-Augmented Data Generation
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)
LingoQA: Visual Question Answering for Autonomous Driving
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)
Answering Questions in Stages: Prompt Chaining for Contract QA
di: Roegiest, Adam, et al.
Pubblicazione: (2024)
di: Roegiest, Adam, et al.
Pubblicazione: (2024)
DebateQA: Evaluating Question Answering on Debatable Knowledge
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
FoQA: A Faroese Question-Answering Dataset
di: Simonsen, Annika, et al.
Pubblicazione: (2025)
di: Simonsen, Annika, et al.
Pubblicazione: (2025)
MMToM-QA: Multimodal Theory of Mind Question Answering
di: Jin, Chuanyang, et al.
Pubblicazione: (2024)
di: Jin, Chuanyang, et al.
Pubblicazione: (2024)
SyllabusQA: A Course Logistics Question Answering Dataset
di: Fernandez, Nigel, et al.
Pubblicazione: (2024)
di: Fernandez, Nigel, et al.
Pubblicazione: (2024)
M2QA: Multi-domain Multilingual Question Answering
di: Engländer, Leon, et al.
Pubblicazione: (2024)
di: Engländer, Leon, et al.
Pubblicazione: (2024)
GRS-QA -- Graph Reasoning-Structured Question Answering Dataset
di: Pahilajani, Anish, et al.
Pubblicazione: (2024)
di: Pahilajani, Anish, et al.
Pubblicazione: (2024)
Memory-QA: Answering Recall Questions Based on Multimodal Memories
di: Jiang, Hongda, et al.
Pubblicazione: (2025)
di: Jiang, Hongda, et al.
Pubblicazione: (2025)
ArabicaQA: A Comprehensive Dataset for Arabic Question Answering
di: Abdallah, Abdelrahman, et al.
Pubblicazione: (2024)
di: Abdallah, Abdelrahman, et al.
Pubblicazione: (2024)
Adversarial Question Answering Robustness: A Multi-Level Error Analysis and Mitigation Study
di: Choudhury, Agniv Roy, et al.
Pubblicazione: (2026)
di: Choudhury, Agniv Roy, et al.
Pubblicazione: (2026)
pdfQA: Diverse, Challenging, and Realistic Question Answering over PDFs
di: Schimanski, Tobias, et al.
Pubblicazione: (2026)
di: Schimanski, Tobias, et al.
Pubblicazione: (2026)
RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering
di: Hudspeth, Marisa, et al.
Pubblicazione: (2026)
di: Hudspeth, Marisa, et al.
Pubblicazione: (2026)
DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards
di: Kartha, Aaryaman, et al.
Pubblicazione: (2025)
di: Kartha, Aaryaman, et al.
Pubblicazione: (2025)
HCT-QA: A Benchmark for Question Answering on Human-Centric Tables
di: Ahmad, Mohammad S., et al.
Pubblicazione: (2025)
di: Ahmad, Mohammad S., et al.
Pubblicazione: (2025)
HistoryBankQA: Multilingual Temporal Question Answering on Historical Events
di: Mandal, Biswadip, et al.
Pubblicazione: (2025)
di: Mandal, Biswadip, et al.
Pubblicazione: (2025)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
di: Koh, Junyoung, et al.
Pubblicazione: (2025)
di: Koh, Junyoung, et al.
Pubblicazione: (2025)
MapQA: Open-domain Geospatial Question Answering on Map Data
di: Li, Zekun, et al.
Pubblicazione: (2025)
di: Li, Zekun, et al.
Pubblicazione: (2025)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
di: Guo, Jiangyuan, et al.
Pubblicazione: (2024)
di: Guo, Jiangyuan, et al.
Pubblicazione: (2024)
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
di: Shafayat, Sheikh, et al.
Pubblicazione: (2024)
di: Shafayat, Sheikh, et al.
Pubblicazione: (2024)
NeoQA: Evidence-based Question Answering with Generated News Events
di: Glockner, Max, et al.
Pubblicazione: (2025)
di: Glockner, Max, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Zephyrus: An Agentic Framework for Weather Science
di: Varambally, Sumanth, et al.
Pubblicazione: (2025) -
Adapting While Learning: Grounding LLMs for Scientific Problems with Intelligent Tool Usage Adaptation
di: Lyu, Bohan, et al.
Pubblicazione: (2024) -
Studying the Soupability of Documents in State Space Models
di: Jafari, Yasaman, et al.
Pubblicazione: (2025) -
MORL-Prompt: An Empirical Analysis of Multi-Objective Reinforcement Learning for Discrete Prompt Optimization
di: Jafari, Yasaman, et al.
Pubblicazione: (2024) -
ClimaQA_SLO - Slovenian Climate Question-Answering Benchmark
di: Ferk Ovčjak, Monika, et al.
Pubblicazione: (2025)