BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
Fuente:
arXiv
Saved in:
| Main Authors: | Shafayat, Sheikh, Hasan, H M Quamran, Mahim, Minhajur Rahman Chowdhury, Putri, Rifki Afina, Thorne, James, Oh, Alice |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge
by: Kabir, Daeen, et al.
Published: (2025)
by: Kabir, Daeen, et al.
Published: (2025)
Adapting Language Models to Indonesian Local Languages: An Empirical Study of Language Transferability on Zero-Shot Settings
by: Putri, Rifki Afina
Published: (2025)
by: Putri, Rifki Afina
Published: (2025)
Can LLM Generate Culturally Relevant Commonsense QA Data? Case Study in Indonesian and Sundanese
by: Putri, Rifki Afina, et al.
Published: (2024)
by: Putri, Rifki Afina, et al.
Published: (2024)
JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors
by: Jin, Jiho, et al.
Published: (2026)
by: Jin, Jiho, et al.
Published: (2026)
Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore
by: Shafayat, Sheikh, et al.
Published: (2024)
by: Shafayat, Sheikh, et al.
Published: (2024)
RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering
by: Hudspeth, Marisa, et al.
Published: (2026)
by: Hudspeth, Marisa, et al.
Published: (2026)
DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards
by: Kartha, Aaryaman, et al.
Published: (2025)
by: Kartha, Aaryaman, et al.
Published: (2025)
BanglaQuAD: A Bengali Open-domain Question Answering Dataset
by: Rony, Md Rashad Al Hasan, et al.
Published: (2024)
by: Rony, Md Rashad Al Hasan, et al.
Published: (2024)
Context Filtering with Reward Modeling in Question Answering
by: Kim, Sangryul, et al.
Published: (2024)
by: Kim, Sangryul, et al.
Published: (2024)
CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic
by: Chen, Jing, et al.
Published: (2026)
by: Chen, Jing, et al.
Published: (2026)
Scaled and Inter-token Relation Enhanced Transformer for Sample-restricted Residential NILM
by: Rahman, Minhajur, et al.
Published: (2024)
by: Rahman, Minhajur, et al.
Published: (2024)
Towards a Deeper Understanding of Transformer for Residential Non-intrusive Load Monitoring
by: Rahman, Minhajur, et al.
Published: (2024)
by: Rahman, Minhajur, et al.
Published: (2024)
KoBBQ: Korean Bias Benchmark for Question Answering
by: Jin, Jiho, et al.
Published: (2023)
by: Jin, Jiho, et al.
Published: (2023)
ClimaQA_SLO - Slovenian Climate Question-Answering Benchmark
by: Ferk Ovčjak, Monika, et al.
Published: (2025)
by: Ferk Ovčjak, Monika, et al.
Published: (2025)
GRS-QA -- Graph Reasoning-Structured Question Answering Dataset
by: Pahilajani, Anish, et al.
Published: (2024)
by: Pahilajani, Anish, et al.
Published: (2024)
DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes
by: Park, Yohan, et al.
Published: (2025)
by: Park, Yohan, et al.
Published: (2025)
DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management
by: Chen, Zhitong, et al.
Published: (2026)
by: Chen, Zhitong, et al.
Published: (2026)
Bangla-Bayanno: A 52K-Pair Bengali Visual Question Answering Dataset with LLM-Assisted Translation Refinement
by: Hasan, Mohammed Rakibul, et al.
Published: (2025)
by: Hasan, Mohammed Rakibul, et al.
Published: (2025)
LingoQA: Visual Question Answering for Autonomous Driving
by: Marcu, Ana-Maria, et al.
Published: (2023)
by: Marcu, Ana-Maria, et al.
Published: (2023)
HCT-QA: A Benchmark for Question Answering on Human-Centric Tables
by: Ahmad, Mohammad S., et al.
Published: (2025)
by: Ahmad, Mohammad S., et al.
Published: (2025)
ASTRA-QA: A Benchmark for Abstract Question Answering over Documents
by: Wang, Shu, et al.
Published: (2026)
by: Wang, Shu, et al.
Published: (2026)
SensorQA: A Question Answering Benchmark for Daily-Life Monitoring
by: Reichman, Benjamin, et al.
Published: (2025)
by: Reichman, Benjamin, et al.
Published: (2025)
MedExQA: Medical Question Answering Benchmark with Multiple Explanations
by: Kim, Yunsoo, et al.
Published: (2024)
by: Kim, Yunsoo, et al.
Published: (2024)
A 2-step Framework for Automated Literary Translation Evaluation: Its Promises and Pitfalls
by: Shafayat, Sheikh, et al.
Published: (2024)
by: Shafayat, Sheikh, et al.
Published: (2024)
ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios
by: Pan, Changzai, et al.
Published: (2026)
by: Pan, Changzai, et al.
Published: (2026)
ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
by: Zhang, Yindong, et al.
Published: (2026)
by: Zhang, Yindong, et al.
Published: (2026)
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
by: Quan, Yinzhu, et al.
Published: (2024)
by: Quan, Yinzhu, et al.
Published: (2024)
BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture
by: Ridoy, Shahriyar Zaman, et al.
Published: (2025)
by: Ridoy, Shahriyar Zaman, et al.
Published: (2025)
Reason2Decide: Rationale-Driven Multi-Task Learning
by: Hasan, H M Quamran, et al.
Published: (2025)
by: Hasan, H M Quamran, et al.
Published: (2025)
EMG Signal Classification for Neuromuscular Disorders with Attention-Enhanced CNN
by: Rahman, Md. Toufiqur, et al.
Published: (2023)
by: Rahman, Md. Toufiqur, et al.
Published: (2023)
MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering
by: Bahaj, Adil, et al.
Published: (2025)
by: Bahaj, Adil, et al.
Published: (2025)
NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens
by: Wang, Cunxiang, et al.
Published: (2024)
by: Wang, Cunxiang, et al.
Published: (2024)
CondAmbigQA: A Benchmark and Dataset for Conditional Ambiguous Question Answering
by: Li, Zongxi, et al.
Published: (2025)
by: Li, Zongxi, et al.
Published: (2025)
AmharicStoryQA: A Multicultural Story Question Answering Benchmark in Amharic
by: Azime, Israel Abebe, et al.
Published: (2026)
by: Azime, Israel Abebe, et al.
Published: (2026)
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
by: Xie, Tianchi, et al.
Published: (2025)
by: Xie, Tianchi, et al.
Published: (2025)
LaMP-QA: A Benchmark for Personalized Long-form Question Answering
by: Salemi, Alireza, et al.
Published: (2025)
by: Salemi, Alireza, et al.
Published: (2025)
PolQA: Polish Question Answering Dataset
by: Rybak, Piotr, et al.
Published: (2022)
by: Rybak, Piotr, et al.
Published: (2022)
VoQA: Visual-only Question Answering
by: An, Jianing, et al.
Published: (2025)
by: An, Jianing, et al.
Published: (2025)
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
by: Alonso, Iñigo, et al.
Published: (2024)
by: Alonso, Iñigo, et al.
Published: (2024)
FairMedQA: Benchmarking Bias in Large Language Models for Medical Question Answering
by: Xiao, Ying, et al.
Published: (2025)
by: Xiao, Ying, et al.
Published: (2025)
Similar Items
-
BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge
by: Kabir, Daeen, et al.
Published: (2025) -
Adapting Language Models to Indonesian Local Languages: An Empirical Study of Language Transferability on Zero-Shot Settings
by: Putri, Rifki Afina
Published: (2025) -
Can LLM Generate Culturally Relevant Commonsense QA Data? Case Study in Indonesian and Sundanese
by: Putri, Rifki Afina, et al.
Published: (2024) -
JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors
by: Jin, Jiho, et al.
Published: (2026) -
Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore
by: Shafayat, Sheikh, et al.
Published: (2024)