BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge
Fuente:
arXiv
Saved in:
| Main Authors: | Kabir, Daeen, Mahim, Minhajur Rahman Chowdhury, Shafayat, Sheikh, Sadik, Adnan, Ahmed, Arian, Kim, Eunsu, Oh, Alice |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
by: Shafayat, Sheikh, et al.
Published: (2024)
by: Shafayat, Sheikh, et al.
Published: (2024)
Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore
by: Shafayat, Sheikh, et al.
Published: (2024)
by: Shafayat, Sheikh, et al.
Published: (2024)
CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean
by: Kim, Eunsu, et al.
Published: (2024)
by: Kim, Eunsu, et al.
Published: (2024)
Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents
by: Oh, Juhyun, et al.
Published: (2025)
by: Oh, Juhyun, et al.
Published: (2025)
From Facts to Folklore: Evaluating Large Language Models on Bengali Cultural Knowledge
by: Chowdhury, Nafis, et al.
Published: (2025)
by: Chowdhury, Nafis, et al.
Published: (2025)
GHTM: A Graph-based Hybrid Topic Modeling Approach with a Benchmark Dataset for the Low-Resource Bengali Language
by: Haque, Farhana, et al.
Published: (2025)
by: Haque, Farhana, et al.
Published: (2025)
Scaled and Inter-token Relation Enhanced Transformer for Sample-restricted Residential NILM
by: Rahman, Minhajur, et al.
Published: (2024)
by: Rahman, Minhajur, et al.
Published: (2024)
The Generative AI Paradox on Evaluation: What It Can Solve, It May Not Evaluate
by: Oh, Juhyun, et al.
Published: (2024)
by: Oh, Juhyun, et al.
Published: (2024)
A 2-step Framework for Automated Literary Translation Evaluation: Its Promises and Pitfalls
by: Shafayat, Sheikh, et al.
Published: (2024)
by: Shafayat, Sheikh, et al.
Published: (2024)
BNLI: A Linguistically-Refined Bengali Dataset for Natural Language Inference
by: Haque, Farah Binta, et al.
Published: (2025)
by: Haque, Farah Binta, et al.
Published: (2025)
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
by: Kim, Eunsu, et al.
Published: (2025)
by: Kim, Eunsu, et al.
Published: (2025)
RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity
by: Shin, Jisu, et al.
Published: (2025)
by: Shin, Jisu, et al.
Published: (2025)
Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generation
by: Shin, Jisu, et al.
Published: (2025)
by: Shin, Jisu, et al.
Published: (2025)
When Tom Eats Kimchi: Evaluating Cultural Bias of Multimodal Large Language Models in Cultural Mixture Contexts
by: Kim, Jun Seong, et al.
Published: (2025)
by: Kim, Jun Seong, et al.
Published: (2025)
LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluation
by: Kim, Eunsu, et al.
Published: (2024)
by: Kim, Eunsu, et al.
Published: (2024)
Bengali Fake Reviews: A Benchmark Dataset and Detection System
by: Shahariar, G. M., et al.
Published: (2023)
by: Shahariar, G. M., et al.
Published: (2023)
Tackling Fake News in Bengali: Unraveling the Impact of Summarization vs. Augmentation on Pre-trained Language Models
by: Chowdhury, Arman Sakif, et al.
Published: (2023)
by: Chowdhury, Arman Sakif, et al.
Published: (2023)
BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture
by: Ridoy, Shahriyar Zaman, et al.
Published: (2025)
by: Ridoy, Shahriyar Zaman, et al.
Published: (2025)
Uncovering Factor Level Preferences to Improve Human-Model Alignment
by: Oh, Juhyun, et al.
Published: (2024)
by: Oh, Juhyun, et al.
Published: (2024)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
by: Kabir, Mohsinul, et al.
Published: (2026)
by: Kabir, Mohsinul, et al.
Published: (2026)
BLEnD: A Benchmark for LLMs on Everyday Knowledge in Diverse Cultures and Languages
by: Myung, Junho, et al.
Published: (2024)
by: Myung, Junho, et al.
Published: (2024)
Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues
by: Kim, Eunsu, et al.
Published: (2025)
by: Kim, Eunsu, et al.
Published: (2025)
BeliN: A Novel Corpus for Bengali Religious News Headline Generation using Contextual Feature Fusion
by: Osama, Md, et al.
Published: (2025)
by: Osama, Md, et al.
Published: (2025)
LangBridge: Multilingual Reasoning Without Multilingual Supervision
by: Yoon, Dongkeun, et al.
Published: (2024)
by: Yoon, Dongkeun, et al.
Published: (2024)
Evaluating Subword Tokenization Techniques for Bengali: A Benchmark Study with BengaliBPE
by: Patwary, Firoj Ahmmed, et al.
Published: (2025)
by: Patwary, Firoj Ahmmed, et al.
Published: (2025)
Towards a Deeper Understanding of Transformer for Residential Non-intrusive Load Monitoring
by: Rahman, Minhajur, et al.
Published: (2024)
by: Rahman, Minhajur, et al.
Published: (2024)
Semantic Label Drift in Cross-Cultural Translation
by: Kabir, Mohsinul, et al.
Published: (2025)
by: Kabir, Mohsinul, et al.
Published: (2025)
IPA Transcription of Bengali Texts
by: Fatema, Kanij, et al.
Published: (2024)
by: Fatema, Kanij, et al.
Published: (2024)
LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control
by: Jeong, Seogyeong, et al.
Published: (2026)
by: Jeong, Seogyeong, et al.
Published: (2026)
MUG-Eval: A Proxy Evaluation Framework for Multilingual Generation Capabilities in Any Language
by: Song, Seyoung, et al.
Published: (2025)
by: Song, Seyoung, et al.
Published: (2025)
BenLLMEval: A Comprehensive Evaluation into the Potentials and Pitfalls of Large Language Models on Bengali NLP
by: Kabir, Mohsinul, et al.
Published: (2023)
by: Kabir, Mohsinul, et al.
Published: (2023)
Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation
by: Singh, Shivalika, et al.
Published: (2024)
by: Singh, Shivalika, et al.
Published: (2024)
Automatic Speech Recognition for Biomedical Data in Bengali Language
by: Kabir, Shariar, et al.
Published: (2024)
by: Kabir, Shariar, et al.
Published: (2024)
KoBALT: Korean Benchmark For Advanced Linguistic Tasks
by: Shin, Hyopil, et al.
Published: (2025)
by: Shin, Hyopil, et al.
Published: (2025)
Transformer-Based Low-Resource Language Translation: A Study on Standard Bengali to Sylheti
by: Oni, Mangsura Kabir, et al.
Published: (2025)
by: Oni, Mangsura Kabir, et al.
Published: (2025)
BengaliFig: A Low-Resource Challenge for Figurative and Culturally Grounded Reasoning in Bengali
by: Sefat, Abdullah Al
Published: (2025)
by: Sefat, Abdullah Al
Published: (2025)
A Novel Word Pair-based Gaussian Sentence Similarity Algorithm For Bengali Extractive Text Summarization
by: Morshed, Fahim, et al.
Published: (2024)
by: Morshed, Fahim, et al.
Published: (2024)
Optical Text Recognition in Nepali and Bengali: A Transformer-based Approach
by: Hasan, S M Rakib, et al.
Published: (2024)
by: Hasan, S M Rakib, et al.
Published: (2024)
CULEMO: Cultural Lenses on Emotion -- Benchmarking LLMs for Cross-Cultural Emotion Understanding
by: Belay, Tadesse Destaw, et al.
Published: (2025)
by: Belay, Tadesse Destaw, et al.
Published: (2025)
Harnessing Large Language Models Over Transformer Models for Detecting Bengali Depressive Social Media Text: A Comprehensive Study
by: Chowdhury, Ahmadul Karim, et al.
Published: (2024)
by: Chowdhury, Ahmadul Karim, et al.
Published: (2024)
Similar Items
-
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
by: Shafayat, Sheikh, et al.
Published: (2024) -
Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore
by: Shafayat, Sheikh, et al.
Published: (2024) -
CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean
by: Kim, Eunsu, et al.
Published: (2024) -
Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents
by: Oh, Juhyun, et al.
Published: (2025) -
From Facts to Folklore: Evaluating Large Language Models on Bengali Cultural Knowledge
by: Chowdhury, Nafis, et al.
Published: (2025)