DIALECTBENCH: A NLP Benchmark for Dialects, Varieties, and Closely-Related Languages
Fuente:
arXiv
Saved in:
| Main Authors: | Faisal, Fahim, Ahia, Orevaoghene, Srivastava, Aarohi, Ahuja, Kabir, Chiang, David, Tsvetkov, Yulia, Anastasopoulos, Antonios |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Extracting Lexical Features from Dialects via Interpretable Dialect Classifiers
by: Xie, Roy, et al.
Published: (2024)
by: Xie, Roy, et al.
Published: (2024)
IDIOLEX: Unified and Continuous Representations for Idiolectal and Stylistic Variation
by: Kantharuban, Anjali, et al.
Published: (2026)
by: Kantharuban, Anjali, et al.
Published: (2026)
Data-Augmentation-Based Dialectal Adaptation for LLMs
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
Dialectal Toxicity Detection: Evaluating LLM-as-a-Judge Consistency Across Language Varieties
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
Speaking of Language: Reflections on Metalanguage Research in NLP
by: Schneider, Nathan, et al.
Published: (2026)
by: Schneider, Nathan, et al.
Published: (2026)
Dialect Matters: Cross-Lingual ASR Transfer for Low-Resource Indic Language Varieties
by: Dhasmana, Akriti, et al.
Published: (2026)
by: Dhasmana, Akriti, et al.
Published: (2026)
Voices Unheard: NLP Resources and Models for Yorùbá Regional Dialects
by: Ahia, Orevaoghene, et al.
Published: (2024)
by: Ahia, Orevaoghene, et al.
Published: (2024)
An Efficient Approach for Studying Cross-Lingual Transfer in Multilingual Language Models
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
by: Limisiewicz, Tomasz, et al.
Published: (2024)
by: Limisiewicz, Tomasz, et al.
Published: (2024)
We're Calling an Intervention: Exploring Fundamental Hurdles in Adapting Language Models to Nonstandard Text
by: Srivastava, Aarohi, et al.
Published: (2024)
by: Srivastava, Aarohi, et al.
Published: (2024)
BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning
by: Jang, Min, et al.
Published: (2026)
by: Jang, Min, et al.
Published: (2026)
Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole Detection
by: Ahuja, Kabir, et al.
Published: (2025)
by: Ahuja, Kabir, et al.
Published: (2025)
BLAB: Brutally Long Audio Bench
by: Ahia, Orevaoghene, et al.
Published: (2025)
by: Ahia, Orevaoghene, et al.
Published: (2025)
SaudiBERT: A Large Language Model Pretrained on Saudi Dialect Corpora
by: Qarah, Faisal
Published: (2024)
by: Qarah, Faisal
Published: (2024)
Dialect Normalization using Large Language Models and Morphological Rules
by: Dimakis, Antonios, et al.
Published: (2025)
by: Dimakis, Antonios, et al.
Published: (2025)
MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-Based Tokenization
by: Ahia, Orevaoghene, et al.
Published: (2024)
by: Ahia, Orevaoghene, et al.
Published: (2024)
PASS: Presentation Automation for Slide Generation and Speech
by: Aggarwal, Tushar, et al.
Published: (2025)
by: Aggarwal, Tushar, et al.
Published: (2025)
DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models
by: Altakrori, Malik H., et al.
Published: (2025)
by: Altakrori, Malik H., et al.
Published: (2025)
Tokenization and Representation Biases in Multilingual Models on Dialectal NLP Tasks
by: Kanjirangat, Vani, et al.
Published: (2025)
by: Kanjirangat, Vani, et al.
Published: (2025)
CODET: A Benchmark for Contrastive Dialectal Evaluation of Machine Translation
by: Alam, Md Mahfuz Ibn, et al.
Published: (2023)
by: Alam, Md Mahfuz Ibn, et al.
Published: (2023)
Can Language Models Solve Graph Problems in Natural Language?
by: Wang, Heng, et al.
Published: (2023)
by: Wang, Heng, et al.
Published: (2023)
Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting
by: Sclar, Melanie, et al.
Published: (2023)
by: Sclar, Melanie, et al.
Published: (2023)
FLEXITOKENS: Flexible Tokenization for Evolving Language Models
by: Owodunni, Abraham Toluwase, et al.
Published: (2025)
by: Owodunni, Abraham Toluwase, et al.
Published: (2025)
Birdie: Advancing State Space Models with Reward-Driven Objectives and Curricula
by: Blouir, Sam, et al.
Published: (2024)
by: Blouir, Sam, et al.
Published: (2024)
PrefDisco: Benchmarking Proactive Personalized Reasoning
by: Li, Shuyue Stella, et al.
Published: (2025)
by: Li, Shuyue Stella, et al.
Published: (2025)
Teaching LLMs to Abstain across Languages via Multilingual Feedback
by: Feng, Shangbin, et al.
Published: (2024)
by: Feng, Shangbin, et al.
Published: (2024)
MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
by: Li, Shuyue Stella, et al.
Published: (2024)
by: Li, Shuyue Stella, et al.
Published: (2024)
Knowledge Crosswords: Geometric Knowledge Reasoning with Large Language Models
by: Ding, Wenxuan, et al.
Published: (2023)
by: Ding, Wenxuan, et al.
Published: (2023)
Varying Shades of Wrong: Aligning LLMs with Wrong Answers Only
by: Yao, Jihan, et al.
Published: (2024)
by: Yao, Jihan, et al.
Published: (2024)
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
by: Jiang, Jiyue, et al.
Published: (2025)
by: Jiang, Jiyue, et al.
Published: (2025)
Benchmarking NLP-supported Language Sample Analysis for Swiss Children's Speech
by: Ryser, Anja, et al.
Published: (2025)
by: Ryser, Anja, et al.
Published: (2025)
LLM-Powered Automatic Translation and Urgency in Crisis Scenarios
by: Ticona, Belu, et al.
Published: (2026)
by: Ticona, Belu, et al.
Published: (2026)
Trajectory Anomaly Detection with Language Models
by: Mbuya, Jonathan, et al.
Published: (2024)
by: Mbuya, Jonathan, et al.
Published: (2024)
Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest
by: Wu, Addison J., et al.
Published: (2026)
by: Wu, Addison J., et al.
Published: (2026)
Connecting Ideas in 'Lower-Resource' Scenarios: NLP for National Varieties, Creoles and Other Low-resource Scenarios
by: Joshi, Aditya, et al.
Published: (2024)
by: Joshi, Aditya, et al.
Published: (2024)
Cognitive Foundations for Reasoning and Their Manifestation in LLMs
by: Kargupta, Priyanka, et al.
Published: (2025)
by: Kargupta, Priyanka, et al.
Published: (2025)
Low-Resource Dialect Adaptation of Large Language Models: A French Dialect Case-Study
by: Khan, Eeham, et al.
Published: (2025)
by: Khan, Eeham, et al.
Published: (2025)
Language and Speech Technology for Central Kurdish Varieties
by: Ahmadi, Sina, et al.
Published: (2024)
by: Ahmadi, Sina, et al.
Published: (2024)
Can LLMs Keep a Secret? Testing Privacy Implications of Language Models via Contextual Integrity Theory
by: Mireshghallah, Niloofar, et al.
Published: (2023)
by: Mireshghallah, Niloofar, et al.
Published: (2023)
Bridging the Language Gap: Dynamic Learning Strategies for Improving Multilingual Performance in LLMs
by: Kumar, Somnath, et al.
Published: (2023)
by: Kumar, Somnath, et al.
Published: (2023)
Similar Items
-
Extracting Lexical Features from Dialects via Interpretable Dialect Classifiers
by: Xie, Roy, et al.
Published: (2024) -
IDIOLEX: Unified and Continuous Representations for Idiolectal and Stylistic Variation
by: Kantharuban, Anjali, et al.
Published: (2026) -
Data-Augmentation-Based Dialectal Adaptation for LLMs
by: Faisal, Fahim, et al.
Published: (2024) -
Dialectal Toxicity Detection: Evaluating LLM-as-a-Judge Consistency Across Language Varieties
by: Faisal, Fahim, et al.
Published: (2024) -
Speaking of Language: Reflections on Metalanguage Research in NLP
by: Schneider, Nathan, et al.
Published: (2026)