Efficiently Identifying Low-Quality Language Subsets in Multilingual Datasets: A Case Study on a Large-Scale Multilingual Audio Dataset
Fuente:
arXiv
Saved in:
| Main Authors: | Samir, Farhan, Ahn, Emily P., Prakash, Shreya, Soskuthy, Márton, Shwartz, Vered, Zhu, Jian |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Locating Information Gaps and Narrative Inconsistencies Across Languages: A Case Study of LGBT People Portrayals on Wikipedia
by: Samir, Farhan, et al.
Published: (2024)
by: Samir, Farhan, et al.
Published: (2024)
WikiGap: Promoting Epistemic Equity by Surfacing Knowledge Gaps Between English Wikipedia and other Language Editions
by: Wang, Zining, et al.
Published: (2025)
by: Wang, Zining, et al.
Published: (2025)
Is It Bad to Work All the Time? Cross-Cultural Evaluation of Social Norm Biases in GPT-4
by: Liu, Zhuozhuo Joy, et al.
Published: (2025)
by: Liu, Zhuozhuo Joy, et al.
Published: (2025)
HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
by: Abdaljalil, Samir, et al.
Published: (2025)
by: Abdaljalil, Samir, et al.
Published: (2025)
SIFT-50M: A Large-Scale Multilingual Dataset for Speech Instruction Fine-Tuning
by: Pandey, Prabhat, et al.
Published: (2025)
by: Pandey, Prabhat, et al.
Published: (2025)
Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation
by: He, Haorui, et al.
Published: (2024)
by: He, Haorui, et al.
Published: (2024)
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
by: He, Haorui, et al.
Published: (2025)
by: He, Haorui, et al.
Published: (2025)
BETA-Labeling for Multilingual Dataset Construction in Low-Resource IR
by: Hasan, Md. Najib, et al.
Published: (2026)
by: Hasan, Md. Najib, et al.
Published: (2026)
Multilingual Entity Linking Using Dense Retrieval
by: Farhan, Dominik
Published: (2024)
by: Farhan, Dominik
Published: (2024)
GeniL: A Multilingual Dataset on Generalizing Language
by: Davani, Aida Mostafazadeh, et al.
Published: (2024)
by: Davani, Aida Mostafazadeh, et al.
Published: (2024)
Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)
by: Liu, Jiarui, et al.
Published: (2024)
by: Liu, Jiarui, et al.
Published: (2024)
SwitchLingua: The First Large-Scale Multilingual and Multi-Ethnic Code-Switching Dataset
by: Xie, Peng, et al.
Published: (2025)
by: Xie, Peng, et al.
Published: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
by: Atuhurra, Jesse, et al.
Published: (2024)
by: Atuhurra, Jesse, et al.
Published: (2024)
Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing
by: Yang, Renyu, et al.
Published: (2026)
by: Yang, Renyu, et al.
Published: (2026)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
by: Huang, Wen, et al.
Published: (2025)
by: Huang, Wen, et al.
Published: (2025)
Multilingual Machine Translation with Open Large Language Models at Practical Scale: An Empirical Study
by: Cui, Menglong, et al.
Published: (2025)
by: Cui, Menglong, et al.
Published: (2025)
Tagengo: A Multilingual Chat Dataset
by: Devine, Peter
Published: (2024)
by: Devine, Peter
Published: (2024)
Datasets for Multilingual Answer Sentence Selection
by: Gabburo, Matteo, et al.
Published: (2024)
by: Gabburo, Matteo, et al.
Published: (2024)
Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
by: Khan, Shaharukh, et al.
Published: (2026)
by: Khan, Shaharukh, et al.
Published: (2026)
Data Quality Issues in Multilingual Speech Datasets: The Need for Sociolinguistic Awareness and Proactive Language Planning
by: Lau, Mingfei, et al.
Published: (2025)
by: Lau, Mingfei, et al.
Published: (2025)
Remastering Divide and Remaster: A Cinematic Audio Source Separation Dataset with Multilingual Support
by: Watcharasupat, Karn N., et al.
Published: (2024)
by: Watcharasupat, Karn N., et al.
Published: (2024)
LLM vs. Lawyers: Identifying a Subset of Summary Judgments in a Large UK Case Law Dataset
by: Izzidien, Ahmed, et al.
Published: (2024)
by: Izzidien, Ahmed, et al.
Published: (2024)
Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy
by: Senaratna, Nuwan I.
Published: (2025)
by: Senaratna, Nuwan I.
Published: (2025)
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
by: Wang, Xintong, et al.
Published: (2025)
by: Wang, Xintong, et al.
Published: (2025)
Enhancing Neural Spoken Language Recognition: An Exploration with Multilingual Datasets
by: Anidjar, Or Haim, et al.
Published: (2025)
by: Anidjar, Or Haim, et al.
Published: (2025)
Multilingual Text Style Transfer: Datasets & Models for Indian Languages
by: Mukherjee, Sourabrata, et al.
Published: (2024)
by: Mukherjee, Sourabrata, et al.
Published: (2024)
The Heap: A Contamination-Free Multilingual Code Dataset for Evaluating Large Language Models
by: Katzy, Jonathan, et al.
Published: (2025)
by: Katzy, Jonathan, et al.
Published: (2025)
PARROT: An Open Multilingual Radiology Reports Dataset
by: Guellec, Bastien Le, et al.
Published: (2025)
by: Guellec, Bastien Le, et al.
Published: (2025)
CUTE: A Multilingual Dataset for Enhancing Cross-Lingual Knowledge Transfer in Low-Resource Languages
by: Zhuang, Wenhao, et al.
Published: (2025)
by: Zhuang, Wenhao, et al.
Published: (2025)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
by: Park, Jeongkyun, et al.
Published: (2023)
by: Park, Jeongkyun, et al.
Published: (2023)
Multilingual Large Language Models and Curse of Multilinguality
by: Gurgurov, Daniil, et al.
Published: (2024)
by: Gurgurov, Daniil, et al.
Published: (2024)
Multilingual Dataset Integration Strategies for Robust Audio Deepfake Detection: A SAFE Challenge System
by: Ali, Hashim, et al.
Published: (2025)
by: Ali, Hashim, et al.
Published: (2025)
Multilingual Topic Classification in X: Dataset and Analysis
by: Antypas, Dimosthenis, et al.
Published: (2024)
by: Antypas, Dimosthenis, et al.
Published: (2024)
ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models
by: Chang, Emily, et al.
Published: (2025)
by: Chang, Emily, et al.
Published: (2025)
Spotlight: Identifying and Localizing Video Generation Errors Using VLMs
by: Chinchure, Aditya, et al.
Published: (2025)
by: Chinchure, Aditya, et al.
Published: (2025)
Beyond Catalogue Counts: the Dataset Visibility Asymmetry in Low-Resource Multilingual NLP
by: Tan, Zhiyin, et al.
Published: (2026)
by: Tan, Zhiyin, et al.
Published: (2026)
OleSpeech-IV: A Large-Scale Multispeaker and Multilingual Conversational Speech Dataset with Diverse Topics
by: Chu, Wei, et al.
Published: (2025)
by: Chu, Wei, et al.
Published: (2025)
Taxi1500: A Multilingual Dataset for Text Classification in 1500 Languages
by: Ma, Chunlan, et al.
Published: (2023)
by: Ma, Chunlan, et al.
Published: (2023)
AfriVoices-KE: A Multilingual Speech Dataset for Kenyan Languages
by: Wanzare, Lilian, et al.
Published: (2026)
by: Wanzare, Lilian, et al.
Published: (2026)
A New Massive Multilingual Dataset for High-Performance Language Technologies
by: de Gibert, Ona, et al.
Published: (2024)
by: de Gibert, Ona, et al.
Published: (2024)
Similar Items
-
Locating Information Gaps and Narrative Inconsistencies Across Languages: A Case Study of LGBT People Portrayals on Wikipedia
by: Samir, Farhan, et al.
Published: (2024) -
WikiGap: Promoting Epistemic Equity by Surfacing Knowledge Gaps Between English Wikipedia and other Language Editions
by: Wang, Zining, et al.
Published: (2025) -
Is It Bad to Work All the Time? Cross-Cultural Evaluation of Social Norm Biases in GPT-4
by: Liu, Zhuozhuo Joy, et al.
Published: (2025) -
HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
by: Abdaljalil, Samir, et al.
Published: (2025) -
SIFT-50M: A Large-Scale Multilingual Dataset for Speech Instruction Fine-Tuning
by: Pandey, Prabhat, et al.
Published: (2025)