The Impact of Code-switched Synthetic Data Quality is Task Dependent: Insights from MT and ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hamed, Injy, Vu, Ngoc Thang, Habash, Nizar |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Survey of Code-switched Arabic NLP: Progress, Challenges, and Future Directions
par: Hamed, Injy, et autres
Publié: (2025)
par: Hamed, Injy, et autres
Publié: (2025)
ZAEBUC-Spoken: A Multilingual Multidialectal Arabic-English Speech Corpus
par: Hamed, Injy, et autres
Publié: (2024)
par: Hamed, Injy, et autres
Publié: (2024)
Lemmatization as a Classification Task: Results from Arabic across Multiple Genres
par: Saeed, Mostafa, et autres
Publié: (2025)
par: Saeed, Mostafa, et autres
Publié: (2025)
NADI 2024: The Fifth Nuanced Arabic Dialect Identification Shared Task
par: Abdul-Mageed, Muhammad, et autres
Publié: (2024)
par: Abdul-Mageed, Muhammad, et autres
Publié: (2024)
Prompting-based Synthetic Data Generation for Few-Shot Question Answering
par: Schmidt, Maximilian, et autres
Publié: (2024)
par: Schmidt, Maximilian, et autres
Publié: (2024)
Arabic Morphosyntactic Tagging and Dependency Parsing with Large Language Models
par: Adel, Mohamed, et autres
Publié: (2026)
par: Adel, Mohamed, et autres
Publié: (2026)
Data Augmentation for Maltese NLP using Transliterated and Machine Translated Arabic Data
par: Micallef, Kurt, et autres
Publié: (2025)
par: Micallef, Kurt, et autres
Publié: (2025)
Enhancing Arabic Automated Essay Scoring with Synthetic Data and Error Injection
par: Qwaider, Chatrine, et autres
Publié: (2025)
par: Qwaider, Chatrine, et autres
Publié: (2025)
Enhancing Text Editing for Grammatical Error Correction: Arabic as a Case Study
par: Alhafni, Bashar, et autres
Publié: (2025)
par: Alhafni, Bashar, et autres
Publié: (2025)
Improving noisy student training for low-resource languages in End-to-End ASR using CycleGAN and inter-domain losses
par: Li, Chia-Yu, et autres
Publié: (2024)
par: Li, Chia-Yu, et autres
Publié: (2024)
The Arabic Generality Score: Another Dimension of Modeling Arabic Dialectness
par: Shaban, Sanad, et autres
Publié: (2025)
par: Shaban, Sanad, et autres
Publié: (2025)
Intrinsic Subgraph Generation for Interpretable Graph based Visual Question Answering
par: Tilli, Pascal, et autres
Publié: (2024)
par: Tilli, Pascal, et autres
Publié: (2024)
Discrete Subgraph Sampling for Interpretable Graph based Visual Question Answering
par: Tilli, Pascal, et autres
Publié: (2024)
par: Tilli, Pascal, et autres
Publié: (2024)
Towards Zero-Shot, Controllable Dialog Planning with LLMs
par: Väth, Dirk, et autres
Publié: (2024)
par: Väth, Dirk, et autres
Publié: (2024)
Cross-Lingual Transfer from Related Languages: Treating Low-Resource Maltese as Multilingual Code-Switching
par: Micallef, Kurt, et autres
Publié: (2024)
par: Micallef, Kurt, et autres
Publié: (2024)
Conversational Tree Search: A New Hybrid Dialog Task
par: Väth, Dirk, et autres
Publié: (2023)
par: Väth, Dirk, et autres
Publié: (2023)
Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks
par: Abouzahir, Chaimae, et autres
Publié: (2026)
par: Abouzahir, Chaimae, et autres
Publié: (2026)
A Derivational ChainBank for Modern Standard Arabic
par: Marzouk, Reham, et autres
Publié: (2024)
par: Marzouk, Reham, et autres
Publié: (2024)
A Tale of Two Scripts: Transliteration and Post-Correction for Judeo-Arabic
par: Gonzalez, Juan Moreno, et autres
Publié: (2025)
par: Gonzalez, Juan Moreno, et autres
Publié: (2025)
Towards a Zero-Data, Controllable, Adaptive Dialog System
par: Väth, Dirk, et autres
Publié: (2024)
par: Väth, Dirk, et autres
Publié: (2024)
Teaching a Multilingual Large Language Model to Understand Multilingual Speech via Multi-Instructional Training
par: Denisov, Pavel, et autres
Publié: (2024)
par: Denisov, Pavel, et autres
Publié: (2024)
A Large and Balanced Corpus for Fine-grained Arabic Readability Assessment
par: Elmadani, Khalid N., et autres
Publié: (2025)
par: Elmadani, Khalid N., et autres
Publié: (2025)
Investigating the effect of Mental Models in User Interaction with an Adaptive Dialog Agent
par: Vanderlyn, Lindsey, et autres
Publié: (2024)
par: Vanderlyn, Lindsey, et autres
Publié: (2024)
Proper Noun Diacritization for Arabic Wikipedia: A Benchmark Dataset
par: Bondok, Rawan, et autres
Publié: (2025)
par: Bondok, Rawan, et autres
Publié: (2025)
ARWI: Arabic Write and Improve
par: Chirkunov, Kirill, et autres
Publié: (2025)
par: Chirkunov, Kirill, et autres
Publié: (2025)
Computational Morphology and Lexicography Modeling of Modern Standard Arabic Nominals
par: Khairallah, Christian, et autres
Publié: (2024)
par: Khairallah, Christian, et autres
Publié: (2024)
Arabic Diacritics in the Wild: Exploiting Opportunities for Improved Diacritization
par: Elgamal, Salman, et autres
Publié: (2024)
par: Elgamal, Salman, et autres
Publié: (2024)
Strategies for Arabic Readability Modeling
par: Liberato, Juan Piñeros, et autres
Publié: (2024)
par: Liberato, Juan Piñeros, et autres
Publié: (2024)
A Toolbox for Improving Evolutionary Prompt Search
par: Grießhaber, Daniel, et autres
Publié: (2025)
par: Grießhaber, Daniel, et autres
Publié: (2025)
Explaining Pre-Trained Language Models with Attribution Scores: An Analysis in Low-Resource Settings
par: Zhou, Wei, et autres
Publié: (2024)
par: Zhou, Wei, et autres
Publié: (2024)
Probing the Feasibility of Multilingual Speaker Anonymization
par: Meyer, Sarina, et autres
Publié: (2024)
par: Meyer, Sarina, et autres
Publié: (2024)
Controlling Emotion in Text-to-Speech with Natural Language Prompts
par: Bott, Thomas, et autres
Publié: (2024)
par: Bott, Thomas, et autres
Publié: (2024)
Thought Flow Nets: From Single Predictions to Trains of Model Thought
par: Schuff, Hendrik, et autres
Publié: (2021)
par: Schuff, Hendrik, et autres
Publié: (2021)
The FIGNEWS Shared Task on News Media Narratives
par: Zaghouani, Wajdi, et autres
Publié: (2024)
par: Zaghouani, Wajdi, et autres
Publié: (2024)
MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks
par: Daoud, Mouath Abu, et autres
Publié: (2025)
par: Daoud, Mouath Abu, et autres
Publié: (2025)
Guidelines for Fine-grained Sentence-level Arabic Readability Annotation
par: Habash, Nizar, et autres
Publié: (2024)
par: Habash, Nizar, et autres
Publié: (2024)
The SAMER Arabic Text Simplification Corpus
par: Alhafni, Bashar, et autres
Publié: (2024)
par: Alhafni, Bashar, et autres
Publié: (2024)
Combining Data Generation and Active Learning for Low-Resource Question Answering
par: Kimmich, Maximilian, et autres
Publié: (2022)
par: Kimmich, Maximilian, et autres
Publié: (2022)
Explaining Caption-Image Interactions in CLIP Models with Second-Order Attributions
par: Möller, Lucas, et autres
Publié: (2024)
par: Möller, Lucas, et autres
Publié: (2024)
Scaling Low-Resource MT via Synthetic Data Generation with LLMs
par: de Gibert, Ona, et autres
Publié: (2025)
par: de Gibert, Ona, et autres
Publié: (2025)
Documents similaires
-
A Survey of Code-switched Arabic NLP: Progress, Challenges, and Future Directions
par: Hamed, Injy, et autres
Publié: (2025) -
ZAEBUC-Spoken: A Multilingual Multidialectal Arabic-English Speech Corpus
par: Hamed, Injy, et autres
Publié: (2024) -
Lemmatization as a Classification Task: Results from Arabic across Multiple Genres
par: Saeed, Mostafa, et autres
Publié: (2025) -
NADI 2024: The Fifth Nuanced Arabic Dialect Identification Shared Task
par: Abdul-Mageed, Muhammad, et autres
Publié: (2024) -
Prompting-based Synthetic Data Generation for Few-Shot Question Answering
par: Schmidt, Maximilian, et autres
Publié: (2024)