RoDia: A New Dataset for Romanian Dialect Identification from Speech
Fuente:
arXiv
Guardado en:
| Autores principales: | Rotaru, Codrut, Ristea, Nicolae-Catalin, Ionescu, Radu Tudor |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Cascaded Cross-Modal Transformer for Audio-Textual Classification
por: Ristea, Nicolae-Catalin, et al.
Publicado: (2024)
por: Ristea, Nicolae-Catalin, et al.
Publicado: (2024)
XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark
por: Ciobanu, Ioan-Paul, et al.
Publicado: (2025)
por: Ciobanu, Ioan-Paul, et al.
Publicado: (2025)
LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect
por: Naouara, Hedi, et al.
Publicado: (2025)
por: Naouara, Hedi, et al.
Publicado: (2025)
Dialectal Coverage And Generalization in Arabic Speech Recognition
por: Djanibekov, Amirbek, et al.
Publicado: (2024)
por: Djanibekov, Amirbek, et al.
Publicado: (2024)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
por: Yamauchi, Kazuki, et al.
Publicado: (2024)
por: Yamauchi, Kazuki, et al.
Publicado: (2024)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
por: Doan, Khai Duy, et al.
Publicado: (2024)
por: Doan, Khai Duy, et al.
Publicado: (2024)
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
por: Mdhaffar, Salima, et al.
Publicado: (2024)
por: Mdhaffar, Salima, et al.
Publicado: (2024)
Habibi: Laying the Open-Source Foundation of Unified-Dialectal Arabic Speech Synthesis
por: Chen, Yushen, et al.
Publicado: (2026)
por: Chen, Yushen, et al.
Publicado: (2026)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
por: Abdullah, Badr M., et al.
Publicado: (2025)
por: Abdullah, Badr M., et al.
Publicado: (2025)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
por: Di, Xinhan, et al.
Publicado: (2024)
por: Di, Xinhan, et al.
Publicado: (2024)
DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation
por: Chen, Ziqi, et al.
Publicado: (2025)
por: Chen, Ziqi, et al.
Publicado: (2025)
CAFE A Novel Code switching Dataset for Algerian Dialect French and English
por: Lachemat, Houssam Eddine-Othman, et al.
Publicado: (2024)
por: Lachemat, Houssam Eddine-Othman, et al.
Publicado: (2024)
Voxlect: A Speech Foundation Model Benchmark for Modeling Dialects and Regional Languages Around the Globe
por: Feng, Tiantian, et al.
Publicado: (2025)
por: Feng, Tiantian, et al.
Publicado: (2025)
Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models
por: Ljubešić, Nikola, et al.
Publicado: (2025)
por: Ljubešić, Nikola, et al.
Publicado: (2025)
Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis
por: Xu, Tianyi, et al.
Publicado: (2025)
por: Xu, Tianyi, et al.
Publicado: (2025)
ICASSP 2024 Speech Signal Improvement Challenge
por: Ristea, Nicolae Catalin, et al.
Publicado: (2024)
por: Ristea, Nicolae Catalin, et al.
Publicado: (2024)
Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond
por: Lee, Beomseok, et al.
Publicado: (2024)
por: Lee, Beomseok, et al.
Publicado: (2024)
YODAS: Youtube-Oriented Dataset for Audio and Speech
por: Li, Xinjian, et al.
Publicado: (2024)
por: Li, Xinjian, et al.
Publicado: (2024)
nEMO: Dataset of Emotional Speech in Polish
por: Christop, Iwona
Publicado: (2024)
por: Christop, Iwona
Publicado: (2024)
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
por: Liu, Yutong, et al.
Publicado: (2025)
por: Liu, Yutong, et al.
Publicado: (2025)
EmoTale: An Enacted Speech-emotion Dataset in Danish
por: Hjuler, Maja J., et al.
Publicado: (2025)
por: Hjuler, Maja J., et al.
Publicado: (2025)
CASPER: A Large Scale Spontaneous Speech Dataset
por: Xiao, Cihan, et al.
Publicado: (2025)
por: Xiao, Cihan, et al.
Publicado: (2025)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Gammatonegram Representation for End-to-End Dysarthric Speech Processing Tasks: Speech Recognition, Speaker Identification, and Intelligibility Assessment
por: Farhadipour, Aref, et al.
Publicado: (2023)
por: Farhadipour, Aref, et al.
Publicado: (2023)
Sagalee: an Open Source Automatic Speech Recognition Dataset for Oromo Language
por: Abu, Turi, et al.
Publicado: (2025)
por: Abu, Turi, et al.
Publicado: (2025)
HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing
por: Turetzky, Arnon, et al.
Publicado: (2024)
por: Turetzky, Arnon, et al.
Publicado: (2024)
CS-FLEURS: A Massively Multilingual and Code-Switched Speech Dataset
por: Yan, Brian, et al.
Publicado: (2025)
por: Yan, Brian, et al.
Publicado: (2025)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
por: Wang, Peidong, et al.
Publicado: (2024)
por: Wang, Peidong, et al.
Publicado: (2024)
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
por: Valente, Martina, et al.
Publicado: (2024)
por: Valente, Martina, et al.
Publicado: (2024)
ChildGuard: A Specialized Dataset for Combatting Child-Targeted Hate Speech
por: Kashyap, Gautam Siddharth, et al.
Publicado: (2025)
por: Kashyap, Gautam Siddharth, et al.
Publicado: (2025)
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
por: He, Haorui, et al.
Publicado: (2025)
por: He, Haorui, et al.
Publicado: (2025)
LearnerVoice: A Dataset of Non-Native English Learners' Spontaneous Speech
por: Kim, Haechan, et al.
Publicado: (2024)
por: Kim, Haechan, et al.
Publicado: (2024)
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning
por: Özyilmaz, Ömer Tarik, et al.
Publicado: (2025)
por: Özyilmaz, Ömer Tarik, et al.
Publicado: (2025)
AnimeScore: A Preference-Based Dataset and Framework for Evaluating Anime-Like Speech Style
por: Park, Joonyong, et al.
Publicado: (2026)
por: Park, Joonyong, et al.
Publicado: (2026)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
por: Liu, Sen, et al.
Publicado: (2024)
por: Liu, Sen, et al.
Publicado: (2024)
CommonVoice-SpeechRE and RPG-MoGe: Advancing Speech Relation Extraction with a New Dataset and Multi-Order Generative Framework
por: Ning, Jinzhong, et al.
Publicado: (2025)
por: Ning, Jinzhong, et al.
Publicado: (2025)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing
por: Peng, An-Ci, et al.
Publicado: (2026)
por: Peng, An-Ci, et al.
Publicado: (2026)
WenetSpeech-Wu: Datasets, Benchmarks, and Models for a Unified Chinese Wu Dialect Speech Processing Ecosystem
por: Wang, Chengyou, et al.
Publicado: (2026)
por: Wang, Chengyou, et al.
Publicado: (2026)
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
por: Zhou, Jiaming, et al.
Publicado: (2025)
por: Zhou, Jiaming, et al.
Publicado: (2025)
Ejemplares similares
-
Cascaded Cross-Modal Transformer for Audio-Textual Classification
por: Ristea, Nicolae-Catalin, et al.
Publicado: (2024) -
XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark
por: Ciobanu, Ioan-Paul, et al.
Publicado: (2025) -
LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect
por: Naouara, Hedi, et al.
Publicado: (2025) -
Dialectal Coverage And Generalization in Arabic Speech Recognition
por: Djanibekov, Amirbek, et al.
Publicado: (2024) -
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
por: Yamauchi, Kazuki, et al.
Publicado: (2024)