Enregistré dans:
| Auteurs principaux: | Kheir, Yassine El, Mubarak, Hamdy, Ali, Ahmed, Chowdhury, Shammur Absar |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2408.02430 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Speech Representation Analysis based on Inter- and Intra-Model Similarities
par: Kheir, Yassine El, et autres
Publié: (2024)
par: Kheir, Yassine El, et autres
Publié: (2024)
IQRA 2026: Interspeech Challenge on Automatic Pronunciation Assessment for Modern Standard Arabic (MSA)
par: Kheir, Yassine El, et autres
Publié: (2026)
par: Kheir, Yassine El, et autres
Publié: (2026)
CAFE A Novel Code switching Dataset for Algerian Dialect French and English
par: Lachemat, Houssam Eddine-Othman, et autres
Publié: (2024)
par: Lachemat, Houssam Eddine-Othman, et autres
Publié: (2024)
HARNESS: Lightweight Distilled Arabic Speech Foundation Models
par: Sukhadia, Vrunda N., et autres
Publié: (2026)
par: Sukhadia, Vrunda N., et autres
Publié: (2026)
Children's Speech Recognition through Discrete Token Enhancement
par: Sukhadia, Vrunda N., et autres
Publié: (2024)
par: Sukhadia, Vrunda N., et autres
Publié: (2024)
Multi-Task Instruction Tuning via Data Scheduling for Low-Resource Arabic AudioLLMs
par: Bhatti, Hunzalah Hassan, et autres
Publié: (2026)
par: Bhatti, Hunzalah Hassan, et autres
Publié: (2026)
BiCrossMamba-ST: Speech Deepfake Detection with Bidirectional Mamba Spectro-Temporal Cross-Attention
par: Kheir, Yassine El, et autres
Publié: (2025)
par: Kheir, Yassine El, et autres
Publié: (2025)
Towards a Unified Benchmark for Arabic Pronunciation Assessment: Quranic Recitation as Case Study
par: Kheir, Yassine El, et autres
Publié: (2025)
par: Kheir, Yassine El, et autres
Publié: (2025)
Comprehensive Layer-wise Analysis of SSL Models for Audio Deepfake Detection
par: Kheir, Yassine El, et autres
Publié: (2025)
par: Kheir, Yassine El, et autres
Publié: (2025)
Automatic Assessment of Dysarthria Using Audio-visual Vowel Graph Attention Network
par: Liu, Xiaokang, et autres
Publié: (2024)
par: Liu, Xiaokang, et autres
Publié: (2024)
LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect
par: Naouara, Hedi, et autres
Publié: (2025)
par: Naouara, Hedi, et autres
Publié: (2025)
Dialectal Coverage And Generalization in Arabic Speech Recognition
par: Djanibekov, Amirbek, et autres
Publié: (2024)
par: Djanibekov, Amirbek, et autres
Publié: (2024)
Generalizable Audio Spoofing Detection using Non-Semantic Representations
par: Das, Arnab, et autres
Publié: (2025)
par: Das, Arnab, et autres
Publié: (2025)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
par: Doan, Khai Duy, et autres
Publié: (2024)
par: Doan, Khai Duy, et autres
Publié: (2024)
Two Views, One Truth: Spectral and Self-Supervised Features Fusion for Robust Speech Deepfake Detection
par: Kheir, Yassine El, et autres
Publié: (2025)
par: Kheir, Yassine El, et autres
Publié: (2025)
DeepFense: A Unified, Modular, and Extensible Framework for Robust Deepfake Audio Detection
par: Kheir, Yassine El, et autres
Publié: (2026)
par: Kheir, Yassine El, et autres
Publié: (2026)
Automatic Speech Recognition with BERT and CTC Transformers: A Review
par: Djeffal, Noussaiba, et autres
Publié: (2024)
par: Djeffal, Noussaiba, et autres
Publié: (2024)
MENASpeechBank: A Reference Voice Bank with Persona-Conditioned Multi-Turn Conversations for AudioLLMs
par: Ali, Zien Sheikh, et autres
Publié: (2026)
par: Ali, Zien Sheikh, et autres
Publié: (2026)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
par: Abdullah, Badr M., et autres
Publié: (2025)
par: Abdullah, Badr M., et autres
Publié: (2025)
Habibi: Laying the Open-Source Foundation of Unified-Dialectal Arabic Speech Synthesis
par: Chen, Yushen, et autres
Publié: (2026)
par: Chen, Yushen, et autres
Publié: (2026)
You Sound a Little Tense: L2 Tailored Clear TTS Using Durational Vowel Properties
par: Tuttösí, Paige, et autres
Publié: (2025)
par: Tuttösí, Paige, et autres
Publié: (2025)
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning
par: Özyilmaz, Ömer Tarik, et autres
Publié: (2025)
par: Özyilmaz, Ömer Tarik, et autres
Publié: (2025)
Hybrid Deep Learning and Signal Processing for Arabic Dialect Recognition in Low-Resource Settings
par: Al-Shwayyat, Ghazal, et autres
Publié: (2025)
par: Al-Shwayyat, Ghazal, et autres
Publié: (2025)
Cross-Dialect Bird Species Recognition with Dialect-Calibrated Augmentation
par: Ding, Jiani, et autres
Publié: (2025)
par: Ding, Jiani, et autres
Publié: (2025)
A Multi-Dialectal Dataset for German Dialect ASR and Dialect-to-Standard Speech Translation
par: Blaschke, Verena, et autres
Publié: (2025)
par: Blaschke, Verena, et autres
Publié: (2025)
Dolphin-CN-Dialect: Where Chinese Dialects Matter
par: Meng, Yangyang, et autres
Publié: (2026)
par: Meng, Yangyang, et autres
Publié: (2026)
Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey
par: Kheddar, Hamza, et autres
Publié: (2024)
par: Kheddar, Hamza, et autres
Publié: (2024)
From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models
par: Ersoy, Asım, et autres
Publié: (2025)
par: Ersoy, Asım, et autres
Publié: (2025)
LAMA-UT: Language Agnostic Multilingual ASR through Orthography Unification and Language-Specific Transliteration
par: Lee, Sangmin, et autres
Publié: (2024)
par: Lee, Sangmin, et autres
Publié: (2024)
DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation
par: Li, Baihan, et autres
Publié: (2024)
par: Li, Baihan, et autres
Publié: (2024)
Automatic Sound Event Detection and Classification of Great Ape Calls Using Neural Networks
par: Jiang, Zifan, et autres
Publié: (2023)
par: Jiang, Zifan, et autres
Publié: (2023)
Improving the Robustness and Clinical Applicability of Automatic Respiratory Sound Classification Using Deep Learning-Based Audio Enhancement: Algorithm Development and Validation
par: Tzeng, Jing-Tong, et autres
Publié: (2024)
par: Tzeng, Jing-Tong, et autres
Publié: (2024)
Arabic TTS with FastPitch: Reproducible Baselines, Adversarial Training, and Oversmoothing Analysis
par: Nippert, Lars
Publié: (2025)
par: Nippert, Lars
Publié: (2025)
Adaptive Representations of Sound for Automatic Insect Recognition
par: Faiß, Marius, et autres
Publié: (2023)
par: Faiß, Marius, et autres
Publié: (2023)
Towards Naturalistic Voice Conversion: NaturalVoices Dataset with an Automatic Processing Pipeline
par: Salman, Ali N., et autres
Publié: (2024)
par: Salman, Ali N., et autres
Publié: (2024)
Arabic ASR on the SADA Large-Scale Arabic Speech Corpus with Transformer-Based Models
par: Gerazov, Branislav, et autres
Publié: (2025)
par: Gerazov, Branislav, et autres
Publié: (2025)
Classification of Short Segment Pediatric Heart Sounds Based on a Transformer-Based Convolutional Neural Network
par: Hassanuzzaman, Md, et autres
Publié: (2024)
par: Hassanuzzaman, Md, et autres
Publié: (2024)
A Unified Denoising and Adaptation Framework for Self-Supervised Bengali Dialectal ASR
par: Biswas, Swadhin, et autres
Publié: (2025)
par: Biswas, Swadhin, et autres
Publié: (2025)
SoulX-Podcast: Towards Realistic Long-form Podcasts with Dialectal and Paralinguistic Diversity
par: Xie, Hanke, et autres
Publié: (2025)
par: Xie, Hanke, et autres
Publié: (2025)
Automatic Inspection Based on Switch Sounds of Electric Point Machines
par: Shibata, Ayano, et autres
Publié: (2025)
par: Shibata, Ayano, et autres
Publié: (2025)
Documents similaires
-
Speech Representation Analysis based on Inter- and Intra-Model Similarities
par: Kheir, Yassine El, et autres
Publié: (2024) -
IQRA 2026: Interspeech Challenge on Automatic Pronunciation Assessment for Modern Standard Arabic (MSA)
par: Kheir, Yassine El, et autres
Publié: (2026) -
CAFE A Novel Code switching Dataset for Algerian Dialect French and English
par: Lachemat, Houssam Eddine-Othman, et autres
Publié: (2024) -
HARNESS: Lightweight Distilled Arabic Speech Foundation Models
par: Sukhadia, Vrunda N., et autres
Publié: (2026) -
Children's Speech Recognition through Discrete Token Enhancement
par: Sukhadia, Vrunda N., et autres
Publié: (2024)