Hello Afrika: Speech Commands in Kinyarwanda
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Igwegbe, George, Awojide, Martins, Bless, Mboh, Kadzo, Nirel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Pretrained YAMNet for Enhanced Speech Command Detection via Transfer Learning
par: Lachenani, Sidahmed, et autres
Publié: (2025)
par: Lachenani, Sidahmed, et autres
Publié: (2025)
Hello-Chat: Towards Realistic Social Audio Interactions
par: Hou, Yueran, et autres
Publié: (2026)
par: Hou, Yueran, et autres
Publié: (2026)
Speech Command Recognition Using LogNNet Reservoir Computing for Embedded Systems
par: Izotov, Yuriy, et autres
Publié: (2025)
par: Izotov, Yuriy, et autres
Publié: (2025)
Enhancing Synthetic Training Data for Speech Commands: From ASR-Based Filtering to Domain Adaptation in SSL Latent Space
par: Quintas, Sebastião, et autres
Publié: (2024)
par: Quintas, Sebastião, et autres
Publié: (2024)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
par: Lin, Zijian, et autres
Publié: (2025)
par: Lin, Zijian, et autres
Publié: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
par: Kim, Jaeyoung, et autres
Publié: (2024)
par: Kim, Jaeyoung, et autres
Publié: (2024)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
par: Wang, Yongqi, et autres
Publié: (2023)
par: Wang, Yongqi, et autres
Publié: (2023)
Non-Intrusive Speech Intelligibility Prediction for Hearing-Impaired Users using Intermediate ASR Features and Human Memory Models
par: Mogridge, Rhiannon, et autres
Publié: (2024)
par: Mogridge, Rhiannon, et autres
Publié: (2024)
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
par: Lee, Seo-Hyun, et autres
Publié: (2023)
par: Lee, Seo-Hyun, et autres
Publié: (2023)
Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis
par: Ji, Zhoulin, et autres
Publié: (2024)
par: Ji, Zhoulin, et autres
Publié: (2024)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
par: Lau, Hok-Shing, et autres
Publié: (2024)
par: Lau, Hok-Shing, et autres
Publié: (2024)
Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
EmoSpeech: A Corpus of Emotionally Rich and Contextually Detailed Speech Annotations
par: Bian, Weizhen, et autres
Publié: (2024)
par: Bian, Weizhen, et autres
Publié: (2024)
Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology
par: Moell, Birger, et autres
Publié: (2025)
par: Moell, Birger, et autres
Publié: (2025)
Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
par: Shah, Neil, et autres
Publié: (2024)
par: Shah, Neil, et autres
Publié: (2024)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
par: Choi, Yerin, et autres
Publié: (2024)
par: Choi, Yerin, et autres
Publié: (2024)
MEBM-Speech: Multi-scale Enhanced BrainMagic for Robust MEG Speech Detection
par: Songyi, Li, et autres
Publié: (2026)
par: Songyi, Li, et autres
Publié: (2026)
TinyML for Speech Recognition
par: Barovic, Andrew, et autres
Publié: (2025)
par: Barovic, Andrew, et autres
Publié: (2025)
MRI2Speech: Speech Synthesis from Articulatory Movements Recorded by Real-time MRI
par: Shah, Neil, et autres
Publié: (2024)
par: Shah, Neil, et autres
Publié: (2024)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
Unveiling the Best Practices for Applying Speech Foundation Models to Speech Intelligibility Prediction for Hearing-Impaired People
par: Zhou, Haoshuai, et autres
Publié: (2025)
par: Zhou, Haoshuai, et autres
Publié: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
par: Wang, Xinsheng, et autres
Publié: (2025)
par: Wang, Xinsheng, et autres
Publié: (2025)
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
par: Anastassiou, Philip, et autres
Publié: (2024)
par: Anastassiou, Philip, et autres
Publié: (2024)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
par: Yao, Wenhan, et autres
Publié: (2024)
par: Yao, Wenhan, et autres
Publié: (2024)
DASB - Discrete Audio and Speech Benchmark
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
An Investigation of Incorporating Mamba for Speech Enhancement
par: Chao, Rong, et autres
Publié: (2024)
par: Chao, Rong, et autres
Publié: (2024)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
par: Lemerle, Théodor, et autres
Publié: (2024)
par: Lemerle, Théodor, et autres
Publié: (2024)
Adaptive Duration Model for Text Speech Alignment
par: Cao, Junjie
Publié: (2025)
par: Cao, Junjie
Publié: (2025)
MathReader : Text-to-Speech for Mathematical Documents
par: Hyeon, Sieun, et autres
Publié: (2025)
par: Hyeon, Sieun, et autres
Publié: (2025)
Decoding Order Matters in Autoregressive Speech Synthesis
par: Zhao, Minghui, et autres
Publié: (2026)
par: Zhao, Minghui, et autres
Publié: (2026)
Study of the Performance of CEEMDAN in Underdetermined Speech Separation
par: Melhem, Rawad, et autres
Publié: (2024)
par: Melhem, Rawad, et autres
Publié: (2024)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
par: Ahn, Hyebin, et autres
Publié: (2025)
par: Ahn, Hyebin, et autres
Publié: (2025)
Adaptive Knowledge Distillation for Device-Directed Speech Detection
par: Chi, Hyung Gun, et autres
Publié: (2025)
par: Chi, Hyung Gun, et autres
Publié: (2025)
Temporal-Aware Iterative Speech Model for Dementia Detection
par: Ugwu, Chukwuemeka, et autres
Publié: (2025)
par: Ugwu, Chukwuemeka, et autres
Publié: (2025)
CIS-BWE: Chaos-Informed Speech Bandwidth Extension
par: Tamiti, Tarikul Islam, et autres
Publié: (2025)
par: Tamiti, Tarikul Islam, et autres
Publié: (2025)
Unlocking Speech Instruction Data Potential with Query Rewriting
par: Hei, Yonghua, et autres
Publié: (2025)
par: Hei, Yonghua, et autres
Publié: (2025)
Unsupervised Speech Enhancement using Data-defined Priors
par: Klement, Dominik, et autres
Publié: (2025)
par: Klement, Dominik, et autres
Publié: (2025)
SCRAPS: Speech Contrastive Representations of Acoustic and Phonetic Spaces
par: Vallés-Pérez, Ivan, et autres
Publié: (2023)
par: Vallés-Pérez, Ivan, et autres
Publié: (2023)
Documents similaires
-
Improving Pretrained YAMNet for Enhanced Speech Command Detection via Transfer Learning
par: Lachenani, Sidahmed, et autres
Publié: (2025) -
Hello-Chat: Towards Realistic Social Audio Interactions
par: Hou, Yueran, et autres
Publié: (2026) -
Speech Command Recognition Using LogNNet Reservoir Computing for Embedded Systems
par: Izotov, Yuriy, et autres
Publié: (2025) -
Enhancing Synthetic Training Data for Speech Commands: From ASR-Based Filtering to Domain Adaptation in SSL Latent Space
par: Quintas, Sebastião, et autres
Publié: (2024) -
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
par: Lin, Zijian, et autres
Publié: (2025)