BanglaNum -- A Public Dataset for Bengali Digit Recognition from Speech
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mohammad, Mir Sayeed, Zahid, Azizul, Iqbal, Md Asif |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The CARFAC v2 Cochlear Model in Matlab, NumPy, and JAX
par: Lyon, Richard F., et autres
Publié: (2024)
par: Lyon, Richard F., et autres
Publié: (2024)
Semantic Communications for Speech Recognition
par: Weng, Zhenzi, et autres
Publié: (2021)
par: Weng, Zhenzi, et autres
Publié: (2021)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
par: Wang, Kuan-Chen, et autres
Publié: (2024)
par: Wang, Kuan-Chen, et autres
Publié: (2024)
BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset
par: Fahad, Istiaq Ahmed, et autres
Publié: (2025)
par: Fahad, Istiaq Ahmed, et autres
Publié: (2025)
Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets
par: Pešán, Jan, et autres
Publié: (2024)
par: Pešán, Jan, et autres
Publié: (2024)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
par: Qi, Tianhua, et autres
Publié: (2026)
par: Qi, Tianhua, et autres
Publié: (2026)
Bengali-Loop: Community Benchmarks for Long-Form Bangla ASR and Speaker Diarization
par: Tabib, H. M. Shadman, et autres
Publié: (2026)
par: Tabib, H. M. Shadman, et autres
Publié: (2026)
SpeechMLC: Speech Multi-label Classification
par: Kim, Miseul, et autres
Publié: (2025)
par: Kim, Miseul, et autres
Publié: (2025)
A Speech Production Model for Radar: Connecting Speech Acoustics with Radar-Measured Vibrations
par: Lenz, Isabella, et autres
Publié: (2025)
par: Lenz, Isabella, et autres
Publié: (2025)
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
par: Yang, Shu-wen, et autres
Publié: (2025)
par: Yang, Shu-wen, et autres
Publié: (2025)
Visual-Aware Speech Recognition for Noisy Scenarios
par: Balaji, Lakshmipathi, et autres
Publié: (2025)
par: Balaji, Lakshmipathi, et autres
Publié: (2025)
Exploring Disentangled Neural Speech Codecs from Self-Supervised Representations
par: Aihara, Ryo, et autres
Publié: (2025)
par: Aihara, Ryo, et autres
Publié: (2025)
Binaural Localization Model for Speech in Noise
par: Tokala, Vikas, et autres
Publié: (2025)
par: Tokala, Vikas, et autres
Publié: (2025)
Speech-Based Prioritization for Schizophrenia Intervention
par: Premananth, Gowtham, et autres
Publié: (2025)
par: Premananth, Gowtham, et autres
Publié: (2025)
Prompt-driven Target Speech Diarization
par: Jiang, Yidi, et autres
Publié: (2023)
par: Jiang, Yidi, et autres
Publié: (2023)
Brain-Informed Speech Separation for Cochlear Implants
par: Gajecki, Tom, et autres
Publié: (2026)
par: Gajecki, Tom, et autres
Publié: (2026)
Speech Enhancement based on cascaded two flows
par: Lee, Seonggyu, et autres
Publié: (2025)
par: Lee, Seonggyu, et autres
Publié: (2025)
FlowSE: Flow Matching-based Speech Enhancement
par: Lee, Seonggyu, et autres
Publié: (2025)
par: Lee, Seonggyu, et autres
Publié: (2025)
USDnet: Unsupervised Speech Dereverberation via Neural Forward Filtering
par: Wang, Zhong-Qiu
Publié: (2024)
par: Wang, Zhong-Qiu
Publié: (2024)
TTSlow: Slow Down Text-to-Speech with Efficiency Robustness Evaluations
par: Gao, Xiaoxue, et autres
Publié: (2024)
par: Gao, Xiaoxue, et autres
Publié: (2024)
Harmonics to the Rescue: Why Voiced Speech is Not a Wss Process
par: Bologni, Giovanni, et autres
Publié: (2025)
par: Bologni, Giovanni, et autres
Publié: (2025)
SELM: Speech Enhancement Using Discrete Tokens and Language Models
par: Wang, Ziqian, et autres
Publié: (2023)
par: Wang, Ziqian, et autres
Publié: (2023)
Binaural Speech Enhancement Using Complex Convolutional Recurrent Networks
par: Tokala, Vikas, et autres
Publié: (2025)
par: Tokala, Vikas, et autres
Publié: (2025)
Analyzing the Impact of Accent on English Speech: Acoustic and Articulatory Perspectives
par: Premananth, Gowtham, et autres
Publié: (2025)
par: Premananth, Gowtham, et autres
Publié: (2025)
The Overview of Segmental Durations Modification Algorithms on Speech Signal Characteristics
par: Jang, Kyeomeun, et autres
Publié: (2025)
par: Jang, Kyeomeun, et autres
Publié: (2025)
Parameter-Efficient Fine-Tuning of Foundation Models for CLP Speech Classification
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
Impact of Microphone Array Mismatches to Learning-based Replay Speech Detection
par: Neri, Michael, et autres
Publié: (2025)
par: Neri, Michael, et autres
Publié: (2025)
DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing
par: Lee, Dongheon, et autres
Publié: (2023)
par: Lee, Dongheon, et autres
Publié: (2023)
Multi-channel Replay Speech Detection using an Adaptive Learnable Beamformer
par: Neri, Michael, et autres
Publié: (2025)
par: Neri, Michael, et autres
Publié: (2025)
Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech Codec
par: Ren, Yanzhou, et autres
Publié: (2026)
par: Ren, Yanzhou, et autres
Publié: (2026)
Auditory Attention Decoding from Ear-EEG Signals: A Dataset with Dynamic Attention Switching and Rigorous Cross-Validation
par: Zhang, Yuanming, et autres
Publié: (2025)
par: Zhang, Yuanming, et autres
Publié: (2025)
Mixture to Mixture: Leveraging Close-talk Mixtures as Weak-supervision for Speech Separation
par: Wang, Zhong-Qiu
Publié: (2024)
par: Wang, Zhong-Qiu
Publié: (2024)
FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching
par: Wang, Ziqian, et autres
Publié: (2025)
par: Wang, Ziqian, et autres
Publié: (2025)
HyBeam: Hybrid Microphone-Beamforming Array-Agnostic Speech Enhancement for Wearables
par: Ilan, Yuval Bar, et autres
Publié: (2025)
par: Ilan, Yuval Bar, et autres
Publié: (2025)
Zero-Bit Transmission of Adaptive Pre- and De-emphasis Filters for Speech and Audio Coding
par: Piralideh, Niloofar Omidi, et autres
Publié: (2024)
par: Piralideh, Niloofar Omidi, et autres
Publié: (2024)
Speak in the Scene: Diffusion-based Acoustic Scene Transfer toward Immersive Speech Generation
par: Kim, Miseul, et autres
Publié: (2024)
par: Kim, Miseul, et autres
Publié: (2024)
Independent Feature Enhanced Crossmodal Fusion for Match-Mismatch Classification of Speech Stimulus and EEG Response
par: Fan, Shitong, et autres
Publié: (2024)
par: Fan, Shitong, et autres
Publié: (2024)
Speaker and Style Disentanglement of Speech Based on Contrastive Predictive Coding Supported Factorized Variational Autoencoder
par: Xie, Yuying, et autres
Publié: (2024)
par: Xie, Yuying, et autres
Publié: (2024)
Collection: UAV-Based RSS Measurements from the AFAR Challenge in Digital Twin and Real-World Environments
par: Masrur, Saad, et autres
Publié: (2025)
par: Masrur, Saad, et autres
Publié: (2025)
Multi-Level Embedding Conformer Framework for Bengali Automatic Speech Recognition
par: Sakib, Md. Nazmus, et autres
Publié: (2025)
par: Sakib, Md. Nazmus, et autres
Publié: (2025)
Documents similaires
-
The CARFAC v2 Cochlear Model in Matlab, NumPy, and JAX
par: Lyon, Richard F., et autres
Publié: (2024) -
Semantic Communications for Speech Recognition
par: Weng, Zhenzi, et autres
Publié: (2021) -
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
par: Wang, Kuan-Chen, et autres
Publié: (2024) -
BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset
par: Fahad, Istiaq Ahmed, et autres
Publié: (2025) -
Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets
par: Pešán, Jan, et autres
Publié: (2024)