Deep Feed-Forward Neural Network for Bangla Isolated Speech Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Bhadra, Dipayan, Hosain, Mehrab, Alam, Fatema |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
por: Wang, Hsuan-Yu, et al.
Publicado: (2025)
por: Wang, Hsuan-Yu, et al.
Publicado: (2025)
Improving Speech Recognition Accuracy Using Custom Language Models with the Vosk Toolkit
por: Soni, Aniket Abhishek
Publicado: (2025)
por: Soni, Aniket Abhishek
Publicado: (2025)
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
por: Chen, Kuan-Yu, et al.
Publicado: (2025)
por: Chen, Kuan-Yu, et al.
Publicado: (2025)
Developing Acoustic Models for Automatic Speech Recognition in Swedish
por: Salvi, Giampiero
Publicado: (2024)
por: Salvi, Giampiero
Publicado: (2024)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
por: Hori, Takaaki, et al.
Publicado: (2025)
por: Hori, Takaaki, et al.
Publicado: (2025)
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
por: Marie, Ambre, et al.
Publicado: (2025)
por: Marie, Ambre, et al.
Publicado: (2025)
Graph Connectionist Temporal Classification for Phoneme Recognition
por: Grafé, Henry, et al.
Publicado: (2025)
por: Grafé, Henry, et al.
Publicado: (2025)
The OCON model: an old but gold solution for distributable supervised classification
por: Giacomelli, Stefano, et al.
Publicado: (2024)
por: Giacomelli, Stefano, et al.
Publicado: (2024)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
por: Viswanathan, Janaki, et al.
Publicado: (2025)
por: Viswanathan, Janaki, et al.
Publicado: (2025)
Self-Improvement for Audio Large Language Model using Unlabeled Speech
por: Wang, Shaowen, et al.
Publicado: (2025)
por: Wang, Shaowen, et al.
Publicado: (2025)
Emotional Voice Messages (EMOVOME) database: emotion recognition in spontaneous voice messages
por: Zaragozá, Lucía Gómez, et al.
Publicado: (2024)
por: Zaragozá, Lucía Gómez, et al.
Publicado: (2024)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
por: Li, Pengcheng, et al.
Publicado: (2024)
por: Li, Pengcheng, et al.
Publicado: (2024)
Quantization for OpenAI's Whisper Models: A Comparative Analysis
por: Andreyev, Allison
Publicado: (2025)
por: Andreyev, Allison
Publicado: (2025)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
por: Kim, Minu, et al.
Publicado: (2025)
por: Kim, Minu, et al.
Publicado: (2025)
Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
por: Mehta, Shivam, et al.
Publicado: (2025)
por: Mehta, Shivam, et al.
Publicado: (2025)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
por: Mehta, Shivam, et al.
Publicado: (2025)
por: Mehta, Shivam, et al.
Publicado: (2025)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
por: Jain, Sarthak, et al.
Publicado: (2024)
por: Jain, Sarthak, et al.
Publicado: (2024)
Generation of Musical Timbres using a Text-Guided Diffusion Model
por: Yuan, Weixuan, et al.
Publicado: (2025)
por: Yuan, Weixuan, et al.
Publicado: (2025)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
por: Alamr, Meshal, et al.
Publicado: (2026)
por: Alamr, Meshal, et al.
Publicado: (2026)
Window Size Versus Accuracy Experiments in Voice Activity Detectors
por: McKinnon, Max, et al.
Publicado: (2026)
por: McKinnon, Max, et al.
Publicado: (2026)
Prevailing Research Areas for Music AI in the Era of Foundation Models
por: Wei, Megan, et al.
Publicado: (2024)
por: Wei, Megan, et al.
Publicado: (2024)
Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Should you use a probabilistic duration model in TTS? Probably! Especially for spontaneous speech
por: Mehta, Shivam, et al.
Publicado: (2024)
por: Mehta, Shivam, et al.
Publicado: (2024)
Distilled HuBERT for Mobile Speech Emotion Recognition: A Cross-Corpus Validation Study
por: Ismail, Saifelden M.
Publicado: (2025)
por: Ismail, Saifelden M.
Publicado: (2025)
SFMS-ALR: Script-First Multilingual Speech Synthesis with Adaptive Locale Resolution
por: Donepudi, Dharma Teja
Publicado: (2025)
por: Donepudi, Dharma Teja
Publicado: (2025)
Splitformer: An improved early-exit architecture for automatic speech recognition on edge devices
por: Lasbordes, Maxence, et al.
Publicado: (2025)
por: Lasbordes, Maxence, et al.
Publicado: (2025)
Measuring Robustness of Speech Recognition from MEG Signals Under Distribution Shift
por: Chien, Sheng-You, et al.
Publicado: (2026)
por: Chien, Sheng-You, et al.
Publicado: (2026)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Fine-Tuning Large Audio-Language Models with LoRA for Precise Temporal Localization of Prolonged Exposure Therapy Elements
por: BN, Suhas, et al.
Publicado: (2025)
por: BN, Suhas, et al.
Publicado: (2025)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
por: Phukan, Orchid Chetia, et al.
Publicado: (2024)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
por: Kozak, Nazar
Publicado: (2026)
por: Kozak, Nazar
Publicado: (2026)
AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks
por: Maben, Leander Melroy, et al.
Publicado: (2025)
por: Maben, Leander Melroy, et al.
Publicado: (2025)
Guitar Tone Morphing by Diffusion-based Model
por: Chen, Kuan-Yu, et al.
Publicado: (2025)
por: Chen, Kuan-Yu, et al.
Publicado: (2025)
Bloodroot: When Watermarking Turns Poisonous For Stealthy Backdoor
por: Chen, Kuan-Yu, et al.
Publicado: (2025)
por: Chen, Kuan-Yu, et al.
Publicado: (2025)
MaskClip: Detachable Clip-on Piezoelectric Sensing of Mask Surface Vibrations for Real-time Noise-Robust Speech Input
por: Hiraki, Hirotaka, et al.
Publicado: (2025)
por: Hiraki, Hirotaka, et al.
Publicado: (2025)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
por: Adelson, Trevor, et al.
Publicado: (2026)
por: Adelson, Trevor, et al.
Publicado: (2026)
UniGlyph: A Seven-Segment Script for Universal Language Representation
por: Sherin, G. V. Bency, et al.
Publicado: (2024)
por: Sherin, G. V. Bency, et al.
Publicado: (2024)
Dereverberation Using Binary Residual Masking with Time-Domain Consistency
por: Williams, Daniel G.
Publicado: (2025)
por: Williams, Daniel G.
Publicado: (2025)
Taming Audio VAEs via Target-KL Regularization
por: Seetharaman, Prem, et al.
Publicado: (2026)
por: Seetharaman, Prem, et al.
Publicado: (2026)
Matcha-TTS: A fast TTS architecture with conditional flow matching
por: Mehta, Shivam, et al.
Publicado: (2023)
por: Mehta, Shivam, et al.
Publicado: (2023)
Ejemplares similares
-
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
por: Wang, Hsuan-Yu, et al.
Publicado: (2025) -
Improving Speech Recognition Accuracy Using Custom Language Models with the Vosk Toolkit
por: Soni, Aniket Abhishek
Publicado: (2025) -
SeamlessEdit: Background Noise Aware Zero-Shot Speech Editing with in-Context Enhancement
por: Chen, Kuan-Yu, et al.
Publicado: (2025) -
Developing Acoustic Models for Automatic Speech Recognition in Swedish
por: Salvi, Giampiero
Publicado: (2024) -
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
por: Hori, Takaaki, et al.
Publicado: (2025)