Visual-Aware Speech Recognition for Noisy Scenarios
Fuente:
arXiv
Salvato in:
| Autori principali: | Balaji, Lakshmipathi, Singla, Karan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Automatic Speech Recognition of Non-Native Child Speech for Language Learning Applications
di: Wills, Simone, et al.
Pubblicazione: (2023)
di: Wills, Simone, et al.
Pubblicazione: (2023)
Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation
di: Kim, Minsu, et al.
Pubblicazione: (2023)
di: Kim, Minsu, et al.
Pubblicazione: (2023)
A Large-Scale Evaluation of Speech Foundation Models
di: Yang, Shu-wen, et al.
Pubblicazione: (2024)
di: Yang, Shu-wen, et al.
Pubblicazione: (2024)
TouchASP: Elastic Automatic Speech Perception that Everyone Can Touch
di: Song, Xingchen, et al.
Pubblicazione: (2024)
di: Song, Xingchen, et al.
Pubblicazione: (2024)
WST-X Series: Wavelet Scattering Transform for Interpretable Speech Deepfake Detection
di: Xuan, Xi, et al.
Pubblicazione: (2026)
di: Xuan, Xi, et al.
Pubblicazione: (2026)
WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake Detection
di: Xuan, Xi, et al.
Pubblicazione: (2025)
di: Xuan, Xi, et al.
Pubblicazione: (2025)
RIR-Mega-Speech: A Reverberant Speech Corpus with Comprehensive Acoustic Metadata and Reproducible Evaluation
di: Goswami, Mandip
Pubblicazione: (2026)
di: Goswami, Mandip
Pubblicazione: (2026)
Hybrid Deep Learning and Signal Processing for Arabic Dialect Recognition in Low-Resource Settings
di: Al-Shwayyat, Ghazal, et al.
Pubblicazione: (2025)
di: Al-Shwayyat, Ghazal, et al.
Pubblicazione: (2025)
Semantic Communications for Speech Recognition
di: Weng, Zhenzi, et al.
Pubblicazione: (2021)
di: Weng, Zhenzi, et al.
Pubblicazione: (2021)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
Language Bias in Self-Supervised Learning For Automatic Speech Recognition
di: Storey, Edward, et al.
Pubblicazione: (2025)
di: Storey, Edward, et al.
Pubblicazione: (2025)
BanglaNum -- A Public Dataset for Bengali Digit Recognition from Speech
di: Mohammad, Mir Sayeed, et al.
Pubblicazione: (2024)
di: Mohammad, Mir Sayeed, et al.
Pubblicazione: (2024)
A Computational Approach to Analyzing Disrupted Language in Schizophrenia: Integrating Surprisal and Coherence Measures
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
Neuro2Semantic: A Transfer Learning Framework for Semantic Reconstruction of Continuous Language from Human Intracranial EEG
di: Shams, Siavash, et al.
Pubblicazione: (2025)
di: Shams, Siavash, et al.
Pubblicazione: (2025)
MultiGen: Child-Friendly Multilingual Speech Generator with LLMs
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
Improved Cross-Lingual Transfer Learning For Automatic Speech Translation
di: Khurana, Sameer, et al.
Pubblicazione: (2023)
di: Khurana, Sameer, et al.
Pubblicazione: (2023)
Reading Miscue Detection in Primary School through Automatic Speech Recognition
di: Gao, Lingyun, et al.
Pubblicazione: (2024)
di: Gao, Lingyun, et al.
Pubblicazione: (2024)
Exploring Audio-Visual Information Fusion for Sound Event Localization and Detection In Low-Resource Realistic Scenarios
di: Jiang, Ya, et al.
Pubblicazione: (2024)
di: Jiang, Ya, et al.
Pubblicazione: (2024)
Enhancing Listened Speech Decoding from EEG via Parallel Phoneme Sequence Prediction
di: Lee, Jihwan, et al.
Pubblicazione: (2025)
di: Lee, Jihwan, et al.
Pubblicazione: (2025)
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
A Study on Speech Assessment with Visual Cues
di: Ahmed, Shafique, et al.
Pubblicazione: (2025)
di: Ahmed, Shafique, et al.
Pubblicazione: (2025)
SpeechMLC: Speech Multi-label Classification
di: Kim, Miseul, et al.
Pubblicazione: (2025)
di: Kim, Miseul, et al.
Pubblicazione: (2025)
A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations
di: Dutta, Soumya, et al.
Pubblicazione: (2026)
di: Dutta, Soumya, et al.
Pubblicazione: (2026)
Exploring Dynamic Parameters for Vietnamese Gender-Independent ASR
di: Leang, Sotheara, et al.
Pubblicazione: (2025)
di: Leang, Sotheara, et al.
Pubblicazione: (2025)
Alzheimer Disease Classification through ASR-based Transcriptions: Exploring the Impact of Punctuation and Pauses
di: Gómez-Zaragozá, Lucía, et al.
Pubblicazione: (2023)
di: Gómez-Zaragozá, Lucía, et al.
Pubblicazione: (2023)
Automatic Assessment of Oral Reading Accuracy for Reading Diagnostics
di: Molenaar, Bo, et al.
Pubblicazione: (2023)
di: Molenaar, Bo, et al.
Pubblicazione: (2023)
Is Attention always needed? A Case Study on Language Identification from Speech
di: Mandal, Atanu, et al.
Pubblicazione: (2021)
di: Mandal, Atanu, et al.
Pubblicazione: (2021)
Attentive Fusion: A Transformer-based Approach to Multimodal Hate Speech Detection
di: Mandal, Atanu, et al.
Pubblicazione: (2024)
di: Mandal, Atanu, et al.
Pubblicazione: (2024)
Benchmarking Audio Deepfake Detection Robustness in Real-world Communication Scenarios
di: Shi, Haohan, et al.
Pubblicazione: (2025)
di: Shi, Haohan, et al.
Pubblicazione: (2025)
Target Speaker Selection for Neural Network Beamforming in Multi-Speaker Scenarios
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2025)
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2025)
A Speech Production Model for Radar: Connecting Speech Acoustics with Radar-Measured Vibrations
di: Lenz, Isabella, et al.
Pubblicazione: (2025)
di: Lenz, Isabella, et al.
Pubblicazione: (2025)
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
VoxKnesset: A Large-Scale Longitudinal Hebrew Speech Dataset for Aging Speaker Modeling
di: Marmor, Yanir, et al.
Pubblicazione: (2026)
di: Marmor, Yanir, et al.
Pubblicazione: (2026)
Binaural Localization Model for Speech in Noise
di: Tokala, Vikas, et al.
Pubblicazione: (2025)
di: Tokala, Vikas, et al.
Pubblicazione: (2025)
Speech-Based Prioritization for Schizophrenia Intervention
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
Prompt-driven Target Speech Diarization
di: Jiang, Yidi, et al.
Pubblicazione: (2023)
di: Jiang, Yidi, et al.
Pubblicazione: (2023)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
di: Fu, Li, et al.
Pubblicazione: (2025)
di: Fu, Li, et al.
Pubblicazione: (2025)
A Neural Denoising Vocoder for Clean Waveform Generation from Noisy Mel-Spectrogram based on Amplitude and Phase Predictions
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
Streaming Speech-to-Confusion Network Speech Recognition
di: Filimonov, Denis, et al.
Pubblicazione: (2023)
di: Filimonov, Denis, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Automatic Speech Recognition of Non-Native Child Speech for Language Learning Applications
di: Wills, Simone, et al.
Pubblicazione: (2023) -
Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation
di: Kim, Minsu, et al.
Pubblicazione: (2023) -
A Large-Scale Evaluation of Speech Foundation Models
di: Yang, Shu-wen, et al.
Pubblicazione: (2024) -
TouchASP: Elastic Automatic Speech Perception that Everyone Can Touch
di: Song, Xingchen, et al.
Pubblicazione: (2024) -
WST-X Series: Wavelet Scattering Transform for Interpretable Speech Deepfake Detection
di: Xuan, Xi, et al.
Pubblicazione: (2026)