How much to Dereverberate? Low-Latency Single-Channel Speech Enhancement in Distant Microphone Scenarios
Fuente:
arXiv
Salvato in:
| Autori principali: | Venkatesh, Satvik, Coleman, Philip, Benilov, Arthur, Brown, Simon, Sheta, Selim, Roskam, Frederic |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet
di: Venkatesh, Satvik, et al.
Pubblicazione: (2024)
di: Venkatesh, Satvik, et al.
Pubblicazione: (2024)
EMOVOME: A Dataset for Emotion Recognition in Spontaneous Real-Life Speech
di: Gómez-Zaragozá, Lucía, et al.
Pubblicazione: (2024)
di: Gómez-Zaragozá, Lucía, et al.
Pubblicazione: (2024)
Dereverberation Using Binary Residual Masking with Time-Domain Consistency
di: Williams, Daniel G.
Pubblicazione: (2025)
di: Williams, Daniel G.
Pubblicazione: (2025)
Unified Semi-Supervised Pipeline for Automatic Speech Recognition
di: Tadevosyan, Nune, et al.
Pubblicazione: (2025)
di: Tadevosyan, Nune, et al.
Pubblicazione: (2025)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
Emotional Voice Messages (EMOVOME) database: emotion recognition in spontaneous voice messages
di: Zaragozá, Lucía Gómez, et al.
Pubblicazione: (2024)
di: Zaragozá, Lucía Gómez, et al.
Pubblicazione: (2024)
Graph Connectionist Temporal Classification for Phoneme Recognition
di: Grafé, Henry, et al.
Pubblicazione: (2025)
di: Grafé, Henry, et al.
Pubblicazione: (2025)
Open Automatic Speech Recognition Models for Classical and Modern Standard Arabic
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
Quantum-Enhanced Analysis and Grading of Vocal Performance
di: Agarwal, Rohan
Pubblicazione: (2025)
di: Agarwal, Rohan
Pubblicazione: (2025)
DFingerNet: Noise-Adaptive Speech Enhancement for Hearing Aids
di: Tsangko, Iosif, et al.
Pubblicazione: (2025)
di: Tsangko, Iosif, et al.
Pubblicazione: (2025)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
Deep Feed-Forward Neural Network for Bangla Isolated Speech Recognition
di: Bhadra, Dipayan, et al.
Pubblicazione: (2025)
di: Bhadra, Dipayan, et al.
Pubblicazione: (2025)
Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering
di: Aristorenas, Aris J.
Pubblicazione: (2024)
di: Aristorenas, Aris J.
Pubblicazione: (2024)
Revisiting SSL for sound event detection: complementary fusion and adaptive post-processing
di: Cui, Hanfang, et al.
Pubblicazione: (2025)
di: Cui, Hanfang, et al.
Pubblicazione: (2025)
Joint Estimation of Piano Dynamics and Metrical Structure with a Multi-task Multi-Scale Network
di: He, Zhanhong, et al.
Pubblicazione: (2025)
di: He, Zhanhong, et al.
Pubblicazione: (2025)
Quantization for OpenAI's Whisper Models: A Comparative Analysis
di: Andreyev, Allison
Pubblicazione: (2025)
di: Andreyev, Allison
Pubblicazione: (2025)
Hidden Echoes Survive Training in Audio To Audio Generative Instrument Models
di: Tralie, Christopher J., et al.
Pubblicazione: (2024)
di: Tralie, Christopher J., et al.
Pubblicazione: (2024)
Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device
di: Kozak, Nazar
Pubblicazione: (2026)
di: Kozak, Nazar
Pubblicazione: (2026)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
di: Marie, Ambre, et al.
Pubblicazione: (2025)
di: Marie, Ambre, et al.
Pubblicazione: (2025)
Modeling L1 Influence on L2 Pronunciation: An MFCC-Based Framework for Explainable Machine Learning and Pedagogical Feedback
di: Jahanbin, Peyman
Pubblicazione: (2025)
di: Jahanbin, Peyman
Pubblicazione: (2025)
In-situ Autoguidance: Eliciting Self-Correction in Diffusion Models
di: Gu, Enhao, et al.
Pubblicazione: (2025)
di: Gu, Enhao, et al.
Pubblicazione: (2025)
Impulsive pattern recognition of a myoelectric hand via Dynamic Time Warping
di: Kadilar, Mustafa Can, et al.
Pubblicazione: (2025)
di: Kadilar, Mustafa Can, et al.
Pubblicazione: (2025)
STRUM: A Spectral Transcription and Rhythm Understanding Model for End-to-End Generation of Playable Rhythm-Game Charts
di: Opria, Joshua
Pubblicazione: (2026)
di: Opria, Joshua
Pubblicazione: (2026)
A Novel Schur-Decomposition-Based Weight Projection Method for Stable State-Space Neural-Network Architectures
di: Vanegas, Sergio, et al.
Pubblicazione: (2026)
di: Vanegas, Sergio, et al.
Pubblicazione: (2026)
SpATr: MoCap 3D Human Action Recognition based on Spiral Auto-encoder and Transformer Network
di: Bouzid, Hamza, et al.
Pubblicazione: (2023)
di: Bouzid, Hamza, et al.
Pubblicazione: (2023)
Sparse Concept Bottleneck Models: Gumbel Tricks in Contrastive Learning
di: Semenov, Andrei, et al.
Pubblicazione: (2024)
di: Semenov, Andrei, et al.
Pubblicazione: (2024)
Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features
di: Freisinger, Steffen, et al.
Pubblicazione: (2026)
di: Freisinger, Steffen, et al.
Pubblicazione: (2026)
Fine-tuning Pre-trained Audio Models for COVID-19 Detection: A Technical Report
di: de Brito, Daniel Oliveira, et al.
Pubblicazione: (2025)
di: de Brito, Daniel Oliveira, et al.
Pubblicazione: (2025)
An End-to-End Approach for Korean Wakeword Systems with Speaker Authentication
di: Seo, Geonwoo
Pubblicazione: (2025)
di: Seo, Geonwoo
Pubblicazione: (2025)
Audio-based Kinship Verification Using Age Domain Conversion
di: Sun, Qiyang, et al.
Pubblicazione: (2024)
di: Sun, Qiyang, et al.
Pubblicazione: (2024)
Uncovering Population PK Covariates from VAE-Generated Latent Spaces
di: Perazzolo, Diego, et al.
Pubblicazione: (2025)
di: Perazzolo, Diego, et al.
Pubblicazione: (2025)
Connected Speech-Based Cognitive Assessment in Chinese and English
di: Luz, Saturnino, et al.
Pubblicazione: (2024)
di: Luz, Saturnino, et al.
Pubblicazione: (2024)
The evolution of inharmonicity and noisiness in contemporary popular music
di: Deruty, Emmanuel, et al.
Pubblicazione: (2024)
di: Deruty, Emmanuel, et al.
Pubblicazione: (2024)
Neural Proxies for Sound Synthesizers: Learning Perceptually Informed Preset Representations
di: Combes, Paolo, et al.
Pubblicazione: (2025)
di: Combes, Paolo, et al.
Pubblicazione: (2025)
Impact of Phonetics on Speaker Identity in Adversarial Voice Attack
di: Dar, Daniyal Kabir, et al.
Pubblicazione: (2025)
di: Dar, Daniyal Kabir, et al.
Pubblicazione: (2025)
Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation
di: Estepa, Imanol G., et al.
Pubblicazione: (2026)
di: Estepa, Imanol G., et al.
Pubblicazione: (2026)
All4One: Symbiotic Neighbour Contrastive Learning via Self-Attention and Redundancy Reduction
di: Estepa, Imanol G., et al.
Pubblicazione: (2023)
di: Estepa, Imanol G., et al.
Pubblicazione: (2023)
Documenti analoghi
-
Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet
di: Venkatesh, Satvik, et al.
Pubblicazione: (2024) -
EMOVOME: A Dataset for Emotion Recognition in Spontaneous Real-Life Speech
di: Gómez-Zaragozá, Lucía, et al.
Pubblicazione: (2024) -
Dereverberation Using Binary Residual Masking with Time-Domain Consistency
di: Williams, Daniel G.
Pubblicazione: (2025) -
Unified Semi-Supervised Pipeline for Automatic Speech Recognition
di: Tadevosyan, Nune, et al.
Pubblicazione: (2025) -
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025)