Speech Denoising with Auditory Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Saddler, Mark R., Francl, Andrew, Feather, Jenelle, Qian, Kaizhi, Zhang, Yang, McDermott, Josh H. |
|---|---|
| Format: | Preprint |
| Publié: |
2020
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Radif Corpus: A Symbolic Dataset for Non-Metric Iranian Classical Music
par: Kanani, Maziar, et autres
Publié: (2025)
par: Kanani, Maziar, et autres
Publié: (2025)
Towards Perception-Informed Latent HRTF Representations
par: Zhang, You, et autres
Publié: (2025)
par: Zhang, You, et autres
Publié: (2025)
Towards Unsupervised Speech Recognition Without Pronunciation Models
par: Ni, Junrui, et autres
Publié: (2024)
par: Ni, Junrui, et autres
Publié: (2024)
Text Conditioned Symbolic Drumbeat Generation using Latent Diffusion Models
par: Jajoria, Pushkar, et autres
Publié: (2024)
par: Jajoria, Pushkar, et autres
Publié: (2024)
Harmonic Detection from Noisy Speech with Auditory Frame Gain for Intelligibility Enhancement
par: Queiroz, A., et autres
Publié: (2024)
par: Queiroz, A., et autres
Publié: (2024)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
par: Li, Jialu, et autres
Publié: (2024)
par: Li, Jialu, et autres
Publié: (2024)
Losses Can Be Blessings: Routing Self-Supervised Speech Representations Towards Efficient Multilingual and Multitask Speech Processing
par: Fu, Yonggan, et autres
Publié: (2022)
par: Fu, Yonggan, et autres
Publié: (2022)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
par: Wang, Siyin, et autres
Publié: (2024)
par: Wang, Siyin, et autres
Publié: (2024)
Grammatical Structure and Grammatical Variations in Non-Metric Iranian Classical Music
par: Kanani, Maziar, et autres
Publié: (2025)
par: Kanani, Maziar, et autres
Publié: (2025)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Training a Perceptual Model for Evaluating Auditory Similarity in Music Adversarial Attack
par: Liu, Yuxuan, et autres
Publié: (2025)
par: Liu, Yuxuan, et autres
Publié: (2025)
Next Tokens Denoising for Speech Synthesis
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
RaD-Net: A Repairing and Denoising Network for Speech Signal Improvement
par: Liu, Mingshuai, et autres
Publié: (2024)
par: Liu, Mingshuai, et autres
Publié: (2024)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
par: Zhang, Leying, et autres
Publié: (2025)
par: Zhang, Leying, et autres
Publié: (2025)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
Auditory Representation Effective for Estimating Vocal Tract Information
par: Irino, Toshio, et autres
Publié: (2023)
par: Irino, Toshio, et autres
Publié: (2023)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
par: Zhang, Leying, et autres
Publié: (2024)
par: Zhang, Leying, et autres
Publié: (2024)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
par: Li, Chenda, et autres
Publié: (2024)
par: Li, Chenda, et autres
Publié: (2024)
Are Deep Speech Denoising Models Robust to Adversarial Noise?
par: Schwarzer, Will, et autres
Publié: (2025)
par: Schwarzer, Will, et autres
Publié: (2025)
Improving Design of Input Condition Invariant Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024)
par: Zhang, Wangyou, et autres
Publié: (2024)
Adaptive Differential Denoising for Respiratory Sounds Classification
par: Dong, Gaoyang, et autres
Publié: (2025)
par: Dong, Gaoyang, et autres
Publié: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
StreamAAD: Decoding Spatial Auditory Attention with a Streaming Architecture
par: Qiu, Zelin, et autres
Publié: (2024)
par: Qiu, Zelin, et autres
Publié: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
par: Lian, Zhicheng, et autres
Publié: (2025)
par: Lian, Zhicheng, et autres
Publié: (2025)
Towards HRTF Personalization using Denoising Diffusion Models
par: Sánchez, Juan Camilo Albarracín, et autres
Publié: (2025)
par: Sánchez, Juan Camilo Albarracín, et autres
Publié: (2025)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
par: Zhang, Chu Yuan, et autres
Publié: (2023)
par: Zhang, Chu Yuan, et autres
Publié: (2023)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
par: Ku, Pin-Jui, et autres
Publié: (2024)
par: Ku, Pin-Jui, et autres
Publié: (2024)
Performance Modeling for Correlation-based Neural Decoding of Auditory Attention to Speech
par: Geirnaert, Simon, et autres
Publié: (2025)
par: Geirnaert, Simon, et autres
Publié: (2025)
Fine-Tuning Automatic Speech Recognition for People with Parkinson's: An Effective Strategy for Enhancing Speech Technology Accessibility
par: Zheng, Xiuwen, et autres
Publié: (2024)
par: Zheng, Xiuwen, et autres
Publié: (2024)
DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis
par: Lee, Dongheon, et autres
Publié: (2025)
par: Lee, Dongheon, et autres
Publié: (2025)
Mamba in Speech: Towards an Alternative to Self-Attention
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
Vision Transformer Segmentation for Visual Bird Sound Denoising
par: Kumar, Sahil, et autres
Publié: (2024)
par: Kumar, Sahil, et autres
Publié: (2024)
Réduire le bruit grâce à la réalité augmentée sonore -- Auditory Concealer
par: Boukhemia, Clara
Publié: (2025)
par: Boukhemia, Clara
Publié: (2025)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
SCOREQ: Speech Quality Assessment with Contrastive Regression
par: Ragano, Alessandro, et autres
Publié: (2024)
par: Ragano, Alessandro, et autres
Publié: (2024)
Complex Image-Generative Diffusion Transformer for Audio Denoising
par: Li, Junhui, et autres
Publié: (2024)
par: Li, Junhui, et autres
Publié: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
par: Liao, Shijia, et autres
Publié: (2024)
par: Liao, Shijia, et autres
Publié: (2024)
Documents similaires
-
Radif Corpus: A Symbolic Dataset for Non-Metric Iranian Classical Music
par: Kanani, Maziar, et autres
Publié: (2025) -
Towards Perception-Informed Latent HRTF Representations
par: Zhang, You, et autres
Publié: (2025) -
Towards Unsupervised Speech Recognition Without Pronunciation Models
par: Ni, Junrui, et autres
Publié: (2024) -
Text Conditioned Symbolic Drumbeat Generation using Latent Diffusion Models
par: Jajoria, Pushkar, et autres
Publié: (2024) -
Harmonic Detection from Noisy Speech with Auditory Frame Gain for Intelligibility Enhancement
par: Queiroz, A., et autres
Publié: (2024)