Interpreting End-to-End Deep Learning Models for Speech Source Localization Using Layer-wise Relevance Propagation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Comanducci, Luca, Antonacci, Fabio, Sarti, Augusto |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Room Transfer Function Reconstruction Using Complex-valued Neural Networks and Irregularly Distributed Microphones
par: Ronchini, Francesca, et autres
Publié: (2024)
par: Ronchini, Francesca, et autres
Publié: (2024)
Physics-Informed Transfer Learning for Data-Driven Sound Source Reconstruction in Near-Field Acoustic Holography
par: Luan, Xinmeng, et autres
Publié: (2025)
par: Luan, Xinmeng, et autres
Publié: (2025)
Synthetic training set generation using text-to-audio models for environmental sound classification
par: Ronchini, Francesca, et autres
Publié: (2024)
par: Ronchini, Francesca, et autres
Publié: (2024)
Reconstruction of Sound Field through Diffusion Models
par: Miotello, Federico, et autres
Publié: (2023)
par: Miotello, Federico, et autres
Publié: (2023)
Synthesis of Soundfields through Irregular Loudspeaker Arrays Based on Convolutional Neural Networks
par: Comanducci, Luca, et autres
Publié: (2022)
par: Comanducci, Luca, et autres
Publié: (2022)
PAGURI: a user experience study of creative interaction with text-to-music models
par: Ronchini, Francesca, et autres
Publié: (2024)
par: Ronchini, Francesca, et autres
Publié: (2024)
MambaFoley: Foley Sound Generation using Selective State-Space Models
par: Colombo, Marco Furio, et autres
Publié: (2024)
par: Colombo, Marco Furio, et autres
Publié: (2024)
Towards HRTF Personalization using Denoising Diffusion Models
par: Sánchez, Juan Camilo Albarracín, et autres
Publié: (2025)
par: Sánchez, Juan Camilo Albarracín, et autres
Publié: (2025)
Acoustic source localization in the spherical harmonics domain exploiting low-rank approximations
par: Cobos, Maximo, et autres
Publié: (2023)
par: Cobos, Maximo, et autres
Publié: (2023)
AI-Assisted Music Production: A User Study on Text-to-Music Models
par: Ronchini, Francesca, et autres
Publié: (2025)
par: Ronchini, Francesca, et autres
Publié: (2025)
Implicit neural representation with physics-informed neural networks for the reconstruction of the early part of room impulse responses
par: Pezzoli, Mirco, et autres
Publié: (2023)
par: Pezzoli, Mirco, et autres
Publié: (2023)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
par: Zhou, Junzuo, et autres
Publié: (2024)
par: Zhou, Junzuo, et autres
Publié: (2024)
Mitigating data replication in text-to-audio generative diffusion models through anti-memorization guidance
par: Messina, Francisco, et autres
Publié: (2025)
par: Messina, Francisco, et autres
Publié: (2025)
Diffused Responsibility: Analyzing the Energy Consumption of Generative Text-to-Audio Diffusion Models
par: Passoni, Riccardo, et autres
Publié: (2025)
par: Passoni, Riccardo, et autres
Publié: (2025)
FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models
par: Comanducci, Luca, et autres
Publié: (2024)
par: Comanducci, Luca, et autres
Publié: (2024)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
par: Chen, Junyang, et autres
Publié: (2026)
par: Chen, Junyang, et autres
Publié: (2026)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
par: Guimarães, Heitor R., et autres
Publié: (2024)
par: Guimarães, Heitor R., et autres
Publié: (2024)
End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario
par: Ghane, Mohsen, et autres
Publié: (2025)
par: Ghane, Mohsen, et autres
Publié: (2025)
End-to-End Diarization utilizing Attractor Deep Clustering
par: Palzer, David, et autres
Publié: (2025)
par: Palzer, David, et autres
Publié: (2025)
AADNet: An End-to-End Deep Learning Model for Auditory Attention Decoding
par: Nguyen, Nhan Duc Thanh, et autres
Publié: (2024)
par: Nguyen, Nhan Duc Thanh, et autres
Publié: (2024)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
par: Ahmad, Hawraz A., et autres
Publié: (2024)
par: Ahmad, Hawraz A., et autres
Publié: (2024)
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
par: Deng, Keqi, et autres
Publié: (2024)
par: Deng, Keqi, et autres
Publié: (2024)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)
par: Yamashita, Natsuo, et autres
Publié: (2024)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
par: Cooper, Erica, et autres
Publié: (2025)
par: Cooper, Erica, et autres
Publié: (2025)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
par: Guo, Yinlin, et autres
Publié: (2024)
par: Guo, Yinlin, et autres
Publié: (2024)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
Low-Rank Adaptation of Deep Prior Neural Networks For Room Impulse Response Reconstruction
par: Pezzoli, Mirco, et autres
Publié: (2025)
par: Pezzoli, Mirco, et autres
Publié: (2025)
On Improving Error Resilience of Neural End-to-End Speech Coders
par: Gupta, Kishan, et autres
Publié: (2024)
par: Gupta, Kishan, et autres
Publié: (2024)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
par: Zhuang, Zhuoran, et autres
Publié: (2026)
par: Zhuang, Zhuoran, et autres
Publié: (2026)
Speaker Adaptation for Quantised End-to-End ASR Models
par: Zhao, Qiuming, et autres
Publié: (2024)
par: Zhao, Qiuming, et autres
Publié: (2024)
Qifusion-Net: Layer-adapted Stream/Non-stream Model for End-to-End Multi-Accent Speech Recognition
par: Chen, Jinming, et autres
Publié: (2024)
par: Chen, Jinming, et autres
Publié: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Toward Deep Drum Source Separation
par: Mezza, Alessandro Ilic, et autres
Publié: (2023)
par: Mezza, Alessandro Ilic, et autres
Publié: (2023)
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
par: Plaquet, Alexis, et autres
Publié: (2025)
par: Plaquet, Alexis, et autres
Publié: (2025)
Meta-Learning in Audio and Speech Processing: An End to End Comprehensive Review
par: Raimon, Athul, et autres
Publié: (2024)
par: Raimon, Athul, et autres
Publié: (2024)
Representation Purification for End-to-End Speech Translation
par: Zhang, Chengwei, et autres
Publié: (2024)
par: Zhang, Chengwei, et autres
Publié: (2024)
End-to-End Amp Modeling: From Data to Controllable Guitar Amplifier Models
par: Juvela, Lauri, et autres
Publié: (2024)
par: Juvela, Lauri, et autres
Publié: (2024)
A Physics-Informed Neural Network-Based Approach for the Spatial Upsampling of Spherical Microphone Arrays
par: Miotello, Federico, et autres
Publié: (2024)
par: Miotello, Federico, et autres
Publié: (2024)
Documents similaires
-
Room Transfer Function Reconstruction Using Complex-valued Neural Networks and Irregularly Distributed Microphones
par: Ronchini, Francesca, et autres
Publié: (2024) -
Physics-Informed Transfer Learning for Data-Driven Sound Source Reconstruction in Near-Field Acoustic Holography
par: Luan, Xinmeng, et autres
Publié: (2025) -
Synthetic training set generation using text-to-audio models for environmental sound classification
par: Ronchini, Francesca, et autres
Publié: (2024) -
Reconstruction of Sound Field through Diffusion Models
par: Miotello, Federico, et autres
Publié: (2023) -
Synthesis of Soundfields through Irregular Loudspeaker Arrays Based on Convolutional Neural Networks
par: Comanducci, Luca, et autres
Publié: (2022)