Explainable by-design Audio Segmentation through Non-Negative Matrix Factorization and Probing
Fuente:
arXiv
Guardado en:
| Autores principales: | Lebourdais, Martin, Mariotte, Théo, Almudévar, Antonio, Tahon, Marie, Ortega, Alfonso |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sparse Autoencoders Make Audio Foundation Models more Explainable
por: Mariotte, Théo, et al.
Publicado: (2025)
por: Mariotte, Théo, et al.
Publicado: (2025)
An Explainable Proxy Model for Multiabel Audio Segmentation
por: Mariotte, Théo, et al.
Publicado: (2024)
por: Mariotte, Théo, et al.
Publicado: (2024)
Angular Distance Distribution Loss for Audio Classification
por: Almudévar, Antonio, et al.
Publicado: (2024)
por: Almudévar, Antonio, et al.
Publicado: (2024)
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
por: Mariotte, Theo, et al.
Publicado: (2024)
por: Mariotte, Theo, et al.
Publicado: (2024)
Channel-Combination Algorithms for Robust Distant Voice Activity and Overlapped Speech Detection
por: Mariotte, Théo, et al.
Publicado: (2024)
por: Mariotte, Théo, et al.
Publicado: (2024)
Large Language Models and Non-Negative Matrix Factorization for Bioacoustic Signal Decomposition
por: Torabi, Yasaman, et al.
Publicado: (2025)
por: Torabi, Yasaman, et al.
Publicado: (2025)
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
por: Xu, Shitong, et al.
Publicado: (2025)
por: Xu, Shitong, et al.
Publicado: (2025)
Rethinking Non-Negative Matrix Factorization with Implicit Neural Representations
por: Subramani, Krishna, et al.
Publicado: (2024)
por: Subramani, Krishna, et al.
Publicado: (2024)
Multiple Choice Learning for Efficient Speech Separation with Many Speakers
por: Perera, David, et al.
Publicado: (2024)
por: Perera, David, et al.
Publicado: (2024)
The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS
por: Carone, Brandon James, et al.
Publicado: (2025)
por: Carone, Brandon James, et al.
Publicado: (2025)
Augmentation through Laundering Attacks for Audio Spoof Detection
por: Ali, Hashim, et al.
Publicado: (2024)
por: Ali, Hashim, et al.
Publicado: (2024)
Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG
por: Yang, Haoyun, et al.
Publicado: (2026)
por: Yang, Haoyun, et al.
Publicado: (2026)
Investigation of Whisper ASR Hallucinations Induced by Non-Speech Audio
por: Barański, Mateusz, et al.
Publicado: (2025)
por: Barański, Mateusz, et al.
Publicado: (2025)
Generalizable Audio Spoofing Detection using Non-Semantic Representations
por: Das, Arnab, et al.
Publicado: (2025)
por: Das, Arnab, et al.
Publicado: (2025)
LearnAFE: Circuit-Algorithm Co-design Framework for Learnable Audio Analog Front-End
por: Hu, Jinhai, et al.
Publicado: (2025)
por: Hu, Jinhai, et al.
Publicado: (2025)
AudioGenX: Explainability on Text-to-Audio Generative Models
por: Kang, Hyunju, et al.
Publicado: (2025)
por: Kang, Hyunju, et al.
Publicado: (2025)
Automatic Voice Identification after Speech Resynthesis using PPG
por: Gaudier, Thibault, et al.
Publicado: (2024)
por: Gaudier, Thibault, et al.
Publicado: (2024)
Quranic Audio Dataset: Crowdsourced and Labeled Recitation from Non-Arabic Speakers
por: Salameh, Raghad, et al.
Publicado: (2024)
por: Salameh, Raghad, et al.
Publicado: (2024)
SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding
por: Guinot, Julien, et al.
Publicado: (2025)
por: Guinot, Julien, et al.
Publicado: (2025)
Combining Audio and Non-Audio Inputs in Evolved Neural Networks for Ovenbird
por: Hernandez, Sergio Poo, et al.
Publicado: (2025)
por: Hernandez, Sergio Poo, et al.
Publicado: (2025)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
por: Lin, Jiaju, et al.
Publicado: (2024)
por: Lin, Jiaju, et al.
Publicado: (2024)
DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization
por: Lee, Geonyoung, et al.
Publicado: (2025)
por: Lee, Geonyoung, et al.
Publicado: (2025)
Beyond Silence: Bias Analysis through Loss and Asymmetric Approach in Audio Anti-Spoofing
por: Shim, Hye-jin, et al.
Publicado: (2024)
por: Shim, Hye-jin, et al.
Publicado: (2024)
Audio Atlas: Visualizing and Exploring Audio Datasets
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
An Investigation Into Explainable Audio Hate Speech Detection
por: An, Jinmyeong, et al.
Publicado: (2024)
por: An, Jinmyeong, et al.
Publicado: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
por: Han, Bing, et al.
Publicado: (2026)
por: Han, Bing, et al.
Publicado: (2026)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
por: Zhou, Xinyu, et al.
Publicado: (2026)
por: Zhou, Xinyu, et al.
Publicado: (2026)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
Audio Signal Processing Using Time Domain Mel-Frequency Wavelet Coefficient
por: Sebastian, Rinku, et al.
Publicado: (2025)
por: Sebastian, Rinku, et al.
Publicado: (2025)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
por: Erol, Mehmet Hamza, et al.
Publicado: (2024)
por: Erol, Mehmet Hamza, et al.
Publicado: (2024)
AudioScene: Integrating Object-Event Audio into 3D Scenes
por: Yuan, Shuaihang, et al.
Publicado: (2025)
por: Yuan, Shuaihang, et al.
Publicado: (2025)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
por: Yadav, Sarthak, et al.
Publicado: (2024)
por: Yadav, Sarthak, et al.
Publicado: (2024)
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
por: Alex, Tony, et al.
Publicado: (2025)
por: Alex, Tony, et al.
Publicado: (2025)
Domain Adaptation Method and Modality Gap Impact in Audio-Text Models for Prototypical Sound Classification
por: Acevedo, Emiliano, et al.
Publicado: (2025)
por: Acevedo, Emiliano, et al.
Publicado: (2025)
Stable Audio Open
por: Evans, Zach, et al.
Publicado: (2024)
por: Evans, Zach, et al.
Publicado: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
por: Song, Zirui, et al.
Publicado: (2025)
por: Song, Zirui, et al.
Publicado: (2025)
SynSonic: Augmenting Sound Event Detection through Text-to-Audio Diffusion ControlNet and Effective Sample Filtering
por: Hai, Jiarui, et al.
Publicado: (2025)
por: Hai, Jiarui, et al.
Publicado: (2025)
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
por: Mei, Xinhao, et al.
Publicado: (2026)
por: Mei, Xinhao, et al.
Publicado: (2026)
Ejemplares similares
-
Sparse Autoencoders Make Audio Foundation Models more Explainable
por: Mariotte, Théo, et al.
Publicado: (2025) -
An Explainable Proxy Model for Multiabel Audio Segmentation
por: Mariotte, Théo, et al.
Publicado: (2024) -
Angular Distance Distribution Loss for Audio Classification
por: Almudévar, Antonio, et al.
Publicado: (2024) -
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
por: Mariotte, Theo, et al.
Publicado: (2024) -
Channel-Combination Algorithms for Robust Distant Voice Activity and Overlapped Speech Detection
por: Mariotte, Théo, et al.
Publicado: (2024)