What Do Neurons Listen To? A Neuron-level Dissection of a General-purpose Audio Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kawamura, Takao, Niizumi, Daisuke, Ono, Nobutaka |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection
par: Niizumi, Daisuke, et autres
Publié: (2024)
par: Niizumi, Daisuke, et autres
Publié: (2024)
Description and Discussion on DCASE 2025 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes
par: Yasuda, Masahiro, et autres
Publié: (2025)
par: Yasuda, Masahiro, et autres
Publié: (2025)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
par: Tsubaki, Shunsuke, et autres
Publié: (2024)
par: Tsubaki, Shunsuke, et autres
Publié: (2024)
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
par: Niizumi, Daisuke, et autres
Publié: (2024)
par: Niizumi, Daisuke, et autres
Publié: (2024)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
par: Niizumi, Daisuke, et autres
Publié: (2026)
par: Niizumi, Daisuke, et autres
Publié: (2026)
SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model
par: Hernandez-Olivan, Carlos, et autres
Publié: (2024)
par: Hernandez-Olivan, Carlos, et autres
Publié: (2024)
Masked Modeling Duo: Towards a Universal Audio Pre-training Framework
par: Niizumi, Daisuke, et autres
Publié: (2024)
par: Niizumi, Daisuke, et autres
Publié: (2024)
Mel-Spectrogram Inversion via Alternating Direction Method of Multipliers
par: Masuyama, Yoshiki, et autres
Publié: (2025)
par: Masuyama, Yoshiki, et autres
Publié: (2025)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
par: Takeuchi, Daiki, et autres
Publié: (2025)
par: Takeuchi, Daiki, et autres
Publié: (2025)
Baseline Systems and Evaluation Metrics for Spatial Semantic Segmentation of Sound Scenes
par: Nguyen, Binh Thien, et autres
Publié: (2025)
par: Nguyen, Binh Thien, et autres
Publié: (2025)
Towards Pre-training an Effective Respiratory Audio Foundation Model
par: Niizumi, Daisuke, et autres
Publié: (2025)
par: Niizumi, Daisuke, et autres
Publié: (2025)
Assessing the Utility of Audio Foundation Models for Heart and Respiratory Sound Analysis
par: Niizumi, Daisuke, et autres
Publié: (2025)
par: Niizumi, Daisuke, et autres
Publié: (2025)
Description and Discussion on DCASE 2026 Challenge Task 2: Noise-aware Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
par: Nishida, Tomoya, et autres
Publié: (2026)
par: Nishida, Tomoya, et autres
Publié: (2026)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
RF-GML: Reference-Free Generative Machine Listener
par: Biswas, Arijit, et autres
Publié: (2024)
par: Biswas, Arijit, et autres
Publié: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
AND: Audio Network Dissection for Interpreting Deep Acoustic Models
par: Wu, Tung-Yu, et autres
Publié: (2024)
par: Wu, Tung-Yu, et autres
Publié: (2024)
Requirements for Mass Adoption of Assistive Listening Technology by the General Public
par: Kaufmann, Thomas B., et autres
Publié: (2023)
par: Kaufmann, Thomas B., et autres
Publié: (2023)
Listen, Think, and Understand
par: Gong, Yuan, et autres
Publié: (2023)
par: Gong, Yuan, et autres
Publié: (2023)
Latent Watermarking of Audio Generative Models
par: Roman, Robin San, et autres
Publié: (2024)
par: Roman, Robin San, et autres
Publié: (2024)
Listen, Analyze, and Adapt to Learn New Attacks: An Exemplar-Free Class Incremental Learning Method for Audio Deepfake Source Tracing
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Listenable Maps for Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
Active Listener: Continuous Generation of Listener's Head Motion Response in Dyadic Interactions
par: Ghosh, Bishal, et autres
Publié: (2024)
par: Ghosh, Bishal, et autres
Publié: (2024)
What Are They Doing? Joint Audio-Speech Co-Reasoning
par: Wang, Yingzhi, et autres
Publié: (2024)
par: Wang, Yingzhi, et autres
Publié: (2024)
DIFFA: Large Language Diffusion Models Can Listen and Understand
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
par: Rouditchenko, Andrew, et autres
Publié: (2025)
par: Rouditchenko, Andrew, et autres
Publié: (2025)
Listen through the Sound: Generative Speech Restoration Leveraging Acoustic Context Representation
par: Chung, Soo-Whan, et autres
Publié: (2025)
par: Chung, Soo-Whan, et autres
Publié: (2025)
Description and Discussion on DCASE 2025 Challenge Task 2: First-shot Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
par: Nishida, Tomoya, et autres
Publié: (2025)
par: Nishida, Tomoya, et autres
Publié: (2025)
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
par: Comunità, Marco, et autres
Publié: (2024)
par: Comunità, Marco, et autres
Publié: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation
par: Guan, Wenhao, et autres
Publié: (2024)
par: Guan, Wenhao, et autres
Publié: (2024)
Learning How to Listen: A Temporal-Frequential Attention Model for Sound Event Detection
par: Shen, Yu-Han, et autres
Publié: (2018)
par: Shen, Yu-Han, et autres
Publié: (2018)
Generalized Audio Deepfake Detection Using Frame-level Latent Information Entropy
par: Zhao, Botao, et autres
Publié: (2025)
par: Zhao, Botao, et autres
Publié: (2025)
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
par: Plaquet, Alexis, et autres
Publié: (2025)
par: Plaquet, Alexis, et autres
Publié: (2025)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
Pengi: An Audio Language Model for Audio Tasks
par: Deshmukh, Soham, et autres
Publié: (2023)
par: Deshmukh, Soham, et autres
Publié: (2023)
Wave-Trainer-Fit: Neural Vocoder with Trainable Prior and Fixed-Point Iteration towards High-Quality Speech Generation from SSL features
par: Ohnaka, Hien, et autres
Publié: (2026)
par: Ohnaka, Hien, et autres
Publié: (2026)
Audio Generation Through Score-Based Generative Modeling: Design Principles and Implementation
par: Zhu, Ge, et autres
Publié: (2025)
par: Zhu, Ge, et autres
Publié: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
Reproducing the Acoustic Velocity Vectors in a Circular Listening Area
par: Wang, Jiarui, et autres
Publié: (2024)
par: Wang, Jiarui, et autres
Publié: (2024)
Documents similaires
-
Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection
par: Niizumi, Daisuke, et autres
Publié: (2024) -
Description and Discussion on DCASE 2025 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes
par: Yasuda, Masahiro, et autres
Publié: (2025) -
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
par: Tsubaki, Shunsuke, et autres
Publié: (2024) -
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
par: Niizumi, Daisuke, et autres
Publié: (2024) -
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
par: Niizumi, Daisuke, et autres
Publié: (2026)