Learning Interpretable Features in Audio Latent Spaces via Sparse Autoencoders
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Paek, Nathan, Zang, Yongyi, Yang, Qihui, Leistikow, Randal |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FlowSynth: Instrument Generation Through Distributional Flow Matching and Test-Time Search
par: Yang, Qihui, et autres
Publié: (2025)
par: Yang, Qihui, et autres
Publié: (2025)
PromptReverb: Multimodal Room Impulse Response Generation Through Latent Rectified Flow Matching
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
Efficient Vocal Source Separation Through Windowed Sink Attention
par: Benetatos, Christodoulos, et autres
Publié: (2025)
par: Benetatos, Christodoulos, et autres
Publié: (2025)
StylePitcher: Generating Style-Following and Expressive Pitch Curves for Versatile Singing Tasks
par: Huang, Jingyue, et autres
Publié: (2025)
par: Huang, Jingyue, et autres
Publié: (2025)
Training-Free Multi-Step Audio Source Separation
par: Zang, Yongyi, et autres
Publié: (2025)
par: Zang, Yongyi, et autres
Publié: (2025)
Music2Latent: Consistency Autoencoders for Latent Audio Compression
par: Pasini, Marco, et autres
Publié: (2024)
par: Pasini, Marco, et autres
Publié: (2024)
Re-Bottleneck: Latent Re-Structuring for Neural Audio Autoencoders
par: Bralios, Dimitrios, et autres
Publié: (2025)
par: Bralios, Dimitrios, et autres
Publié: (2025)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
par: Paissan, Francesco, et autres
Publié: (2026)
par: Paissan, Francesco, et autres
Publié: (2026)
Sparse Autoencoders Make Audio Foundation Models more Explainable
par: Mariotte, Théo, et autres
Publié: (2025)
par: Mariotte, Théo, et autres
Publié: (2025)
Audio Super-Resolution with Latent Bridge Models
par: Li, Chang, et autres
Publié: (2025)
par: Li, Chang, et autres
Publié: (2025)
Piano Transcription by Hierarchical Language Modeling with Pretrained Roll-based Encoders
par: Li, Dichucheng, et autres
Publié: (2025)
par: Li, Dichucheng, et autres
Publié: (2025)
Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization
par: Torres, Bernardo, et autres
Publié: (2025)
par: Torres, Bernardo, et autres
Publié: (2025)
Descriptor-Injected Cross-Modal Learning: A Systematic Exploration of Audio-MIDI Alignment via Spectral and Melodic Features
par: Méndez, Mariano Fernández
Publié: (2026)
par: Méndez, Mariano Fernández
Publié: (2026)
Learning to Upsample and Upmix Audio in the Latent Domain
par: Bralios, Dimitrios, et autres
Publié: (2025)
par: Bralios, Dimitrios, et autres
Publié: (2025)
CyIN: Cyclic Informative Latent Space for Bridging Complete and Incomplete Multimodal Learning
par: Lin, Ronghao, et autres
Publié: (2026)
par: Lin, Ronghao, et autres
Publié: (2026)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
par: Wu, Daiqing, et autres
Publié: (2026)
par: Wu, Daiqing, et autres
Publié: (2026)
Unleashing the Power of Natural Audio Featuring Multiple Sound Sources
par: Cheng, Xize, et autres
Publié: (2025)
par: Cheng, Xize, et autres
Publié: (2025)
CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents
par: Banerjee, Adhiraj, et autres
Publié: (2025)
par: Banerjee, Adhiraj, et autres
Publié: (2025)
Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification
par: Yoshimura, Kosuke, et autres
Publié: (2026)
par: Yoshimura, Kosuke, et autres
Publié: (2026)
Latent Space Disentanglement via Activation Steering for Interpretable Attribute Control in Symbolic Music Generation
par: Prokopiou, Ioannis, et autres
Publié: (2026)
par: Prokopiou, Ioannis, et autres
Publié: (2026)
Low-Resource Guidance for Controllable Latent Audio Diffusion
par: Novack, Zachary, et autres
Publié: (2026)
par: Novack, Zachary, et autres
Publié: (2026)
PACE: Pretrained Audio Continual Learning
par: Li, Chang, et autres
Publié: (2026)
par: Li, Chang, et autres
Publié: (2026)
Constructing Composite Features for Interpretable Music-Tagging
par: Xue, Chenhao, et autres
Publié: (2026)
par: Xue, Chenhao, et autres
Publié: (2026)
Music Source Restoration
par: Zang, Yongyi, et autres
Publié: (2025)
par: Zang, Yongyi, et autres
Publié: (2025)
Active Restoration of Lost Audio Signals Using Machine Learning and Latent Information
par: Cheddad, Zohra Adila, et autres
Publié: (2021)
par: Cheddad, Zohra Adila, et autres
Publié: (2021)
Fast Timing-Conditioned Latent Audio Diffusion
par: Evans, Zach, et autres
Publié: (2024)
par: Evans, Zach, et autres
Publié: (2024)
Smule Renaissance Small: Efficient General-Purpose Vocal Restoration
par: Zang, Yongyi, et autres
Publié: (2025)
par: Zang, Yongyi, et autres
Publié: (2025)
How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection
par: Xiao, Yixuan, et autres
Publié: (2026)
par: Xiao, Yixuan, et autres
Publié: (2026)
ADNAC: Audio Denoiser using Neural Audio Codec
par: Jimon, Daniel, et autres
Publié: (2025)
par: Jimon, Daniel, et autres
Publié: (2025)
Prototypical Contrastive Learning For Improved Few-Shot Audio Classification
par: Sgouropoulos, Christos, et autres
Publié: (2025)
par: Sgouropoulos, Christos, et autres
Publié: (2025)
Masked Autoencoders as Universal Speech Enhancer
par: Rajagopalan, Rajalaxmi, et autres
Publié: (2026)
par: Rajagopalan, Rajalaxmi, et autres
Publié: (2026)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
par: Ishii, Masato, et autres
Publié: (2025)
par: Ishii, Masato, et autres
Publié: (2025)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
par: Collins, Nick
Publié: (2024)
par: Collins, Nick
Publié: (2024)
The Interpretation Gap in Text-to-Music Generation Models
par: Zang, Yongyi, et autres
Publié: (2024)
par: Zang, Yongyi, et autres
Publié: (2024)
Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs
par: Zeng, Donghuo, et autres
Publié: (2026)
par: Zeng, Donghuo, et autres
Publié: (2026)
"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models
par: Gupta, Isha, et autres
Publié: (2025)
par: Gupta, Isha, et autres
Publié: (2025)
AudioMosaic: Contrastive Masked Audio Representation Learning
par: Huang, Hanxun, et autres
Publié: (2026)
par: Huang, Hanxun, et autres
Publié: (2026)
Virtual Consistency for Audio Editing
par: Cervera, Matthieu, et autres
Publié: (2025)
par: Cervera, Matthieu, et autres
Publié: (2025)
Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training
par: Wu, Yanru, et autres
Publié: (2026)
par: Wu, Yanru, et autres
Publié: (2026)
Towards Interpretable Framework for Neural Audio Codecs via Sparse Autoencoders: A Case Study on Accent Information
par: Wang, Shih-Heng, et autres
Publié: (2026)
par: Wang, Shih-Heng, et autres
Publié: (2026)
Documents similaires
-
FlowSynth: Instrument Generation Through Distributional Flow Matching and Test-Time Search
par: Yang, Qihui, et autres
Publié: (2025) -
PromptReverb: Multimodal Room Impulse Response Generation Through Latent Rectified Flow Matching
par: Vosoughi, Ali, et autres
Publié: (2025) -
Efficient Vocal Source Separation Through Windowed Sink Attention
par: Benetatos, Christodoulos, et autres
Publié: (2025) -
StylePitcher: Generating Style-Following and Expressive Pitch Curves for Versatile Singing Tasks
par: Huang, Jingyue, et autres
Publié: (2025) -
Training-Free Multi-Step Audio Source Separation
par: Zang, Yongyi, et autres
Publié: (2025)