AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
Fuente:
arXiv
Guardado en:
| Autores principales: | Aparin, Georgii, Sadekova, Tasnima, Rukhovich, Alexey, Yermekova, Assel, Kushnareva, Laida, Popov, Vadim, Kuznetsov, Kristian, Piontkovskaya, Irina |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improving Diffusion Models's Data-Corruption Resistance using Scheduled Pseudo-Huber Loss
por: Khrapov, Artem, et al.
Publicado: (2024)
por: Khrapov, Artem, et al.
Publicado: (2024)
Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection
por: Wang, Xiaopeng, et al.
Publicado: (2024)
por: Wang, Xiaopeng, et al.
Publicado: (2024)
Training-Free Voice Conversion with Factorized Optimal Transport
por: Lobashev, Alexander, et al.
Publicado: (2025)
por: Lobashev, Alexander, et al.
Publicado: (2025)
Feature-Level Insights into Artificial Text Detection with Sparse Autoencoders
por: Kuznetsov, Kristian, et al.
Publicado: (2025)
por: Kuznetsov, Kristian, et al.
Publicado: (2025)
Robust AI-Generated Text Detection by Restricted Embeddings
por: Kuznetsov, Kristian, et al.
Publicado: (2024)
por: Kuznetsov, Kristian, et al.
Publicado: (2024)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
Commute Your Domains: Trajectory Optimality Criterion for Multi-Domain Learning
por: Rukhovich, Alexey, et al.
Publicado: (2025)
por: Rukhovich, Alexey, et al.
Publicado: (2025)
Do Foundational Audio Encoders Understand Music Structure?
por: Toyama, Keisuke, et al.
Publicado: (2025)
por: Toyama, Keisuke, et al.
Publicado: (2025)
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
por: Luo, Jing, et al.
Publicado: (2025)
por: Luo, Jing, et al.
Publicado: (2025)
Combining Audio and Non-Audio Inputs in Evolved Neural Networks for Ovenbird
por: Hernandez, Sergio Poo, et al.
Publicado: (2025)
por: Hernandez, Sergio Poo, et al.
Publicado: (2025)
Intrinsic Dimension Estimation for Robust Detection of AI-Generated Texts
por: Tulchinskii, Eduard, et al.
Publicado: (2023)
por: Tulchinskii, Eduard, et al.
Publicado: (2023)
Listening to the Wise Few: Select-and-Copy Attention Heads for Multiple-Choice QA
por: Tulchinskii, Eduard, et al.
Publicado: (2024)
por: Tulchinskii, Eduard, et al.
Publicado: (2024)
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
por: Chen, William, et al.
Publicado: (2026)
por: Chen, William, et al.
Publicado: (2026)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
por: Dinkel, Heinrich, et al.
Publicado: (2026)
por: Dinkel, Heinrich, et al.
Publicado: (2026)
FastWave: Optimized Diffusion Model for Audio Super-Resolution
por: Kuznetsov, Nikita, et al.
Publicado: (2026)
por: Kuznetsov, Nikita, et al.
Publicado: (2026)
The ICME 2025 Audio Encoder Capability Challenge
por: Zhang, Junbo, et al.
Publicado: (2025)
por: Zhang, Junbo, et al.
Publicado: (2025)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
por: Yin, Han, et al.
Publicado: (2025)
por: Yin, Han, et al.
Publicado: (2025)
Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story
por: Pedashenko, Vladislav, et al.
Publicado: (2025)
por: Pedashenko, Vladislav, et al.
Publicado: (2025)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
por: Wang, Yucheng, et al.
Publicado: (2026)
por: Wang, Yucheng, et al.
Publicado: (2026)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Using Random Codebooks for Audio Neural AutoEncoders
por: Giniès, Benoît, et al.
Publicado: (2024)
por: Giniès, Benoît, et al.
Publicado: (2024)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
por: Zhang, Wenyu, et al.
Publicado: (2024)
por: Zhang, Wenyu, et al.
Publicado: (2024)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
por: Su, Yuchen, et al.
Publicado: (2026)
por: Su, Yuchen, et al.
Publicado: (2026)
The CMU-AIST submission for the ICME 2025 Audio Encoder Challenge
por: Bharadwaj, Shikhar, et al.
Publicado: (2026)
por: Bharadwaj, Shikhar, et al.
Publicado: (2026)
AI-generated text boundary detection with RoFT
por: Kushnareva, Laida, et al.
Publicado: (2023)
por: Kushnareva, Laida, et al.
Publicado: (2023)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
por: Dinkel, Heinrich, et al.
Publicado: (2025)
por: Dinkel, Heinrich, et al.
Publicado: (2025)
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
por: Alex, Tony, et al.
Publicado: (2025)
por: Alex, Tony, et al.
Publicado: (2025)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
por: Han, Bing, et al.
Publicado: (2026)
por: Han, Bing, et al.
Publicado: (2026)
ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood
por: Feng, Tiantian, et al.
Publicado: (2026)
por: Feng, Tiantian, et al.
Publicado: (2026)
Toward a Sparse and Interpretable Audio Codec
por: Vinyard, John
Publicado: (2025)
por: Vinyard, John
Publicado: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
por: Zhang, Junbo, et al.
Publicado: (2025)
por: Zhang, Junbo, et al.
Publicado: (2025)
An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance
por: Jeong, Wonwoo
Publicado: (2026)
por: Jeong, Wonwoo
Publicado: (2026)
Breaking Audio Large Language Models by Attacking Only the Encoder: A Universal Targeted Latent-Space Audio Attack
por: Ziv, Roee, et al.
Publicado: (2025)
por: Ziv, Roee, et al.
Publicado: (2025)
AudioToolAgent: An Agentic Framework for Audio-Language Models
por: Wijngaard, Gijs, et al.
Publicado: (2025)
por: Wijngaard, Gijs, et al.
Publicado: (2025)
MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
por: Bensaid, Reda, et al.
Publicado: (2026)
por: Bensaid, Reda, et al.
Publicado: (2026)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
por: Yang, Dongchao, et al.
Publicado: (2026)
por: Yang, Dongchao, et al.
Publicado: (2026)
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
por: Xie, Zeyu, et al.
Publicado: (2026)
por: Xie, Zeyu, et al.
Publicado: (2026)
Ejemplares similares
-
Improving Diffusion Models's Data-Corruption Resistance using Scheduled Pseudo-Huber Loss
por: Khrapov, Artem, et al.
Publicado: (2024) -
Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection
por: Wang, Xiaopeng, et al.
Publicado: (2024) -
Training-Free Voice Conversion with Factorized Optimal Transport
por: Lobashev, Alexander, et al.
Publicado: (2025) -
Feature-Level Insights into Artificial Text Detection with Sparse Autoencoders
por: Kuznetsov, Kristian, et al.
Publicado: (2025) -
Robust AI-Generated Text Detection by Restricted Embeddings
por: Kuznetsov, Kristian, et al.
Publicado: (2024)