EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Liang, Luo, Chunxi, Luo, Kaiwen, Zhang, Jie, Wang, Jin, Zhang, Yuanhe, Yuchen, Cai, Li, Qiankun, Xi, Gongli, Zhou, Zhenhong, Wang, Kun, Dong, Junhao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
por: Lin, Liang, et al.
Publicado: (2025)
por: Lin, Liang, et al.
Publicado: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
por: Zhang, Yibo, et al.
Publicado: (2026)
por: Zhang, Yibo, et al.
Publicado: (2026)
SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models
por: Zhang, Yuanhe, et al.
Publicado: (2026)
por: Zhang, Yuanhe, et al.
Publicado: (2026)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
por: Chen, Yafeng, et al.
Publicado: (2024)
por: Chen, Yafeng, et al.
Publicado: (2024)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
por: Chen, Yafeng, et al.
Publicado: (2023)
por: Chen, Yafeng, et al.
Publicado: (2023)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
por: Zhang, Yizhou, et al.
Publicado: (2025)
por: Zhang, Yizhou, et al.
Publicado: (2025)
To Distill or Not to Distill? On the Robustness of Robust Knowledge Distillation
por: Waheed, Abdul, et al.
Publicado: (2024)
por: Waheed, Abdul, et al.
Publicado: (2024)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
DARAS: Dynamic Audio-Room Acoustic Synthesis for Blind Room Impulse Response Estimation
por: Wang, Chunxi, et al.
Publicado: (2025)
por: Wang, Chunxi, et al.
Publicado: (2025)
S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models
por: Adlouni, Mohammed Ali El, et al.
Publicado: (2026)
por: Adlouni, Mohammed Ali El, et al.
Publicado: (2026)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
por: Yang, Qingran, et al.
Publicado: (2026)
por: Yang, Qingran, et al.
Publicado: (2026)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
DistilMOS: Layer-Wise Self-Distillation For Self-Supervised Learning Model-Based MOS Prediction
por: Yang, Jianing, et al.
Publicado: (2026)
por: Yang, Jianing, et al.
Publicado: (2026)
CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation
por: Hu, Jing, et al.
Publicado: (2026)
por: Hu, Jing, et al.
Publicado: (2026)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
por: Wu, Daiqing, et al.
Publicado: (2026)
por: Wu, Daiqing, et al.
Publicado: (2026)
DDFAD: Dataset Distillation Framework for Audio Data
por: Jiang, Wenbo, et al.
Publicado: (2024)
por: Jiang, Wenbo, et al.
Publicado: (2024)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
por: Sun, Zhe, et al.
Publicado: (2025)
por: Sun, Zhe, et al.
Publicado: (2025)
Hierarchical Activity Recognition and Captioning from Long-Form Audio
por: Zhang, Peng, et al.
Publicado: (2026)
por: Zhang, Peng, et al.
Publicado: (2026)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
por: Huang, Zhiqi, et al.
Publicado: (2024)
por: Huang, Zhiqi, et al.
Publicado: (2024)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
por: Zhang, Jing-Xuan, et al.
Publicado: (2025)
por: Zhang, Jing-Xuan, et al.
Publicado: (2025)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
por: Tong, Xinyi, et al.
Publicado: (2025)
por: Tong, Xinyi, et al.
Publicado: (2025)
Structural and Statistical Audio Texture Knowledge Distillation for Acoustic Classification
por: Ritu, Jarin, et al.
Publicado: (2025)
por: Ritu, Jarin, et al.
Publicado: (2025)
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
por: Wang, Yuxuan, et al.
Publicado: (2026)
por: Wang, Yuxuan, et al.
Publicado: (2026)
On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation
por: Cheng, Changhao, et al.
Publicado: (2026)
por: Cheng, Changhao, et al.
Publicado: (2026)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG
por: Yang, Haoyun, et al.
Publicado: (2026)
por: Yang, Haoyun, et al.
Publicado: (2026)
Multimodal Transformer Distillation for Audio-Visual Synchronization
por: Chen, Xuanjun, et al.
Publicado: (2022)
por: Chen, Xuanjun, et al.
Publicado: (2022)
Codec-Robust Attacks on Audio LLMs
por: Roh, Jaechul, et al.
Publicado: (2026)
por: Roh, Jaechul, et al.
Publicado: (2026)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
por: Cai, Yiqiang, et al.
Publicado: (2024)
por: Cai, Yiqiang, et al.
Publicado: (2024)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
por: Liu, Xiangyu, et al.
Publicado: (2026)
por: Liu, Xiangyu, et al.
Publicado: (2026)
Guiding Frame-Level CTC Alignments Using Self-knowledge Distillation
por: Kim, Eungbeom, et al.
Publicado: (2024)
por: Kim, Eungbeom, et al.
Publicado: (2024)
USAD: Universal Speech and Audio Representation via Distillation
por: Chang, Heng-Jui, et al.
Publicado: (2025)
por: Chang, Heng-Jui, et al.
Publicado: (2025)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
por: Zhang, Linhao, et al.
Publicado: (2026)
por: Zhang, Linhao, et al.
Publicado: (2026)
Ensemble-Guided Distillation for Compact and Robust Acoustic Scene Classification on Edge Devices
por: Sharify, Hossein, et al.
Publicado: (2025)
por: Sharify, Hossein, et al.
Publicado: (2025)
ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation
por: Feng, Tiantian, et al.
Publicado: (2024)
por: Feng, Tiantian, et al.
Publicado: (2024)
Pushing the Frontiers of Self-Distillation Prototypes Network with Dimension Regularization and Score Normalization
por: Chen, Yafeng, et al.
Publicado: (2025)
por: Chen, Yafeng, et al.
Publicado: (2025)
VocalNet-MDM: Accelerating Streaming Speech LLM via Self-Distilled Masked Diffusion Modeling
por: Cheng, Ziyang, et al.
Publicado: (2026)
por: Cheng, Ziyang, et al.
Publicado: (2026)
STEP: Detecting Audio Backdoor Attacks via Stability-based Trigger Exposure Profiling
por: Wang, Kun, et al.
Publicado: (2026)
por: Wang, Kun, et al.
Publicado: (2026)
Ejemplares similares
-
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
por: Lin, Liang, et al.
Publicado: (2025) -
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026) -
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
por: Zhang, Yibo, et al.
Publicado: (2026) -
SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models
por: Zhang, Yuanhe, et al.
Publicado: (2026) -
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
por: Chen, Yafeng, et al.
Publicado: (2024)