DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
Fuente:
arXiv
Salvato in:
| Autori principali: | Bhati, Saurabhchand, Gong, Yuan, Karlinsky, Leonid, Kuehne, Hilde, Feris, Rogerio, Glass, James |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
State-Space Large Audio Language Models
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2024)
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2024)
Towards Audio Token Compression in Large Audio Language Models
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2025)
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2025)
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
di: Araujo, Edson, et al.
Pubblicazione: (2025)
di: Araujo, Edson, et al.
Pubblicazione: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
USAD: Universal Speech and Audio Representation via Distillation
di: Chang, Heng-Jui, et al.
Pubblicazione: (2025)
di: Chang, Heng-Jui, et al.
Pubblicazione: (2025)
Listen, Think, and Understand
di: Gong, Yuan, et al.
Pubblicazione: (2023)
di: Gong, Yuan, et al.
Pubblicazione: (2023)
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
di: Mei, Xinhao, et al.
Pubblicazione: (2026)
di: Mei, Xinhao, et al.
Pubblicazione: (2026)
SALAD-VAE: Semantic Audio Compression with Language-Audio Distillation
di: Braun, Sebastian, et al.
Pubblicazione: (2025)
di: Braun, Sebastian, et al.
Pubblicazione: (2025)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
Total-Duration-Aware Duration Modeling for Text-to-Speech Systems
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
SAM: A Mamba-2 State-Space Audio-Language Model
di: Lee, Taehan, et al.
Pubblicazione: (2025)
di: Lee, Taehan, et al.
Pubblicazione: (2025)
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
Siamese Vision Transformers are Scalable Audio-visual Learners
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study
di: Ogg, Mattson
Pubblicazione: (2025)
di: Ogg, Mattson
Pubblicazione: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
di: Lin, Jiaju, et al.
Pubblicazione: (2024)
di: Lin, Jiaju, et al.
Pubblicazione: (2024)
Say More with Less: Variable-Frame-Rate Speech Tokenization via Adaptive Clustering and Implicit Duration Coding
di: Zheng, Rui-Chen, et al.
Pubblicazione: (2025)
di: Zheng, Rui-Chen, et al.
Pubblicazione: (2025)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
di: Chen, Yujie, et al.
Pubblicazione: (2024)
di: Chen, Yujie, et al.
Pubblicazione: (2024)
Structural and Statistical Audio Texture Knowledge Distillation for Acoustic Classification
di: Ritu, Jarin, et al.
Pubblicazione: (2025)
di: Ritu, Jarin, et al.
Pubblicazione: (2025)
Multiplexing Neural Audio Watermarks
di: Yuan, Zheqi, et al.
Pubblicazione: (2025)
di: Yuan, Zheqi, et al.
Pubblicazione: (2025)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
MiMo-Audio: Audio Language Models are Few-Shot Learners
di: Core Team, et al.
Pubblicazione: (2025)
di: Core Team, et al.
Pubblicazione: (2025)
Enhancing In-the-Wild Speech Emotion Conversion with Resynthesis-based Duration Modeling
di: Prabhu, Navin Raj, et al.
Pubblicazione: (2025)
di: Prabhu, Navin Raj, et al.
Pubblicazione: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space Model
di: Shams, Siavash, et al.
Pubblicazione: (2024)
di: Shams, Siavash, et al.
Pubblicazione: (2024)
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
di: Li, Longhao, et al.
Pubblicazione: (2026)
di: Li, Longhao, et al.
Pubblicazione: (2026)
FlashSR: One-step Versatile Audio Super-resolution via Diffusion Distillation
di: Im, Jaekwon, et al.
Pubblicazione: (2025)
di: Im, Jaekwon, et al.
Pubblicazione: (2025)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
di: Meng, Qingliang, et al.
Pubblicazione: (2025)
di: Meng, Qingliang, et al.
Pubblicazione: (2025)
DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2025)
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2025)
ALDAS: Audio-Linguistic Data Augmentation for Spoofed Audio Detection
di: Khanjani, Zahra, et al.
Pubblicazione: (2024)
di: Khanjani, Zahra, et al.
Pubblicazione: (2024)
Distillation and Pruning for Scalable Self-Supervised Representation-Based Speech Quality Assessment
di: Stahl, Benjamin, et al.
Pubblicazione: (2025)
di: Stahl, Benjamin, et al.
Pubblicazione: (2025)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models
di: He, Haolin, et al.
Pubblicazione: (2025)
di: He, Haolin, et al.
Pubblicazione: (2025)
A Closer Look at Neural Codec Resynthesis: Bridging the Gap between Codec and Waveform Generation
di: Liu, Alexander H., et al.
Pubblicazione: (2024)
di: Liu, Alexander H., et al.
Pubblicazione: (2024)
Documenti analoghi
-
State-Space Large Audio Language Models
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2024) -
Towards Audio Token Compression in Large Audio Language Models
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2025) -
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025) -
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
di: Araujo, Edson, et al.
Pubblicazione: (2025) -
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)