SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zampierin, Luca, Hacene, Ghouthi Boukli, Nguyen, Bac, Ravanelli, Mirco |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What Are They Doing? Joint Audio-Speech Co-Reasoning
par: Wang, Yingzhi, et autres
Publié: (2024)
par: Wang, Yingzhi, et autres
Publié: (2024)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
par: Li, Jingyi, et autres
Publié: (2026)
par: Li, Jingyi, et autres
Publié: (2026)
Autoregressive Speech Enhancement via Acoustic Tokens
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
ProGRes: Prompted Generative Rescoring on ASR n-Best
par: Tur, Ada Defne, et autres
Publié: (2024)
par: Tur, Ada Defne, et autres
Publié: (2024)
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
par: Jeong, Jihoon, et autres
Publié: (2026)
par: Jeong, Jihoon, et autres
Publié: (2026)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
par: Zaiem, Salah, et autres
Publié: (2023)
par: Zaiem, Salah, et autres
Publié: (2023)
SpeechGLUE: How Well Can Self-Supervised Speech Models Capture Linguistic Knowledge?
par: Ashihara, Takanori, et autres
Publié: (2023)
par: Ashihara, Takanori, et autres
Publié: (2023)
Towards Robust FastSpeech 2 by Modelling Residual Multimodality
par: Kögel, Fabian, et autres
Publié: (2023)
par: Kögel, Fabian, et autres
Publié: (2023)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
Focal Modulation Networks for Interpretable Sound Classification
par: Della Libera, Luca, et autres
Publié: (2024)
par: Della Libera, Luca, et autres
Publié: (2024)
TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models
par: Peng, Junyi, et autres
Publié: (2025)
par: Peng, Junyi, et autres
Publié: (2025)
STaR: Distilling Speech Temporal Relation for Lightweight Speech Self-Supervised Learning Models
par: Jang, Kangwook, et autres
Publié: (2023)
par: Jang, Kangwook, et autres
Publié: (2023)
Interface Design for Self-Supervised Speech Models
par: Shih, Yi-Jen, et autres
Publié: (2024)
par: Shih, Yi-Jen, et autres
Publié: (2024)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Is Self-Supervised Learning Enough to Fill in the Gap? A Study on Speech Inpainting
par: Asaad, Ihab, et autres
Publié: (2024)
par: Asaad, Ihab, et autres
Publié: (2024)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022)
par: Wang, Yujin, et autres
Publié: (2022)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
Pushing the Performance of Synthetic Speech Detection with Kolmogorov-Arnold Networks and Self-Supervised Learning Models
par: Phuong, Tuan Dat, et autres
Publié: (2025)
par: Phuong, Tuan Dat, et autres
Publié: (2025)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
par: Hwang, Min-Jae, et autres
Publié: (2024)
par: Hwang, Min-Jae, et autres
Publié: (2024)
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice
par: Gupta, Shubham, et autres
Publié: (2024)
par: Gupta, Shubham, et autres
Publié: (2024)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
Do Discrete Self-Supervised Representations of Speech Capture Tone Distinctions?
par: Osakuade, Opeyemi, et autres
Publié: (2024)
par: Osakuade, Opeyemi, et autres
Publié: (2024)
BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition
par: Jiang, Liuyuan, et autres
Publié: (2025)
par: Jiang, Liuyuan, et autres
Publié: (2025)
Pairwise Evaluation of Accent Similarity in Speech Synthesis
par: Zhong, Jinzuomu, et autres
Publié: (2025)
par: Zhong, Jinzuomu, et autres
Publié: (2025)
Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2025)
par: Lin, Tzu-Quan, et autres
Publié: (2025)
Analytic Study of Text-Free Speech Synthesis for Raw Audio using a Self-Supervised Learning Model
par: Park, Joonyong, et autres
Publié: (2024)
par: Park, Joonyong, et autres
Publié: (2024)
DASB - Discrete Audio and Speech Benchmark
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
Fast Word Error Rate Estimation Using Self-Supervised Representations for Speech and Text
par: Park, Chanho, et autres
Publié: (2023)
par: Park, Chanho, et autres
Publié: (2023)
Probing for Phonology in Self-Supervised Speech Representations: A Case Study on Accent Perception
par: Venkateswaran, Nitin, et autres
Publié: (2025)
par: Venkateswaran, Nitin, et autres
Publié: (2025)
Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease
par: Hernandez, Abner, et autres
Publié: (2026)
par: Hernandez, Abner, et autres
Publié: (2026)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
par: Wang, Haoyu, et autres
Publié: (2022)
par: Wang, Haoyu, et autres
Publié: (2022)
Exploring Acoustic Similarity in Emotional Speech and Music via Self-Supervised Representations
par: Sun, Yujia, et autres
Publié: (2024)
par: Sun, Yujia, et autres
Publié: (2024)
What Do Self-Supervised Speech and Speaker Models Learn? New Findings From a Cross Model Layer-Wise Analysis
par: Ashihara, Takanori, et autres
Publié: (2024)
par: Ashihara, Takanori, et autres
Publié: (2024)
Listenable Maps for Zero-Shot Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
Listenable Maps for Audio Classifiers
par: Paissan, Francesco, et autres
Publié: (2024)
par: Paissan, Francesco, et autres
Publié: (2024)
Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis
par: Xu, Tianyi, et autres
Publié: (2025)
par: Xu, Tianyi, et autres
Publié: (2025)
Layer-Wise Analysis of Self-Supervised Acoustic Word Embeddings: A Study on Speech Emotion Recognition
par: Saliba, Alexandra, et autres
Publié: (2024)
par: Saliba, Alexandra, et autres
Publié: (2024)
Self-Supervised Learning for Multi-Channel Neural Transducer
par: Kojima, Atsushi
Publié: (2024)
par: Kojima, Atsushi
Publié: (2024)
Documents similaires
-
What Are They Doing? Joint Audio-Speech Co-Reasoning
par: Wang, Yingzhi, et autres
Publié: (2024) -
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
par: Mousavi, Pooneh, et autres
Publié: (2025) -
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
par: Li, Jingyi, et autres
Publié: (2026) -
Autoregressive Speech Enhancement via Acoustic Tokens
par: Della Libera, Luca, et autres
Publié: (2025) -
ProGRes: Prompted Generative Rescoring on ASR n-Best
par: Tur, Ada Defne, et autres
Publié: (2024)