Distillation and Pruning for Scalable Self-Supervised Representation-Based Speech Quality Assessment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Stahl, Benjamin, Gamper, Hannes |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric
par: Ogg, Mattson, et autres
Publié: (2025)
par: Ogg, Mattson, et autres
Publié: (2025)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
par: Wang, Wei, et autres
Publié: (2025)
par: Wang, Wei, et autres
Publié: (2025)
Refining Self-Supervised Learnt Speech Representation using Brain Activations
par: Li, Hengyu, et autres
Publié: (2024)
par: Li, Hengyu, et autres
Publié: (2024)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Towards Automatic Assessment of Self-Supervised Speech Models using Rank
par: Aldeneh, Zakaria, et autres
Publié: (2024)
par: Aldeneh, Zakaria, et autres
Publié: (2024)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
par: Chen, Yafeng, et autres
Publié: (2024)
par: Chen, Yafeng, et autres
Publié: (2024)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
par: Chen, Yafeng, et autres
Publié: (2023)
par: Chen, Yafeng, et autres
Publié: (2023)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
par: Hwang, Min-Jae, et autres
Publié: (2024)
par: Hwang, Min-Jae, et autres
Publié: (2024)
A Large-Scale Probing Analysis of Speaker-Specific Attributes in Self-Supervised Speech Representations
par: Chiu, Aemon Yat Fei, et autres
Publié: (2025)
par: Chiu, Aemon Yat Fei, et autres
Publié: (2025)
Evaluating Self-Supervised Speech Models via Text-Based LLMS
par: Maekaku, Takashi, et autres
Publié: (2025)
par: Maekaku, Takashi, et autres
Publié: (2025)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
par: Sato, Hiroshi, et autres
Publié: (2025)
par: Sato, Hiroshi, et autres
Publié: (2025)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
par: Li, Jialu, et autres
Publié: (2024)
par: Li, Jialu, et autres
Publié: (2024)
SCOREQ: Speech Quality Assessment with Contrastive Regression
par: Ragano, Alessandro, et autres
Publié: (2024)
par: Ragano, Alessandro, et autres
Publié: (2024)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022)
par: Wang, Yujin, et autres
Publié: (2022)
Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms
par: Premananth, Gowtham, et autres
Publié: (2024)
par: Premananth, Gowtham, et autres
Publié: (2024)
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
par: Geng, Haopeng, et autres
Publié: (2024)
par: Geng, Haopeng, et autres
Publié: (2024)
Scalable Speech Enhancement with Dynamic Channel Pruning
par: Miccini, Riccardo, et autres
Publié: (2024)
par: Miccini, Riccardo, et autres
Publié: (2024)
Sci-Phi: A Large Language Model Spatial Audio Descriptor
par: Jiang, Xilin, et autres
Publié: (2025)
par: Jiang, Xilin, et autres
Publié: (2025)
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
par: Moliner, Eloi, et autres
Publié: (2024)
par: Moliner, Eloi, et autres
Publié: (2024)
GigaAM: Efficient Self-Supervised Learner for Speech Recognition
par: Kutsakov, Aleksandr, et autres
Publié: (2025)
par: Kutsakov, Aleksandr, et autres
Publié: (2025)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
par: Farhadipour, Aref, et autres
Publié: (2024)
par: Farhadipour, Aref, et autres
Publié: (2024)
Universal Preference-Score-based Pairwise Speech Quality Assessment
par: Shi, Yu-Fei, et autres
Publié: (2025)
par: Shi, Yu-Fei, et autres
Publié: (2025)
STaR: Distilling Speech Temporal Relation for Lightweight Speech Self-Supervised Learning Models
par: Jang, Kangwook, et autres
Publié: (2023)
par: Jang, Kangwook, et autres
Publié: (2023)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
par: Wang, Shih-heng, et autres
Publié: (2024)
par: Wang, Shih-heng, et autres
Publié: (2024)
Comparison of Self-Supervised Speech Pre-Training Methods on Flemish Dutch
par: Poncelet, Jakob, et autres
Publié: (2021)
par: Poncelet, Jakob, et autres
Publié: (2021)
Natural Language Supervision for General-Purpose Audio Representations
par: Elizalde, Benjamin, et autres
Publié: (2023)
par: Elizalde, Benjamin, et autres
Publié: (2023)
Speaker Recognition Using Isomorphic Graph Attention Network Based Pooling on Self-Supervised Representation
par: Ge, Zirui, et autres
Publié: (2023)
par: Ge, Zirui, et autres
Publié: (2023)
MambaRate: Speech Quality Assessment Across Different Sampling Rates
par: Kakoulidis, Panos, et autres
Publié: (2025)
par: Kakoulidis, Panos, et autres
Publié: (2025)
Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
par: Zheng, Qixi, et autres
Publié: (2025)
par: Zheng, Qixi, et autres
Publié: (2025)
Convexity-based Pruning of Speech Representation Models
par: Dorszewski, Teresa, et autres
Publié: (2024)
par: Dorszewski, Teresa, et autres
Publié: (2024)
DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS
par: Nguyen, Tan Dat, et autres
Publié: (2025)
par: Nguyen, Tan Dat, et autres
Publié: (2025)
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
par: Hu, Cheng-Hung, et autres
Publié: (2025)
par: Hu, Cheng-Hung, et autres
Publié: (2025)
Advancing Speech Quality Assessment Through Scientific Challenges and Open-source Activities
par: Huang, Wen-Chin
Publié: (2025)
par: Huang, Wen-Chin
Publié: (2025)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
Balancing Information Preservation and Disentanglement in Self-Supervised Music Representation Learning
par: Wilkins, Julia, et autres
Publié: (2025)
par: Wilkins, Julia, et autres
Publié: (2025)
Documents similaires
-
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric
par: Ogg, Mattson, et autres
Publié: (2025) -
PAM: Prompting Audio-Language Models for Audio Quality Assessment
par: Deshmukh, Soham, et autres
Publié: (2024) -
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
par: Wang, Wei, et autres
Publié: (2025) -
Refining Self-Supervised Learnt Speech Representation using Brain Activations
par: Li, Hengyu, et autres
Publié: (2024) -
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
par: Liu, Rui, et autres
Publié: (2024)