Losses Can Be Blessings: Routing Self-Supervised Speech Representations Towards Efficient Multilingual and Multitask Speech Processing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Yonggan, Zhang, Yang, Qian, Kaizhi, Ye, Zhifan, Yu, Zhongzhi, Lai, Cheng-I, Lin, Yingyan Celine |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Generic Speech Enhancement with Self-Supervised Representation Space Loss
par: Sato, Hiroshi, et autres
Publié: (2025)
par: Sato, Hiroshi, et autres
Publié: (2025)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
par: Wang, Shih-heng, et autres
Publié: (2024)
par: Wang, Shih-heng, et autres
Publié: (2024)
Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages
par: Shao, Mingchen, et autres
Publié: (2025)
par: Shao, Mingchen, et autres
Publié: (2025)
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
par: Gong, Cheng, et autres
Publié: (2023)
par: Gong, Cheng, et autres
Publié: (2023)
Speech Denoising with Auditory Models
par: Saddler, Mark R., et autres
Publié: (2020)
par: Saddler, Mark R., et autres
Publié: (2020)
Refining Self-Supervised Learnt Speech Representation using Brain Activations
par: Li, Hengyu, et autres
Publié: (2024)
par: Li, Hengyu, et autres
Publié: (2024)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Towards Automatic Assessment of Self-Supervised Speech Models using Rank
par: Aldeneh, Zakaria, et autres
Publié: (2024)
par: Aldeneh, Zakaria, et autres
Publié: (2024)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
par: Li, Jialu, et autres
Publié: (2024)
par: Li, Jialu, et autres
Publié: (2024)
Distillation and Pruning for Scalable Self-Supervised Representation-Based Speech Quality Assessment
par: Stahl, Benjamin, et autres
Publié: (2025)
par: Stahl, Benjamin, et autres
Publié: (2025)
Can you Remove the Downstream Model for Speaker Recognition with Self-Supervised Speech Features?
par: Aldeneh, Zakaria, et autres
Publié: (2024)
par: Aldeneh, Zakaria, et autres
Publié: (2024)
Mamba in Speech: Towards an Alternative to Self-Attention
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
Efficient Compression of Multitask Multilingual Speech Models
par: Ferraz, Thomas Palmeira
Publié: (2024)
par: Ferraz, Thomas Palmeira
Publié: (2024)
Towards Unsupervised Speech Recognition Without Pronunciation Models
par: Ni, Junrui, et autres
Publié: (2024)
par: Ni, Junrui, et autres
Publié: (2024)
A Large-Scale Probing Analysis of Speaker-Specific Attributes in Self-Supervised Speech Representations
par: Chiu, Aemon Yat Fei, et autres
Publié: (2025)
par: Chiu, Aemon Yat Fei, et autres
Publié: (2025)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric
par: Ogg, Mattson, et autres
Publié: (2025)
par: Ogg, Mattson, et autres
Publié: (2025)
SpeechGLUE: How Well Can Self-Supervised Speech Models Capture Linguistic Knowledge?
par: Ashihara, Takanori, et autres
Publié: (2023)
par: Ashihara, Takanori, et autres
Publié: (2023)
Towards Machine Unlearning for Paralinguistic Speech Processing
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
par: Shah, Neil, et autres
Publié: (2024)
par: Shah, Neil, et autres
Publié: (2024)
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
par: Zhou, Junzuo, et autres
Publié: (2024)
par: Zhou, Junzuo, et autres
Publié: (2024)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
par: Farhadipour, Aref, et autres
Publié: (2024)
par: Farhadipour, Aref, et autres
Publié: (2024)
GigaAM: Efficient Self-Supervised Learner for Speech Recognition
par: Kutsakov, Aleksandr, et autres
Publié: (2025)
par: Kutsakov, Aleksandr, et autres
Publié: (2025)
PolySpeech: Exploring Unified Multitask Speech Models for Competitiveness with Single-task Models
par: Yang, Runyan, et autres
Publié: (2024)
par: Yang, Runyan, et autres
Publié: (2024)
TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models
par: Peng, Junyi, et autres
Publié: (2025)
par: Peng, Junyi, et autres
Publié: (2025)
Configurable Multilingual ASR with Speech Summary Representations
par: Zhu, Harrison, et autres
Publié: (2024)
par: Zhu, Harrison, et autres
Publié: (2024)
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
par: Xue, Hongfei, et autres
Publié: (2023)
par: Xue, Hongfei, et autres
Publié: (2023)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
par: Zhang, Wenyu, et autres
Publié: (2025)
par: Zhang, Wenyu, et autres
Publié: (2025)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
par: Liao, Shijia, et autres
Publié: (2024)
par: Liao, Shijia, et autres
Publié: (2024)
Comparison of Self-Supervised Speech Pre-Training Methods on Flemish Dutch
par: Poncelet, Jakob, et autres
Publié: (2021)
par: Poncelet, Jakob, et autres
Publié: (2021)
Evaluating Self-Supervised Speech Models via Text-Based LLMS
par: Maekaku, Takashi, et autres
Publié: (2025)
par: Maekaku, Takashi, et autres
Publié: (2025)
Emotion-Coherent Speech Data Augmentation and Self-Supervised Contrastive Style Training for Enhancing Kids's Story Speech Synthesis
par: Chung, Raymond
Publié: (2026)
par: Chung, Raymond
Publié: (2026)
The Effect of Batch Size on Contrastive Self-Supervised Speech Representation Learning
par: Vaessen, Nik, et autres
Publié: (2024)
par: Vaessen, Nik, et autres
Publié: (2024)
Do Discrete Self-Supervised Representations of Speech Capture Tone Distinctions?
par: Osakuade, Opeyemi, et autres
Publié: (2024)
par: Osakuade, Opeyemi, et autres
Publié: (2024)
Using Speech Foundational Models in Loss Functions for Hearing Aid Speech Enhancement
par: Sutherland, Robert, et autres
Publié: (2024)
par: Sutherland, Robert, et autres
Publié: (2024)
A Multilingual Framework for Dysarthria: Detection, Severity Classification, Speech-to-Text, and Clean Speech Generation
par: Raghu, Ananya, et autres
Publié: (2025)
par: Raghu, Ananya, et autres
Publié: (2025)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
par: Wang, Haoyu, et autres
Publié: (2022)
par: Wang, Haoyu, et autres
Publié: (2022)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
par: Cooper, Erica, et autres
Publié: (2025)
par: Cooper, Erica, et autres
Publié: (2025)
Documents similaires
-
Generic Speech Enhancement with Self-Supervised Representation Space Loss
par: Sato, Hiroshi, et autres
Publié: (2025) -
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
par: Wang, Shih-heng, et autres
Publié: (2024) -
Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages
par: Shao, Mingchen, et autres
Publié: (2025) -
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
par: Gong, Cheng, et autres
Publié: (2023) -
Speech Denoising with Auditory Models
par: Saddler, Mark R., et autres
Publié: (2020)