Towards the Next Frontier in Speech Representation Learning Using Disentanglement
Fuente:
arXiv
Salvato in:
| Autori principali: | Krishna, Varun, Ganapathy, Sriram |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025)
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025)
Improving Self-supervised Pre-training using Accent-Specific Codebooks
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
Self-Supervised Disentangled Representation Learning for Robust Target Speech Extraction
di: Mu, Zhaoxi, et al.
Pubblicazione: (2023)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2023)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
Disentangling Textual and Acoustic Features of Neural Speech Representations
di: Mohebbi, Hosein, et al.
Pubblicazione: (2024)
di: Mohebbi, Hosein, et al.
Pubblicazione: (2024)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
Towards Robust Speech Representation Learning for Thousands of Languages
di: Chen, William, et al.
Pubblicazione: (2024)
di: Chen, William, et al.
Pubblicazione: (2024)
Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
Towards End-to-End Training of Automatic Speech Recognition for Nigerian Pidgin
di: Rufai, Amina Mardiyyah, et al.
Pubblicazione: (2020)
di: Rufai, Amina Mardiyyah, et al.
Pubblicazione: (2020)
FlashSpeech: Efficient Zero-Shot Speech Synthesis
di: Ye, Zhen, et al.
Pubblicazione: (2024)
di: Ye, Zhen, et al.
Pubblicazione: (2024)
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2024)
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2024)
Advancing Speech Understanding in Speech-Aware Language Models with GRPO
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
di: Elmakies, Avishai, et al.
Pubblicazione: (2025)
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
di: Peng, Puyuan, et al.
Pubblicazione: (2024)
di: Peng, Puyuan, et al.
Pubblicazione: (2024)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
di: Singh, Prachi, et al.
Pubblicazione: (2024)
di: Singh, Prachi, et al.
Pubblicazione: (2024)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
di: Ju, Zeqian, et al.
Pubblicazione: (2024)
di: Ju, Zeqian, et al.
Pubblicazione: (2024)
TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
Innovative Speech-Based Deep Learning Approaches for Parkinson's Disease Classification: A Systematic Review
di: van Gelderen, Lisanne, et al.
Pubblicazione: (2024)
di: van Gelderen, Lisanne, et al.
Pubblicazione: (2024)
Learning Disentangled Speech Representations
di: Brima, Yusuf, et al.
Pubblicazione: (2023)
di: Brima, Yusuf, et al.
Pubblicazione: (2023)
HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion Recognition
di: Dutta, Soumya, et al.
Pubblicazione: (2023)
di: Dutta, Soumya, et al.
Pubblicazione: (2023)
MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization
di: Zhu, Haina, et al.
Pubblicazione: (2025)
di: Zhu, Haina, et al.
Pubblicazione: (2025)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
di: Liu, Zhijun, et al.
Pubblicazione: (2024)
di: Liu, Zhijun, et al.
Pubblicazione: (2024)
Real-time Speech Summarization for Medical Conversations
di: Le-Duc, Khai, et al.
Pubblicazione: (2024)
di: Le-Duc, Khai, et al.
Pubblicazione: (2024)
On the Role of Speech Data in Reducing Toxicity Detection Bias
di: Bell, Samuel J., et al.
Pubblicazione: (2024)
di: Bell, Samuel J., et al.
Pubblicazione: (2024)
Scaling Rich Style-Prompted Text-to-Speech Datasets
di: Diwan, Anuj, et al.
Pubblicazione: (2025)
di: Diwan, Anuj, et al.
Pubblicazione: (2025)
ABHINAYA -- A System for Speech Emotion Recognition In Naturalistic Conditions Challenge
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
di: Ghosh, Sreyan, et al.
Pubblicazione: (2026)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2026)
RNN-Transducer-based Losses for Speech Recognition on Noisy Targets
di: Bataev, Vladimir
Pubblicazione: (2025)
di: Bataev, Vladimir
Pubblicazione: (2025)
Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
di: Ok, Hyunjong, et al.
Pubblicazione: (2025)
di: Ok, Hyunjong, et al.
Pubblicazione: (2025)
DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
di: Jia, Dongya, et al.
Pubblicazione: (2025)
di: Jia, Dongya, et al.
Pubblicazione: (2025)
QUADS: QUAntized Distillation Framework for Efficient Speech Language Understanding
di: Biswas, Subrata, et al.
Pubblicazione: (2025)
di: Biswas, Subrata, et al.
Pubblicazione: (2025)
Large Language Models are Efficient Learners of Noise-Robust Speech Recognition
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
BanglaDialecto: An End-to-End AI-Powered Regional Speech Standardization
di: Samin, Md. Nazmus Sadat, et al.
Pubblicazione: (2024)
di: Samin, Md. Nazmus Sadat, et al.
Pubblicazione: (2024)
GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
di: Li, Zehua Kcriss, et al.
Pubblicazione: (2024)
di: Li, Zehua Kcriss, et al.
Pubblicazione: (2024)
SEGAA: A Unified Approach to Predicting Age, Gender, and Emotion in Speech
di: R, Aron, et al.
Pubblicazione: (2024)
di: R, Aron, et al.
Pubblicazione: (2024)
Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey
di: Xie, Tianxin, et al.
Pubblicazione: (2024)
di: Xie, Tianxin, et al.
Pubblicazione: (2024)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
Speaker- and Text-Independent Estimation of Articulatory Movements and Phoneme Alignments from Speech
di: Weise, Tobias, et al.
Pubblicazione: (2024)
di: Weise, Tobias, et al.
Pubblicazione: (2024)
ELP-Adapters: Parameter Efficient Adapter Tuning for Various Speech Processing Tasks
di: Inoue, Nakamasa, et al.
Pubblicazione: (2024)
di: Inoue, Nakamasa, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025) -
Improving Self-supervised Pre-training using Accent-Specific Codebooks
di: Prabhu, Darshan, et al.
Pubblicazione: (2024) -
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
di: Dutta, Soumya, et al.
Pubblicazione: (2024) -
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022) -
Self-Supervised Disentangled Representation Learning for Robust Target Speech Extraction
di: Mu, Zhaoxi, et al.
Pubblicazione: (2023)