Speech Separation based on Contrastive Learning and Deep Modularization
Fuente:
arXiv
Salvato in:
| Autore principale: | Ochieng, Peter |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Speech Synthesis By Unrolling Diffusion Process using Neural Network Layers
di: Ochieng, Peter
Pubblicazione: (2023)
di: Ochieng, Peter
Pubblicazione: (2023)
A Modular-based Strategy for Mitigating Gradient Conflicts in Simultaneous Speech Translation
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024)
DyPCL: Dynamic Phoneme-level Contrastive Learning for Dysarthric Speech Recognition
di: Lee, Wonjun, et al.
Pubblicazione: (2025)
di: Lee, Wonjun, et al.
Pubblicazione: (2025)
A Cross-Corpus Speech Emotion Recognition Method Based on Supervised Contrastive Learning
di: minjie, Xiang
Pubblicazione: (2024)
di: minjie, Xiang
Pubblicazione: (2024)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Noise-Aware Speech Separation with Contrastive Learning
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
A Deep Learning Automatic Speech Recognition Model for Shona Language
di: Sirora, Leslie Wellington, et al.
Pubblicazione: (2025)
di: Sirora, Leslie Wellington, et al.
Pubblicazione: (2025)
Echotune: A Modular Extractor Leveraging the Variable-Length Nature of Speech in ASR Tasks
di: Chen, Sizhou, et al.
Pubblicazione: (2023)
di: Chen, Sizhou, et al.
Pubblicazione: (2023)
SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
Speech DF Arena: A Leaderboard for Speech DeepFake Detection Models
di: Dowerah, Sandipana, et al.
Pubblicazione: (2025)
di: Dowerah, Sandipana, et al.
Pubblicazione: (2025)
Continual Speech Learning with Fused Speech Features
di: Wang, Guitao, et al.
Pubblicazione: (2025)
di: Wang, Guitao, et al.
Pubblicazione: (2025)
Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models
di: Ljubešić, Nikola, et al.
Pubblicazione: (2025)
di: Ljubešić, Nikola, et al.
Pubblicazione: (2025)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
di: Liu, Henglyu, et al.
Pubblicazione: (2025)
di: Liu, Henglyu, et al.
Pubblicazione: (2025)
What Do Speech Foundation Models Not Learn About Speech?
di: Waheed, Abdul, et al.
Pubblicazione: (2024)
di: Waheed, Abdul, et al.
Pubblicazione: (2024)
Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling
di: Yeo, Eunjung, et al.
Pubblicazione: (2026)
di: Yeo, Eunjung, et al.
Pubblicazione: (2026)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
Speaker-Aware Simulation Improves Conversational Speech Recognition
di: Gedeon, Máté, et al.
Pubblicazione: (2026)
di: Gedeon, Máté, et al.
Pubblicazione: (2026)
Unimodal Aggregation for CTC-based Speech Recognition
di: Fang, Ying, et al.
Pubblicazione: (2023)
di: Fang, Ying, et al.
Pubblicazione: (2023)
Convexity-based Pruning of Speech Representation Models
di: Dorszewski, Teresa, et al.
Pubblicazione: (2024)
di: Dorszewski, Teresa, et al.
Pubblicazione: (2024)
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
di: Do, Cong-Thanh, et al.
Pubblicazione: (2024)
di: Do, Cong-Thanh, et al.
Pubblicazione: (2024)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2024)
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2024)
LibriheavyMix: A 20,000-Hour Dataset for Single-Channel Reverberant Multi-Talker Speech Separation, ASR and Speaker Diarization
di: Jin, Zengrui, et al.
Pubblicazione: (2024)
di: Jin, Zengrui, et al.
Pubblicazione: (2024)
STaR: Distilling Speech Temporal Relation for Lightweight Speech Self-Supervised Learning Models
di: Jang, Kangwook, et al.
Pubblicazione: (2023)
di: Jang, Kangwook, et al.
Pubblicazione: (2023)
TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models
di: Peng, Junyi, et al.
Pubblicazione: (2025)
di: Peng, Junyi, et al.
Pubblicazione: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
Causally Disentangled Contrastive Learning for Multilingual Speaker Embeddings
di: Olijslager, Mariëtte, et al.
Pubblicazione: (2026)
di: Olijslager, Mariëtte, et al.
Pubblicazione: (2026)
XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception
di: Han, HyoJung, et al.
Pubblicazione: (2024)
di: Han, HyoJung, et al.
Pubblicazione: (2024)
Rethinking Discrete Speech Representation Tokens for Accent Generation
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
Crossmodal ASR Error Correction with Discrete Speech Units
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
Weight Factorization and Centralization for Continual Learning in Speech Recognition
di: Ugan, Enes Yavuz, et al.
Pubblicazione: (2025)
di: Ugan, Enes Yavuz, et al.
Pubblicazione: (2025)
Emotion-Anchored Contrastive Learning Framework for Emotion Recognition in Conversation
di: Yu, Fangxu, et al.
Pubblicazione: (2024)
di: Yu, Fangxu, et al.
Pubblicazione: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023)
di: Zhang, Xin, et al.
Pubblicazione: (2023)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
di: Futami, Hayato, et al.
Pubblicazione: (2025)
di: Futami, Hayato, et al.
Pubblicazione: (2025)
Continuous Speech Tokenizer in Text To Speech
di: Li, Yixing, et al.
Pubblicazione: (2024)
di: Li, Yixing, et al.
Pubblicazione: (2024)
TTSDS2: Resources and Benchmark for Evaluating Human-Quality Text to Speech Systems
di: Minixhofer, Christoph, et al.
Pubblicazione: (2025)
di: Minixhofer, Christoph, et al.
Pubblicazione: (2025)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
Improving Speech-based Emotion Recognition with Contextual Utterance Analysis and LLMs
di: Zhang, Enshi, et al.
Pubblicazione: (2024)
di: Zhang, Enshi, et al.
Pubblicazione: (2024)
DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition
di: Sudo, Yui, et al.
Pubblicazione: (2025)
di: Sudo, Yui, et al.
Pubblicazione: (2025)
Communication-Efficient Personalized Federated Learning for Speech-to-Text Tasks
di: Du, Yichao, et al.
Pubblicazione: (2024)
di: Du, Yichao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Speech Synthesis By Unrolling Diffusion Process using Neural Network Layers
di: Ochieng, Peter
Pubblicazione: (2023) -
A Modular-based Strategy for Mitigating Gradient Conflicts in Simultaneous Speech Translation
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024) -
DyPCL: Dynamic Phoneme-level Contrastive Learning for Dysarthric Speech Recognition
di: Lee, Wonjun, et al.
Pubblicazione: (2025) -
A Cross-Corpus Speech Emotion Recognition Method Based on Supervised Contrastive Learning
di: minjie, Xiang
Pubblicazione: (2024) -
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)