DDTSE: Discriminative Diffusion Model for Target Speech Extraction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Leying, Qian, Yao, Yu, Linfeng, Wang, Heming, Yang, Hemin, Zhou, Long, Liu, Shujie, Qian, Yanmin |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
par: Zhang, Leying, et autres
Publié: (2025)
par: Zhang, Leying, et autres
Publié: (2025)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
par: Zhang, Leying, et autres
Publié: (2024)
par: Zhang, Leying, et autres
Publié: (2024)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
par: Li, Chenda, et autres
Publié: (2024)
par: Li, Chenda, et autres
Publié: (2024)
DeepASMR: LLM-Based Zero-Shot ASMR Speech Generation for Anyone of Any Voice
par: Zhang, Leying, et autres
Publié: (2026)
par: Zhang, Leying, et autres
Publié: (2026)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
par: Gong, Xun, et autres
Publié: (2024)
par: Gong, Xun, et autres
Publié: (2024)
SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
par: Lu, Haitian, et autres
Publié: (2025)
par: Lu, Haitian, et autres
Publié: (2025)
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions
par: Zhang, Leying, et autres
Publié: (2026)
par: Zhang, Leying, et autres
Publié: (2026)
From Sharpness to Better Generalization for Speech Deepfake Detection
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction
par: Wang, Shuai, et autres
Publié: (2024)
par: Wang, Shuai, et autres
Publié: (2024)
Improving Design of Input Condition Invariant Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024)
par: Zhang, Wangyou, et autres
Publié: (2024)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
par: Pei, Hanchen, et autres
Publié: (2026)
par: Pei, Hanchen, et autres
Publié: (2026)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Towards Lightweight Speaker Verification via Adaptive Neural Network Quantization
par: Liu, Bei, et autres
Publié: (2024)
par: Liu, Bei, et autres
Publié: (2024)
Discriminative-Generative Target Speaker Extraction with Decoder-Only Language Models
par: Zeng, Bang, et autres
Publié: (2026)
par: Zeng, Bang, et autres
Publié: (2026)
TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation
par: Le, Chenyang, et autres
Publié: (2024)
par: Le, Chenyang, et autres
Publié: (2024)
CoVoMix: Advancing Zero-Shot Speech Generation for Human-like Multi-talker Conversations
par: Zhang, Leying, et autres
Publié: (2024)
par: Zhang, Leying, et autres
Publié: (2024)
Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
Continuous Target Speech Extraction: Enhancing Personalized Diarization and Extraction on Complex Recordings
par: Zhao, He, et autres
Publié: (2024)
par: Zhao, He, et autres
Publié: (2024)
USED: Universal Speaker Extraction and Diarization
par: Ao, Junyi, et autres
Publié: (2023)
par: Ao, Junyi, et autres
Publié: (2023)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
par: Wang, Wei, et autres
Publié: (2025)
par: Wang, Wei, et autres
Publié: (2025)
Probing Self-supervised Learning Models with Target Speech Extraction
par: Peng, Junyi, et autres
Publié: (2024)
par: Peng, Junyi, et autres
Publié: (2024)
Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024)
par: Zhang, Wangyou, et autres
Publié: (2024)
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
par: Chen, Sanyuan, et autres
Publié: (2024)
par: Chen, Sanyuan, et autres
Publié: (2024)
Text adaptation for speaker verification with speaker-text factorized embeddings
par: Yang, Yexin, et autres
Publié: (2025)
par: Yang, Yexin, et autres
Publié: (2025)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
par: Xin, Detai, et autres
Publié: (2026)
par: Xin, Detai, et autres
Publié: (2026)
Target Speech Extraction with Pre-trained Self-supervised Learning Models
par: Peng, Junyi, et autres
Publié: (2024)
par: Peng, Junyi, et autres
Publié: (2024)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
par: Hao, Hongkun, et autres
Publié: (2023)
par: Hao, Hongkun, et autres
Publié: (2023)
CoVoMix2: Advancing Zero-Shot Dialogue Generation with Fully Non-Autoregressive Flow Matching
par: Zhang, Leying, et autres
Publié: (2025)
par: Zhang, Leying, et autres
Publié: (2025)
Beyond Speaker Identity: Text Guided Target Speech Extraction
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
par: Liu, Bei, et autres
Publié: (2024)
par: Liu, Bei, et autres
Publié: (2024)
Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios
par: Yang, Yiming, et autres
Publié: (2026)
par: Yang, Yiming, et autres
Publié: (2026)
Combined Generative and Predictive Modeling for Speech Super-resolution
par: Wang, Heming, et autres
Publié: (2024)
par: Wang, Heming, et autres
Publié: (2024)
DENSE: Dynamic Embedding Causal Target Speech Extraction
par: Wang, Yiwen, et autres
Publié: (2024)
par: Wang, Yiwen, et autres
Publié: (2024)
Distance Based Single-Channel Target Speech Extraction
par: Shi, Runwu, et autres
Publié: (2024)
par: Shi, Runwu, et autres
Publié: (2024)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
par: Ma, Hao, et autres
Publié: (2025)
par: Ma, Hao, et autres
Publié: (2025)
Toward Universal Speech Enhancement for Diverse Input Conditions
par: Zhang, Wangyou, et autres
Publié: (2023)
par: Zhang, Wangyou, et autres
Publié: (2023)
SpatialCodec: Neural Spatial Speech Coding
par: Xu, Zhongweiyang, et autres
Publié: (2023)
par: Xu, Zhongweiyang, et autres
Publié: (2023)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
Documents similaires
-
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
par: Zhang, Leying, et autres
Publié: (2025) -
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
par: Zhang, Leying, et autres
Publié: (2024) -
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
par: Li, Chenda, et autres
Publié: (2024) -
DeepASMR: LLM-Based Zero-Shot ASMR Speech Generation for Anyone of Any Voice
par: Zhang, Leying, et autres
Publié: (2026) -
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
par: Gong, Xun, et autres
Publié: (2024)