Time-Layer Adaptive Alignment for Speaker Similarity in Flow-Matching Based Zero-Shot TTS
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Haoyu, Han, Mingyang, Xi, Yu, Wang, Dongxiao, Wang, Hankun, Shi, Haoxiang, Li, Boyu, Song, Jun, Zheng, Bo, Wang, Shuai, Yu, Kai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
por: Wang, Haoyu, et al.
Publicado: (2024)
por: Wang, Haoyu, et al.
Publicado: (2024)
Detect, Attend and Extract: Keyword Guided Target Speaker Extraction
por: Li, Haoyu, et al.
Publicado: (2026)
por: Li, Haoyu, et al.
Publicado: (2026)
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
por: Jeon, Yejin, et al.
Publicado: (2024)
por: Jeon, Yejin, et al.
Publicado: (2024)
An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS
por: Wang, Xiaofei, et al.
Publicado: (2024)
por: Wang, Xiaofei, et al.
Publicado: (2024)
What Does the Speaker Embedding Encode?
por: Wang, Shuai, et al.
Publicado: (2025)
por: Wang, Shuai, et al.
Publicado: (2025)
A Survey on Speech Large Language Models for Understanding
por: Peng, Jing, et al.
Publicado: (2024)
por: Peng, Jing, et al.
Publicado: (2024)
Traceable TTS: Toward Watermark-Free TTS with Strong Traceability
por: Zhao, Yuxiang, et al.
Publicado: (2025)
por: Zhao, Yuxiang, et al.
Publicado: (2025)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
por: Chen, Yushen, et al.
Publicado: (2024)
por: Chen, Yushen, et al.
Publicado: (2024)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching
por: Chen, Zhengyang, et al.
Publicado: (2024)
por: Chen, Zhengyang, et al.
Publicado: (2024)
Adaptive Deterministic Flow Matching for Target Speaker Extraction
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
Measuring Prosody Diversity in Zero-Shot TTS: A New Metric, Benchmark, and Exploration
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
DialoSpeech: Dual-Speaker Dialogue Generation with LLM and Flow Matching
por: Xie, Hanke, et al.
Publicado: (2025)
por: Xie, Hanke, et al.
Publicado: (2025)
Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning
por: Wang, Tianrui, et al.
Publicado: (2025)
por: Wang, Tianrui, et al.
Publicado: (2025)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
por: Wang, Hankun, et al.
Publicado: (2024)
por: Wang, Hankun, et al.
Publicado: (2024)
DINO-VITS: Data-Efficient Zero-Shot TTS with Self-Supervised Speaker Verification Loss for Noise Robustness
por: Pankov, Vikentii, et al.
Publicado: (2023)
por: Pankov, Vikentii, et al.
Publicado: (2023)
E1 TTS: Simple and Fast Non-Autoregressive TTS
por: Liu, Zhijun, et al.
Publicado: (2024)
por: Liu, Zhijun, et al.
Publicado: (2024)
SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention
por: Li, Junjie, et al.
Publicado: (2023)
por: Li, Junjie, et al.
Publicado: (2023)
Zero-Shot TTS With Enhanced Audio Prompts: Bsc Submission For The 2026 Wildspoof Challenge TTS Track
por: Giraldo, Jose, et al.
Publicado: (2026)
por: Giraldo, Jose, et al.
Publicado: (2026)
On the Effectiveness of Acoustic BPE in Decoder-Only TTS
por: Li, Bohan, et al.
Publicado: (2024)
por: Li, Bohan, et al.
Publicado: (2024)
Towards Flow-Matching-based TTS without Classifier-Free Guidance
por: Liang, Yuzhe, et al.
Publicado: (2025)
por: Liang, Yuzhe, et al.
Publicado: (2025)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
por: Wang, Hankun, et al.
Publicado: (2025)
por: Wang, Hankun, et al.
Publicado: (2025)
Intelli-Z: Toward Intelligible Zero-Shot TTS
por: Jung, Sunghee, et al.
Publicado: (2024)
por: Jung, Sunghee, et al.
Publicado: (2024)
F5R-TTS: Improving Flow-Matching based Text-to-Speech with Group Relative Policy Optimization
por: Sun, Xiaohui, et al.
Publicado: (2025)
por: Sun, Xiaohui, et al.
Publicado: (2025)
DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation
por: Meng, Ming, et al.
Publicado: (2025)
por: Meng, Ming, et al.
Publicado: (2025)
Towards Lightweight Speaker Verification via Adaptive Neural Network Quantization
por: Liu, Bei, et al.
Publicado: (2024)
por: Liu, Bei, et al.
Publicado: (2024)
Improvement Speaker Similarity for Zero-Shot Any-to-Any Voice Conversion of Whispered and Regular Speech
por: Avdeeva, Anastasia, et al.
Publicado: (2024)
por: Avdeeva, Anastasia, et al.
Publicado: (2024)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
por: Peng, Puyuan, et al.
Publicado: (2025)
por: Peng, Puyuan, et al.
Publicado: (2025)
MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
por: Jiang, Ziyue, et al.
Publicado: (2025)
por: Jiang, Ziyue, et al.
Publicado: (2025)
Multi-Level Speaker Representation for Target Speaker Extraction
por: Zhang, Ke, et al.
Publicado: (2024)
por: Zhang, Ke, et al.
Publicado: (2024)
Zero-Shot vs. Few-Shot Multi-Speaker TTS Using Pre-trained Czech SpeechT5 Model
por: Lehečka, Jan, et al.
Publicado: (2024)
por: Lehečka, Jan, et al.
Publicado: (2024)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
por: Guo, Yiwei, et al.
Publicado: (2025)
por: Guo, Yiwei, et al.
Publicado: (2025)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
por: Guan, Wenhao, et al.
Publicado: (2025)
por: Guan, Wenhao, et al.
Publicado: (2025)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
por: Jiang, Ziyue, et al.
Publicado: (2023)
por: Jiang, Ziyue, et al.
Publicado: (2023)
Improving Data Augmentation-based Cross-Speaker Style Transfer for TTS with Singing Voice, Style Filtering, and F0 Matching
por: Marques, Leonardo B. de M. M., et al.
Publicado: (2024)
por: Marques, Leonardo B. de M. M., et al.
Publicado: (2024)
Adversarial Attacks and Robust Defenses in Speaker Embedding based Zero-Shot Text-to-Speech System
por: Li, Ze, et al.
Publicado: (2024)
por: Li, Ze, et al.
Publicado: (2024)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
por: Yao, Jixun, et al.
Publicado: (2024)
por: Yao, Jixun, et al.
Publicado: (2024)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
por: Chen, Zhengyang, et al.
Publicado: (2024)
por: Chen, Zhengyang, et al.
Publicado: (2024)
Ejemplares similares
-
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
por: Wang, Haoyu, et al.
Publicado: (2024) -
Detect, Attend and Extract: Keyword Guided Target Speaker Extraction
por: Li, Haoyu, et al.
Publicado: (2026) -
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
por: Jeon, Yejin, et al.
Publicado: (2024) -
An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS
por: Wang, Xiaofei, et al.
Publicado: (2024) -
What Does the Speaker Embedding Encode?
por: Wang, Shuai, et al.
Publicado: (2025)