StyleStream: Real-Time Zero-Shot Voice Style Conversion
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yisi, Lee, Nicholas, Anumanchipalli, Gopala |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RT-VC: Real-Time Zero-Shot Voice Conversion with Speech Articulatory Coding
por: Liu, Yisi, et al.
Publicado: (2025)
por: Liu, Yisi, et al.
Publicado: (2025)
Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
por: Kim, Nam-Gyu
Publicado: (2025)
por: Kim, Nam-Gyu
Publicado: (2025)
Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion
por: Rong, Yan, et al.
Publicado: (2024)
por: Rong, Yan, et al.
Publicado: (2024)
ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis
por: Li, Haitao, et al.
Publicado: (2026)
por: Li, Haitao, et al.
Publicado: (2026)
Fast, High-Quality and Parameter-Efficient Articulatory Synthesis using Differentiable DSP
por: Liu, Yisi, et al.
Publicado: (2024)
por: Liu, Yisi, et al.
Publicado: (2024)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
YingMusic-SVC: Real-World Robust Zero-Shot Singing Voice Conversion with Flow-GRPO and Singing-Specific Inductive Biases
por: Chen, Gongyu, et al.
Publicado: (2025)
por: Chen, Gongyu, et al.
Publicado: (2025)
Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck
por: Hu, Zhetao, et al.
Publicado: (2026)
por: Hu, Zhetao, et al.
Publicado: (2026)
Voice "Cloning" is Style Transfer
por: Zhou, Kaitlyn, et al.
Publicado: (2026)
por: Zhou, Kaitlyn, et al.
Publicado: (2026)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
por: Akti, Seymanur, et al.
Publicado: (2025)
por: Akti, Seymanur, et al.
Publicado: (2025)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models
por: Low, Chetwin, et al.
Publicado: (2025)
por: Low, Chetwin, et al.
Publicado: (2025)
Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning
por: Zhao, Junchuan, et al.
Publicado: (2025)
por: Zhao, Junchuan, et al.
Publicado: (2025)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
por: Sim, Youngjun, et al.
Publicado: (2024)
por: Sim, Youngjun, et al.
Publicado: (2024)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
por: Luo, Dan, et al.
Publicado: (2025)
por: Luo, Dan, et al.
Publicado: (2025)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
por: Pan, Yu, et al.
Publicado: (2024)
por: Pan, Yu, et al.
Publicado: (2024)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
por: Wang, Kaidi, et al.
Publicado: (2025)
por: Wang, Kaidi, et al.
Publicado: (2025)
Music Style Transfer With Diffusion Model
por: Huang, Hong, et al.
Publicado: (2024)
por: Huang, Hong, et al.
Publicado: (2024)
Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation
por: Wang, Qi, et al.
Publicado: (2025)
por: Wang, Qi, et al.
Publicado: (2025)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
por: Yao, Jixun, et al.
Publicado: (2024)
por: Yao, Jixun, et al.
Publicado: (2024)
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
por: Bai, Bingsong, et al.
Publicado: (2025)
por: Bai, Bingsong, et al.
Publicado: (2025)
VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions
por: Zhan, Jun, et al.
Publicado: (2025)
por: Zhan, Jun, et al.
Publicado: (2025)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
por: Yang, Yuguang, et al.
Publicado: (2024)
por: Yang, Yuguang, et al.
Publicado: (2024)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
por: Zheng, Junjie, et al.
Publicado: (2025)
por: Zheng, Junjie, et al.
Publicado: (2025)
Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
DAST: A Dual-Stream Voice Anonymization Attacker with Staged Training
por: Arefeen, Ridwan, et al.
Publicado: (2026)
por: Arefeen, Ridwan, et al.
Publicado: (2026)
Defense Against Synthetic Speech: Real-Time Detection of RVC Voice Conversion Attacks
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025)
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025)
Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems
por: Chen, Leduo, et al.
Publicado: (2026)
por: Chen, Leduo, et al.
Publicado: (2026)
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
por: Xu, Rixi, et al.
Publicado: (2026)
por: Xu, Rixi, et al.
Publicado: (2026)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
por: Lian, Jiachen, et al.
Publicado: (2022)
por: Lian, Jiachen, et al.
Publicado: (2022)
DAFMSVC: One-Shot Singing Voice Conversion with Dual Attention Mechanism and Flow Matching
por: Chen, Wei, et al.
Publicado: (2025)
por: Chen, Wei, et al.
Publicado: (2025)
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
por: Anastassiou, Philip, et al.
Publicado: (2024)
por: Anastassiou, Philip, et al.
Publicado: (2024)
Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play
por: Shi, Yemin, et al.
Publicado: (2025)
por: Shi, Yemin, et al.
Publicado: (2025)
Composer Vector: Style-steering Symbolic Music Generation in a Latent Space
por: Jiang, Xunyi, et al.
Publicado: (2026)
por: Jiang, Xunyi, et al.
Publicado: (2026)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
por: Joglekar, Advait, et al.
Publicado: (2025)
por: Joglekar, Advait, et al.
Publicado: (2025)
TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control
por: Zhang, Yu, et al.
Publicado: (2024)
por: Zhang, Yu, et al.
Publicado: (2024)
$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains
por: Ray, Soham, et al.
Publicado: (2026)
por: Ray, Soham, et al.
Publicado: (2026)
IntrinsicVoice: Empowering LLMs with Intrinsic Real-time Voice Interaction Abilities
por: Zhang, Xin, et al.
Publicado: (2024)
por: Zhang, Xin, et al.
Publicado: (2024)
Coding Speech through Vocal Tract Kinematics
por: Cho, Cheol Jun, et al.
Publicado: (2024)
por: Cho, Cheol Jun, et al.
Publicado: (2024)
Structure-Aware Piano Accompaniment via Style Planning and Dataset-Aligned Pattern Retrieval
por: Zang, Wanyu, et al.
Publicado: (2026)
por: Zang, Wanyu, et al.
Publicado: (2026)
Ejemplares similares
-
RT-VC: Real-Time Zero-Shot Voice Conversion with Speech Articulatory Coding
por: Liu, Yisi, et al.
Publicado: (2025) -
Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
por: Kim, Nam-Gyu
Publicado: (2025) -
Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion
por: Rong, Yan, et al.
Publicado: (2024) -
ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis
por: Li, Haitao, et al.
Publicado: (2026) -
Fast, High-Quality and Parameter-Efficient Articulatory Synthesis using Differentiable DSP
por: Liu, Yisi, et al.
Publicado: (2024)