VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Zhisheng, Peng, Puyuan, Diwan, Anuj, Huynh, Cong Phuoc, Sun, Xiaohang, Liu, Zhu, Bhat, Vimal, Harwath, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
di: Peng, Puyuan, et al.
Pubblicazione: (2024)
di: Peng, Puyuan, et al.
Pubblicazione: (2024)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
Scaling Rich Style-Prompted Text-to-Speech Datasets
di: Diwan, Anuj, et al.
Pubblicazione: (2025)
di: Diwan, Anuj, et al.
Pubblicazione: (2025)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
di: Diwan, Anuj, et al.
Pubblicazione: (2026)
di: Diwan, Anuj, et al.
Pubblicazione: (2026)
Beyond Speaker Identity: Text Guided Target Speech Extraction
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
VoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models
di: Sung-Bin, Kim, et al.
Pubblicazione: (2025)
di: Sung-Bin, Kim, et al.
Pubblicazione: (2025)
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
di: Anastassiou, Philip, et al.
Pubblicazione: (2024)
di: Anastassiou, Philip, et al.
Pubblicazione: (2024)
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
di: Li, Xuyuan, et al.
Pubblicazione: (2024)
di: Li, Xuyuan, et al.
Pubblicazione: (2024)
Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology
di: Moell, Birger, et al.
Pubblicazione: (2025)
di: Moell, Birger, et al.
Pubblicazione: (2025)
Speech to Speech Synthesis for Voice Impersonation
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
Mitigating Unauthorized Speech Synthesis for Voice Protection
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
Speech Synthesis along Perceptual Voice Quality Dimensions
di: Rautenberg, Frederik, et al.
Pubblicazione: (2025)
di: Rautenberg, Frederik, et al.
Pubblicazione: (2025)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
Probing the Robustness Properties of Neural Speech Codecs
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
di: Byun, Kyungguen, et al.
Pubblicazione: (2025)
di: Byun, Kyungguen, et al.
Pubblicazione: (2025)
VoiceX: A Text-To-Speech Framework for Custom Voices
di: Mertes, Silvan, et al.
Pubblicazione: (2024)
di: Mertes, Silvan, et al.
Pubblicazione: (2024)
Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
di: Suda, Hitoshi, et al.
Pubblicazione: (2025)
di: Suda, Hitoshi, et al.
Pubblicazione: (2025)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
di: Jung, Jaemin, et al.
Pubblicazione: (2024)
di: Jung, Jaemin, et al.
Pubblicazione: (2024)
OpenVoice: Versatile Instant Voice Cloning
di: Qin, Zengyi, et al.
Pubblicazione: (2023)
di: Qin, Zengyi, et al.
Pubblicazione: (2023)
Amplifying Artifacts with Speech Enhancement in Voice Anti-spoofing
di: Trachu, Thanapat, et al.
Pubblicazione: (2025)
di: Trachu, Thanapat, et al.
Pubblicazione: (2025)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
di: Dai, Shuqi, et al.
Pubblicazione: (2025)
di: Dai, Shuqi, et al.
Pubblicazione: (2025)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
RAVE for Speech: Efficient Voice Conversion at High Sampling Rates
di: Bargum, Anders R., et al.
Pubblicazione: (2024)
di: Bargum, Anders R., et al.
Pubblicazione: (2024)
Voice Cloning: Comprehensive Survey
di: Azzuni, Hussam, et al.
Pubblicazione: (2025)
di: Azzuni, Hussam, et al.
Pubblicazione: (2025)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
di: Byun, Kyungguen, et al.
Pubblicazione: (2024)
di: Byun, Kyungguen, et al.
Pubblicazione: (2024)
Loudspeaker Beamforming to Enhance Speech Recognition Performance of Voice Driven Applications
di: de Groot, Dimme, et al.
Pubblicazione: (2025)
di: de Groot, Dimme, et al.
Pubblicazione: (2025)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
di: Park, Nohil, et al.
Pubblicazione: (2024)
di: Park, Nohil, et al.
Pubblicazione: (2024)
VoiceRestore: Flow-Matching Transformers for Speech Recording Quality Restoration
di: Kirdey, Stanislav
Pubblicazione: (2025)
di: Kirdey, Stanislav
Pubblicazione: (2025)
Voice Biomarker Analysis and Automated Severity Classification of Dysarthric Speech in a Multilingual Context
di: Yeo, Eunjung
Pubblicazione: (2024)
di: Yeo, Eunjung
Pubblicazione: (2024)
BAT: Learning to Reason about Spatial Sounds with Large Language Models
di: Zheng, Zhisheng, et al.
Pubblicazione: (2024)
di: Zheng, Zhisheng, et al.
Pubblicazione: (2024)
Textless Speech-to-Speech Translation With Limited Parallel Data
di: Diwan, Anuj, et al.
Pubblicazione: (2023)
di: Diwan, Anuj, et al.
Pubblicazione: (2023)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
Channel-Combination Algorithms for Robust Distant Voice Activity and Overlapped Speech Detection
di: Mariotte, Théo, et al.
Pubblicazione: (2024)
di: Mariotte, Théo, et al.
Pubblicazione: (2024)
ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
When Voice Matters: Evidence of Gender Disparity in Positional Bias of SpeechLLMs
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2025)
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2025)
Modeling of Speech-dependent Own Voice Transfer Characteristics for Hearables with In-ear Microphones
di: Ohlenbusch, Mattes, et al.
Pubblicazione: (2023)
di: Ohlenbusch, Mattes, et al.
Pubblicazione: (2023)
Speech-dependent Modeling of Own Voice Transfer Characteristics for In-ear Microphones in Hearables
di: Ohlenbusch, Mattes, et al.
Pubblicazione: (2023)
di: Ohlenbusch, Mattes, et al.
Pubblicazione: (2023)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
Interface Design for Self-Supervised Speech Models
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
di: Peng, Puyuan, et al.
Pubblicazione: (2024) -
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
di: Peng, Puyuan, et al.
Pubblicazione: (2025) -
Scaling Rich Style-Prompted Text-to-Speech Datasets
di: Diwan, Anuj, et al.
Pubblicazione: (2025) -
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
di: Diwan, Anuj, et al.
Pubblicazione: (2026) -
Beyond Speaker Identity: Text Guided Target Speech Extraction
di: Huo, Mingyue, et al.
Pubblicazione: (2025)