Controlling your Attributes in Voice
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xuyuan, Wang, Zengqiang Shang. Li, Zhang, Pengyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
par: Li, Xuyuan, et autres
Publié: (2024)
par: Li, Xuyuan, et autres
Publié: (2024)
Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder
par: Li, Xuyuan, et autres
Publié: (2023)
par: Li, Xuyuan, et autres
Publié: (2023)
Improving Short Utterance Anti-Spoofing with AASIST2
par: Zhang, Yuxiang, et autres
Publié: (2023)
par: Zhang, Yuxiang, et autres
Publié: (2023)
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
par: He, Haorui, et autres
Publié: (2025)
par: He, Haorui, et autres
Publié: (2025)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
par: Peng, Puyuan, et autres
Publié: (2025)
par: Peng, Puyuan, et autres
Publié: (2025)
QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection
par: Wu, Zhiyu, et autres
Publié: (2025)
par: Wu, Zhiyu, et autres
Publié: (2025)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2026)
par: Wang, Zhichao, et autres
Publié: (2026)
Voice Attribute Editing with Text Prompt
par: Sheng, Zhengyan, et autres
Publié: (2024)
par: Sheng, Zhengyan, et autres
Publié: (2024)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
par: Wang, Jianzong, et autres
Publié: (2024)
par: Wang, Jianzong, et autres
Publié: (2024)
Robust Singing Voice Transcription Serves Synthesis
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
EchoVoices: Preserving Generational Voices and Memories for Seniors and Children
par: Xu, Haiying, et autres
Publié: (2025)
par: Xu, Haiying, et autres
Publié: (2025)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
par: Zhang, Leying, et autres
Publié: (2024)
par: Zhang, Leying, et autres
Publié: (2024)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
par: Zuo, Jialong, et autres
Publié: (2025)
par: Zuo, Jialong, et autres
Publié: (2025)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
par: Sha, Binzhu, et autres
Publié: (2023)
par: Sha, Binzhu, et autres
Publié: (2023)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
par: Chen, Meiying, et autres
Publié: (2022)
par: Chen, Meiying, et autres
Publié: (2022)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
par: Lin, Zhennan, et autres
Publié: (2026)
par: Lin, Zhennan, et autres
Publié: (2026)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
par: Zeng, Bang, et autres
Publié: (2025)
par: Zeng, Bang, et autres
Publié: (2025)
Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
par: Suda, Hitoshi, et autres
Publié: (2025)
par: Suda, Hitoshi, et autres
Publié: (2025)
TRNet: Two-level Refinement Network leveraging Speech Enhancement for Noise Robust Speech Emotion Recognition
par: Chen, Chengxin, et autres
Publié: (2024)
par: Chen, Chengxin, et autres
Publié: (2024)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
par: Yao, Jixun, et autres
Publié: (2024)
par: Yao, Jixun, et autres
Publié: (2024)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
par: Yu, Fan, et autres
Publié: (2025)
par: Yu, Fan, et autres
Publié: (2025)
Generating Novel and Realistic Speakers for Voice Conversion
par: Chen, Meiying Melissa, et autres
Publié: (2025)
par: Chen, Meiying Melissa, et autres
Publié: (2025)
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
par: Li, Yuke, et autres
Publié: (2024)
par: Li, Yuke, et autres
Publié: (2024)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
par: Ren, Pengyu, et autres
Publié: (2025)
par: Ren, Pengyu, et autres
Publié: (2025)
Human Voice is Unique
par: Singh, Rita, et autres
Publié: (2025)
par: Singh, Rita, et autres
Publié: (2025)
Creating Personalized Synthetic Voices from Articulation Impaired Speech Using Augmented Reconstruction Loss
par: Tian, Yusheng, et autres
Publié: (2024)
par: Tian, Yusheng, et autres
Publié: (2024)
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
par: Cao, Songjun, et autres
Publié: (2025)
par: Cao, Songjun, et autres
Publié: (2025)
LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
par: Ohmura, Junki, et autres
Publié: (2025)
par: Ohmura, Junki, et autres
Publié: (2025)
MuSE-SVS: Multi-Singer Emotional Singing Voice Synthesizer that Controls Emotional Intensity
par: Kim, Sungjae, et autres
Publié: (2022)
par: Kim, Sungjae, et autres
Publié: (2022)
SYKI-SVC: Advancing Singing Voice Conversion with Post-Processing Innovations and an Open-Source Professional Testset
par: Zhou, Yiquan, et autres
Publié: (2025)
par: Zhou, Yiquan, et autres
Publié: (2025)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
par: Guan, Wenhao, et autres
Publié: (2025)
par: Guan, Wenhao, et autres
Publié: (2025)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
par: Kameoka, Hirokazu, et autres
Publié: (2025)
par: Kameoka, Hirokazu, et autres
Publié: (2025)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
par: Byun, Kyungguen, et autres
Publié: (2025)
par: Byun, Kyungguen, et autres
Publié: (2025)
Documents similaires
-
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
par: Li, Xuyuan, et autres
Publié: (2024) -
Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder
par: Li, Xuyuan, et autres
Publié: (2023) -
Improving Short Utterance Anti-Spoofing with AASIST2
par: Zhang, Yuxiang, et autres
Publié: (2023) -
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
par: He, Haorui, et autres
Publié: (2025) -
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
par: Peng, Puyuan, et autres
Publié: (2025)