Controlling your Attributes in Voice
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Xuyuan, Wang, Zengqiang Shang. Li, Zhang, Pengyuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
por: Li, Xuyuan, et al.
Publicado: (2024)
por: Li, Xuyuan, et al.
Publicado: (2024)
Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder
por: Li, Xuyuan, et al.
Publicado: (2023)
por: Li, Xuyuan, et al.
Publicado: (2023)
Improving Short Utterance Anti-Spoofing with AASIST2
por: Zhang, Yuxiang, et al.
Publicado: (2023)
por: Zhang, Yuxiang, et al.
Publicado: (2023)
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
por: He, Haorui, et al.
Publicado: (2025)
por: He, Haorui, et al.
Publicado: (2025)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
por: Peng, Puyuan, et al.
Publicado: (2025)
por: Peng, Puyuan, et al.
Publicado: (2025)
QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection
por: Wu, Zhiyu, et al.
Publicado: (2025)
por: Wu, Zhiyu, et al.
Publicado: (2025)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026)
por: Wang, Zhichao, et al.
Publicado: (2026)
Voice Attribute Editing with Text Prompt
por: Sheng, Zhengyan, et al.
Publicado: (2024)
por: Sheng, Zhengyan, et al.
Publicado: (2024)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
por: Wang, Jianzong, et al.
Publicado: (2024)
por: Wang, Jianzong, et al.
Publicado: (2024)
Robust Singing Voice Transcription Serves Synthesis
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
EchoVoices: Preserving Generational Voices and Memories for Seniors and Children
por: Xu, Haiying, et al.
Publicado: (2025)
por: Xu, Haiying, et al.
Publicado: (2025)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
por: Zhang, Leying, et al.
Publicado: (2024)
por: Zhang, Leying, et al.
Publicado: (2024)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
por: Sha, Binzhu, et al.
Publicado: (2023)
por: Sha, Binzhu, et al.
Publicado: (2023)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
por: Huo, Mingyue, et al.
Publicado: (2025)
por: Huo, Mingyue, et al.
Publicado: (2025)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
por: Chen, Meiying, et al.
Publicado: (2022)
por: Chen, Meiying, et al.
Publicado: (2022)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
por: Lin, Zhennan, et al.
Publicado: (2026)
por: Lin, Zhennan, et al.
Publicado: (2026)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
por: Zeng, Bang, et al.
Publicado: (2025)
por: Zeng, Bang, et al.
Publicado: (2025)
Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
por: Suda, Hitoshi, et al.
Publicado: (2025)
por: Suda, Hitoshi, et al.
Publicado: (2025)
TRNet: Two-level Refinement Network leveraging Speech Enhancement for Noise Robust Speech Emotion Recognition
por: Chen, Chengxin, et al.
Publicado: (2024)
por: Chen, Chengxin, et al.
Publicado: (2024)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
por: Yao, Jixun, et al.
Publicado: (2024)
por: Yao, Jixun, et al.
Publicado: (2024)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
por: Yu, Fan, et al.
Publicado: (2025)
por: Yu, Fan, et al.
Publicado: (2025)
Generating Novel and Realistic Speakers for Voice Conversion
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
por: Li, Yuke, et al.
Publicado: (2024)
por: Li, Yuke, et al.
Publicado: (2024)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
por: Ren, Pengyu, et al.
Publicado: (2025)
por: Ren, Pengyu, et al.
Publicado: (2025)
Human Voice is Unique
por: Singh, Rita, et al.
Publicado: (2025)
por: Singh, Rita, et al.
Publicado: (2025)
Creating Personalized Synthetic Voices from Articulation Impaired Speech Using Augmented Reconstruction Loss
por: Tian, Yusheng, et al.
Publicado: (2024)
por: Tian, Yusheng, et al.
Publicado: (2024)
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
por: Cao, Songjun, et al.
Publicado: (2025)
por: Cao, Songjun, et al.
Publicado: (2025)
LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
por: Ohmura, Junki, et al.
Publicado: (2025)
por: Ohmura, Junki, et al.
Publicado: (2025)
MuSE-SVS: Multi-Singer Emotional Singing Voice Synthesizer that Controls Emotional Intensity
por: Kim, Sungjae, et al.
Publicado: (2022)
por: Kim, Sungjae, et al.
Publicado: (2022)
SYKI-SVC: Advancing Singing Voice Conversion with Post-Processing Innovations and an Open-Source Professional Testset
por: Zhou, Yiquan, et al.
Publicado: (2025)
por: Zhou, Yiquan, et al.
Publicado: (2025)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
por: Guan, Wenhao, et al.
Publicado: (2025)
por: Guan, Wenhao, et al.
Publicado: (2025)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
por: Gu, Yicheng, et al.
Publicado: (2025)
por: Gu, Yicheng, et al.
Publicado: (2025)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
por: Kameoka, Hirokazu, et al.
Publicado: (2025)
por: Kameoka, Hirokazu, et al.
Publicado: (2025)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
por: Byun, Kyungguen, et al.
Publicado: (2025)
por: Byun, Kyungguen, et al.
Publicado: (2025)
Ejemplares similares
-
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
por: Li, Xuyuan, et al.
Publicado: (2024) -
Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder
por: Li, Xuyuan, et al.
Publicado: (2023) -
Improving Short Utterance Anti-Spoofing with AASIST2
por: Zhang, Yuxiang, et al.
Publicado: (2023) -
Emilia: A Large-Scale, Extensive, Multilingual, and Diverse Dataset for Speech Generation
por: He, Haorui, et al.
Publicado: (2025) -
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
por: Peng, Puyuan, et al.
Publicado: (2025)