TVTSyn: Content-Synchronous Time-Varying Timbre for Streaming Voice Conversion and Anonymization
Fuente:
arXiv
Guardado en:
| Autores principales: | Quamer, Waris, Tseng, Mu-Ruei, Nasrallah, Ghady, Gutierrez-Osuna, Ricardo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PHONOS: PHOnetic Neutralization for Online Streaming Applications
por: Quamer, Waris, et al.
Publicado: (2026)
por: Quamer, Waris, et al.
Publicado: (2026)
DarkStream: real-time speech anonymization with low latency
por: Quamer, Waris, et al.
Publicado: (2025)
por: Quamer, Waris, et al.
Publicado: (2025)
Disentangling segmental and prosodic factors to non-native speech comprehensibility
por: Quamer, Waris, et al.
Publicado: (2024)
por: Quamer, Waris, et al.
Publicado: (2024)
End-to-end streaming model for low-latency speech anonymization
por: Quamer, Waris, et al.
Publicado: (2024)
por: Quamer, Waris, et al.
Publicado: (2024)
The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization
por: Tomashenko, Natalia, et al.
Publicado: (2026)
por: Tomashenko, Natalia, et al.
Publicado: (2026)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
por: Pan, Yu, et al.
Publicado: (2024)
por: Pan, Yu, et al.
Publicado: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
por: Chen, Meiying, et al.
Publicado: (2022)
por: Chen, Meiying, et al.
Publicado: (2022)
Analysis of Speech Temporal Dynamics in the Context of Speaker Verification and Voice Anonymization
por: Tomashenko, Natalia, et al.
Publicado: (2024)
por: Tomashenko, Natalia, et al.
Publicado: (2024)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
por: Yang, Yuguang, et al.
Publicado: (2024)
por: Yang, Yuguang, et al.
Publicado: (2024)
QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection
por: Wu, Zhiyu, et al.
Publicado: (2025)
por: Wu, Zhiyu, et al.
Publicado: (2025)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
por: Kim, Tae-Woo, et al.
Publicado: (2022)
por: Kim, Tae-Woo, et al.
Publicado: (2022)
On the Impact of Voice Anonymization on Speech Diagnostic Applications: a Case Study on COVID-19 Detection
por: Zhu, Yi, et al.
Publicado: (2023)
por: Zhu, Yi, et al.
Publicado: (2023)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
por: Ning, Ziqian, et al.
Publicado: (2023)
por: Ning, Ziqian, et al.
Publicado: (2023)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
USM-VC: Mitigating Timbre Leakage with Universal Semantic Mapping Residual Block for Voice Conversion
por: Li, Na, et al.
Publicado: (2025)
por: Li, Na, et al.
Publicado: (2025)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
por: Kim, Jaehun, et al.
Publicado: (2025)
por: Kim, Jaehun, et al.
Publicado: (2025)
StreamVC: Real-Time Low-Latency Voice Conversion
por: Yang, Yang, et al.
Publicado: (2024)
por: Yang, Yang, et al.
Publicado: (2024)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
por: Ma, Guobin, et al.
Publicado: (2025)
por: Ma, Guobin, et al.
Publicado: (2025)
Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning
por: Yang, Qian, et al.
Publicado: (2025)
por: Yang, Qian, et al.
Publicado: (2025)
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
por: Nguyen, Tuan-Nam, et al.
Publicado: (2025)
por: Nguyen, Tuan-Nam, et al.
Publicado: (2025)
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
por: Guo, Zhao, et al.
Publicado: (2025)
por: Guo, Zhao, et al.
Publicado: (2025)
Attacking Voice Anonymization Systems with Augmented Feature and Speaker Identity Difference
por: Zhang, Yanzhe, et al.
Publicado: (2024)
por: Zhang, Yanzhe, et al.
Publicado: (2024)
The Voice Timbre Attribute Detection 2025 Challenge Evaluation Plan
por: Sheng, Zhengyan, et al.
Publicado: (2025)
por: Sheng, Zhengyan, et al.
Publicado: (2025)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
por: Abdullah, Badr M., et al.
Publicado: (2025)
por: Abdullah, Badr M., et al.
Publicado: (2025)
Voice Conversion for Lombard Speaking Style with Implicit and Explicit Acoustic Feature Conditioning
por: Woszczyk, Dominika, et al.
Publicado: (2025)
por: Woszczyk, Dominika, et al.
Publicado: (2025)
Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
por: He, Haorui, et al.
Publicado: (2024)
por: He, Haorui, et al.
Publicado: (2024)
SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention
por: Li, Junjie, et al.
Publicado: (2023)
por: Li, Junjie, et al.
Publicado: (2023)
Probing the Feasibility of Multilingual Speaker Anonymization
por: Meyer, Sarina, et al.
Publicado: (2024)
por: Meyer, Sarina, et al.
Publicado: (2024)
A Benchmark for Multi-speaker Anonymization
por: Miao, Xiaoxiao, et al.
Publicado: (2024)
por: Miao, Xiaoxiao, et al.
Publicado: (2024)
Timbre Difference Capturing in Anomalous Sound Detection
por: Nishida, Tomoya, et al.
Publicado: (2024)
por: Nishida, Tomoya, et al.
Publicado: (2024)
Exploiting Context-dependent Duration Features for Voice Anonymization Attack Systems
por: Tomashenko, Natalia, et al.
Publicado: (2025)
por: Tomashenko, Natalia, et al.
Publicado: (2025)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
por: Seki, Kentaro, et al.
Publicado: (2024)
por: Seki, Kentaro, et al.
Publicado: (2024)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
por: Li, Chin-Jou, et al.
Publicado: (2025)
por: Li, Chin-Jou, et al.
Publicado: (2025)
Custom Data Augmentation for low resource ASR using Bark and Retrieval-Based Voice Conversion
por: Kamble, Anand, et al.
Publicado: (2023)
por: Kamble, Anand, et al.
Publicado: (2023)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
por: Huo, Mingyue, et al.
Publicado: (2025)
por: Huo, Mingyue, et al.
Publicado: (2025)
Assessing the Alignment of Audio Representations with Timbre Similarity Ratings
por: Tian, Haokun, et al.
Publicado: (2025)
por: Tian, Haokun, et al.
Publicado: (2025)
DiariST: Streaming Speech Translation with Speaker Diarization
por: Yang, Mu, et al.
Publicado: (2023)
por: Yang, Mu, et al.
Publicado: (2023)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
por: Sha, Binzhu, et al.
Publicado: (2023)
por: Sha, Binzhu, et al.
Publicado: (2023)
Ejemplares similares
-
PHONOS: PHOnetic Neutralization for Online Streaming Applications
por: Quamer, Waris, et al.
Publicado: (2026) -
DarkStream: real-time speech anonymization with low latency
por: Quamer, Waris, et al.
Publicado: (2025) -
Disentangling segmental and prosodic factors to non-native speech comprehensibility
por: Quamer, Waris, et al.
Publicado: (2024) -
End-to-end streaming model for low-latency speech anonymization
por: Quamer, Waris, et al.
Publicado: (2024) -
The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization
por: Tomashenko, Natalia, et al.
Publicado: (2026)