Application of ASV for Voice Identification after VC and Duration Predictor Improvement in TTS Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Nikolayevich, Borodin Kirill, Dmitrievich, Kudryavtsev Vasiliy, Maratovich, Mkrtchian Grach, Genadievich, Gorodnichev Mikhail, Sergeevich, Korzh Dmitrii |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
AASIST3: KAN-Enhanced AASIST Speech Deepfake Detection using SSL Features and Additional Regularization for the ASVspoof 2024 Challenge
di: Borodin, Kirill, et al.
Pubblicazione: (2024)
di: Borodin, Kirill, et al.
Pubblicazione: (2024)
Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech
di: Borodin, Kirill, et al.
Pubblicazione: (2025)
di: Borodin, Kirill, et al.
Pubblicazione: (2025)
Interpreting Multi-Branch Anti-Spoofing Architectures: Correlating Internal Strategy with Empirical Performance
di: Viakhirev, Ivan, et al.
Pubblicazione: (2026)
di: Viakhirev, Ivan, et al.
Pubblicazione: (2026)
From Visual to Multimodal: Systematic Ablation of Encoders and Fusion Strategies in Animal Identification
di: Kudryavtsev, Vasiliy, et al.
Pubblicazione: (2026)
di: Kudryavtsev, Vasiliy, et al.
Pubblicazione: (2026)
Benchmarking Compact VLMs for Clip-Level Surveillance Anomaly Detection Under Weak Supervision
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
Evaluating Generalization and Robustness in Russian Anti-Spoofing: The RuASD Initiative
di: Lysikova, Ksenia, et al.
Pubblicazione: (2026)
di: Lysikova, Ksenia, et al.
Pubblicazione: (2026)
From Dispersion to Attraction: Spectral Dynamics of Hallucination Across Whisper Model Scales
di: Viakhirev, Ivan, et al.
Pubblicazione: (2026)
di: Viakhirev, Ivan, et al.
Pubblicazione: (2026)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
Certification of Speaker Recognition Models to Additive Perturbations
di: Korzh, Dmitrii, et al.
Pubblicazione: (2024)
di: Korzh, Dmitrii, et al.
Pubblicazione: (2024)
Towards Scalable AASIST: Refining Graph Attention for Speech Deepfake Detection
di: Viakhirev, Ivan, et al.
Pubblicazione: (2025)
di: Viakhirev, Ivan, et al.
Pubblicazione: (2025)
An Exhaustive Evaluation of TTS- and VC-based Data Augmentation for ASR
di: Ogun, Sewade, et al.
Pubblicazione: (2025)
di: Ogun, Sewade, et al.
Pubblicazione: (2025)
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
di: Meng, Qingliang, et al.
Pubblicazione: (2025)
di: Meng, Qingliang, et al.
Pubblicazione: (2025)
Compact Neural TTS Voices for Accessibility
di: Jain, Kunal, et al.
Pubblicazione: (2025)
di: Jain, Kunal, et al.
Pubblicazione: (2025)
Zero-shot Cross-lingual Voice Transfer for TTS
di: Biadsy, Fadi, et al.
Pubblicazione: (2024)
di: Biadsy, Fadi, et al.
Pubblicazione: (2024)
Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages
di: Pandey, Isha, et al.
Pubblicazione: (2025)
di: Pandey, Isha, et al.
Pubblicazione: (2025)
Voice Impression Control in Zero-Shot TTS
di: Fujita, Kenichi, et al.
Pubblicazione: (2025)
di: Fujita, Kenichi, et al.
Pubblicazione: (2025)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
di: Byun, Kyungguen, et al.
Pubblicazione: (2024)
di: Byun, Kyungguen, et al.
Pubblicazione: (2024)
SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark
di: Saito, Yuki, et al.
Pubblicazione: (2024)
di: Saito, Yuki, et al.
Pubblicazione: (2024)
GenVC: Self-Supervised Zero-Shot Voice Conversion
di: Cai, Zexin, et al.
Pubblicazione: (2025)
di: Cai, Zexin, et al.
Pubblicazione: (2025)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
di: Zhou, Fangru, et al.
Pubblicazione: (2025)
di: Zhou, Fangru, et al.
Pubblicazione: (2025)
REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
di: Cao, Songjun, et al.
Pubblicazione: (2025)
di: Cao, Songjun, et al.
Pubblicazione: (2025)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
di: Niu, Xinlei, et al.
Pubblicazione: (2024)
di: Niu, Xinlei, et al.
Pubblicazione: (2024)
X-VC: Zero-shot Streaming Voice Conversion in Codec Space
di: Zheng, Qixi, et al.
Pubblicazione: (2026)
di: Zheng, Qixi, et al.
Pubblicazione: (2026)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
di: Kim, Jaehun, et al.
Pubblicazione: (2025)
di: Kim, Jaehun, et al.
Pubblicazione: (2025)
MulliVC: Multi-lingual Voice Conversion With Cycle Consistency
di: Huang, Jiawei, et al.
Pubblicazione: (2024)
di: Huang, Jiawei, et al.
Pubblicazione: (2024)
StreamVC: Real-Time Low-Latency Voice Conversion
di: Yang, Yang, et al.
Pubblicazione: (2024)
di: Yang, Yang, et al.
Pubblicazione: (2024)
LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
di: Ohmura, Junki, et al.
Pubblicazione: (2025)
di: Ohmura, Junki, et al.
Pubblicazione: (2025)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
di: Guan, Wenhao, et al.
Pubblicazione: (2025)
di: Guan, Wenhao, et al.
Pubblicazione: (2025)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
di: Chen, Meiying, et al.
Pubblicazione: (2022)
di: Chen, Meiying, et al.
Pubblicazione: (2022)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
di: Ma, Guobin, et al.
Pubblicazione: (2025)
di: Ma, Guobin, et al.
Pubblicazione: (2025)
Traceable TTS: Toward Watermark-Free TTS with Strong Traceability
di: Zhao, Yuxiang, et al.
Pubblicazione: (2025)
di: Zhao, Yuxiang, et al.
Pubblicazione: (2025)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
di: Joglekar, Advait, et al.
Pubblicazione: (2025)
di: Joglekar, Advait, et al.
Pubblicazione: (2025)
SelfVC: Voice Conversion With Iterative Refinement using Self Transformations
di: Neekhara, Paarth, et al.
Pubblicazione: (2023)
di: Neekhara, Paarth, et al.
Pubblicazione: (2023)
Novel Loss-Enhanced Universal Adversarial Patches for Sustainable Speaker Privacy
di: Karimov, Elvir, et al.
Pubblicazione: (2025)
di: Karimov, Elvir, et al.
Pubblicazione: (2025)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS
di: Borodin, Kirill, et al.
Pubblicazione: (2026) -
When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus
di: Borodin, Kirill, et al.
Pubblicazione: (2026) -
AASIST3: KAN-Enhanced AASIST Speech Deepfake Detection using SSL Features and Additional Regularization for the ASVspoof 2024 Challenge
di: Borodin, Kirill, et al.
Pubblicazione: (2024) -
Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech
di: Borodin, Kirill, et al.
Pubblicazione: (2025) -
Interpreting Multi-Branch Anti-Spoofing Architectures: Correlating Internal Strategy with Empirical Performance
di: Viakhirev, Ivan, et al.
Pubblicazione: (2026)