Salvato in:
| Autori principali: | Chinchmalatpure, Prajwal, Chinchmalatpure, Suyash, Chavan, Siddharth |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.04227 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
Selective Attention System (SAS): Device-Addressed Speech Detection for Real-Time On-Device Voice AI
di: Kim, David Joohun, et al.
Pubblicazione: (2026)
di: Kim, David Joohun, et al.
Pubblicazione: (2026)
A Real-Time Voice Activity Detection Based On Lightweight Neural
di: Jia, Jidong, et al.
Pubblicazione: (2024)
di: Jia, Jidong, et al.
Pubblicazione: (2024)
What Counts as Real? Speech Restoration and Voice Quality Conversion Pose New Challenges to Deepfake Detection
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2026)
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2026)
Safe Guard: an LLM-agent for Real-time Voice-based Hate Speech Detection in Social Virtual Reality
di: Xu, Yiwen, et al.
Pubblicazione: (2024)
di: Xu, Yiwen, et al.
Pubblicazione: (2024)
Replay Attacks Against Audio Deepfake Detection
di: Müller, Nicolas, et al.
Pubblicazione: (2025)
di: Müller, Nicolas, et al.
Pubblicazione: (2025)
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
di: Anastassiou, Philip, et al.
Pubblicazione: (2024)
di: Anastassiou, Philip, et al.
Pubblicazione: (2024)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
di: Lau, Hok-Shing, et al.
Pubblicazione: (2024)
di: Lau, Hok-Shing, et al.
Pubblicazione: (2024)
Unsupervised Rhythm and Voice Conversion to Improve ASR on Dysarthric Speech
di: Hajal, Karl El, et al.
Pubblicazione: (2025)
di: Hajal, Karl El, et al.
Pubblicazione: (2025)
Unsupervised Rhythm and Voice Conversion of Dysarthric to Healthy Speech for ASR
di: Hajal, Karl El, et al.
Pubblicazione: (2025)
di: Hajal, Karl El, et al.
Pubblicazione: (2025)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2024)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2024)
Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology
di: Moell, Birger, et al.
Pubblicazione: (2025)
di: Moell, Birger, et al.
Pubblicazione: (2025)
Speech Foundation Model Ensembles for the Controlled Singing Voice Deepfake Detection (CtrSVDD) Challenge 2024
di: Guragain, Anmol, et al.
Pubblicazione: (2024)
di: Guragain, Anmol, et al.
Pubblicazione: (2024)
MulliVC: Multi-lingual Voice Conversion With Cycle Consistency
di: Huang, Jiawei, et al.
Pubblicazione: (2024)
di: Huang, Jiawei, et al.
Pubblicazione: (2024)
Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio
di: Chen, Guangke, et al.
Pubblicazione: (2025)
di: Chen, Guangke, et al.
Pubblicazione: (2025)
Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation
di: Chen, Guo, et al.
Pubblicazione: (2025)
di: Chen, Guo, et al.
Pubblicazione: (2025)
Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis
di: Ji, Zhoulin, et al.
Pubblicazione: (2024)
di: Ji, Zhoulin, et al.
Pubblicazione: (2024)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
di: Choi, Ha-Yeong, et al.
Pubblicazione: (2025)
di: Choi, Ha-Yeong, et al.
Pubblicazione: (2025)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
di: Joglekar, Advait, et al.
Pubblicazione: (2025)
di: Joglekar, Advait, et al.
Pubblicazione: (2025)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
di: Bai, Bingsong, et al.
Pubblicazione: (2024)
di: Bai, Bingsong, et al.
Pubblicazione: (2024)
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
di: Huang, Yubo, et al.
Pubblicazione: (2024)
di: Huang, Yubo, et al.
Pubblicazione: (2024)
SelfVC: Voice Conversion With Iterative Refinement using Self Transformations
di: Neekhara, Paarth, et al.
Pubblicazione: (2023)
di: Neekhara, Paarth, et al.
Pubblicazione: (2023)
Improving Voice Quality in Speech Anonymization With Just Perception-Informed Losses
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
Anonymising Elderly and Pathological Speech: Voice Conversion Using DDSP and Query-by-Example
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
CloneShield: A Framework for Universal Perturbation Against Zero-Shot Voice Cloning
di: Li, Renyuan, et al.
Pubblicazione: (2025)
di: Li, Renyuan, et al.
Pubblicazione: (2025)
Generative Adversarial Network based Voice Conversion: Techniques, Challenges, and Recent Advancements
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
di: Akti, Seymanur, et al.
Pubblicazione: (2025)
di: Akti, Seymanur, et al.
Pubblicazione: (2025)
Attention-based Interactive Disentangling Network for Instance-level Emotional Voice Conversion
di: Chen, Yun, et al.
Pubblicazione: (2023)
di: Chen, Yun, et al.
Pubblicazione: (2023)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
di: Lu, Shenghui, et al.
Pubblicazione: (2025)
di: Lu, Shenghui, et al.
Pubblicazione: (2025)
A Lightweight and Real-Time Binaural Speech Enhancement Model with Spatial Cues Preservation
di: Wang, Jingyuan, et al.
Pubblicazione: (2024)
di: Wang, Jingyuan, et al.
Pubblicazione: (2024)
Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters
di: Abrassart, Mathilde, et al.
Pubblicazione: (2025)
di: Abrassart, Mathilde, et al.
Pubblicazione: (2025)
Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning
di: Zhao, Junchuan, et al.
Pubblicazione: (2025)
di: Zhao, Junchuan, et al.
Pubblicazione: (2025)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
di: Sim, Youngjun, et al.
Pubblicazione: (2024)
di: Sim, Youngjun, et al.
Pubblicazione: (2024)
Deepfake Detection of Singing Voices With Whisper Encodings
di: Sharma, Falguni, et al.
Pubblicazione: (2025)
di: Sharma, Falguni, et al.
Pubblicazione: (2025)
SingFake: Singing Voice Deepfake Detection
di: Zang, Yongyi, et al.
Pubblicazione: (2023)
di: Zang, Yongyi, et al.
Pubblicazione: (2023)
Documenti analoghi
-
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2024) -
Selective Attention System (SAS): Device-Addressed Speech Detection for Real-Time On-Device Voice AI
di: Kim, David Joohun, et al.
Pubblicazione: (2026) -
A Real-Time Voice Activity Detection Based On Lightweight Neural
di: Jia, Jidong, et al.
Pubblicazione: (2024) -
What Counts as Real? Speech Restoration and Voice Quality Conversion Pose New Challenges to Deepfake Detection
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2026) -
Safe Guard: an LLM-agent for Real-time Voice-based Hate Speech Detection in Social Virtual Reality
di: Xu, Yiwen, et al.
Pubblicazione: (2024)