DAST: A Dual-Stream Voice Anonymization Attacker with Staged Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Arefeen, Ridwan, Miao, Xiaoxiao, Tong, Rong, Ng, Aik Beng, See, Simon, Liu, Timothy |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SegReConcat: A Data Augmentation Method for Voice Anonymization Attack
por: Arefeen, Ridwan, et al.
Publicado: (2025)
por: Arefeen, Ridwan, et al.
Publicado: (2025)
The First Voice Timbre Attribute Detection Challenge
por: Chen, Liping, et al.
Publicado: (2025)
por: Chen, Liping, et al.
Publicado: (2025)
StyleStream: Real-Time Zero-Shot Voice Style Conversion
por: Liu, Yisi, et al.
Publicado: (2026)
por: Liu, Yisi, et al.
Publicado: (2026)
Addressing Gradient Misalignment in Data-Augmented Training for Robust Speech Deepfake Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
por: Wang, Rui, et al.
Publicado: (2024)
por: Wang, Rui, et al.
Publicado: (2024)
The Voice Timbre Attribute Detection 2025 Challenge Evaluation Plan
por: Sheng, Zhengyan, et al.
Publicado: (2025)
por: Sheng, Zhengyan, et al.
Publicado: (2025)
Improving Voice Quality in Speech Anonymization With Just Perception-Informed Losses
por: Ghosh, Suhita, et al.
Publicado: (2024)
por: Ghosh, Suhita, et al.
Publicado: (2024)
Exploring Machine Learning and Language Models for Multimodal Depression Detection
por: Hong, Javier Si Zhao, et al.
Publicado: (2025)
por: Hong, Javier Si Zhao, et al.
Publicado: (2025)
Any-to-any Speaker Attribute Perturbation for Asynchronous Voice Anonymization
por: Chen, Liping, et al.
Publicado: (2025)
por: Chen, Liping, et al.
Publicado: (2025)
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
por: Zou, Wenhao, et al.
Publicado: (2026)
por: Zou, Wenhao, et al.
Publicado: (2026)
Speech Emotion Recognition via Entropy-Aware Score Selection
por: Chua, ChenYi, et al.
Publicado: (2025)
por: Chua, ChenYi, et al.
Publicado: (2025)
ReLA: Representation Learning and Aggregation for Job Scheduling with Reinforcement Learning
por: Kwan, Zhengyi, et al.
Publicado: (2026)
por: Kwan, Zhengyi, et al.
Publicado: (2026)
QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
Automated evaluation of children's speech fluency for low-resource languages
por: Zhang, Bowen, et al.
Publicado: (2025)
por: Zhang, Bowen, et al.
Publicado: (2025)
Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input
por: Liu, Changsong, et al.
Publicado: (2026)
por: Liu, Changsong, et al.
Publicado: (2026)
$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains
por: Ray, Soham, et al.
Publicado: (2026)
por: Ray, Soham, et al.
Publicado: (2026)
i-LAVA: Insights on Low Latency Voice-2-Voice Architecture for Agents
por: Purwar, Anupam, et al.
Publicado: (2025)
por: Purwar, Anupam, et al.
Publicado: (2025)
IntrinsicVoice: Empowering LLMs with Intrinsic Real-time Voice Interaction Abilities
por: Zhang, Xin, et al.
Publicado: (2024)
por: Zhang, Xin, et al.
Publicado: (2024)
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
por: Kuzmin, Nikita, et al.
Publicado: (2026)
por: Kuzmin, Nikita, et al.
Publicado: (2026)
Voice Privacy from an Attribute-based Perspective
por: Rahman, Mehtab Ur, et al.
Publicado: (2026)
por: Rahman, Mehtab Ur, et al.
Publicado: (2026)
Probabilistic Verification of Voice Anti-Spoofing Models
por: Kushnir, Evgeny, et al.
Publicado: (2026)
por: Kushnir, Evgeny, et al.
Publicado: (2026)
Melody or Machine: Detecting Synthetic Music with Dual-Stream Contrastive Learning
por: Batra, Arnesh, et al.
Publicado: (2025)
por: Batra, Arnesh, et al.
Publicado: (2025)
DAFMSVC: One-Shot Singing Voice Conversion with Dual Attention Mechanism and Flow Matching
por: Chen, Wei, et al.
Publicado: (2025)
por: Chen, Wei, et al.
Publicado: (2025)
Self Voice Conversion as an Attack against Neural Audio Watermarking
por: Özer, Yigitcan, et al.
Publicado: (2026)
por: Özer, Yigitcan, et al.
Publicado: (2026)
An Agent-Based Framework for Automated Higher-Voice Harmony Generation
por: Ganapathy, Nia D'Souza, et al.
Publicado: (2025)
por: Ganapathy, Nia D'Souza, et al.
Publicado: (2025)
Anonymizing Speech: Evaluating and Designing Speaker Anonymization Techniques
por: Champion, Pierre
Publicado: (2023)
por: Champion, Pierre
Publicado: (2023)
Stage-adaptive audio diffusion modeling
por: Zhang, Xuanhao, et al.
Publicado: (2026)
por: Zhang, Xuanhao, et al.
Publicado: (2026)
Text-dependent Speaker Verification (TdSV) Challenge 2024: Challenge Evaluation Plan
por: Hossein, Zeinali, et al.
Publicado: (2024)
por: Hossein, Zeinali, et al.
Publicado: (2024)
Neural Multi-Speaker Voice Cloning for Nepali in Low-Resource Settings
por: Shrestha, Aayush M., et al.
Publicado: (2026)
por: Shrestha, Aayush M., et al.
Publicado: (2026)
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
por: Cheng, Sitong, et al.
Publicado: (2025)
por: Cheng, Sitong, et al.
Publicado: (2025)
Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play
por: Shi, Yemin, et al.
Publicado: (2025)
por: Shi, Yemin, et al.
Publicado: (2025)
CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models
por: Du, Zhihao, et al.
Publicado: (2024)
por: Du, Zhihao, et al.
Publicado: (2024)
Fairness-Aware Partial-label Domain Adaptation for Voice Classification of Parkinson's and ALS
por: Francesconi, Arianna, et al.
Publicado: (2026)
por: Francesconi, Arianna, et al.
Publicado: (2026)
Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
por: Kim, Nam-Gyu
Publicado: (2025)
por: Kim, Nam-Gyu
Publicado: (2025)
SEF-MK: Speaker-Embedding-Free Voice Anonymization through Multi-k-means Quantization
por: Tang, Beilong, et al.
Publicado: (2025)
por: Tang, Beilong, et al.
Publicado: (2025)
MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions
por: Huang, Kexin, et al.
Publicado: (2026)
por: Huang, Kexin, et al.
Publicado: (2026)
Memo2496: Expert-Annotated Dataset and Dual-View Adaptive Framework for Music Emotion Recognition
por: Li, Qilin, et al.
Publicado: (2025)
por: Li, Qilin, et al.
Publicado: (2025)
Voices of the Mountains: Deep Learning-Based Vocal Error Detection System for Kurdish Maqams
por: Khairaldeen, Darvan Shvan, et al.
Publicado: (2026)
por: Khairaldeen, Darvan Shvan, et al.
Publicado: (2026)
VividVoice: A Unified Framework for Scene-Aware Visually-Driven Speech Synthesis
por: Ma, Chengyuan, et al.
Publicado: (2026)
por: Ma, Chengyuan, et al.
Publicado: (2026)
A Lightweight Pipeline for Noisy Speech Voice Cloning and Accurate Lip Sync Synthesis
por: Amir, Javeria, et al.
Publicado: (2025)
por: Amir, Javeria, et al.
Publicado: (2025)
Ejemplares similares
-
SegReConcat: A Data Augmentation Method for Voice Anonymization Attack
por: Arefeen, Ridwan, et al.
Publicado: (2025) -
The First Voice Timbre Attribute Detection Challenge
por: Chen, Liping, et al.
Publicado: (2025) -
StyleStream: Real-Time Zero-Shot Voice Style Conversion
por: Liu, Yisi, et al.
Publicado: (2026) -
Addressing Gradient Misalignment in Data-Augmented Training for Robust Speech Deepfake Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2025) -
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
por: Wang, Rui, et al.
Publicado: (2024)