Transferable Adversarial Attacks against ASR
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Xiaoxue, Li, Zexin, Chen, Yiming, Liu, Cong, Li, Haizhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MORE: Multi-Objective Adversarial Attacks on Speech Recognition
di: Gao, Xiaoxue, et al.
Pubblicazione: (2026)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2026)
Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
MultiGen: Child-Friendly Multilingual Speech Generator with LLMs
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
TTSlow: Slow Down Text-to-Speech with Efficiency Robustness Evaluations
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS
di: Wang, Xiaofei, et al.
Pubblicazione: (2024)
di: Wang, Xiaofei, et al.
Pubblicazione: (2024)
Laugh Now Cry Later: Controlling Time-Varying Emotional States of Flow-Matching-Based Zero-Shot Text-to-Speech
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
Joint Semantic Knowledge Distillation and Masked Acoustic Modeling for Full-band Speech Restoration with Improved Intelligibility
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
Prompt-driven Target Speech Diarization
di: Jiang, Yidi, et al.
Pubblicazione: (2023)
di: Jiang, Yidi, et al.
Pubblicazione: (2023)
VoiceBench: Benchmarking LLM-Based Voice Assistants
di: Chen, Yiming, et al.
Pubblicazione: (2024)
di: Chen, Yiming, et al.
Pubblicazione: (2024)
CSL-L2M: Controllable Song-Level Lyric-to-Melody Generation Based on Conditional Transformer with Fine-Grained Lyric and Musical Controls
di: Chai, Li, et al.
Pubblicazione: (2024)
di: Chai, Li, et al.
Pubblicazione: (2024)
Crowdsourced Multilingual Speech Intelligibility Testing
di: Lechler, Laura, et al.
Pubblicazione: (2024)
di: Lechler, Laura, et al.
Pubblicazione: (2024)
FreGrad: Lightweight and Fast Frequency-aware Diffusion Vocoder
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
Text-Aware Adapter for Few-Shot Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
Relational Proxy Loss for Audio-Text based Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
Mitigating Intra-Speaker Variability in Diarization with Style-Controllable Speech Augmentation
di: Kim, Miseul, et al.
Pubblicazione: (2025)
di: Kim, Miseul, et al.
Pubblicazione: (2025)
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
Neural Spectral Band Generation for Audio Coding
di: Choi, Woongjib, et al.
Pubblicazione: (2025)
di: Choi, Woongjib, et al.
Pubblicazione: (2025)
Scattering Transform for Auditory Attention Decoding
di: Pallenberg, René, et al.
Pubblicazione: (2026)
di: Pallenberg, René, et al.
Pubblicazione: (2026)
Explainable AI in Speaker Recognition -- Making Latent Representations Understandable
di: Xu, Yanze, et al.
Pubblicazione: (2026)
di: Xu, Yanze, et al.
Pubblicazione: (2026)
Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment
di: Cai, Huanchen, et al.
Pubblicazione: (2026)
di: Cai, Huanchen, et al.
Pubblicazione: (2026)
Enhancing dysarthria speech feature representation with empirical mode decomposition and Walsh-Hadamard transform
di: Zhu, Ting, et al.
Pubblicazione: (2023)
di: Zhu, Ting, et al.
Pubblicazione: (2023)
Can Layer-wise SSL Features Improve Zero-Shot ASR Performance for Children's Speech?
di: Sinha, Abhijit, et al.
Pubblicazione: (2025)
di: Sinha, Abhijit, et al.
Pubblicazione: (2025)
Improved Cross-Lingual Transfer Learning For Automatic Speech Translation
di: Khurana, Sameer, et al.
Pubblicazione: (2023)
di: Khurana, Sameer, et al.
Pubblicazione: (2023)
Construction and Evaluation of Mandarin Multimodal Emotional Speech Database
di: Ting, Zhu, et al.
Pubblicazione: (2024)
di: Ting, Zhu, et al.
Pubblicazione: (2024)
MaLa-ASR: Multimedia-Assisted LLM-Based ASR
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
Recent Advances in Discrete Speech Tokens: A Review
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
Confidence-Based Self-Training for EMG-to-Speech: Leveraging Synthetic EMG for Robust Modeling
di: Chen, Xiaodan, et al.
Pubblicazione: (2025)
di: Chen, Xiaodan, et al.
Pubblicazione: (2025)
Single-stage TTS with Masked Audio Token Modeling and Semantic Knowledge Distillation
di: Gállego, Gerard I., et al.
Pubblicazione: (2024)
di: Gállego, Gerard I., et al.
Pubblicazione: (2024)
Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations
di: Huang, Kuan-Tang, et al.
Pubblicazione: (2026)
di: Huang, Kuan-Tang, et al.
Pubblicazione: (2026)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
di: Gong, Xun, et al.
Pubblicazione: (2025)
di: Gong, Xun, et al.
Pubblicazione: (2025)
Analyzable Chain-of-Musical-Thought Prompting for High-Fidelity Music Generation
di: Lam, Max W. Y., et al.
Pubblicazione: (2025)
di: Lam, Max W. Y., et al.
Pubblicazione: (2025)
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
di: Meng, Hanyu, et al.
Pubblicazione: (2025)
di: Meng, Hanyu, et al.
Pubblicazione: (2025)
Accelerating High-Fidelity Waveform Generation via Adversarial Flow Matching Optimization
di: Lee, Sang-Hoon, et al.
Pubblicazione: (2024)
di: Lee, Sang-Hoon, et al.
Pubblicazione: (2024)
Text-guided HuBERT: Self-Supervised Speech Pre-training via Generative Adversarial Networks
di: Ma, Duo, et al.
Pubblicazione: (2024)
di: Ma, Duo, et al.
Pubblicazione: (2024)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
di: Qi, Tianhua, et al.
Pubblicazione: (2026)
di: Qi, Tianhua, et al.
Pubblicazione: (2026)
SuperM2M: Supervised and Mixture-to-Mixture Co-Learning for Speech Enhancement and Noise-Robust ASR
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
Toward Fully-End-to-End Listened Speech Decoding from EEG Signals
di: Lee, Jihwan, et al.
Pubblicazione: (2024)
di: Lee, Jihwan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MORE: Multi-Objective Adversarial Attacks on Speech Recognition
di: Gao, Xiaoxue, et al.
Pubblicazione: (2026) -
Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025) -
MultiGen: Child-Friendly Multilingual Speech Generator with LLMs
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025) -
TTSlow: Slow Down Text-to-Speech with Efficiency Robustness Evaluations
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024) -
Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)