Imperceptible Rhythm Backdoor Attacks: Exploring Rhythm Transformation for Embedding Undetectable Vulnerabilities on Speech Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Yao, Wenhan, Yang, Jiangkun, He, Yongqiang, Liu, Jia, Wen, Weiping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
Pureformer-VC: Non-parallel One-Shot Voice Conversion with Pure Transformer Blocks and Triplet Discriminative Training
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
Generating Rhythm Game Music with Jukebox
di: Yan, Nicholas
Pubblicazione: (2023)
di: Yan, Nicholas
Pubblicazione: (2023)
DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization
di: Chen, Huakang, et al.
Pubblicazione: (2025)
di: Chen, Huakang, et al.
Pubblicazione: (2025)
Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations
di: Wachter, Maximilian, et al.
Pubblicazione: (2026)
di: Wachter, Maximilian, et al.
Pubblicazione: (2026)
Leveraging AM and FM Rhythm Spectrograms for Dementia Classification and Assessment
di: Gogoi, Parismita, et al.
Pubblicazione: (2025)
di: Gogoi, Parismita, et al.
Pubblicazione: (2025)
MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation
di: Lan, Yun-Han, et al.
Pubblicazione: (2024)
di: Lan, Yun-Han, et al.
Pubblicazione: (2024)
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
Multimodal Lyrics-Rhythm Matching
di: Liao, Callie C., et al.
Pubblicazione: (2023)
di: Liao, Callie C., et al.
Pubblicazione: (2023)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
Towards an Accessible and Rapidly Trainable Rhythm Sequencer Using a Generative Stacked Autoencoder
di: Wastnidge, Alex
Pubblicazione: (2024)
di: Wastnidge, Alex
Pubblicazione: (2024)
Edit Content, Preserve Acoustics: Imperceptible Text-Based Speech Editing via Self-Consistency Rewards
di: Ren, Yong, et al.
Pubblicazione: (2026)
di: Ren, Yong, et al.
Pubblicazione: (2026)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
Unsupervised Rhythm and Voice Conversion to Improve ASR on Dysarthric Speech
di: Hajal, Karl El, et al.
Pubblicazione: (2025)
di: Hajal, Karl El, et al.
Pubblicazione: (2025)
Unsupervised Rhythm and Voice Conversion of Dysarthric to Healthy Speech for ASR
di: Hajal, Karl El, et al.
Pubblicazione: (2025)
di: Hajal, Karl El, et al.
Pubblicazione: (2025)
From Qubits to Rhythm: Exploring Quantum Random Walks in Rhythmspaces
di: Aguado-Yáñez, María, et al.
Pubblicazione: (2025)
di: Aguado-Yáñez, María, et al.
Pubblicazione: (2025)
Beat-Based Rhythm Quantization of MIDI Performances
di: Wachter, Maximilian, et al.
Pubblicazione: (2025)
di: Wachter, Maximilian, et al.
Pubblicazione: (2025)
Device Feature based on Graph Fourier Transformation with Logarithmic Processing For Detection of Replay Speech Attacks
di: He, Mingrui, et al.
Pubblicazione: (2024)
di: He, Mingrui, et al.
Pubblicazione: (2024)
Gradient Norm-based Fine-Tuning for Backdoor Defense in Automatic Speech Recognition
di: Zhou, Nanjun, et al.
Pubblicazione: (2025)
di: Zhou, Nanjun, et al.
Pubblicazione: (2025)
Exploring Local Interpretable Model-Agnostic Explanations for Speech Emotion Recognition with Distribution-Shift
di: Hjuler, Maja J., et al.
Pubblicazione: (2025)
di: Hjuler, Maja J., et al.
Pubblicazione: (2025)
In-Materia Speech Recognition
di: Zolfagharinejad, Mohamadreza, et al.
Pubblicazione: (2024)
di: Zolfagharinejad, Mohamadreza, et al.
Pubblicazione: (2024)
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
di: Tian, Jingguang, et al.
Pubblicazione: (2024)
di: Tian, Jingguang, et al.
Pubblicazione: (2024)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
di: Zhao, Ya, et al.
Pubblicazione: (2026)
di: Zhao, Ya, et al.
Pubblicazione: (2026)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
Are Modern Speech Enhancement Systems Vulnerable to Adversarial Attacks?
di: Makarov, Rostislav, et al.
Pubblicazione: (2025)
di: Makarov, Rostislav, et al.
Pubblicazione: (2025)
Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model
di: Li, Jizhen, et al.
Pubblicazione: (2025)
di: Li, Jizhen, et al.
Pubblicazione: (2025)
Detecting the Undetectable: Assessing the Efficacy of Current Spoof Detection Methods Against Seamless Speech Edits
di: Huang, Sung-Feng, et al.
Pubblicazione: (2025)
di: Huang, Sung-Feng, et al.
Pubblicazione: (2025)
FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System
di: Xu, Kaituo, et al.
Pubblicazione: (2026)
di: Xu, Kaituo, et al.
Pubblicazione: (2026)
Multi-Channel Differential ASR for Robust Wearer Speech Recognition on Smart Glasses
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
Two-pass Endpoint Detection for Speech Recognition
di: Raju, Anirudh, et al.
Pubblicazione: (2024)
di: Raju, Anirudh, et al.
Pubblicazione: (2024)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
di: Yang, Yiqing, et al.
Pubblicazione: (2025)
di: Yang, Yiqing, et al.
Pubblicazione: (2025)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
di: Chen, Peikun, et al.
Pubblicazione: (2024)
di: Chen, Peikun, et al.
Pubblicazione: (2024)
A Neural Speech Codec for Noise Robust Speech Coding
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
di: Liu, Huadai, et al.
Pubblicazione: (2023)
di: Liu, Huadai, et al.
Pubblicazione: (2023)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
Unmixing the Crowd: Learning Mixture-to-Set Speaker Embeddings for Enrollment-Free Target Speech Extraction
di: Sidharth, FNU, et al.
Pubblicazione: (2026)
di: Sidharth, FNU, et al.
Pubblicazione: (2026)
EventTrojan: Manipulating Non-Intrusive Speech Quality Assessment via Imperceptible Events
di: Ren, Ying, et al.
Pubblicazione: (2023)
di: Ren, Ying, et al.
Pubblicazione: (2023)
Documenti analoghi
-
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2024) -
SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2025) -
Pureformer-VC: Non-parallel One-Shot Voice Conversion with Pure Transformer Blocks and Triplet Discriminative Training
di: Yao, Wenhan, et al.
Pubblicazione: (2024) -
Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training
di: Yao, Wenhan, et al.
Pubblicazione: (2025) -
Generating Rhythm Game Music with Jukebox
di: Yan, Nicholas
Pubblicazione: (2023)