Universal Acoustic Adversarial Attacks for Flexible Control of Speech-LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Rao, Qian, Mengjie, Raina, Vyas, Gales, Mark, Knill, Kate |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Muting Whisper: A Universal Acoustic Adversarial Attack on Speech Foundation Models
par: Raina, Vyas, et autres
Publié: (2024)
par: Raina, Vyas, et autres
Publié: (2024)
Controlling Whisper: Universal Acoustic Adversarial Attacks to Control Speech Foundation Models
par: Raina, Vyas, et autres
Publié: (2024)
par: Raina, Vyas, et autres
Publié: (2024)
ASR Error Correction using Large Language Models
par: Ma, Rao, et autres
Publié: (2024)
par: Ma, Rao, et autres
Publié: (2024)
Assessment of L2 Oral Proficiency using Speech Large Language Models
par: Ma, Rao, et autres
Publié: (2025)
par: Ma, Rao, et autres
Publié: (2025)
Scaling and Prompting for Improved End-to-End Spoken Grammatical Error Correction
par: Qian, Mengjie, et autres
Publié: (2025)
par: Qian, Mengjie, et autres
Publié: (2025)
End-to-End Spoken Grammatical Error Correction
par: Qian, Mengjie, et autres
Publié: (2025)
par: Qian, Mengjie, et autres
Publié: (2025)
Learn and Don't Forget: Adding a New Language to ASR Foundation Models
par: Qian, Mengjie, et autres
Publié: (2024)
par: Qian, Mengjie, et autres
Publié: (2024)
Data Augmentation for Spoken Grammatical Error Correction
par: Karanasou, Penny, et autres
Publié: (2025)
par: Karanasou, Penny, et autres
Publié: (2025)
Speaker Retrieval in the Wild: Challenges, Effectiveness and Robustness
par: Loweimi, Erfan, et autres
Publié: (2025)
par: Loweimi, Erfan, et autres
Publié: (2025)
Natural Language-based Assessment of L2 Oral Proficiency using LLMs
par: Bannò, Stefano, et autres
Publié: (2025)
par: Bannò, Stefano, et autres
Publié: (2025)
Towards End-to-End Spoken Grammatical Error Correction
par: Bannò, Stefano, et autres
Publié: (2023)
par: Bannò, Stefano, et autres
Publié: (2023)
Training Articulatory Inversion Models for Interspeaker Consistency
par: McGhee, Charles, et autres
Publié: (2025)
par: McGhee, Charles, et autres
Publié: (2025)
LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors
par: Ma, Rao, et autres
Publié: (2025)
par: Ma, Rao, et autres
Publié: (2025)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
par: Hwang, Min-Jae, et autres
Publié: (2024)
par: Hwang, Min-Jae, et autres
Publié: (2024)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025)
par: Futami, Hayato, et autres
Publié: (2025)
Solla: Towards a Speech-Oriented LLM That Hears Acoustic Context
par: Ao, Junyi, et autres
Publié: (2025)
par: Ao, Junyi, et autres
Publié: (2025)
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
par: Deng, Keqi, et autres
Publié: (2025)
par: Deng, Keqi, et autres
Publié: (2025)
FASA: a Flexible and Automatic Speech Aligner for Extracting High-quality Aligned Children Speech Data
par: Liu, Dancheng, et autres
Publié: (2024)
par: Liu, Dancheng, et autres
Publié: (2024)
Acoustic to Articulatory Inversion of Speech; Data Driven Approaches, Challenges, Applications, and Future Scope
par: Pillai, Leena G, et autres
Publié: (2025)
par: Pillai, Leena G, et autres
Publié: (2025)
Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition
par: Shu, Yuchun, et autres
Publié: (2024)
par: Shu, Yuchun, et autres
Publié: (2024)
Improving Acoustic Word Embeddings through Correspondence Training of Self-supervised Speech Representations
par: Meghanani, Amit, et autres
Publié: (2024)
par: Meghanani, Amit, et autres
Publié: (2024)
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
par: Peri, Raghuveer, et autres
Publié: (2024)
par: Peri, Raghuveer, et autres
Publié: (2024)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
par: Wang, Haoyu, et autres
Publié: (2022)
par: Wang, Haoyu, et autres
Publié: (2022)
Towards Unsupervised Speech Recognition Without Pronunciation Models
par: Ni, Junrui, et autres
Publié: (2024)
par: Ni, Junrui, et autres
Publié: (2024)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Layer-Wise Analysis of Self-Supervised Acoustic Word Embeddings: A Study on Speech Emotion Recognition
par: Saliba, Alexandra, et autres
Publié: (2024)
par: Saliba, Alexandra, et autres
Publié: (2024)
PersonaTAB: Predicting Personality Traits using Textual, Acoustic, and Behavioral Cues in Fully-Duplex Speech Dialogs
par: Inoue, Sho, et autres
Publié: (2025)
par: Inoue, Sho, et autres
Publié: (2025)
The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs
par: Satish, Shree Harsha Bokkahalli, et autres
Publié: (2026)
par: Satish, Shree Harsha Bokkahalli, et autres
Publié: (2026)
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
par: Lin, Liang, et autres
Publié: (2025)
par: Lin, Liang, et autres
Publié: (2025)
MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition
par: Xia, Yinfeng, et autres
Publié: (2025)
par: Xia, Yinfeng, et autres
Publié: (2025)
USAD: Universal Speech and Audio Representation via Distillation
par: Chang, Heng-Jui, et autres
Publié: (2025)
par: Chang, Heng-Jui, et autres
Publié: (2025)
ML-SUPERB: Multilingual Speech Universal PERformance Benchmark
par: Shi, Jiatong, et autres
Publié: (2023)
par: Shi, Jiatong, et autres
Publié: (2023)
Novel Parasitic Dual-Scale Modeling for Efficient and Accurate Multilingual Speech Translation
par: Le, Chenyang, et autres
Publié: (2025)
par: Le, Chenyang, et autres
Publié: (2025)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
par: Zhang, Wenyu, et autres
Publié: (2025)
par: Zhang, Wenyu, et autres
Publié: (2025)
RIR-Mega-Speech: A Reverberant Speech Corpus with Comprehensive Acoustic Metadata and Reproducible Evaluation
par: Goswami, Mandip
Publié: (2026)
par: Goswami, Mandip
Publié: (2026)
Improving Speech-based Emotion Recognition with Contextual Utterance Analysis and LLMs
par: Zhang, Enshi, et autres
Publié: (2024)
par: Zhang, Enshi, et autres
Publié: (2024)
JELLY: Joint Emotion Recognition and Context Reasoning with LLMs for Conversational Speech Synthesis
par: Cha, Jun-Hyeok, et autres
Publié: (2025)
par: Cha, Jun-Hyeok, et autres
Publié: (2025)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
par: Yuhang, Yang, et autres
Publié: (2024)
par: Yuhang, Yang, et autres
Publié: (2024)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions
par: Zhou, Kun, et autres
Publié: (2024)
par: Zhou, Kun, et autres
Publié: (2024)
Documents similaires
-
Muting Whisper: A Universal Acoustic Adversarial Attack on Speech Foundation Models
par: Raina, Vyas, et autres
Publié: (2024) -
Controlling Whisper: Universal Acoustic Adversarial Attacks to Control Speech Foundation Models
par: Raina, Vyas, et autres
Publié: (2024) -
ASR Error Correction using Large Language Models
par: Ma, Rao, et autres
Publié: (2024) -
Assessment of L2 Oral Proficiency using Speech Large Language Models
par: Ma, Rao, et autres
Publié: (2025) -
Scaling and Prompting for Improved End-to-End Spoken Grammatical Error Correction
par: Qian, Mengjie, et autres
Publié: (2025)