Towards Probing Speech-Specific Risks in Large Multimodal Models: A Taxonomy, Benchmark, and Insights
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Hao, Qu, Lizhen, Shareghi, Ehsan, Haffari, Gholamreza |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
por: Yang, Hao, et al.
Publicado: (2024)
por: Yang, Hao, et al.
Publicado: (2024)
Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models
por: Yang, Hao, et al.
Publicado: (2025)
por: Yang, Hao, et al.
Publicado: (2025)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
por: Yang, Hao, et al.
Publicado: (2026)
por: Yang, Hao, et al.
Publicado: (2026)
Continual Speech Learning with Fused Speech Features
por: Wang, Guitao, et al.
Publicado: (2025)
por: Wang, Guitao, et al.
Publicado: (2025)
Double Mixture: Towards Continual Event Detection from Speech
por: Kang, Jingqi, et al.
Publicado: (2024)
por: Kang, Jingqi, et al.
Publicado: (2024)
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
por: Cui, Ziyun, et al.
Publicado: (2024)
por: Cui, Ziyun, et al.
Publicado: (2024)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
por: Fang, Yuanbo, et al.
Publicado: (2025)
por: Fang, Yuanbo, et al.
Publicado: (2025)
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
por: Peri, Raghuveer, et al.
Publicado: (2024)
por: Peri, Raghuveer, et al.
Publicado: (2024)
BLSP-Emo: Towards Empathetic Large Speech-Language Models
por: Wang, Chen, et al.
Publicado: (2024)
por: Wang, Chen, et al.
Publicado: (2024)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
por: Gao, Yifan, et al.
Publicado: (2025)
por: Gao, Yifan, et al.
Publicado: (2025)
An End-to-End Speech Summarization Using Large Language Model
por: Shang, Hengchao, et al.
Publicado: (2024)
por: Shang, Hengchao, et al.
Publicado: (2024)
Hallucination Benchmark for Speech Foundation Models
por: Koudounas, Alkis, et al.
Publicado: (2025)
por: Koudounas, Alkis, et al.
Publicado: (2025)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
por: Hu, Ke, et al.
Publicado: (2025)
por: Hu, Ke, et al.
Publicado: (2025)
Towards Unsupervised Speech Recognition Without Pronunciation Models
por: Ni, Junrui, et al.
Publicado: (2024)
por: Ni, Junrui, et al.
Publicado: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
por: Hao, Hongkun, et al.
Publicado: (2023)
por: Hao, Hongkun, et al.
Publicado: (2023)
ELF: Encoding Speaker-Specific Latent Speech Feature for Speech Synthesis
por: Kong, Jungil, et al.
Publicado: (2023)
por: Kong, Jungil, et al.
Publicado: (2023)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
por: Guo, Shoutao, et al.
Publicado: (2025)
por: Guo, Shoutao, et al.
Publicado: (2025)
Benchmarking Automatic Speech Recognition Models for African Languages
por: Nahabwe, Alvin, et al.
Publicado: (2025)
por: Nahabwe, Alvin, et al.
Publicado: (2025)
EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech Models
por: de Seyssel, Maureen, et al.
Publicado: (2023)
por: de Seyssel, Maureen, et al.
Publicado: (2023)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2024)
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2024)
TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models
por: Peng, Junyi, et al.
Publicado: (2025)
por: Peng, Junyi, et al.
Publicado: (2025)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
por: Xie, Jingran, et al.
Publicado: (2025)
por: Xie, Jingran, et al.
Publicado: (2025)
Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India
por: Bhogale, Kaushal, et al.
Publicado: (2026)
por: Bhogale, Kaushal, et al.
Publicado: (2026)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
Multilingual Source Tracing of Speech Deepfakes: A First Benchmark
por: Xuan, Xi, et al.
Publicado: (2025)
por: Xuan, Xi, et al.
Publicado: (2025)
Effective Context in Neural Speech Models
por: Meng, Yen, et al.
Publicado: (2025)
por: Meng, Yen, et al.
Publicado: (2025)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Speech Language Models for Under-Represented Languages: Insights from Wolof
por: Sy, Yaya, et al.
Publicado: (2025)
por: Sy, Yaya, et al.
Publicado: (2025)
When Large Language Models Meet Speech: A Survey on Integration Approaches
por: Yang, Zhengdong, et al.
Publicado: (2025)
por: Yang, Zhengdong, et al.
Publicado: (2025)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
por: Fan, Ruchao, et al.
Publicado: (2024)
por: Fan, Ruchao, et al.
Publicado: (2024)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023)
por: Huang, Kuan-Po, et al.
Publicado: (2023)
STAB: Speech Tokenizer Assessment Benchmark
por: Vashishth, Shikhar, et al.
Publicado: (2024)
por: Vashishth, Shikhar, et al.
Publicado: (2024)
Speak Your Mind: The Speech Continuation Task as a Probe of Voice-Based Model Bias
por: Satish, Shree Harsha Bokkahalli, et al.
Publicado: (2025)
por: Satish, Shree Harsha Bokkahalli, et al.
Publicado: (2025)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
por: Chen, Chen, et al.
Publicado: (2025)
por: Chen, Chen, et al.
Publicado: (2025)
Customizing Speech Recognition Model with Large Language Model Feedback
por: Ling, Shaoshi, et al.
Publicado: (2025)
por: Ling, Shaoshi, et al.
Publicado: (2025)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
por: Wang, Siyin, et al.
Publicado: (2024)
por: Wang, Siyin, et al.
Publicado: (2024)
Large Language Models for Dysfluency Detection in Stuttered Speech
por: Wagner, Dominik, et al.
Publicado: (2024)
por: Wagner, Dominik, et al.
Publicado: (2024)
Attempt Towards Stress Transfer in Speech-to-Speech Machine Translation
por: Akarsh, Sai, et al.
Publicado: (2024)
por: Akarsh, Sai, et al.
Publicado: (2024)
Ejemplares similares
-
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
por: Yang, Hao, et al.
Publicado: (2024) -
Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models
por: Yang, Hao, et al.
Publicado: (2025) -
Resurfacing Paralinguistic Awareness in Large Audio Language Models
por: Yang, Hao, et al.
Publicado: (2026) -
Continual Speech Learning with Fused Speech Features
por: Wang, Guitao, et al.
Publicado: (2025) -
Double Mixture: Towards Continual Event Detection from Speech
por: Kang, Jingqi, et al.
Publicado: (2024)