An Investigation Into Explainable Audio Hate Speech Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | An, Jinmyeong, Lee, Wonjun, Jeon, Yejin, Ok, Jungseul, Kim, Yunsu, Lee, Gary Geunbae |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DyPCL: Dynamic Phoneme-level Contrastive Learning for Dysarthric Speech Recognition
par: Lee, Wonjun, et autres
Publié: (2025)
par: Lee, Wonjun, et autres
Publié: (2025)
Leveraging the Interplay Between Syntactic and Acoustic Cues for Optimizing Korean TTS Pause Formation
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning
par: Lee, Wonjun, et autres
Publié: (2024)
par: Lee, Wonjun, et autres
Publié: (2024)
Audio-Based Linguistic Feature Extraction for Enhancing Multi-lingual and Low-Resource Text-to-Speech
par: Kim, Youngjae, et autres
Publié: (2024)
par: Kim, Youngjae, et autres
Publié: (2024)
Multi-Level Attention Aggregation for Language-Agnostic Speaker Replication
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
AudioBERT: Audio Knowledge Augmented Language Model
par: Ok, Hyunjong, et autres
Publié: (2024)
par: Ok, Hyunjong, et autres
Publié: (2024)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
par: Ghosh, Sreyan, et autres
Publié: (2026)
par: Ghosh, Sreyan, et autres
Publié: (2026)
Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion
par: Jang, Jaehyuk, et autres
Publié: (2026)
par: Jang, Jaehyuk, et autres
Publié: (2026)
Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
par: Ok, Hyunjong, et autres
Publié: (2025)
par: Ok, Hyunjong, et autres
Publié: (2025)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Identifying False Content and Hate Speech in Sinhala YouTube Videos by Analyzing the Audio
par: Wickramaarachchi, W. A. K. M., et autres
Publié: (2024)
par: Wickramaarachchi, W. A. K. M., et autres
Publié: (2024)
Length-Aware Rotary Position Embedding for Text-Speech Alignment
par: Kim, Hyeongju, et autres
Publié: (2025)
par: Kim, Hyeongju, et autres
Publié: (2025)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
par: Goel, Arushi, et autres
Publié: (2025)
par: Goel, Arushi, et autres
Publié: (2025)
FLowHigh: Towards Efficient and High-Quality Audio Super-Resolution with Single-Step Flow Matching
par: Yun, Jun-Hak, et autres
Publié: (2025)
par: Yun, Jun-Hak, et autres
Publié: (2025)
Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder
par: Dai, Yusheng, et autres
Publié: (2023)
par: Dai, Yusheng, et autres
Publié: (2023)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)
S2Cap: A Benchmark and a Baseline for Singing Style Captioning
par: Ok, Hyunjong, et autres
Publié: (2024)
par: Ok, Hyunjong, et autres
Publié: (2024)
KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
par: Kim, Jinyoung, et autres
Publié: (2026)
par: Kim, Jinyoung, et autres
Publié: (2026)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
par: Feng, Bo-Han, et autres
Publié: (2025)
par: Feng, Bo-Han, et autres
Publié: (2025)
Activity-Guided Industrial Anomalous Sound Detection against Interferences
par: Lee, Yunjoo, et autres
Publié: (2024)
par: Lee, Yunjoo, et autres
Publié: (2024)
Lightweight Audio Segmentation for Long-form Speech Translation
par: Lee, Jaesong, et autres
Publié: (2024)
par: Lee, Jaesong, et autres
Publié: (2024)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
par: Diwan, Anuj, et autres
Publié: (2026)
par: Diwan, Anuj, et autres
Publié: (2026)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
par: He, Xinlu, et autres
Publié: (2025)
par: He, Xinlu, et autres
Publié: (2025)
Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM
par: Shahin, Mostafa, et autres
Publié: (2025)
par: Shahin, Mostafa, et autres
Publié: (2025)
Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation
par: Yan, Canxiang, et autres
Publié: (2025)
par: Yan, Canxiang, et autres
Publié: (2025)
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
par: Chen, Szu-Chi, et autres
Publié: (2026)
par: Chen, Szu-Chi, et autres
Publié: (2026)
StreamAtt: Direct Streaming Speech-to-Text Translation with Attention-based Audio History Selection
par: Papi, Sara, et autres
Publié: (2024)
par: Papi, Sara, et autres
Publié: (2024)
Self-supervised Speech Models for Word-Level Stuttered Speech Detection
par: Shih, Yi-Jen, et autres
Publié: (2024)
par: Shih, Yi-Jen, et autres
Publié: (2024)
Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Models
par: Yoo, Suho, et autres
Publié: (2025)
par: Yoo, Suho, et autres
Publié: (2025)
RECA-PD: A Robust Explainable Cross-Attention Method for Speech-based Parkinson's Disease Classification
par: Zhong, Terry Yi, et autres
Publié: (2025)
par: Zhong, Terry Yi, et autres
Publié: (2025)
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka
par: Chen, Li-Wei, et autres
Publié: (2024)
par: Chen, Li-Wei, et autres
Publié: (2024)
Discrete Audio Tokens: More Than a Survey!
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
par: Ranjan, Rishabh, et autres
Publié: (2025)
par: Ranjan, Rishabh, et autres
Publié: (2025)
Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions
par: Park, Hansol, et autres
Publié: (2025)
par: Park, Hansol, et autres
Publié: (2025)
Beyond Hard Sharing: Efficient Multi-Task Speech-to-Text Modeling with Supervised Mixture of Experts
par: Jin, Hojun, et autres
Publié: (2025)
par: Jin, Hojun, et autres
Publié: (2025)
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
par: Kim, Jaeyeon, et autres
Publié: (2024)
par: Kim, Jaeyeon, et autres
Publié: (2024)
Documents similaires
-
DyPCL: Dynamic Phoneme-level Contrastive Learning for Dysarthric Speech Recognition
par: Lee, Wonjun, et autres
Publié: (2025) -
Leveraging the Interplay Between Syntactic and Acoustic Cues for Optimizing Korean TTS Pause Formation
par: Jeon, Yejin, et autres
Publié: (2024) -
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
par: Jeon, Yejin, et autres
Publié: (2024) -
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
par: Do, Heejin, et autres
Publié: (2024) -
Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning
par: Lee, Wonjun, et autres
Publié: (2024)