Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Dietrich, Juergen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Lingual Speech Emotion Recognition: Humans vs. Self-Supervised Models
par: Han, Zhichen, et autres
Publié: (2024)
par: Han, Zhichen, et autres
Publié: (2024)
Improving Multimodal Emotion Recognition by Leveraging Acoustic Adaptation and Visual Alignment
par: Zhao, Zhixian, et autres
Publié: (2024)
par: Zhao, Zhixian, et autres
Publié: (2024)
STAA-Net: A Sparse and Transferable Adversarial Attack for Speech Emotion Recognition
par: Chang, Yi, et autres
Publié: (2024)
par: Chang, Yi, et autres
Publié: (2024)
Emotion-Disentangled Embedding Alignment for Noise-Robust and Cross-Corpus Speech Emotion Recognition
par: Tiwari, Upasana, et autres
Publié: (2025)
par: Tiwari, Upasana, et autres
Publié: (2025)
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2025)
par: Chen, Youjun, et autres
Publié: (2025)
EmoKnob: Enhance Voice Cloning with Fine-Grained Emotion Control
par: Chen, Haozhe, et autres
Publié: (2024)
par: Chen, Haozhe, et autres
Publié: (2024)
A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition
par: Benster, Tyler, et autres
Publié: (2024)
par: Benster, Tyler, et autres
Publié: (2024)
A Theory-Based Explainable Deep Learning Architecture for Music Emotion
par: Fong, Hortense, et autres
Publié: (2024)
par: Fong, Hortense, et autres
Publié: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023)
par: Ma, Ziyang, et autres
Publié: (2023)
Are Expressions for Music Emotions the Same Across Cultures?
par: Celen, Elif, et autres
Publié: (2025)
par: Celen, Elif, et autres
Publié: (2025)
MinMo: A Multimodal Large Language Model for Seamless Voice Interaction
par: Chen, Qian, et autres
Publié: (2025)
par: Chen, Qian, et autres
Publié: (2025)
MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes
par: Chen, Maximillian, et autres
Publié: (2026)
par: Chen, Maximillian, et autres
Publié: (2026)
Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction
par: Huang, Ailin, et autres
Publié: (2025)
par: Huang, Ailin, et autres
Publié: (2025)
Personalized Speech Emotion Recognition in Human-Robot Interaction using Vision Transformers
par: Mishra, Ruchik, et autres
Publié: (2024)
par: Mishra, Ruchik, et autres
Publié: (2024)
Human Feedback Driven Dynamic Speech Emotion Recognition
par: Fedorov, Ilya, et autres
Publié: (2025)
par: Fedorov, Ilya, et autres
Publié: (2025)
Exploring Acoustic Similarity in Emotional Speech and Music via Self-Supervised Representations
par: Sun, Yujia, et autres
Publié: (2024)
par: Sun, Yujia, et autres
Publié: (2024)
AAD-LLM: Neural Attention-Driven Auditory Scene Understanding
par: Jiang, Xilin, et autres
Publié: (2025)
par: Jiang, Xilin, et autres
Publié: (2025)
Early Detection of Furniture-Infesting Wood-Boring Beetles Using CNN-LSTM Networks and MFCC-Based Acoustic Features
par: Manukalpa, J. M. Chan Sri, et autres
Publié: (2025)
par: Manukalpa, J. M. Chan Sri, et autres
Publié: (2025)
EmoHeal: An End-to-End System for Personalized Therapeutic Music Retrieval from Fine-grained Emotions
par: Wan, Xinchen, et autres
Publié: (2025)
par: Wan, Xinchen, et autres
Publié: (2025)
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
par: Siriwardhana, Shamane, et autres
Publié: (2020)
par: Siriwardhana, Shamane, et autres
Publié: (2020)
Amplifying Emotional Signals: Data-Efficient Deep Learning for Robust Speech Emotion Recognition
par: Vu, Tai
Publié: (2025)
par: Vu, Tai
Publié: (2025)
Sound-Based Recognition of Touch Gestures and Emotions for Enhanced Human-Robot Interaction
par: Hou, Yuanbo, et autres
Publié: (2024)
par: Hou, Yuanbo, et autres
Publié: (2024)
Layer-Wise Analysis of Self-Supervised Acoustic Word Embeddings: A Study on Speech Emotion Recognition
par: Saliba, Alexandra, et autres
Publié: (2024)
par: Saliba, Alexandra, et autres
Publié: (2024)
SonicSieve: Bringing Directional Speech Extraction to Smartphones Using Acoustic Microstructures
par: Yuan, Kuang, et autres
Publié: (2025)
par: Yuan, Kuang, et autres
Publié: (2025)
Language Model Can Listen While Speaking
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
CabinSep: IR-Augmented Mask-Based MVDR for Real-Time In-Car Speech Separation with Distributed Heterogeneous Arrays
par: Han, Runduo, et autres
Publié: (2025)
par: Han, Runduo, et autres
Publié: (2025)
VoiceFlow: Efficient Text-to-Speech with Rectified Flow Matching
par: Guo, Yiwei, et autres
Publié: (2023)
par: Guo, Yiwei, et autres
Publié: (2023)
Using Confidence Scores to Improve Eyes-free Detection of Speech Recognition Errors
par: Nowrin, Sadia, et autres
Publié: (2024)
par: Nowrin, Sadia, et autres
Publié: (2024)
AIx Speed: Playback Speed Optimization Using Listening Comprehension of Speech Recognition Models
par: Kawamura, Kazuki, et autres
Publié: (2024)
par: Kawamura, Kazuki, et autres
Publié: (2024)
Freetalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness
par: Yang, Sicheng, et autres
Publié: (2024)
par: Yang, Sicheng, et autres
Publié: (2024)
Optimizing Multilingual Text-To-Speech with Accents & Emotions
par: Pawar, Pranav, et autres
Publié: (2025)
par: Pawar, Pranav, et autres
Publié: (2025)
Step-Audio-EditX Technical Report
par: Yan, Chao, et autres
Publié: (2025)
par: Yan, Chao, et autres
Publié: (2025)
Speech vs. Transcript: Does It Matter for Human Annotators in Speech Summarization?
par: Sharma, Roshan, et autres
Publié: (2024)
par: Sharma, Roshan, et autres
Publié: (2024)
SynthScribe: Deep Multimodal Tools for Synthesizer Sound Retrieval and Exploration
par: Brade, Stephen, et autres
Publié: (2023)
par: Brade, Stephen, et autres
Publié: (2023)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
par: Zhang, Hezhao, et autres
Publié: (2026)
par: Zhang, Hezhao, et autres
Publié: (2026)
Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese
par: Wang, Xihuai, et autres
Publié: (2025)
par: Wang, Xihuai, et autres
Publié: (2025)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
par: Fu, Yu-Kuan, et autres
Publié: (2024)
par: Fu, Yu-Kuan, et autres
Publié: (2024)
Bimodal Connection Attention Fusion for Speech Emotion Recognition
par: Luo, Jiachen, et autres
Publié: (2025)
par: Luo, Jiachen, et autres
Publié: (2025)
Dual Information Speech Language Models for Emotional Conversations
par: Wang, Chun, et autres
Publié: (2025)
par: Wang, Chun, et autres
Publié: (2025)
Directional Source Separation for Robust Speech Recognition on Smart Glasses
par: Feng, Tiantian, et autres
Publié: (2023)
par: Feng, Tiantian, et autres
Publié: (2023)
Documents similaires
-
Cross-Lingual Speech Emotion Recognition: Humans vs. Self-Supervised Models
par: Han, Zhichen, et autres
Publié: (2024) -
Improving Multimodal Emotion Recognition by Leveraging Acoustic Adaptation and Visual Alignment
par: Zhao, Zhixian, et autres
Publié: (2024) -
STAA-Net: A Sparse and Transferable Adversarial Attack for Speech Emotion Recognition
par: Chang, Yi, et autres
Publié: (2024) -
Emotion-Disentangled Embedding Alignment for Noise-Robust and Cross-Corpus Speech Emotion Recognition
par: Tiwari, Upasana, et autres
Publié: (2025) -
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2025)