Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Wenda, Jin, Hongyu, Wang, Siyi, Wei, Zhiqiang, Dang, Ting |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
par: Jia, Hong, et autres
Publié: (2026)
par: Jia, Hong, et autres
Publié: (2026)
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
par: Dang, Ting, et autres
Publié: (2025)
par: Dang, Ting, et autres
Publié: (2025)
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
par: Yu, Xiaofeng, et autres
Publié: (2026)
par: Yu, Xiaofeng, et autres
Publié: (2026)
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
par: Halim, Jule Valendo, et autres
Publié: (2025)
par: Halim, Jule Valendo, et autres
Publié: (2025)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Color-based Emotion Representation for Speech Emotion Recognition
par: Nagase, Ryotaro, et autres
Publié: (2026)
par: Nagase, Ryotaro, et autres
Publié: (2026)
EmoSpeech: A Corpus of Emotionally Rich and Contextually Detailed Speech Annotations
par: Bian, Weizhen, et autres
Publié: (2024)
par: Bian, Weizhen, et autres
Publié: (2024)
Persian Speech Emotion Recognition by Fine-Tuning Transformers
par: Shayaninasab, Minoo, et autres
Publié: (2024)
par: Shayaninasab, Minoo, et autres
Publié: (2024)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
par: Hyeon, Jonghwan, et autres
Publié: (2024)
par: Hyeon, Jonghwan, et autres
Publié: (2024)
Audio Codec Augmentation for Robust Collaborative Watermarking of Speech Synthesis
par: Juvela, Lauri, et autres
Publié: (2024)
par: Juvela, Lauri, et autres
Publié: (2024)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
par: Xiao, Yang, et autres
Publié: (2026)
par: Xiao, Yang, et autres
Publié: (2026)
Efficient Finetuning for Dimensional Speech Emotion Recognition in the Age of Transformers
par: Sampath, Aneesha, et autres
Publié: (2025)
par: Sampath, Aneesha, et autres
Publié: (2025)
Improvement and Implementation of a Speech Emotion Recognition Model Based on Dual-Layer LSTM
par: Yang, Xiaoran, et autres
Publié: (2024)
par: Yang, Xiaoran, et autres
Publié: (2024)
Speech Emotion Recognition Using MFCC Features and LSTM-Based Deep Learning Model
par: Oluwademilade, Adelekun, et autres
Publié: (2026)
par: Oluwademilade, Adelekun, et autres
Publié: (2026)
Breaking Resource Barriers in Speech Emotion Recognition via Data Distillation
par: Chang, Yi, et autres
Publié: (2024)
par: Chang, Yi, et autres
Publié: (2024)
Learning Physiology-Informed Vocal Spectrotemporal Representations for Speech Emotion Recognition
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
Toward Efficient Speech Emotion Recognition via Spectral Learning and Attention
par: Lee, HyeYoung, et autres
Publié: (2025)
par: Lee, HyeYoung, et autres
Publié: (2025)
ABHINAYA -- A System for Speech Emotion Recognition In Naturalistic Conditions Challenge
par: Dutta, Soumya, et autres
Publié: (2025)
par: Dutta, Soumya, et autres
Publié: (2025)
Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition
par: Li, Dongyuan, et autres
Publié: (2024)
par: Li, Dongyuan, et autres
Publié: (2024)
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
par: Wang, Yuxiang, et autres
Publié: (2026)
par: Wang, Yuxiang, et autres
Publié: (2026)
Are you sure? Analysing Uncertainty Quantification Approaches for Real-world Speech Emotion Recognition
par: Schrüfer, Oliver, et autres
Publié: (2024)
par: Schrüfer, Oliver, et autres
Publié: (2024)
Explaining Deep Learning Embeddings for Speech Emotion Recognition by Predicting Interpretable Acoustic Features
par: Dixit, Satvik, et autres
Publié: (2024)
par: Dixit, Satvik, et autres
Publié: (2024)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
par: Gao, Ming, et autres
Publié: (2025)
par: Gao, Ming, et autres
Publié: (2025)
Exploring Self-Supervised Multi-view Contrastive Learning for Speech Emotion Recognition with Limited Annotations
par: Khaertdinov, Bulat, et autres
Publié: (2024)
par: Khaertdinov, Bulat, et autres
Publié: (2024)
MATER: Multi-level Acoustic and Textual Emotion Representation for Interpretable Speech Emotion Recognition
par: Jon, Hyo Jin, et autres
Publié: (2025)
par: Jon, Hyo Jin, et autres
Publié: (2025)
EmoSphere-SER: Enhancing Speech Emotion Recognition Through Spherical Representation with Auxiliary Classification
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
par: Cho, Deok-Hyeon, et autres
Publié: (2025)
Cross-Corpus Validation of Speech Emotion Recognition in Urdu using Domain-Knowledge Acoustic Features
par: Talpur, Unzela, et autres
Publié: (2025)
par: Talpur, Unzela, et autres
Publié: (2025)
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
par: Jiao, Xinxin, et autres
Publié: (2024)
par: Jiao, Xinxin, et autres
Publié: (2024)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
par: Chen, Yifu, et autres
Publié: (2025)
par: Chen, Yifu, et autres
Publié: (2025)
Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models
par: Kabir, Muhammad Ashad, et autres
Publié: (2026)
par: Kabir, Muhammad Ashad, et autres
Publié: (2026)
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
par: Deng, Wei, et autres
Publié: (2025)
par: Deng, Wei, et autres
Publié: (2025)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2023)
par: Pan, Yu, et autres
Publié: (2023)
Tiny-Align: Bridging Automatic Speech Recognition and Large Language Model on the Edge
par: Qin, Ruiyang, et autres
Publié: (2024)
par: Qin, Ruiyang, et autres
Publié: (2024)
Inference-time Scaling for Diffusion-based Audio Super-resolution
par: Jin, Yizhu, et autres
Publié: (2025)
par: Jin, Yizhu, et autres
Publié: (2025)
Searching for Effective Preprocessing Method and CNN-based Architecture with Efficient Channel Attention on Speech Emotion Recognition
par: Kim, Byunggun, et autres
Publié: (2024)
par: Kim, Byunggun, et autres
Publié: (2024)
Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
par: Jung, Kyudan, et autres
Publié: (2026)
par: Jung, Kyudan, et autres
Publié: (2026)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
Documents similaires
-
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
par: Jia, Hong, et autres
Publié: (2026) -
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
par: Dang, Ting, et autres
Publié: (2025) -
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
par: Yu, Xiaofeng, et autres
Publié: (2026) -
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
par: Halim, Jule Valendo, et autres
Publié: (2025) -
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
par: Liu, Rui, et autres
Publié: (2025)