EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Shi, Jiacheng, Du, Hongfei, Hong, Y. Alicia, Gao, Ye |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization
por: Shi, Jiacheng, et al.
Publicado: (2025)
por: Shi, Jiacheng, et al.
Publicado: (2025)
Plug-and-Play Emotion Graphs for Compositional Prompting in Zero-Shot Speech Emotion Recognition
por: Shi, Jiacheng, et al.
Publicado: (2025)
por: Shi, Jiacheng, et al.
Publicado: (2025)
AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling
por: Shi, Jiacheng, et al.
Publicado: (2026)
por: Shi, Jiacheng, et al.
Publicado: (2026)
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
por: Jia, Hong, et al.
Publicado: (2026)
por: Jia, Hong, et al.
Publicado: (2026)
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
por: Dang, Ting, et al.
Publicado: (2025)
por: Dang, Ting, et al.
Publicado: (2025)
MERaLiON-SER: Robust Speech Emotion Recognition Model for English and SEA Languages
por: Sailor, Hardik B., et al.
Publicado: (2025)
por: Sailor, Hardik B., et al.
Publicado: (2025)
LI-TTA: Language Informed Test-Time Adaptation for Automatic Speech Recognition
por: Yoon, Eunseop, et al.
Publicado: (2024)
por: Yoon, Eunseop, et al.
Publicado: (2024)
Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
por: Zhang, Wenda, et al.
Publicado: (2026)
por: Zhang, Wenda, et al.
Publicado: (2026)
EMO-SUPERB: An In-depth Look at Speech Emotion Recognition
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
por: Li, Pengcheng, et al.
Publicado: (2025)
por: Li, Pengcheng, et al.
Publicado: (2025)
Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition
por: Li, Dongyuan, et al.
Publicado: (2024)
por: Li, Dongyuan, et al.
Publicado: (2024)
Improving Audio Event Recognition with Consistency Regularization
por: Sadhu, Shanmuka, et al.
Publicado: (2025)
por: Sadhu, Shanmuka, et al.
Publicado: (2025)
Speech Emotion Recognition via Entropy-Aware Score Selection
por: Chua, ChenYi, et al.
Publicado: (2025)
por: Chua, ChenYi, et al.
Publicado: (2025)
Audio-Guided Fusion Techniques for Multimodal Emotion Analysis
por: Shi, Pujin, et al.
Publicado: (2024)
por: Shi, Pujin, et al.
Publicado: (2024)
Test-Time Adaptation for Speech Emotion Recognition
por: Dong, Jiaheng, et al.
Publicado: (2026)
por: Dong, Jiaheng, et al.
Publicado: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
por: Shi, Yanfeng, et al.
Publicado: (2026)
por: Shi, Yanfeng, et al.
Publicado: (2026)
Color-based Emotion Representation for Speech Emotion Recognition
por: Nagase, Ryotaro, et al.
Publicado: (2026)
por: Nagase, Ryotaro, et al.
Publicado: (2026)
Deep Learning for Speech Emotion Recognition: A CNN Approach Utilizing Mel Spectrograms
por: Penumajji, Niketa
Publicado: (2025)
por: Penumajji, Niketa
Publicado: (2025)
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
por: Yu, Xiaofeng, et al.
Publicado: (2026)
por: Yu, Xiaofeng, et al.
Publicado: (2026)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
por: Gao, Ming, et al.
Publicado: (2025)
por: Gao, Ming, et al.
Publicado: (2025)
Exploring How Audio Effects Alter Emotion with Foundation Models
por: Katsis, Stelios, et al.
Publicado: (2025)
por: Katsis, Stelios, et al.
Publicado: (2025)
Enabling Automatic Disordered Speech Recognition: An Impaired Speech Dataset in the Akan Language
por: Wiafe, Isaac, et al.
Publicado: (2026)
por: Wiafe, Isaac, et al.
Publicado: (2026)
SLM-SS: Speech Language Model for Generative Speech Separation
por: Li, Tianhua, et al.
Publicado: (2026)
por: Li, Tianhua, et al.
Publicado: (2026)
Hybrid CNN-Transformer Architecture for Arabic Speech Emotion Recognition
por: Gheffari, Youcef Soufiane, et al.
Publicado: (2026)
por: Gheffari, Youcef Soufiane, et al.
Publicado: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
por: Glazer, Neta, et al.
Publicado: (2026)
por: Glazer, Neta, et al.
Publicado: (2026)
SLM-TTA: A Framework for Test-Time Adaptation of Generative Spoken Language Models
por: Wu, Yuan-Kuei, et al.
Publicado: (2025)
por: Wu, Yuan-Kuei, et al.
Publicado: (2025)
PTS-SNN: A Prompt-Tuned Temporal Shift Spiking Neural Networks for Efficient Speech Emotion Recognition
por: Su, Xun, et al.
Publicado: (2026)
por: Su, Xun, et al.
Publicado: (2026)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
por: Guo, Xiaoxuan, et al.
Publicado: (2026)
por: Guo, Xiaoxuan, et al.
Publicado: (2026)
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
por: Li, Xiang, et al.
Publicado: (2026)
por: Li, Xiang, et al.
Publicado: (2026)
Persian Speech Emotion Recognition by Fine-Tuning Transformers
por: Shayaninasab, Minoo, et al.
Publicado: (2024)
por: Shayaninasab, Minoo, et al.
Publicado: (2024)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
por: Zhang, Dan, et al.
Publicado: (2026)
por: Zhang, Dan, et al.
Publicado: (2026)
$\texttt{AVROBUSTBENCH}$: Benchmarking the Robustness of Audio-Visual Recognition Models at Test-Time
por: Maharana, Sarthak Kumar, et al.
Publicado: (2025)
por: Maharana, Sarthak Kumar, et al.
Publicado: (2025)
Do Audio-Visual Large Language Models Really See and Hear?
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2026)
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2026)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
por: Zhang, Ruixing, et al.
Publicado: (2026)
por: Zhang, Ruixing, et al.
Publicado: (2026)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
Efficient Finetuning for Dimensional Speech Emotion Recognition in the Age of Transformers
por: Sampath, Aneesha, et al.
Publicado: (2025)
por: Sampath, Aneesha, et al.
Publicado: (2025)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
por: Shi, Hao, et al.
Publicado: (2024)
por: Shi, Hao, et al.
Publicado: (2024)
Improvement and Implementation of a Speech Emotion Recognition Model Based on Dual-Layer LSTM
por: Yang, Xiaoran, et al.
Publicado: (2024)
por: Yang, Xiaoran, et al.
Publicado: (2024)
Speech Emotion Recognition Using MFCC Features and LSTM-Based Deep Learning Model
por: Oluwademilade, Adelekun, et al.
Publicado: (2026)
por: Oluwademilade, Adelekun, et al.
Publicado: (2026)
Ejemplares similares
-
Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization
por: Shi, Jiacheng, et al.
Publicado: (2025) -
Plug-and-Play Emotion Graphs for Compositional Prompting in Zero-Shot Speech Emotion Recognition
por: Shi, Jiacheng, et al.
Publicado: (2025) -
AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling
por: Shi, Jiacheng, et al.
Publicado: (2026) -
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
por: Jia, Hong, et al.
Publicado: (2026) -
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
por: Dang, Ting, et al.
Publicado: (2025)