Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jia, Hong, Li, Weibin, Wu, Jingyao, Yu, Xiaofeng, Gao, Yan, Cheng, Jintao, Tang, Xiaoyu, Xia, Feng, Dang, Ting |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
par: Yu, Xiaofeng, et autres
Publié: (2026)
par: Yu, Xiaofeng, et autres
Publié: (2026)
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
par: Dang, Ting, et autres
Publié: (2025)
par: Dang, Ting, et autres
Publié: (2025)
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
par: Halim, Jule Valendo, et autres
Publié: (2025)
par: Halim, Jule Valendo, et autres
Publié: (2025)
Test-Time Adaptation for Speech Emotion Recognition
par: Dong, Jiaheng, et autres
Publié: (2026)
par: Dong, Jiaheng, et autres
Publié: (2026)
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
par: Sun, Haoqin, et autres
Publié: (2024)
par: Sun, Haoqin, et autres
Publié: (2024)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
par: Tang, Haobin, et autres
Publié: (2024)
par: Tang, Haobin, et autres
Publié: (2024)
E-BATS: Efficient Backpropagation-Free Test-Time Adaptation for Speech Foundation Models
par: Dong, Jiaheng, et autres
Publié: (2025)
par: Dong, Jiaheng, et autres
Publié: (2025)
MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model
par: Gong, Jingyao
Publié: (2026)
par: Gong, Jingyao
Publié: (2026)
SoCov: Semi-Orthogonal Parametric Pooling of Covariance Matrix for Speaker Recognition
par: Li, Rongjin, et autres
Publié: (2025)
par: Li, Rongjin, et autres
Publié: (2025)
AmbER$^2$: Dual Ambiguity-Aware Emotion Recognition Applied to Speech and Text
par: Wu, Jingyao, et autres
Publié: (2026)
par: Wu, Jingyao, et autres
Publié: (2026)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
par: Xiao, Yang, et autres
Publié: (2026)
par: Xiao, Yang, et autres
Publié: (2026)
Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
par: Zhang, Wenda, et autres
Publié: (2026)
par: Zhang, Wenda, et autres
Publié: (2026)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
par: Zhao, Yan, et autres
Publié: (2022)
par: Zhao, Yan, et autres
Publié: (2022)
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
par: Chen, Yuanjian, et autres
Publié: (2026)
par: Chen, Yuanjian, et autres
Publié: (2026)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
FGAS: Fixed Decoder Network-Based Audio Steganography with Adversarial Perturbation Generation
par: Yan, Jialin, et autres
Publié: (2025)
par: Yan, Jialin, et autres
Publié: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
par: Shen, Siyuan, et autres
Publié: (2024)
par: Shen, Siyuan, et autres
Publié: (2024)
IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling
par: Huang, Kuan-Po, et autres
Publié: (2025)
par: Huang, Kuan-Po, et autres
Publié: (2025)
The ICME 2025 Audio Encoder Capability Challenge
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
Audio-Guided Fusion Techniques for Multimodal Emotion Analysis
par: Shi, Pujin, et autres
Publié: (2024)
par: Shi, Pujin, et autres
Publié: (2024)
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
par: Li, Pengcheng, et autres
Publié: (2025)
par: Li, Pengcheng, et autres
Publié: (2025)
Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory
par: Xiao, Yang, et autres
Publié: (2026)
par: Xiao, Yang, et autres
Publié: (2026)
Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition
par: Zhao, Yan, et autres
Publié: (2024)
par: Zhao, Yan, et autres
Publié: (2024)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
par: Xu, Qisheng, et autres
Publié: (2024)
par: Xu, Qisheng, et autres
Publié: (2024)
APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding
par: Ai, Yang, et autres
Publié: (2024)
par: Ai, Yang, et autres
Publié: (2024)
STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
Speech Emotion Recognition Via CNN-Transformer and Multidimensional Attention Mechanism
par: Tang, Xiaoyu, et autres
Publié: (2024)
par: Tang, Xiaoyu, et autres
Publié: (2024)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
par: Hussain, Tassadaq, et autres
Publié: (2024)
par: Hussain, Tassadaq, et autres
Publié: (2024)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
par: Jin, Zhan, et autres
Publié: (2025)
par: Jin, Zhan, et autres
Publié: (2025)
Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?
par: Akhtar, Mohd Mujtaba, et autres
Publié: (2025)
par: Akhtar, Mohd Mujtaba, et autres
Publié: (2025)
Streaming Audio Transformers for Online Audio Tagging
par: Dinkel, Heinrich, et autres
Publié: (2023)
par: Dinkel, Heinrich, et autres
Publié: (2023)
AeroGPT: Leveraging Large-Scale Audio Model for Aero-Engine Bearing Fault Diagnosis
par: Liu, Jiale, et autres
Publié: (2025)
par: Liu, Jiale, et autres
Publié: (2025)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
par: Yang, Xiaoyu, et autres
Publié: (2024)
par: Yang, Xiaoyu, et autres
Publié: (2024)
Magnetoencephalography (MEG) Based Non-Invasive Chinese Speech Decoding
par: Jia, Zhihong, et autres
Publié: (2025)
par: Jia, Zhihong, et autres
Publié: (2025)
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
par: Hu, Cheng-Hung, et autres
Publié: (2025)
par: Hu, Cheng-Hung, et autres
Publié: (2025)
MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding
par: Xi, Yu, et autres
Publié: (2025)
par: Xi, Yu, et autres
Publié: (2025)
Testing Correctness, Fairness, and Robustness of Speech Emotion Recognition Models
par: Derington, Anna, et autres
Publié: (2023)
par: Derington, Anna, et autres
Publié: (2023)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
par: Jia, Yuhang, et autres
Publié: (2024)
par: Jia, Yuhang, et autres
Publié: (2024)
Documents similaires
-
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
par: Yu, Xiaofeng, et autres
Publié: (2026) -
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
par: Dang, Ting, et autres
Publié: (2025) -
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
par: Halim, Jule Valendo, et autres
Publié: (2025) -
Test-Time Adaptation for Speech Emotion Recognition
par: Dong, Jiaheng, et autres
Publié: (2026) -
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
par: Sun, Haoqin, et autres
Publié: (2024)