Edge-Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xue, Xiangyuan, Lu, Jiajun, Gao, Yan, Huang, Gongping, Dang, Ting, Jia, Hong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
di: Halim, Jule Valendo, et al.
Pubblicazione: (2025)
di: Halim, Jule Valendo, et al.
Pubblicazione: (2025)
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
di: Jia, Hong, et al.
Pubblicazione: (2026)
di: Jia, Hong, et al.
Pubblicazione: (2026)
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
di: Dang, Ting, et al.
Pubblicazione: (2025)
di: Dang, Ting, et al.
Pubblicazione: (2025)
CoCoEmo: Composable and Controllable Human-Like Emotional TTS via Activation Steering
di: Wang, Siyi, et al.
Pubblicazione: (2026)
di: Wang, Siyi, et al.
Pubblicazione: (2026)
Test-Time Adaptation for Speech Emotion Recognition
di: Dong, Jiaheng, et al.
Pubblicazione: (2026)
di: Dong, Jiaheng, et al.
Pubblicazione: (2026)
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
di: Yu, Xiaofeng, et al.
Pubblicazione: (2026)
di: Yu, Xiaofeng, et al.
Pubblicazione: (2026)
Emotion-Aware Quantization for Discrete Speech Representations: An Analysis of Emotion Preservation
di: Zhou, Haoguang, et al.
Pubblicazione: (2026)
di: Zhou, Haoguang, et al.
Pubblicazione: (2026)
Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
di: Zhang, Wenda, et al.
Pubblicazione: (2026)
di: Zhang, Wenda, et al.
Pubblicazione: (2026)
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
di: Shi, Jiacheng, et al.
Pubblicazione: (2025)
di: Shi, Jiacheng, et al.
Pubblicazione: (2025)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
di: Lin, Zijian, et al.
Pubblicazione: (2025)
di: Lin, Zijian, et al.
Pubblicazione: (2025)
Low-latency Speech Enhancement via Speech Token Generation
di: Xue, Huaying, et al.
Pubblicazione: (2023)
di: Xue, Huaying, et al.
Pubblicazione: (2023)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
di: Pei, Hanchen, et al.
Pubblicazione: (2026)
di: Pei, Hanchen, et al.
Pubblicazione: (2026)
Emotion and Acoustics Should Agree: Cross-Level Inconsistency Analysis for Audio Deepfake Detection
di: Zhang, Jinhua, et al.
Pubblicazione: (2026)
di: Zhang, Jinhua, et al.
Pubblicazione: (2026)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
TAC: Timestamped Audio Captioning
di: Kumar, Sonal, et al.
Pubblicazione: (2026)
di: Kumar, Sonal, et al.
Pubblicazione: (2026)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
EmoSURA: Towards Accurate Evaluation of Detailed and Long-Context Emotional Speech Captions
di: Jing, Xin, et al.
Pubblicazione: (2026)
di: Jing, Xin, et al.
Pubblicazione: (2026)
Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models
di: Yin, Han, et al.
Pubblicazione: (2026)
di: Yin, Han, et al.
Pubblicazione: (2026)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
di: Wei, Linye, et al.
Pubblicazione: (2025)
di: Wei, Linye, et al.
Pubblicazione: (2025)
TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
di: He, Yuxuan, et al.
Pubblicazione: (2025)
di: He, Yuxuan, et al.
Pubblicazione: (2025)
Investigation on the Robustness of Acoustic Foundation Models on Post Exercise Speech
di: Xue, Xiangyuan, et al.
Pubblicazione: (2026)
di: Xue, Xiangyuan, et al.
Pubblicazione: (2026)
Semantic Audio-Visual Navigation in Continuous Environments
di: Zeng, Yichen, et al.
Pubblicazione: (2026)
di: Zeng, Yichen, et al.
Pubblicazione: (2026)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
di: Xiao, Yang, et al.
Pubblicazione: (2026)
di: Xiao, Yang, et al.
Pubblicazione: (2026)
AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling
di: Shi, Jiacheng, et al.
Pubblicazione: (2026)
di: Shi, Jiacheng, et al.
Pubblicazione: (2026)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
di: Yang, Xiaoran, et al.
Pubblicazione: (2025)
di: Yang, Xiaoran, et al.
Pubblicazione: (2025)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
EmoTransCap: Dataset and Pipeline for Emotion Transition-Aware Speech Captioning in Discourses
di: Xu, Shuhao, et al.
Pubblicazione: (2026)
di: Xu, Shuhao, et al.
Pubblicazione: (2026)
Improving DF-Conformer Using Hydra For High-Fidelity Generative Speech Enhancement on Discrete Codec Token
di: Seki, Shogo, et al.
Pubblicazione: (2025)
di: Seki, Shogo, et al.
Pubblicazione: (2025)
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
di: Chen, Youjun, et al.
Pubblicazione: (2026)
di: Chen, Youjun, et al.
Pubblicazione: (2026)
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
EmotionCaps: Enhancing Audio Captioning Through Emotion-Augmented Data Generation
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
di: Qi, Tianhua, et al.
Pubblicazione: (2026)
di: Qi, Tianhua, et al.
Pubblicazione: (2026)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
di: Halim, Jule Valendo, et al.
Pubblicazione: (2025) -
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
di: Jia, Hong, et al.
Pubblicazione: (2026) -
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
di: Dang, Ting, et al.
Pubblicazione: (2025) -
CoCoEmo: Composable and Controllable Human-Like Emotional TTS via Activation Steering
di: Wang, Siyi, et al.
Pubblicazione: (2026) -
Test-Time Adaptation for Speech Emotion Recognition
di: Dong, Jiaheng, et al.
Pubblicazione: (2026)