Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Qingran, Zhao, Botao, Kang, Zuheng, Li, Xue, He, Yayun, Liu, Chuhang, Zhang, Xulong, Qu, Xiaoyang, Peng, Junqing, Wang, Jianzong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
por: Li, Pengcheng, et al.
Publicado: (2025)
por: Li, Pengcheng, et al.
Publicado: (2025)
Generalized Audio Deepfake Detection Using Frame-level Latent Information Entropy
por: Zhao, Botao, et al.
Publicado: (2025)
por: Zhao, Botao, et al.
Publicado: (2025)
Retrieval-Augmented Audio Deepfake Detection
por: Kang, Zuheng, et al.
Publicado: (2024)
por: Kang, Zuheng, et al.
Publicado: (2024)
EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization
por: Wang, Jianzong, et al.
Publicado: (2024)
por: Wang, Jianzong, et al.
Publicado: (2024)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
por: Tang, Haobin, et al.
Publicado: (2024)
por: Tang, Haobin, et al.
Publicado: (2024)
Efficient Multi-Model Fusion with Adversarial Complementary Representation Learning
por: Kang, Zuheng, et al.
Publicado: (2024)
por: Kang, Zuheng, et al.
Publicado: (2024)
ESARM: 3D Emotional Speech-to-Animation via Reward Model from Automatically-Ranked Demonstrations
por: Zhang, Xulong, et al.
Publicado: (2024)
por: Zhang, Xulong, et al.
Publicado: (2024)
RSET: Remapping-based Sorting Method for Emotion Transfer Speech Synthesis
por: Shi, Haoxiang, et al.
Publicado: (2024)
por: Shi, Haoxiang, et al.
Publicado: (2024)
CycleFlow: Leveraging Cycle Consistency in Flow Matching for Speaker Style Adaptation
por: Liang, Ziqi, et al.
Publicado: (2025)
por: Liang, Ziqi, et al.
Publicado: (2025)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
por: Deng, Yimin, et al.
Publicado: (2024)
por: Deng, Yimin, et al.
Publicado: (2024)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
por: Deng, Yimin, et al.
Publicado: (2024)
por: Deng, Yimin, et al.
Publicado: (2024)
Dataset-Distillation Generative Model for Speech Emotion Recognition
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2024)
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2024)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
Improving Speech Emotion Recognition Through Cross Modal Attention Alignment and Balanced Stacking Model
por: Ueda, Lucas, et al.
Publicado: (2025)
por: Ueda, Lucas, et al.
Publicado: (2025)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
por: Wang, Jianzong, et al.
Publicado: (2024)
por: Wang, Jianzong, et al.
Publicado: (2024)
DQR-TTS: Semi-supervised Text-to-speech Synthesis with Dynamic Quantized Representation
por: Wang, Jianzong, et al.
Publicado: (2023)
por: Wang, Jianzong, et al.
Publicado: (2023)
AmbER$^2$: Dual Ambiguity-Aware Emotion Recognition Applied to Speech and Text
por: Wu, Jingyao, et al.
Publicado: (2026)
por: Wu, Jingyao, et al.
Publicado: (2026)
Multi-Teacher Language-Aware Knowledge Distillation for Multilingual Speech Emotion Recognition
por: Bijoy, Mehedi Hasan, et al.
Publicado: (2025)
por: Bijoy, Mehedi Hasan, et al.
Publicado: (2025)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
por: Zhang, Jing-Xuan, et al.
Publicado: (2025)
por: Zhang, Jing-Xuan, et al.
Publicado: (2025)
Speech Emotion Recognition with ASR Integration
por: Li, Yuanchao
Publicado: (2026)
por: Li, Yuanchao
Publicado: (2026)
Double Multi-Head Attention Multimodal System for Odyssey 2024 Speech Emotion Recognition Challenge
por: Costa, Federico, et al.
Publicado: (2024)
por: Costa, Federico, et al.
Publicado: (2024)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
por: Li, Xiao, et al.
Publicado: (2025)
por: Li, Xiao, et al.
Publicado: (2025)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
por: Shen, Siyuan, et al.
Publicado: (2024)
por: Shen, Siyuan, et al.
Publicado: (2024)
Semi-Supervised Self-Learning Enhanced Music Emotion Recognition
por: Sun, Yifu, et al.
Publicado: (2024)
por: Sun, Yifu, et al.
Publicado: (2024)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
por: Lin, Zhaofeng, et al.
Publicado: (2024)
por: Lin, Zhaofeng, et al.
Publicado: (2024)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
por: Wan, Zixiang, et al.
Publicado: (2024)
por: Wan, Zixiang, et al.
Publicado: (2024)
EMO-SUPERB: An In-depth Look at Speech Emotion Recognition
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
THAI Speech Emotion Recognition (THAI-SER) corpus
por: Wongpithayadisai, Jilamika, et al.
Publicado: (2025)
por: Wongpithayadisai, Jilamika, et al.
Publicado: (2025)
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
por: Sun, Haoqin, et al.
Publicado: (2024)
por: Sun, Haoqin, et al.
Publicado: (2024)
Breaking Resource Barriers in Speech Emotion Recognition via Data Distillation
por: Chang, Yi, et al.
Publicado: (2024)
por: Chang, Yi, et al.
Publicado: (2024)
Structural and Statistical Audio Texture Knowledge Distillation for Acoustic Classification
por: Ritu, Jarin, et al.
Publicado: (2025)
por: Ritu, Jarin, et al.
Publicado: (2025)
PCQ: Emotion Recognition in Speech via Progressive Channel Querying
por: Wang, Xincheng, et al.
Publicado: (2024)
por: Wang, Xincheng, et al.
Publicado: (2024)
Testing Correctness, Fairness, and Robustness of Speech Emotion Recognition Models
por: Derington, Anna, et al.
Publicado: (2023)
por: Derington, Anna, et al.
Publicado: (2023)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
por: Bukhari, Hazim, et al.
Publicado: (2024)
por: Bukhari, Hazim, et al.
Publicado: (2024)
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
por: Yuan, Xihao, et al.
Publicado: (2025)
por: Yuan, Xihao, et al.
Publicado: (2025)
Frequency-mix Knowledge Distillation for Fake Speech Detection
por: Fan, Cunhang, et al.
Publicado: (2024)
por: Fan, Cunhang, et al.
Publicado: (2024)
Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification
por: Sundar, Anirudh S., et al.
Publicado: (2023)
por: Sundar, Anirudh S., et al.
Publicado: (2023)
Attention-Guided Adaptation for Code-Switching Speech Recognition
por: Aditya, Bobbi, et al.
Publicado: (2023)
por: Aditya, Bobbi, et al.
Publicado: (2023)
Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition
por: Zhao, Yan, et al.
Publicado: (2024)
por: Zhao, Yan, et al.
Publicado: (2024)
Ejemplares similares
-
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
por: Li, Pengcheng, et al.
Publicado: (2025) -
Generalized Audio Deepfake Detection Using Frame-level Latent Information Entropy
por: Zhao, Botao, et al.
Publicado: (2025) -
Retrieval-Augmented Audio Deepfake Detection
por: Kang, Zuheng, et al.
Publicado: (2024) -
EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization
por: Wang, Jianzong, et al.
Publicado: (2024) -
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
por: Tang, Haobin, et al.
Publicado: (2024)