Guardado en:
| Autores principales: | Song, Haoyu, McLoughlin, Ian, Gu, Qing, Jiang, Nan, Song, Yan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2509.23795 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
por: Cai, Pengfei, et al.
Publicado: (2025)
por: Cai, Pengfei, et al.
Publicado: (2025)
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
por: Cai, Pengfei, et al.
Publicado: (2024)
por: Cai, Pengfei, et al.
Publicado: (2024)
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
por: Cai, Pengfei, et al.
Publicado: (2024)
por: Cai, Pengfei, et al.
Publicado: (2024)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
por: Shi, Yanfeng, et al.
Publicado: (2026)
por: Shi, Yanfeng, et al.
Publicado: (2026)
CodecFlow: Efficient Bandwidth Extension via Conditional Flow Matching in Neural Codec Latent Space
por: Zhang, Bowen, et al.
Publicado: (2026)
por: Zhang, Bowen, et al.
Publicado: (2026)
A General Model for Deepfake Speech Detection: Diverse Bonafide Resources or Diverse AI-Based Generators
por: Pham, Lam, et al.
Publicado: (2026)
por: Pham, Lam, et al.
Publicado: (2026)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
por: Pan, Yu, et al.
Publicado: (2023)
por: Pan, Yu, et al.
Publicado: (2023)
PEFT-SER: On the Use of Parameter Efficient Transfer Learning Approaches For Speech Emotion Recognition Using Pre-trained Speech Models
por: Feng, Tiantian, et al.
Publicado: (2023)
por: Feng, Tiantian, et al.
Publicado: (2023)
A Cross-Corpus Speech Emotion Recognition Method Based on Supervised Contrastive Learning
por: minjie, Xiang
Publicado: (2024)
por: minjie, Xiang
Publicado: (2024)
AmbER$^2$: Dual Ambiguity-Aware Emotion Recognition Applied to Speech and Text
por: Wu, Jingyao, et al.
Publicado: (2026)
por: Wu, Jingyao, et al.
Publicado: (2026)
Toward Efficient Speech Emotion Recognition via Spectral Learning and Attention
por: Lee, HyeYoung, et al.
Publicado: (2025)
por: Lee, HyeYoung, et al.
Publicado: (2025)
Automated evaluation of children's speech fluency for low-resource languages
por: Zhang, Bowen, et al.
Publicado: (2025)
por: Zhang, Bowen, et al.
Publicado: (2025)
Two-Stage Acoustic Adaptation with Gated Cross-Attention Adapters for LLM-Based Multi-Talker Speech Recognition
por: Shi, Hao, et al.
Publicado: (2026)
por: Shi, Hao, et al.
Publicado: (2026)
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
por: Chen, Youjun, et al.
Publicado: (2026)
por: Chen, Youjun, et al.
Publicado: (2026)
Exploration of Adapter for Noise Robust Automatic Speech Recognition
por: Shi, Hao, et al.
Publicado: (2024)
por: Shi, Hao, et al.
Publicado: (2024)
Enhancing Speech Emotion Recognition with Multi-Task Learning and Dynamic Feature Fusion
por: Wang, Honghong, et al.
Publicado: (2025)
por: Wang, Honghong, et al.
Publicado: (2025)
RSET: Remapping-based Sorting Method for Emotion Transfer Speech Synthesis
por: Shi, Haoxiang, et al.
Publicado: (2024)
por: Shi, Haoxiang, et al.
Publicado: (2024)
Amplifying Emotional Signals: Data-Efficient Deep Learning for Robust Speech Emotion Recognition
por: Vu, Tai
Publicado: (2025)
por: Vu, Tai
Publicado: (2025)
AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling
por: Shi, Jiacheng, et al.
Publicado: (2026)
por: Shi, Jiacheng, et al.
Publicado: (2026)
Speech Emotion Recognition with ASR Integration
por: Li, Yuanchao
Publicado: (2026)
por: Li, Yuanchao
Publicado: (2026)
A Parameter-Efficient Multi-Scale Convolutional Adapter for Synthetic Speech Detection
por: Kheir, Yassine El, et al.
Publicado: (2025)
por: Kheir, Yassine El, et al.
Publicado: (2025)
Efficient Finetuning for Dimensional Speech Emotion Recognition in the Age of Transformers
por: Sampath, Aneesha, et al.
Publicado: (2025)
por: Sampath, Aneesha, et al.
Publicado: (2025)
Parameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation
por: Lashkarashvili, Nineli, et al.
Publicado: (2024)
por: Lashkarashvili, Nineli, et al.
Publicado: (2024)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
por: Shen, Siyuan, et al.
Publicado: (2024)
por: Shen, Siyuan, et al.
Publicado: (2024)
A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction
por: Wang, Qing, et al.
Publicado: (2026)
por: Wang, Qing, et al.
Publicado: (2026)
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
por: Li, Pengcheng, et al.
Publicado: (2025)
por: Li, Pengcheng, et al.
Publicado: (2025)
Exploring Local Interpretable Model-Agnostic Explanations for Speech Emotion Recognition with Distribution-Shift
por: Hjuler, Maja J., et al.
Publicado: (2025)
por: Hjuler, Maja J., et al.
Publicado: (2025)
Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition
por: Zhao, Jiaqi, et al.
Publicado: (2024)
por: Zhao, Jiaqi, et al.
Publicado: (2024)
Searching for Effective Preprocessing Method and CNN-based Architecture with Efficient Channel Attention on Speech Emotion Recognition
por: Kim, Byunggun, et al.
Publicado: (2024)
por: Kim, Byunggun, et al.
Publicado: (2024)
Enhancing Speech Emotion Recognition with Graph-Based Multimodal Fusion and Prosodic Features for the Speech Emotion Recognition in Naturalistic Conditions Challenge at Interspeech 2025
por: Ferreira, Alef Iury Siqueira, et al.
Publicado: (2025)
por: Ferreira, Alef Iury Siqueira, et al.
Publicado: (2025)
Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition
por: Zhao, Yan, et al.
Publicado: (2024)
por: Zhao, Yan, et al.
Publicado: (2024)
EmoHRNet: High-Resolution Neural Network Based Speech Emotion Recognition
por: Muppidi, Akshay, et al.
Publicado: (2025)
por: Muppidi, Akshay, et al.
Publicado: (2025)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
por: Dutta, Soumya, et al.
Publicado: (2025)
por: Dutta, Soumya, et al.
Publicado: (2025)
Color-based Emotion Representation for Speech Emotion Recognition
por: Nagase, Ryotaro, et al.
Publicado: (2026)
por: Nagase, Ryotaro, et al.
Publicado: (2026)
GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition
por: Pan, Yu, et al.
Publicado: (2024)
por: Pan, Yu, et al.
Publicado: (2024)
Speech Emotion Recognition Using MFCC Features and LSTM-Based Deep Learning Model
por: Oluwademilade, Adelekun, et al.
Publicado: (2026)
por: Oluwademilade, Adelekun, et al.
Publicado: (2026)
Learning More with Less: Self-Supervised Approaches for Low-Resource Speech Emotion Recognition
por: Gong, Ziwei, et al.
Publicado: (2025)
por: Gong, Ziwei, et al.
Publicado: (2025)
Deep Learning for Speech Emotion Recognition: A CNN Approach Utilizing Mel Spectrograms
por: Penumajji, Niketa
Publicado: (2025)
por: Penumajji, Niketa
Publicado: (2025)
THAI Speech Emotion Recognition (THAI-SER) corpus
por: Wongpithayadisai, Jilamika, et al.
Publicado: (2025)
por: Wongpithayadisai, Jilamika, et al.
Publicado: (2025)
EMO-SUPERB: An In-depth Look at Speech Emotion Recognition
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Ejemplares similares
-
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
por: Cai, Pengfei, et al.
Publicado: (2025) -
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
por: Cai, Pengfei, et al.
Publicado: (2024) -
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
por: Cai, Pengfei, et al.
Publicado: (2024) -
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
por: Shi, Yanfeng, et al.
Publicado: (2026) -
CodecFlow: Efficient Bandwidth Extension via Conditional Flow Matching in Neural Codec Latent Space
por: Zhang, Bowen, et al.
Publicado: (2026)