Samsung Research China-Beijing at SemEval-2024 Task 3: A multi-stage framework for Emotion-Cause Pair Extraction in Conversations
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Shen, Zhang, Haojie, Zhang, Jing, Zhang, Xudong, Zhuang, Yimeng, Wu, Jinting |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LastResort at SemEval-2024 Task 3: Exploring Multimodal Emotion Cause Pair Extraction as Sequence Labelling Task
por: Mathur, Suyash Vardhan, et al.
Publicado: (2024)
por: Mathur, Suyash Vardhan, et al.
Publicado: (2024)
Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction
por: Fan, Cunhang, et al.
Publicado: (2025)
por: Fan, Cunhang, et al.
Publicado: (2025)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
por: Li, Zixuan, et al.
Publicado: (2025)
por: Li, Zixuan, et al.
Publicado: (2025)
Distribution-based Emotion Recognition in Conversation
por: Wu, Wen, et al.
Publicado: (2022)
por: Wu, Wen, et al.
Publicado: (2022)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
por: Tang, Haobin, et al.
Publicado: (2024)
por: Tang, Haobin, et al.
Publicado: (2024)
Adaptive Speech Emotion Representation Learning Based On Dynamic Graph
por: Gao, Yingxue, et al.
Publicado: (2024)
por: Gao, Yingxue, et al.
Publicado: (2024)
LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations
por: Dutta, Soumya, et al.
Publicado: (2025)
por: Dutta, Soumya, et al.
Publicado: (2025)
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
por: Cao, Songjun, et al.
Publicado: (2025)
por: Cao, Songjun, et al.
Publicado: (2025)
1st Place Solution to Odyssey Emotion Recognition Challenge Task1: Tackling Class Imbalance Problem
por: Chen, Mingjie, et al.
Publicado: (2024)
por: Chen, Mingjie, et al.
Publicado: (2024)
MSP-Conversation: A Corpus for Naturalistic, Time-Continuous Emotion Recognition
por: Martinez-Lucas, Luz, et al.
Publicado: (2026)
por: Martinez-Lucas, Luz, et al.
Publicado: (2026)
DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech
por: Zhang, Xu, et al.
Publicado: (2026)
por: Zhang, Xu, et al.
Publicado: (2026)
CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning
por: Shi, Jiacheng, et al.
Publicado: (2025)
por: Shi, Jiacheng, et al.
Publicado: (2025)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
por: Zhang, Xueyao, et al.
Publicado: (2023)
por: Zhang, Xueyao, et al.
Publicado: (2023)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
por: Zhang, Daning, et al.
Publicado: (2025)
por: Zhang, Daning, et al.
Publicado: (2025)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
por: Jin, Zhan, et al.
Publicado: (2025)
por: Jin, Zhan, et al.
Publicado: (2025)
Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition
por: Li, Dongyuan, et al.
Publicado: (2024)
por: Li, Dongyuan, et al.
Publicado: (2024)
Online Audio-Visual Autoregressive Speaker Extraction
por: Pan, Zexu, et al.
Publicado: (2025)
por: Pan, Zexu, et al.
Publicado: (2025)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
por: Zhao, Yan, et al.
Publicado: (2022)
por: Zhao, Yan, et al.
Publicado: (2022)
Multi-Level Speaker Representation for Target Speaker Extraction
por: Zhang, Ke, et al.
Publicado: (2024)
por: Zhang, Ke, et al.
Publicado: (2024)
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
por: Li, Junjie, et al.
Publicado: (2024)
por: Li, Junjie, et al.
Publicado: (2024)
Mitigating Category Imbalance: Fosafer System for the Multimodal Emotion and Intent Joint Understanding Challenge
por: Wang, Honghong, et al.
Publicado: (2025)
por: Wang, Honghong, et al.
Publicado: (2025)
RSET: Remapping-based Sorting Method for Emotion Transfer Speech Synthesis
por: Shi, Haoxiang, et al.
Publicado: (2024)
por: Shi, Haoxiang, et al.
Publicado: (2024)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
por: Zhuang, Zhuoran, et al.
Publicado: (2026)
por: Zhuang, Zhuoran, et al.
Publicado: (2026)
A lightweight dual-stage framework for personalized speech enhancement based on DeepFilterNet2
por: Serre, Thomas, et al.
Publicado: (2024)
por: Serre, Thomas, et al.
Publicado: (2024)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
por: Li, Xiao, et al.
Publicado: (2025)
por: Li, Xiao, et al.
Publicado: (2025)
Listen to Extract: Onset-Prompted Target Speaker Extraction
por: Shen, Pengjie, et al.
Publicado: (2025)
por: Shen, Pengjie, et al.
Publicado: (2025)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
por: Wan, Zixiang, et al.
Publicado: (2024)
por: Wan, Zixiang, et al.
Publicado: (2024)
Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
por: Mi, Jinyi, et al.
Publicado: (2024)
por: Mi, Jinyi, et al.
Publicado: (2024)
Adapting General Disentanglement-Based Speaker Anonymization for Enhanced Emotion Preservation
por: Miao, Xiaoxiao, et al.
Publicado: (2024)
por: Miao, Xiaoxiao, et al.
Publicado: (2024)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
por: Ma, Hao, et al.
Publicado: (2025)
por: Ma, Hao, et al.
Publicado: (2025)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
por: Guo, Zixin, et al.
Publicado: (2024)
por: Guo, Zixin, et al.
Publicado: (2024)
Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
por: Jing, Ruihao, et al.
Publicado: (2025)
por: Jing, Ruihao, et al.
Publicado: (2025)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
por: Xue, Hongfei, et al.
Publicado: (2023)
por: Xue, Hongfei, et al.
Publicado: (2023)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
por: Zhang, Xiaohui, et al.
Publicado: (2024)
por: Zhang, Xiaohui, et al.
Publicado: (2024)
ParaLBench: A Large-Scale Benchmark for Computational Paralinguistics over Acoustic Foundation Models
por: Zhang, Zixing, et al.
Publicado: (2024)
por: Zhang, Zixing, et al.
Publicado: (2024)
3S-TSE: Efficient Three-Stage Target Speaker Extraction for Real-Time and Low-Resource Applications
por: He, Shulin, et al.
Publicado: (2023)
por: He, Shulin, et al.
Publicado: (2023)
Zero-Shot Sing Voice Conversion: built upon clustering-based phoneme representations
por: Zhou, Wangjin, et al.
Publicado: (2024)
por: Zhou, Wangjin, et al.
Publicado: (2024)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026)
por: Wang, Zhichao, et al.
Publicado: (2026)
Ejemplares similares
-
LastResort at SemEval-2024 Task 3: Exploring Multimodal Emotion Cause Pair Extraction as Sequence Labelling Task
por: Mathur, Suyash Vardhan, et al.
Publicado: (2024) -
Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction
por: Fan, Cunhang, et al.
Publicado: (2025) -
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
por: Li, Zixuan, et al.
Publicado: (2025) -
Distribution-based Emotion Recognition in Conversation
por: Wu, Wen, et al.
Publicado: (2022) -
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
por: Tang, Haobin, et al.
Publicado: (2024)