CEM-Net: Cross-Emotion Memory Network for Emotional Talking Face Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Kangyi, Li, Pengna, Fu, Jingwen, Wu, Yang, Liu, Yuhan, Zhou, Sanping, Wang, Jinjun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation
par: Shen, Nanhan, et autres
Publié: (2026)
par: Shen, Nanhan, et autres
Publié: (2026)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
par: Zhou, Dingkun, et autres
Publié: (2025)
par: Zhou, Dingkun, et autres
Publié: (2025)
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
par: Rong, Yan, et autres
Publié: (2025)
par: Rong, Yan, et autres
Publié: (2025)
CLAIP-Emo: Parameter-Efficient Adaptation of Language-supervised models for In-the-Wild Audiovisual Emotion Recognition
par: Chen, Yin, et autres
Publié: (2025)
par: Chen, Yin, et autres
Publié: (2025)
InconVAD: A Two-Stage Dual-Tower Framework for Multimodal Emotion Inconsistency Detection
par: Li, Zongyi, et autres
Publié: (2025)
par: Li, Zongyi, et autres
Publié: (2025)
AMB-DSGDN: Adaptive Modality-Balanced Dynamic Semantic Graph Differential Network for Multimodal Emotion Recognition
par: Wang, Yunsheng, et autres
Publié: (2026)
par: Wang, Yunsheng, et autres
Publié: (2026)
READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection
par: Chen, Chenglizhao, et autres
Publié: (2026)
par: Chen, Chenglizhao, et autres
Publié: (2026)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
par: Zhang, Xiaohui, et autres
Publié: (2024)
par: Zhang, Xiaohui, et autres
Publié: (2024)
Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition
par: Koo, Inyong, et autres
Publié: (2026)
par: Koo, Inyong, et autres
Publié: (2026)
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
par: Li, Fu, et autres
Publié: (2025)
par: Li, Fu, et autres
Publié: (2025)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
par: Li, Hebeizi, et autres
Publié: (2026)
par: Li, Hebeizi, et autres
Publié: (2026)
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
par: Deng, Zeyu, et autres
Publié: (2025)
par: Deng, Zeyu, et autres
Publié: (2025)
From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection
par: Liu, Ke, et autres
Publié: (2026)
par: Liu, Ke, et autres
Publié: (2026)
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
par: Cong, Gaoxiang, et autres
Publié: (2024)
par: Cong, Gaoxiang, et autres
Publié: (2024)
Memo2496: Expert-Annotated Dataset and Dual-View Adaptive Framework for Music Emotion Recognition
par: Li, Qilin, et autres
Publié: (2025)
par: Li, Qilin, et autres
Publié: (2025)
EMO100DB: An Open Dataset of Improvised Songs with Emotion Data
par: Hwang, Daeun, et autres
Publié: (2025)
par: Hwang, Daeun, et autres
Publié: (2025)
Robust Multi-modal Task-oriented Communications with Redundancy-aware Representations
par: Fu, Jingwen, et autres
Publié: (2025)
par: Fu, Jingwen, et autres
Publié: (2025)
A Survey on Multimodal Music Emotion Recognition
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
par: Li, Shuyu, et autres
Publié: (2025)
par: Li, Shuyu, et autres
Publié: (2025)
Emotion-Aligned Contrastive Learning Between Images and Music
par: Stewart, Shanti, et autres
Publié: (2023)
par: Stewart, Shanti, et autres
Publié: (2023)
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
par: Ji, Shulei, et autres
Publié: (2023)
par: Ji, Shulei, et autres
Publié: (2023)
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
par: Liu, Renhang, et autres
Publié: (2024)
par: Liu, Renhang, et autres
Publié: (2024)
Towards Practical Real-Time Low-Latency Music Source Separation
par: Wu, Junyu, et autres
Publié: (2025)
par: Wu, Junyu, et autres
Publié: (2025)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
par: Kang, Fang, et autres
Publié: (2025)
par: Kang, Fang, et autres
Publié: (2025)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
par: Liu, Xiangyu, et autres
Publié: (2026)
par: Liu, Xiangyu, et autres
Publié: (2026)
Let the Model Learn to Feel: Mode-Guided Tonality Injection for Symbolic Music Emotion Recognition
par: Xia, Haiying, et autres
Publié: (2025)
par: Xia, Haiying, et autres
Publié: (2025)
REGNav: Room Expert Guided Image-Goal Navigation
par: Li, Pengna, et autres
Publié: (2025)
par: Li, Pengna, et autres
Publié: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
par: Zhou, Yang-Hao, et autres
Publié: (2026)
par: Zhou, Yang-Hao, et autres
Publié: (2026)
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
par: Qian, Zhiwen, et autres
Publié: (2025)
par: Qian, Zhiwen, et autres
Publié: (2025)
Ensembling Synchronisation-based and Face-Voice Association Paradigms for Robust Active Speaker Detection in Egocentric Recordings
par: Clarke, Jason, et autres
Publié: (2025)
par: Clarke, Jason, et autres
Publié: (2025)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
par: Li, Yaoru, et autres
Publié: (2025)
par: Li, Yaoru, et autres
Publié: (2025)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
par: Qiu, Ke, et autres
Publié: (2026)
par: Qiu, Ke, et autres
Publié: (2026)
Early Joint Learning of Emotion Information Makes MultiModal Model Understand You Better
par: Ge, Mengying, et autres
Publié: (2024)
par: Ge, Mengying, et autres
Publié: (2024)
STCTS: Generative Semantic Compression for Ultra-Low Bitrate Speech via Explicit Text-Prosody-Timbre Decomposition
par: Wang, Siyu, et autres
Publié: (2025)
par: Wang, Siyu, et autres
Publié: (2025)
EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction
par: Jing, Chong, et autres
Publié: (2026)
par: Jing, Chong, et autres
Publié: (2026)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
par: Xu, Xinmeng, et autres
Publié: (2026)
par: Xu, Xinmeng, et autres
Publié: (2026)
Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
par: Sun, Haoqin, et autres
Publié: (2024)
par: Sun, Haoqin, et autres
Publié: (2024)
TalkSketch: Multimodal Generative AI for Real-time Sketch Ideation with Speech
par: Shi, Weiyan, et autres
Publié: (2025)
par: Shi, Weiyan, et autres
Publié: (2025)
Documents similaires
-
Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation
par: Shen, Nanhan, et autres
Publié: (2026) -
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
par: Zhou, Dingkun, et autres
Publié: (2025) -
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
par: Rong, Yan, et autres
Publié: (2025) -
CLAIP-Emo: Parameter-Efficient Adaptation of Language-supervised models for In-the-Wild Audiovisual Emotion Recognition
par: Chen, Yin, et autres
Publié: (2025) -
InconVAD: A Two-Stage Dual-Tower Framework for Multimodal Emotion Inconsistency Detection
par: Li, Zongyi, et autres
Publié: (2025)