Contrastive Decoupled Representation Learning and Regularization for Speech-Preserving Facial Expression Manipulation
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Tianshui, Lin, Jianman, Yang, Zhijing, Qing, Chumei, Shi, Yukai, Lin, Liang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Spatial-Temporal Coherent Correlations for Speech-Preserving Facial Expression Manipulation
di: Chen, Tianshui, et al.
Pubblicazione: (2026)
di: Chen, Tianshui, et al.
Pubblicazione: (2026)
Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation
di: Chen, Tianshui, et al.
Pubblicazione: (2026)
di: Chen, Tianshui, et al.
Pubblicazione: (2026)
Geometry-Editable and Appearance-Preserving Object Compositon
di: Lin, Jianman, et al.
Pubblicazione: (2025)
di: Lin, Jianman, et al.
Pubblicazione: (2025)
Neural Scene Designer: Self-Styled Semantic Image Manipulation
di: Lin, Jianman, et al.
Pubblicazione: (2025)
di: Lin, Jianman, et al.
Pubblicazione: (2025)
Exploring Talking Head Models With Adjacent Frame Prior for Speech-Preserving Facial Expression Manipulation
di: Lu, Zhenxuan, et al.
Pubblicazione: (2026)
di: Lu, Zhenxuan, et al.
Pubblicazione: (2026)
Dual-Perspective Semantic-Aware Representation Blending for Multi-Label Image Recognition with Partial Labels
di: Pu, Tao, et al.
Pubblicazione: (2022)
di: Pu, Tao, et al.
Pubblicazione: (2022)
Heterogeneous Semantic Transfer for Multi-label Recognition with Partial Labels
di: Chen, Tianshui, et al.
Pubblicazione: (2022)
di: Chen, Tianshui, et al.
Pubblicazione: (2022)
Adaptive Global-Local Representation Learning and Selection for Cross-Domain Facial Expression Recognition
di: Gao, Yuefang, et al.
Pubblicazione: (2024)
di: Gao, Yuefang, et al.
Pubblicazione: (2024)
Decoding Emotions: Unveiling Facial Expressions through Acoustic Sensing with Contrastive Attention
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
Diff-Mosaic: Augmenting Realistic Representations in Infrared Small Target Detection via Diffusion Prior
di: Shi, Yukai, et al.
Pubblicazione: (2024)
di: Shi, Yukai, et al.
Pubblicazione: (2024)
Dynamic Correlation Learning and Regularization for Multi-Label Confidence Calibration
di: Chen, Tianshui, et al.
Pubblicazione: (2024)
di: Chen, Tianshui, et al.
Pubblicazione: (2024)
Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning
di: Yang, Kang, et al.
Pubblicazione: (2025)
di: Yang, Kang, et al.
Pubblicazione: (2025)
Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning
di: Wang, Linge, et al.
Pubblicazione: (2026)
di: Wang, Linge, et al.
Pubblicazione: (2026)
Learning Co-Speech Gesture Representations in Dialogue through Contrastive Learning: An Intrinsic Evaluation
di: Ghaleb, Esam, et al.
Pubblicazione: (2024)
di: Ghaleb, Esam, et al.
Pubblicazione: (2024)
DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And Intelligibility
di: Liu, Yifan, et al.
Pubblicazione: (2025)
di: Liu, Yifan, et al.
Pubblicazione: (2025)
Neural Clothing Tryer: Customized Virtual Try-On via Semantic Enhancement and Controlling Diffusion Model
di: Yang, Zhijing, et al.
Pubblicazione: (2026)
di: Yang, Zhijing, et al.
Pubblicazione: (2026)
Exploiting Temporal Audio-Visual Correlation Embedding for Audio-Driven One-Shot Talking Head Animation
di: Xu, Zhihua, et al.
Pubblicazione: (2025)
di: Xu, Zhihua, et al.
Pubblicazione: (2025)
VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection
di: Cheng, Hao, et al.
Pubblicazione: (2025)
di: Cheng, Hao, et al.
Pubblicazione: (2025)
An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical Circuits
di: Li, Kai, et al.
Pubblicazione: (2022)
di: Li, Kai, et al.
Pubblicazione: (2022)
Learning Semantic-Aware Representation in Visual-Language Models for Multi-Label Recognition with Partial Labels
di: Ruan, Haoxian, et al.
Pubblicazione: (2024)
di: Ruan, Haoxian, et al.
Pubblicazione: (2024)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
di: Bai, Detao, et al.
Pubblicazione: (2025)
di: Bai, Detao, et al.
Pubblicazione: (2025)
Hierarchical Codec Diffusion for Video-to-Speech Generation
di: Ye, Jiaxin, et al.
Pubblicazione: (2026)
di: Ye, Jiaxin, et al.
Pubblicazione: (2026)
DIDiffGes: Decoupled Semi-Implicit Diffusion Models for Real-time Gesture Generation from Speech
di: Cheng, Yongkang, et al.
Pubblicazione: (2025)
di: Cheng, Yongkang, et al.
Pubblicazione: (2025)
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
di: Kim, Minsu, et al.
Pubblicazione: (2024)
di: Kim, Minsu, et al.
Pubblicazione: (2024)
EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation
di: Izzati, Fathinah, et al.
Pubblicazione: (2025)
di: Izzati, Fathinah, et al.
Pubblicazione: (2025)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
Leveraging Audio Representations for Vibration-Based Crowd Monitoring in Stadiums
di: Chang, Yen Cheng, et al.
Pubblicazione: (2025)
di: Chang, Yen Cheng, et al.
Pubblicazione: (2025)
Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition
di: Haliassos, Alexandros, et al.
Pubblicazione: (2026)
di: Haliassos, Alexandros, et al.
Pubblicazione: (2026)
TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation
di: Liu, Xinran, et al.
Pubblicazione: (2026)
di: Liu, Xinran, et al.
Pubblicazione: (2026)
DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation
di: Paar, Ferdinand, et al.
Pubblicazione: (2026)
di: Paar, Ferdinand, et al.
Pubblicazione: (2026)
Distillation-based Layer Dropping (DLD): Effective End-to-end Framework for Dynamic Speech Networks
di: Hannan, Abdul, et al.
Pubblicazione: (2026)
di: Hannan, Abdul, et al.
Pubblicazione: (2026)
EchoMask: Speech-Queried Attention-based Mask Modeling for Holistic Co-Speech Motion Generation
di: Zhang, Xiangyue, et al.
Pubblicazione: (2025)
di: Zhang, Xiangyue, et al.
Pubblicazione: (2025)
InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
DRKF: Decoupled Representations with Knowledge Fusion for Multimodal Emotion Recognition
di: Jiang, Peiyuan, et al.
Pubblicazione: (2025)
di: Jiang, Peiyuan, et al.
Pubblicazione: (2025)
Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
di: Song, Zijian, et al.
Pubblicazione: (2025)
di: Song, Zijian, et al.
Pubblicazione: (2025)
Speech Audio Generation from dynamic MRI via a Knowledge Enhanced Conditional Variational Autoencoder
di: Li, Yaxuan, et al.
Pubblicazione: (2025)
di: Li, Yaxuan, et al.
Pubblicazione: (2025)
Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention
di: Li, Kai, et al.
Pubblicazione: (2025)
di: Li, Kai, et al.
Pubblicazione: (2025)
Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization
di: Vu, Tung, et al.
Pubblicazione: (2026)
di: Vu, Tung, et al.
Pubblicazione: (2026)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning Spatial-Temporal Coherent Correlations for Speech-Preserving Facial Expression Manipulation
di: Chen, Tianshui, et al.
Pubblicazione: (2026) -
Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation
di: Chen, Tianshui, et al.
Pubblicazione: (2026) -
Geometry-Editable and Appearance-Preserving Object Compositon
di: Lin, Jianman, et al.
Pubblicazione: (2025) -
Neural Scene Designer: Self-Styled Semantic Image Manipulation
di: Lin, Jianman, et al.
Pubblicazione: (2025) -
Exploring Talking Head Models With Adjacent Frame Prior for Speech-Preserving Facial Expression Manipulation
di: Lu, Zhenxuan, et al.
Pubblicazione: (2026)