Leveraging CLIP Encoder for Multimodal Emotion Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Song, Yehun, Cho, Sunyoung |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Emotion Recognition with CLIP and Sequential Learning
by: Zhou, Weiwei, et al.
Published: (2025)
by: Zhou, Weiwei, et al.
Published: (2025)
Expanding Event Modality Applications through a Robust CLIP-Based Encoder
by: Jeong, Sungheon, et al.
Published: (2024)
by: Jeong, Sungheon, et al.
Published: (2024)
Grounding Emotion Recognition with Visual Prototypes: VEGA -- Revisiting CLIP in MERC
by: Hu, Guanyu, et al.
Published: (2025)
by: Hu, Guanyu, et al.
Published: (2025)
Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark
by: Hu, Jinpeng, et al.
Published: (2025)
by: Hu, Jinpeng, et al.
Published: (2025)
Leveraging Retrieval Augment Approach for Multimodal Emotion Recognition Under Missing Modalities
by: Fan, Qi, et al.
Published: (2024)
by: Fan, Qi, et al.
Published: (2024)
MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
by: Xing, Jiazheng, et al.
Published: (2023)
by: Xing, Jiazheng, et al.
Published: (2023)
A Trustworthy Method for Multimodal Emotion Recognition
by: Xue, Junxiao, et al.
Published: (2025)
by: Xue, Junxiao, et al.
Published: (2025)
Decoupled Hierarchical Distillation for Multimodal Emotion Recognition
by: Li, Yong, et al.
Published: (2026)
by: Li, Yong, et al.
Published: (2026)
MV-CLIP: Multi-View CLIP for Zero-shot 3D Shape Recognition
by: Song, Dan, et al.
Published: (2023)
by: Song, Dan, et al.
Published: (2023)
Cattle-CLIP: A Multimodal Framework for Cattle Behaviour Recognition from Video
by: Liu, Huimin, et al.
Published: (2025)
by: Liu, Huimin, et al.
Published: (2025)
WP-CLIP: Leveraging CLIP to Predict Wölfflin's Principles in Visual Art
by: Ghildyal, Abhijay, et al.
Published: (2025)
by: Ghildyal, Abhijay, et al.
Published: (2025)
DEEMO: De-identity Multimodal Emotion Recognition and Reasoning
by: Li, Deng, et al.
Published: (2025)
by: Li, Deng, et al.
Published: (2025)
CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition
by: Zeeshan, Muhammad Osama, et al.
Published: (2026)
by: Zeeshan, Muhammad Osama, et al.
Published: (2026)
Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval
by: Wang, Zhichuan, et al.
Published: (2025)
by: Wang, Zhichuan, et al.
Published: (2025)
Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition
by: Huang, Zhexian, et al.
Published: (2026)
by: Huang, Zhexian, et al.
Published: (2026)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
by: Wang, Mengmeng, et al.
Published: (2024)
by: Wang, Mengmeng, et al.
Published: (2024)
Leveraging Foundation Models for Multimodal Graph-Based Action Recognition
by: Ziaeetabar, Fatemeh, et al.
Published: (2025)
by: Ziaeetabar, Fatemeh, et al.
Published: (2025)
Multimodal Multilabel Classification by CLIP
by: Guo, Yanming
Published: (2024)
by: Guo, Yanming
Published: (2024)
SPACE-CLIP: Spatial Perception via Adaptive CLIP Embeddings for Monocular Depth Estimation
by: Cho, Taewan, et al.
Published: (2026)
by: Cho, Taewan, et al.
Published: (2026)
MoCLIP-Lite: Efficient Video Recognition by Fusing CLIP with Motion Vectors
by: Huang, Binhua, et al.
Published: (2025)
by: Huang, Binhua, et al.
Published: (2025)
CLIP-SLA: Parameter-Efficient CLIP Adaptation for Continuous Sign Language Recognition
by: Alyami, Sarah, et al.
Published: (2025)
by: Alyami, Sarah, et al.
Published: (2025)
Dual-Prompt CLIP with Hybrid Visual Encoders for Occluded Person Re-Identification
by: Ji, Zhangjian, et al.
Published: (2026)
by: Ji, Zhangjian, et al.
Published: (2026)
Zoom-shot: Fast and Efficient Unsupervised Zero-Shot Transfer of CLIP to Vision Encoders with Multimodal Loss
by: Shipard, Jordan, et al.
Published: (2024)
by: Shipard, Jordan, et al.
Published: (2024)
Multimodal Emotion Recognition via Causal-Diffusion Bridge (Affect-Diff)
by: Sanjyal, Ankit
Published: (2026)
by: Sanjyal, Ankit
Published: (2026)
MultiMAE-DER: Multimodal Masked Autoencoder for Dynamic Emotion Recognition
by: Xiang, Peihao, et al.
Published: (2024)
by: Xiang, Peihao, et al.
Published: (2024)
Textualized and Feature-based Models for Compound Multimodal Emotion Recognition in the Wild
by: Richet, Nicolas, et al.
Published: (2024)
by: Richet, Nicolas, et al.
Published: (2024)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
by: Jiang, Dongsheng, et al.
Published: (2023)
by: Jiang, Dongsheng, et al.
Published: (2023)
Navigating the Emotion Tree: Hierarchical Hyperbolic RAG for Multimodal Emotion Recognition
by: Wang, Zeheng, et al.
Published: (2026)
by: Wang, Zeheng, et al.
Published: (2026)
OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning
by: Liu, Mushui, et al.
Published: (2024)
by: Liu, Mushui, et al.
Published: (2024)
GenCLIP: Generalizing CLIP Prompts for Zero-shot Anomaly Detection
by: Kim, Donghyeong, et al.
Published: (2025)
by: Kim, Donghyeong, et al.
Published: (2025)
Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge
by: Chen, Ruiming, et al.
Published: (2025)
by: Chen, Ruiming, et al.
Published: (2025)
ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
by: Ge, Chunjiang, et al.
Published: (2024)
by: Ge, Chunjiang, et al.
Published: (2024)
TiCAL:Typicality-Based Consistency-Aware Learning for Multimodal Emotion Recognition
by: Yin, Wen, et al.
Published: (2025)
by: Yin, Wen, et al.
Published: (2025)
ICANet: A Method of Short Video Emotion Recognition Driven by Multimodal Data
by: Wu, Xuecheng, et al.
Published: (2022)
by: Wu, Xuecheng, et al.
Published: (2022)
Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
by: Ge, Mengying, et al.
Published: (2024)
by: Ge, Mengying, et al.
Published: (2024)
VISTANet: VIsual Spoken Textual Additive Net for Interpretable Multimodal Emotion Recognition
by: Kumar, Puneet, et al.
Published: (2022)
by: Kumar, Puneet, et al.
Published: (2022)
Effectively Leveraging CLIP for Generating Situational Summaries of Images and Videos
by: Verma, Dhruv, et al.
Published: (2024)
by: Verma, Dhruv, et al.
Published: (2024)
CLIP-Decoder : ZeroShot Multilabel Classification using Multimodal CLIP Aligned Representation
by: Ali, Muhammad, et al.
Published: (2024)
by: Ali, Muhammad, et al.
Published: (2024)
Unified Multimodal Models as Auto-Encoders
by: Yan, Zhiyuan, et al.
Published: (2025)
by: Yan, Zhiyuan, et al.
Published: (2025)
Variational Encoder--Multi-Decoder (VE-MD) for Privacy-by-functional-design (Group) Emotion Recognition
by: Augusma, Anderson, et al.
Published: (2026)
by: Augusma, Anderson, et al.
Published: (2026)
Similar Items
-
Emotion Recognition with CLIP and Sequential Learning
by: Zhou, Weiwei, et al.
Published: (2025) -
Expanding Event Modality Applications through a Robust CLIP-Based Encoder
by: Jeong, Sungheon, et al.
Published: (2024) -
Grounding Emotion Recognition with Visual Prototypes: VEGA -- Revisiting CLIP in MERC
by: Hu, Guanyu, et al.
Published: (2025) -
Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark
by: Hu, Jinpeng, et al.
Published: (2025) -
Leveraging Retrieval Augment Approach for Multimodal Emotion Recognition Under Missing Modalities
by: Fan, Qi, et al.
Published: (2024)