MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Jian, Hu, Yuxuan, Lu, Haifeng, Wang, Wei, Yang, Min, Li, Chengming, Hu, Xiping |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Towards Stable Cross-Domain Depression Recognition under Missing Modalities
by: Chen, Jiuyi, et al.
Published: (2025)
by: Chen, Jiuyi, et al.
Published: (2025)
Emotion Recognition from Skeleton Data: A Comprehensive Survey
by: Lu, Haifeng, et al.
Published: (2025)
by: Lu, Haifeng, et al.
Published: (2025)
ECMF: Enhanced Cross-Modal Fusion for Multimodal Emotion Recognition in MER-SEMI Challenge
by: Hu, Juewen, et al.
Published: (2025)
by: Hu, Juewen, et al.
Published: (2025)
Infrared Adversarial Car Stickers
by: Zhu, Xiaopei, et al.
Published: (2024)
by: Zhu, Xiaopei, et al.
Published: (2024)
Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning
by: Zhu, Yinglian, et al.
Published: (2025)
by: Zhu, Yinglian, et al.
Published: (2025)
A Survey on Facial Expression Recognition of Static and Dynamic Emotions
by: Wang, Yan, et al.
Published: (2024)
by: Wang, Yan, et al.
Published: (2024)
Animated Stickers: Bringing Stickers to Life with Video Diffusion
by: Yan, David, et al.
Published: (2024)
by: Yan, David, et al.
Published: (2024)
Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing
by: Chen, Xi, et al.
Published: (2026)
by: Chen, Xi, et al.
Published: (2026)
PhysioSync: Temporal and Cross-Modal Contrastive Learning Inspired by Physiological Synchronization for EEG-Based Emotion Recognition
by: Cui, Kai, et al.
Published: (2025)
by: Cui, Kai, et al.
Published: (2025)
CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition
by: Zheng, Jinzhi, et al.
Published: (2024)
by: Zheng, Jinzhi, et al.
Published: (2024)
GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker Detection
by: Wang, Yu, et al.
Published: (2025)
by: Wang, Yu, et al.
Published: (2025)
GSE: Evaluating Sticker Visual Semantic Similarity via a General Sticker Encoder
by: Chee, Heng Er Metilda, et al.
Published: (2025)
by: Chee, Heng Er Metilda, et al.
Published: (2025)
AMGFormer: Adaptive Multi-Granular Transformer for Brain Tumor Segmentation with Missing Modalities
by: Guo, Chengxiang, et al.
Published: (2026)
by: Guo, Chengxiang, et al.
Published: (2026)
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
by: Praveen, R. Gnana, et al.
Published: (2024)
by: Praveen, R. Gnana, et al.
Published: (2024)
Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion
by: Shi, Yi, et al.
Published: (2025)
by: Shi, Yi, et al.
Published: (2025)
Revisiting Cross-Architecture Distillation: Adaptive Dual-Teacher Transfer for Lightweight Video Models
by: Peng, Ying, et al.
Published: (2025)
by: Peng, Ying, et al.
Published: (2025)
Dynamic Modality-Camera Invariant Clustering for Unsupervised Visible-Infrared Person Re-identification
by: Yang, Yiming, et al.
Published: (2024)
by: Yang, Yiming, et al.
Published: (2024)
Cross-Modal Consistency Learning for Sign Language Recognition
by: Wu, Kepeng, et al.
Published: (2025)
by: Wu, Kepeng, et al.
Published: (2025)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
by: Chen, Yingfa, et al.
Published: (2024)
by: Chen, Yingfa, et al.
Published: (2024)
TACFN: Transformer-based Adaptive Cross-modal Fusion Network for Multimodal Emotion Recognition
by: Liu, Feng, et al.
Published: (2025)
by: Liu, Feng, et al.
Published: (2025)
Decoupled Hierarchical Distillation for Multimodal Emotion Recognition
by: Li, Yong, et al.
Published: (2026)
by: Li, Yong, et al.
Published: (2026)
MM-DETR: An Efficient Multimodal Detection Transformer with Mamba-Driven Dual-Granularity Fusion and Frequency-Aware Modality Adapters
by: Han, Jianhong, et al.
Published: (2025)
by: Han, Jianhong, et al.
Published: (2025)
Adaptive Physical-Facial Representation Fusion via Subject-Invariant Cross-Modal Prompt Tuning for Video-Based Emotion Recognition
by: Luo, Xiwen, et al.
Published: (2026)
by: Luo, Xiwen, et al.
Published: (2026)
LiGAR: LiDAR-Guided Hierarchical Transformer for Multi-Modal Group Activity Recognition
by: Chappa, Naga Venkata Sai Raviteja, et al.
Published: (2024)
by: Chappa, Naga Venkata Sai Raviteja, et al.
Published: (2024)
A Multimodal Fusion Network For Student Emotion Recognition Based on Transformer and Tensor Product
by: Xiang, Ao, et al.
Published: (2024)
by: Xiang, Ao, et al.
Published: (2024)
Towards Generalizable Deepfake Detection with Spatial-Frequency Collaborative Learning and Hierarchical Cross-Modal Fusion
by: Qiao, Mengyu, et al.
Published: (2025)
by: Qiao, Mengyu, et al.
Published: (2025)
Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
by: Zhou, Ziheng, et al.
Published: (2024)
by: Zhou, Ziheng, et al.
Published: (2024)
Contrastive Learning-Driven Traffic Sign Perception: Multi-Modal Fusion of Text and Vision
by: Lu, Qiang, et al.
Published: (2025)
by: Lu, Qiang, et al.
Published: (2025)
AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries
by: Zhang, Zhen, et al.
Published: (2026)
by: Zhang, Zhen, et al.
Published: (2026)
Inconsistency-Aware Cross-Attention for Audio-Visual Fusion in Dimensional Emotion Recognition
by: Rajasekhar, G, et al.
Published: (2024)
by: Rajasekhar, G, et al.
Published: (2024)
GroundingSuite: Measuring Complex Multi-Granular Pixel Grounding
by: Hu, Rui, et al.
Published: (2025)
by: Hu, Rui, et al.
Published: (2025)
MoChat: Joints-Grouped Spatio-Temporal Grounding LLM for Multi-Turn Motion Comprehension and Description
by: Mo, Jiawei, et al.
Published: (2024)
by: Mo, Jiawei, et al.
Published: (2024)
P$^2$HCT: Plug-and-Play Hierarchical C2F Transformer for Multi-Scale Feature Fusion
by: Hu, Junyi, et al.
Published: (2025)
by: Hu, Junyi, et al.
Published: (2025)
HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
by: Zhang, Jianke, et al.
Published: (2024)
by: Zhang, Jianke, et al.
Published: (2024)
Beyond Realism: Learning the Art of Expressive Composition with StickerNet
by: Lu, Haoming, et al.
Published: (2025)
by: Lu, Haoming, et al.
Published: (2025)
Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark
by: Hu, Jinpeng, et al.
Published: (2025)
by: Hu, Jinpeng, et al.
Published: (2025)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
by: Liu, Tengfei, et al.
Published: (2024)
by: Liu, Tengfei, et al.
Published: (2024)
Emotion Recognition Using Transformers with Masked Learning
by: Min, Seongjae, et al.
Published: (2024)
by: Min, Seongjae, et al.
Published: (2024)
Dynamic Contrastive Learning for Hierarchical Retrieval: A Case Study of Distance-Aware Cross-View Geo-Localization
by: Zhang, Suofei, et al.
Published: (2025)
by: Zhang, Suofei, et al.
Published: (2025)
Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition
by: Shang, Tianyi, et al.
Published: (2025)
by: Shang, Tianyi, et al.
Published: (2025)
Similar Items
-
Towards Stable Cross-Domain Depression Recognition under Missing Modalities
by: Chen, Jiuyi, et al.
Published: (2025) -
Emotion Recognition from Skeleton Data: A Comprehensive Survey
by: Lu, Haifeng, et al.
Published: (2025) -
ECMF: Enhanced Cross-Modal Fusion for Multimodal Emotion Recognition in MER-SEMI Challenge
by: Hu, Juewen, et al.
Published: (2025) -
Infrared Adversarial Car Stickers
by: Zhu, Xiaopei, et al.
Published: (2024) -
Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning
by: Zhu, Yinglian, et al.
Published: (2025)