MCIHN: A Hybrid Network Model Based on Multi-path Cross-modal Interaction for Multimodal Emotion Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Haoyang, Yang, Zhou, Sun, Ke, Pang, Yucai, Xu, Guoliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-modal Speech Emotion Recognition via Feature Distribution Adaptation Network
por: Li, Shaokai, et al.
Publicado: (2024)
por: Li, Shaokai, et al.
Publicado: (2024)
SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition
por: Huang, Shunyu, et al.
Publicado: (2026)
por: Huang, Shunyu, et al.
Publicado: (2026)
GPT-4V with Emotion: A Zero-shot Benchmark for Generalized Emotion Recognition
por: Lian, Zheng, et al.
Publicado: (2023)
por: Lian, Zheng, et al.
Publicado: (2023)
EALD-MLLM: Emotion Analysis in Long-sequential and De-identity videos with Multi-modal Large Language Model
por: Li, Deng, et al.
Publicado: (2024)
por: Li, Deng, et al.
Publicado: (2024)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
por: Chow, Wei, et al.
Publicado: (2024)
por: Chow, Wei, et al.
Publicado: (2024)
Towards Robust and Realible Multimodal Misinformation Recognition with Incomplete Modality
por: Zhou, Hengyang, et al.
Publicado: (2025)
por: Zhou, Hengyang, et al.
Publicado: (2025)
MicroEmo: Time-Sensitive Multimodal Emotion Recognition with Micro-Expression Dynamics in Video Dialogues
por: Zhang, Liyun
Publicado: (2024)
por: Zhang, Liyun
Publicado: (2024)
Deep Reversible Consistency Learning for Cross-modal Retrieval
por: Pu, Ruitao, et al.
Publicado: (2025)
por: Pu, Ruitao, et al.
Publicado: (2025)
MAVEN: Multi-modal Attention for Valence-Arousal Emotion Network
por: Ahire, Vrushank, et al.
Publicado: (2025)
por: Ahire, Vrushank, et al.
Publicado: (2025)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
por: Tang, Hao, et al.
Publicado: (2026)
por: Tang, Hao, et al.
Publicado: (2026)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
por: Sun, Yanpeng, et al.
Publicado: (2024)
por: Sun, Yanpeng, et al.
Publicado: (2024)
Balanced Multi-modal Federated Learning via Cross-Modal Infiltration
por: Fan, Yunfeng, et al.
Publicado: (2023)
por: Fan, Yunfeng, et al.
Publicado: (2023)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
por: Hu, Xiaowan, et al.
Publicado: (2024)
por: Hu, Xiaowan, et al.
Publicado: (2024)
Calibrating Multimodal Consensus for Emotion Recognition
por: Zhong, Guowei, et al.
Publicado: (2025)
por: Zhong, Guowei, et al.
Publicado: (2025)
Detached and Interactive Multimodal Learning
por: Fan, Yunfeng, et al.
Publicado: (2024)
por: Fan, Yunfeng, et al.
Publicado: (2024)
Quantifying and Enhancing Multi-modal Robustness with Modality Preference
por: Yang, Zequn, et al.
Publicado: (2024)
por: Yang, Zequn, et al.
Publicado: (2024)
Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer
por: Zhang, Zhihao, et al.
Publicado: (2023)
por: Zhang, Zhihao, et al.
Publicado: (2023)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Joint Explicit and Implicit Cross-Modal Interaction Network for Anterior Chamber Inflammation Diagnosis
por: Shao, Qian, et al.
Publicado: (2023)
por: Shao, Qian, et al.
Publicado: (2023)
Grounded Chain-of-Thought for Multimodal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2025)
por: Wu, Qiong, et al.
Publicado: (2025)
DepthGait: Multi-Scale Cross-Level Feature Fusion of RGB-Derived Depth and Silhouette Sequences for Robust Gait Recognition
por: Li, Xinzhu, et al.
Publicado: (2025)
por: Li, Xinzhu, et al.
Publicado: (2025)
XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning
por: Zhang, Hanwen, et al.
Publicado: (2026)
por: Zhang, Hanwen, et al.
Publicado: (2026)
MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding
por: Liu, Chang, et al.
Publicado: (2025)
por: Liu, Chang, et al.
Publicado: (2025)
ReFiNe: Recursive Field Networks for Cross-modal Multi-scene Representation
por: Zakharov, Sergey, et al.
Publicado: (2024)
por: Zakharov, Sergey, et al.
Publicado: (2024)
Visual Grounding with Multi-modal Conditional Adaptation
por: Yao, Ruilin, et al.
Publicado: (2024)
por: Yao, Ruilin, et al.
Publicado: (2024)
Mitigating Cross-modal Representation Bias for Multicultural Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
por: Li, Qifei, et al.
Publicado: (2024)
por: Li, Qifei, et al.
Publicado: (2024)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
por: Li, Zeju, et al.
Publicado: (2024)
por: Li, Zeju, et al.
Publicado: (2024)
Universally Unfiltered and Unseen:Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards
por: Yan, Song, et al.
Publicado: (2025)
por: Yan, Song, et al.
Publicado: (2025)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
por: Zhao, Pengcheng, et al.
Publicado: (2024)
por: Zhao, Pengcheng, et al.
Publicado: (2024)
GSSF: Generalized Structural Sparse Function for Deep Cross-modal Metric Learning
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
HybridMQA: Exploring Geometry-Texture Interactions for Colored Mesh Quality Assessment
por: Sarvestani, Armin Shafiee, et al.
Publicado: (2024)
por: Sarvestani, Armin Shafiee, et al.
Publicado: (2024)
MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization
por: Fernandez-Lopez, Adriana, et al.
Publicado: (2024)
por: Fernandez-Lopez, Adriana, et al.
Publicado: (2024)
Towards Training-free Multimodal Hate Localisation with Large Language Models
por: Sun, Yueming, et al.
Publicado: (2026)
por: Sun, Yueming, et al.
Publicado: (2026)
Multi-scale Bottleneck Transformer for Weakly Supervised Multimodal Violence Detection
por: Sun, Shengyang, et al.
Publicado: (2024)
por: Sun, Shengyang, et al.
Publicado: (2024)
Dynamic Self-adaptive Multiscale Distillation from Pre-trained Multimodal Large Model for Efficient Cross-modal Representation Learning
por: Liang, Zhengyang, et al.
Publicado: (2024)
por: Liang, Zhengyang, et al.
Publicado: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
por: Xu, Yifang, et al.
Publicado: (2025)
por: Xu, Yifang, et al.
Publicado: (2025)
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
por: Ding, Peng, et al.
Publicado: (2024)
por: Ding, Peng, et al.
Publicado: (2024)
Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation
por: Zhu, Lingsi, et al.
Publicado: (2026)
por: Zhu, Lingsi, et al.
Publicado: (2026)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
por: Tang, Yolo Yunlong, et al.
Publicado: (2022)
por: Tang, Yolo Yunlong, et al.
Publicado: (2022)
Ejemplares similares
-
Multi-modal Speech Emotion Recognition via Feature Distribution Adaptation Network
por: Li, Shaokai, et al.
Publicado: (2024) -
SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition
por: Huang, Shunyu, et al.
Publicado: (2026) -
GPT-4V with Emotion: A Zero-shot Benchmark for Generalized Emotion Recognition
por: Lian, Zheng, et al.
Publicado: (2023) -
EALD-MLLM: Emotion Analysis in Long-sequential and De-identity videos with Multi-modal Large Language Model
por: Li, Deng, et al.
Publicado: (2024) -
Unified Generative and Discriminative Training for Multi-modal Large Language Models
por: Chow, Wei, et al.
Publicado: (2024)