Detail-Enhanced Intra- and Inter-modal Interaction for Audio-Visual Emotion Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Tong, Ge, Xuri, Jose, Joemon M., Pugeault, Nicolas, Henderson, Paul |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hire: Hybrid-modal Interaction with Multiple Relational Enhancements for Image-Text Matching
di: Ge, Xuri, et al.
Pubblicazione: (2024)
di: Ge, Xuri, et al.
Pubblicazione: (2024)
On the Benefits of Instance Decomposition in Video Prediction Models
di: Suleyman, Eliyas, et al.
Pubblicazione: (2025)
di: Suleyman, Eliyas, et al.
Pubblicazione: (2025)
Beyond Reconstruction: A Physics Based Neural Deferred Shader for Photo-realistic Rendering
di: He, Zhuo, et al.
Pubblicazione: (2025)
di: He, Zhuo, et al.
Pubblicazione: (2025)
Generative Fields: Uncovering Hierarchical Feature Control for StyleGAN via Inverted Receptive Fields
di: He, Zhuo, et al.
Pubblicazione: (2025)
di: He, Zhuo, et al.
Pubblicazione: (2025)
Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning
di: Ge, Xuri, et al.
Pubblicazione: (2024)
di: Ge, Xuri, et al.
Pubblicazione: (2024)
Splat-Portrait: Generalizing Talking Heads with Gaussian Splatting
di: Shi, Tong, et al.
Pubblicazione: (2026)
di: Shi, Tong, et al.
Pubblicazione: (2026)
3SHNet: Boosting Image-Sentence Retrieval via Visual Semantic-Spatial Self-Highlighting
di: Ge, Xuri, et al.
Pubblicazione: (2024)
di: Ge, Xuri, et al.
Pubblicazione: (2024)
Multimodal Representation Learning Techniques for Comprehensive Facial State Analysis
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2025)
MGRR-Net: Multi-level Graph Relational Reasoning Network for Facial Action Units Detection
di: Ge, Xuri, et al.
Pubblicazione: (2022)
di: Ge, Xuri, et al.
Pubblicazione: (2022)
Flow and Depth Assisted Video Prediction with Latent Transformer
di: Suleyman, Eliyas, et al.
Pubblicazione: (2025)
di: Suleyman, Eliyas, et al.
Pubblicazione: (2025)
CFIR: Fast and Effective Long-Text To Image Retrieval for Large Corpora
di: Long, Zijun, et al.
Pubblicazione: (2024)
di: Long, Zijun, et al.
Pubblicazione: (2024)
The Bad Batches: Enhancing Self-Supervised Learning in Image Classification Through Representative Batch Curation
di: Goksu, Ozgu, et al.
Pubblicazione: (2024)
di: Goksu, Ozgu, et al.
Pubblicazione: (2024)
A Convolutional Neural Deferred Shader for Physics Based Rendering
di: He, Zhuo, et al.
Pubblicazione: (2025)
di: He, Zhuo, et al.
Pubblicazione: (2025)
Enhancing Incomplete Multi-modal Brain Tumor Segmentation with Intra-modal Asymmetry and Inter-modal Dependency
di: Liu, Weide, et al.
Pubblicazione: (2024)
di: Liu, Weide, et al.
Pubblicazione: (2024)
Enhancing Federated Quadruplet Learning: Stochastic Client Selection and Embedding Stability Analysis
di: Goksu, Ozgu, et al.
Pubblicazione: (2026)
di: Goksu, Ozgu, et al.
Pubblicazione: (2026)
Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal Regions
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
di: Zheng, Kaiwen, et al.
Pubblicazione: (2026)
IIP-Transformer: Intra-Inter-Part Transformer for Skeleton-Based Action Recognition
di: Wang, Qingtian, et al.
Pubblicazione: (2021)
di: Wang, Qingtian, et al.
Pubblicazione: (2021)
IISAN: Efficiently Adapting Multimodal Representation for Sequential Recommendation with Decoupled PEFT
di: Fu, Junchen, et al.
Pubblicazione: (2024)
di: Fu, Junchen, et al.
Pubblicazione: (2024)
FedQuad: Federated Stochastic Quadruplet Learning to Mitigate Data Heterogeneity
di: Goksu, Ozgu, et al.
Pubblicazione: (2025)
di: Goksu, Ozgu, et al.
Pubblicazione: (2025)
Hybrid-Regularized Magnitude Pruning for Robust Federated Learning under Covariate Shift
di: Goksu, Ozgu, et al.
Pubblicazione: (2024)
di: Goksu, Ozgu, et al.
Pubblicazione: (2024)
LLMPopcorn: Exploring LLMs as Assistants for Popular Micro-video Generation
di: Fu, Junchen, et al.
Pubblicazione: (2025)
di: Fu, Junchen, et al.
Pubblicazione: (2025)
I2CR: Intra- and Inter-modal Collaborative Reflections for Multimodal Entity Linking
di: Liu, Ziyan, et al.
Pubblicazione: (2025)
di: Liu, Ziyan, et al.
Pubblicazione: (2025)
Efficient and Effective Adaptation of Multimodal Foundation Models in Sequential Recommendation
di: Fu, Junchen, et al.
Pubblicazione: (2024)
di: Fu, Junchen, et al.
Pubblicazione: (2024)
Visual Prompting in LLMs for Enhancing Emotion Recognition
di: Zhang, Qixuan, et al.
Pubblicazione: (2024)
di: Zhang, Qixuan, et al.
Pubblicazione: (2024)
Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition
di: Cong, Kaixuan, et al.
Pubblicazione: (2025)
di: Cong, Kaixuan, et al.
Pubblicazione: (2025)
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
di: Yang, Qize, et al.
Pubblicazione: (2025)
di: Yang, Qize, et al.
Pubblicazione: (2025)
Inconsistency-Aware Cross-Attention for Audio-Visual Fusion in Dimensional Emotion Recognition
di: Rajasekhar, G, et al.
Pubblicazione: (2024)
di: Rajasekhar, G, et al.
Pubblicazione: (2024)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
di: Tong, Wenwen, et al.
Pubblicazione: (2025)
di: Tong, Wenwen, et al.
Pubblicazione: (2025)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
di: Li, Kai, et al.
Pubblicazione: (2023)
di: Li, Kai, et al.
Pubblicazione: (2023)
Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition
di: He, Wen-Jue, et al.
Pubblicazione: (2025)
di: He, Wen-Jue, et al.
Pubblicazione: (2025)
Jointly Modeling Inter- & Intra-Modality Dependencies for Multi-modal Learning
di: Madaan, Divyam, et al.
Pubblicazione: (2024)
di: Madaan, Divyam, et al.
Pubblicazione: (2024)
Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues
di: Fu, Junchen, et al.
Pubblicazione: (2026)
di: Fu, Junchen, et al.
Pubblicazione: (2026)
Visual and Textual Prompts in VLLMs for Enhancing Emotion Recognition
di: Wang, Zhifeng, et al.
Pubblicazione: (2025)
di: Wang, Zhifeng, et al.
Pubblicazione: (2025)
MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval
di: Ge, Xuri, et al.
Pubblicazione: (2026)
di: Ge, Xuri, et al.
Pubblicazione: (2026)
CAE-AV: Improving Audio-Visual Learning via Cross-modal Interactive Enrichment
di: Hu, Yunzuo, et al.
Pubblicazione: (2026)
di: Hu, Yunzuo, et al.
Pubblicazione: (2026)
Mamba-Enhanced Text-Audio-Video Alignment Network for Emotion Recognition in Conversations
di: Li, Xinran, et al.
Pubblicazione: (2024)
di: Li, Xinran, et al.
Pubblicazione: (2024)
Modeling 3D Pedestrian-Vehicle Interactions for Vehicle-Conditioned Pose Forecasting
di: Zhu, Guangxun, et al.
Pubblicazione: (2026)
di: Zhu, Guangxun, et al.
Pubblicazione: (2026)
MEJO: MLLM-Engaged Surgical Triplet Recognition via Inter- and Intra-Task Joint Optimization
di: Zhang, Yiyi, et al.
Pubblicazione: (2025)
di: Zhang, Yiyi, et al.
Pubblicazione: (2025)
Cross-Attention is Not Always Needed: Dynamic Cross-Attention for Audio-Visual Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
M2I2HA: Multi-modal Object Detection Based on Intra- and Inter-Modal Hypergraph Attention
di: Yang, Xiaofan, et al.
Pubblicazione: (2026)
di: Yang, Xiaofan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Hire: Hybrid-modal Interaction with Multiple Relational Enhancements for Image-Text Matching
di: Ge, Xuri, et al.
Pubblicazione: (2024) -
On the Benefits of Instance Decomposition in Video Prediction Models
di: Suleyman, Eliyas, et al.
Pubblicazione: (2025) -
Beyond Reconstruction: A Physics Based Neural Deferred Shader for Photo-realistic Rendering
di: He, Zhuo, et al.
Pubblicazione: (2025) -
Generative Fields: Uncovering Hierarchical Feature Control for StyleGAN via Inverted Receptive Fields
di: He, Zhuo, et al.
Pubblicazione: (2025) -
Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning
di: Ge, Xuri, et al.
Pubblicazione: (2024)