GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker Detection
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Yu, Ha, Juhyung, Ramirez, Frangil M., Wang, Yuchen, Crandall, David J. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EgoVIS@CVPR: PAIR-Net: Enhancing Egocentric Speaker Detection via Pretrained Audio-Visual Fusion and Alignment Loss
by: Wang, Yu, et al.
Published: (2025)
by: Wang, Yu, et al.
Published: (2025)
EgoVIS@CVPR: What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning
by: Kung, Chi-Hsi, et al.
Published: (2025)
by: Kung, Chi-Hsi, et al.
Published: (2025)
What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning
by: Kung, Chi-Hsi, et al.
Published: (2025)
by: Kung, Chi-Hsi, et al.
Published: (2025)
CGF-DETR: Cross-Gated Fusion DETR for Enhanced Pneumonia Detection in Chest X-rays
by: Wu, Yefeng, et al.
Published: (2025)
by: Wu, Yefeng, et al.
Published: (2025)
A solution to generalized learning from small training sets found in infant repeated visual experiences of individual objects
by: Ramirez, Frangil, et al.
Published: (2025)
by: Ramirez, Frangil, et al.
Published: (2025)
GatedCLIP: Gated Multimodal Fusion for Hateful Memes Detection
by: Guo, Yingying, et al.
Published: (2026)
by: Guo, Yingying, et al.
Published: (2026)
LoCoNet: Long-Short Context Network for Active Speaker Detection
by: Wang, Xizi, et al.
Published: (2023)
by: Wang, Xizi, et al.
Published: (2023)
BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
by: Xiang, Sike, et al.
Published: (2025)
by: Xiang, Sike, et al.
Published: (2025)
SphereFusion: Efficient Panorama Depth Estimation via Gated Fusion
by: Yan, Qingsong, et al.
Published: (2025)
by: Yan, Qingsong, et al.
Published: (2025)
Towards Generalizable Deepfake Detection with Spatial-Frequency Collaborative Learning and Hierarchical Cross-Modal Fusion
by: Qiao, Mengyu, et al.
Published: (2025)
by: Qiao, Mengyu, et al.
Published: (2025)
Co-AttenDWG: Co-Attentive Dimension-Wise Gating and Expert Fusion for Multi-Modal Offensive Content Detection
by: Hossain, Md. Mithun, et al.
Published: (2025)
by: Hossain, Md. Mithun, et al.
Published: (2025)
Frequency-Aware Semantic Fusion with Gated Injection for AI-generated Image Detection
by: Zhou, Shuchang, et al.
Published: (2026)
by: Zhou, Shuchang, et al.
Published: (2026)
Architecture-Agnostic Modality-Isolated Gated Fusion for Robust Multi-Modal Prostate MRI Segmentation
by: Shu, Yongbo, et al.
Published: (2026)
by: Shu, Yongbo, et al.
Published: (2026)
CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection
by: Wu, Yuchen, et al.
Published: (2026)
by: Wu, Yuchen, et al.
Published: (2026)
VGGT-Occ: Geometry-Grounded and Density-Aware Gated Fusion for 3D Occupancy Prediction
by: Chen, Xun, et al.
Published: (2026)
by: Chen, Xun, et al.
Published: (2026)
GPF-Net: Gated Progressive Fusion Learning for Polyp Re-Identification
by: Xiang, Suncheng, et al.
Published: (2025)
by: Xiang, Suncheng, et al.
Published: (2025)
Multi-resolution Guided 3D GANs for Medical Image Translation
by: Ha, Juhyung, et al.
Published: (2024)
by: Ha, Juhyung, et al.
Published: (2024)
Beyond Simple Fusion: Adaptive Gated Fusion for Robust Multimodal Sentiment Analysis
by: Wu, Han, et al.
Published: (2025)
by: Wu, Han, et al.
Published: (2025)
Pyramidal Adaptive Cross-Gating for Multimodal Detection
by: Gu, Zidong, et al.
Published: (2025)
by: Gu, Zidong, et al.
Published: (2025)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
by: Chen, Jian, et al.
Published: (2025)
by: Chen, Jian, et al.
Published: (2025)
BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation
by: Tong, Huanyang, et al.
Published: (2026)
by: Tong, Huanyang, et al.
Published: (2026)
Enriching Knowledge Distillation with Cross-Modal Teacher Fusion
by: Mansourian, Amir M., et al.
Published: (2025)
by: Mansourian, Amir M., et al.
Published: (2025)
PromptGate Client Adaptive Vision Language Gating for Open Set Federated Active Learning
by: Nesturi, Adea, et al.
Published: (2026)
by: Nesturi, Adea, et al.
Published: (2026)
MambaLiteUNet: Cross-Gated Adaptive Feature Fusion for Robust Skin Lesion Segmentation
by: Rahman, Md Maklachur, et al.
Published: (2026)
by: Rahman, Md Maklachur, et al.
Published: (2026)
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
by: Wang, Yi, et al.
Published: (2026)
by: Wang, Yi, et al.
Published: (2026)
Cross-Modal Fusion and Attention Mechanism for Weakly Supervised Video Anomaly Detection
by: Ghadiya, Ayush, et al.
Published: (2024)
by: Ghadiya, Ayush, et al.
Published: (2024)
LCD-Net: A Lightweight Remote Sensing Change Detection Network Combining Feature Fusion and Gating Mechanism
by: Liu, Wenyu, et al.
Published: (2024)
by: Liu, Wenyu, et al.
Published: (2024)
GMF-Drive: Gated Mamba Fusion with Spatial-Aware BEV Representation for End-to-End Autonomous Driving
by: Wang, Jian, et al.
Published: (2025)
by: Wang, Jian, et al.
Published: (2025)
Mask-adaptive Gated Convolution and Bi-directional Progressive Fusion Network for Depth Completion
by: Huang, Tingxuan, et al.
Published: (2024)
by: Huang, Tingxuan, et al.
Published: (2024)
Gated-Attention Feature-Fusion Based Framework for Poverty Prediction
by: Ramzan, Muhammad Umer, et al.
Published: (2024)
by: Ramzan, Muhammad Umer, et al.
Published: (2024)
MoCTEFuse: Illumination-Gated Mixture of Chiral Transformer Experts for Multi-Level Infrared and Visible Image Fusion
by: Jinfu, Li, et al.
Published: (2025)
by: Jinfu, Li, et al.
Published: (2025)
$x^2$-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space
by: Guo, Ruishan, et al.
Published: (2026)
by: Guo, Ruishan, et al.
Published: (2026)
Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection
by: Senadeera, Damith Chamalke, et al.
Published: (2025)
by: Senadeera, Damith Chamalke, et al.
Published: (2025)
Leveraging Multi-Modal Saliency and Fusion for Gaze Target Detection
by: Mathew, Athul M., et al.
Published: (2025)
by: Mathew, Athul M., et al.
Published: (2025)
Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared
by: Zhang, Yafei, et al.
Published: (2026)
by: Zhang, Yafei, et al.
Published: (2026)
PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association
by: Hannan, Abdul, et al.
Published: (2025)
by: Hannan, Abdul, et al.
Published: (2025)
Event-Adaptive State Transition and Gated Fusion for RGB-Event Object Tracking
by: You, Jinlin, et al.
Published: (2026)
by: You, Jinlin, et al.
Published: (2026)
VoxelNextFusion: A Simple, Unified and Effective Voxel Fusion Framework for Multi-Modal 3D Object Detection
by: Song, Ziying, et al.
Published: (2024)
by: Song, Ziying, et al.
Published: (2024)
A Gated Cross-domain Collaborative Network for Underwater Object Detection
by: Dai, Linhui, et al.
Published: (2023)
by: Dai, Linhui, et al.
Published: (2023)
Sequence-Based Identification of First-Person Camera Wearers in Third-Person Views
by: Zhao, Ziwei, et al.
Published: (2025)
by: Zhao, Ziwei, et al.
Published: (2025)
Similar Items
-
EgoVIS@CVPR: PAIR-Net: Enhancing Egocentric Speaker Detection via Pretrained Audio-Visual Fusion and Alignment Loss
by: Wang, Yu, et al.
Published: (2025) -
EgoVIS@CVPR: What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning
by: Kung, Chi-Hsi, et al.
Published: (2025) -
What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning
by: Kung, Chi-Hsi, et al.
Published: (2025) -
CGF-DETR: Cross-Gated Fusion DETR for Enhanced Pneumonia Detection in Chest X-rays
by: Wu, Yefeng, et al.
Published: (2025) -
A solution to generalized learning from small training sets found in infant repeated visual experiences of individual objects
by: Ramirez, Frangil, et al.
Published: (2025)