MultiFuser: Multimodal Fusion Transformer for Enhanced Driver Action Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Ruoyu, Wang, Wenqian, Gao, Jianjun, Lin, Dan, Yap, Kim-Hui, Li, Bingbing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CM2-Net: Continual Cross-Modal Mapping Network for Driver Action Recognition
por: Wang, Ruoyu, et al.
Publicado: (2024)
por: Wang, Ruoyu, et al.
Publicado: (2024)
DAOS: A Multimodal In-cabin Behavior Monitoring with Driver Action-Object Synergy Dataset
por: Li, Yiming, et al.
Publicado: (2026)
por: Li, Yiming, et al.
Publicado: (2026)
Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition
por: Liu, Tianyi, et al.
Publicado: (2026)
por: Liu, Tianyi, et al.
Publicado: (2026)
Open World Object Detection: A Survey
por: Li, Yiming, et al.
Publicado: (2024)
por: Li, Yiming, et al.
Publicado: (2024)
Multi-modality action recognition based on dual feature shift in vehicle cabin monitoring
por: Lin, Dan, et al.
Publicado: (2024)
por: Lin, Dan, et al.
Publicado: (2024)
MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving
por: Duan, Yiqun, et al.
Publicado: (2024)
por: Duan, Yiqun, et al.
Publicado: (2024)
MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding
por: Cao, Yue, et al.
Publicado: (2024)
por: Cao, Yue, et al.
Publicado: (2024)
TDS-CLIP: Temporal Difference Side Network for Efficient VideoAction Recognition
por: Wang, Bin, et al.
Publicado: (2024)
por: Wang, Bin, et al.
Publicado: (2024)
OccluTrack: Rethinking Awareness of Occlusion for Enhancing Multiple Pedestrian Tracking
por: Gao, Jianjun, et al.
Publicado: (2023)
por: Gao, Jianjun, et al.
Publicado: (2023)
Transformer-based Fusion of 2D-pose and Spatio-temporal Embeddings for Distracted Driver Action Recognition
por: Akdag, Erkut, et al.
Publicado: (2024)
por: Akdag, Erkut, et al.
Publicado: (2024)
InterFuserDVS: Event-Enhanced Sensor Fusion for Safe RL-Based Decision Making
por: Sakhaia, Mustafa, et al.
Publicado: (2026)
por: Sakhaia, Mustafa, et al.
Publicado: (2026)
CL-HOI: Cross-Level Human-Object Interaction Distillation from Vision Large Language Models
por: Gao, Jianjun, et al.
Publicado: (2024)
por: Gao, Jianjun, et al.
Publicado: (2024)
MALT: Multi-scale Action Learning Transformer for Online Action Detection
por: Yang, Zhipeng, et al.
Publicado: (2024)
por: Yang, Zhipeng, et al.
Publicado: (2024)
A$^2$M$^2$-Net: Adaptively Aligned Multi-Scale Moment for Few-Shot Action Recognition
por: Gao, Zilin, et al.
Publicado: (2025)
por: Gao, Zilin, et al.
Publicado: (2025)
StainFuser: Controlling Diffusion for Faster Neural Style Transfer in Multi-Gigapixel Histology Images
por: Jewsbury, Robert, et al.
Publicado: (2024)
por: Jewsbury, Robert, et al.
Publicado: (2024)
SSH-Net: A Self-Supervised and Hybrid Network for Noisy Image Watermark Removal
por: Liu, Wenyang, et al.
Publicado: (2025)
por: Liu, Wenyang, et al.
Publicado: (2025)
Multi-Task Learning for Fatigue Detection and Face Recognition of Drivers via Tree-Style Space-Channel Attention Fusion Network
por: Qu, Shulei, et al.
Publicado: (2024)
por: Qu, Shulei, et al.
Publicado: (2024)
A Structure-aware and Motion-adaptive Framework for 3D Human Pose Estimation with Mamba
por: Lu, Ye, et al.
Publicado: (2025)
por: Lu, Ye, et al.
Publicado: (2025)
MM-Gesture: Towards Precise Micro-Gesture Recognition through Multimodal Fusion
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
por: Li, Qifei, et al.
Publicado: (2024)
por: Li, Qifei, et al.
Publicado: (2024)
Phantom-Insight: Adaptive Multi-cue Fusion for Video Camouflaged Object Detection with Multimodal LLM
por: Zhang, Hua, et al.
Publicado: (2025)
por: Zhang, Hua, et al.
Publicado: (2025)
MultiTSF: Transformer-based Sensor Fusion for Human-Centric Multi-view and Multi-modal Action Recognition
por: Nguyen, Trung Thanh, et al.
Publicado: (2025)
por: Nguyen, Trung Thanh, et al.
Publicado: (2025)
Towards Adaptive Fusion of Multimodal Deep Networks for Human Action Recognition
por: Yudistira, Novanto
Publicado: (2025)
por: Yudistira, Novanto
Publicado: (2025)
ARN-LSTM: A Multi-Stream Fusion Model for Skeleton-based Action Recognition
por: Wang, Chuanchuan, et al.
Publicado: (2024)
por: Wang, Chuanchuan, et al.
Publicado: (2024)
A Multimodal Fusion Network For Student Emotion Recognition Based on Transformer and Tensor Product
por: Xiang, Ao, et al.
Publicado: (2024)
por: Xiang, Ao, et al.
Publicado: (2024)
Video sentence grounding with temporally global textual knowledge
por: Chen, Cai, et al.
Publicado: (2024)
por: Chen, Cai, et al.
Publicado: (2024)
From Semantics, Scene to Instance-awareness: Distilling Foundation Model for Grounded Open-vocabulary Situation Recognition
por: Cai, Chen, et al.
Publicado: (2025)
por: Cai, Chen, et al.
Publicado: (2025)
PromptSR: Cascade Prompting for Lightweight Image Super-Resolution
por: Liu, Wenyang, et al.
Publicado: (2025)
por: Liu, Wenyang, et al.
Publicado: (2025)
Multi-view Distillation based on Multi-modal Fusion for Few-shot Action Recognition(CLIP-$\mathrm{M^2}$DF)
por: Guo, Fei, et al.
Publicado: (2024)
por: Guo, Fei, et al.
Publicado: (2024)
Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs
por: Xing, Jiazheng, et al.
Publicado: (2026)
por: Xing, Jiazheng, et al.
Publicado: (2026)
MultiSensor-Home: A Wide-area Multi-modal Multi-view Dataset for Action Recognition and Transformer-based Sensor Fusion
por: Nguyen, Trung Thanh, et al.
Publicado: (2025)
por: Nguyen, Trung Thanh, et al.
Publicado: (2025)
An Effective End-to-End Solution for Multimodal Action Recognition
por: Wang, Songping, et al.
Publicado: (2025)
por: Wang, Songping, et al.
Publicado: (2025)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
por: Wang, Mengmeng, et al.
Publicado: (2024)
por: Wang, Mengmeng, et al.
Publicado: (2024)
SkateFormer: Skeletal-Temporal Transformer for Human Action Recognition
por: Do, Jeonghyeok, et al.
Publicado: (2024)
por: Do, Jeonghyeok, et al.
Publicado: (2024)
Knowledge-Enhanced Facial Expression Recognition with Emotional-to-Neutral Transformation
por: Li, Hangyu, et al.
Publicado: (2024)
por: Li, Hangyu, et al.
Publicado: (2024)
EraW-Net: Enhance-Refine-Align W-Net for Scene-Associated Driver Attention Estimation
por: Zhou, Jun, et al.
Publicado: (2024)
por: Zhou, Jun, et al.
Publicado: (2024)
SNN-Driven Multimodal Human Action Recognition via Sparse Spatial-Temporal Data Fusion
por: Zheng, Naichuan, et al.
Publicado: (2025)
por: Zheng, Naichuan, et al.
Publicado: (2025)
Human-Centric Transformer for Domain Adaptive Action Recognition
por: Lin, Kun-Yu, et al.
Publicado: (2024)
por: Lin, Kun-Yu, et al.
Publicado: (2024)
TACFN: Transformer-based Adaptive Cross-modal Fusion Network for Multimodal Emotion Recognition
por: Liu, Feng, et al.
Publicado: (2025)
por: Liu, Feng, et al.
Publicado: (2025)
Active Multimodal Distillation for Few-shot Action Recognition
por: Feng, Weijia, et al.
Publicado: (2025)
por: Feng, Weijia, et al.
Publicado: (2025)
Ejemplares similares
-
CM2-Net: Continual Cross-Modal Mapping Network for Driver Action Recognition
por: Wang, Ruoyu, et al.
Publicado: (2024) -
DAOS: A Multimodal In-cabin Behavior Monitoring with Driver Action-Object Synergy Dataset
por: Li, Yiming, et al.
Publicado: (2026) -
Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition
por: Liu, Tianyi, et al.
Publicado: (2026) -
Open World Object Detection: A Survey
por: Li, Yiming, et al.
Publicado: (2024) -
Multi-modality action recognition based on dual feature shift in vehicle cabin monitoring
por: Lin, Dan, et al.
Publicado: (2024)