CM2-Net: Continual Cross-Modal Mapping Network for Driver Action Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Ruoyu, Cai, Chen, Wang, Wenqian, Gao, Jianjun, Lin, Dan, Liu, Wenyang, Yap, Kim-Hui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MultiFuser: Multimodal Fusion Transformer for Enhanced Driver Action Recognition
di: Wang, Ruoyu, et al.
Pubblicazione: (2024)
di: Wang, Ruoyu, et al.
Pubblicazione: (2024)
Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
SSH-Net: A Self-Supervised and Hybrid Network for Noisy Image Watermark Removal
di: Liu, Wenyang, et al.
Pubblicazione: (2025)
di: Liu, Wenyang, et al.
Pubblicazione: (2025)
DAOS: A Multimodal In-cabin Behavior Monitoring with Driver Action-Object Synergy Dataset
di: Li, Yiming, et al.
Pubblicazione: (2026)
di: Li, Yiming, et al.
Pubblicazione: (2026)
CL-HOI: Cross-Level Human-Object Interaction Distillation from Vision Large Language Models
di: Gao, Jianjun, et al.
Pubblicazione: (2024)
di: Gao, Jianjun, et al.
Pubblicazione: (2024)
Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting
di: Cai, Chen, et al.
Pubblicazione: (2024)
di: Cai, Chen, et al.
Pubblicazione: (2024)
PromptSR: Cascade Prompting for Lightweight Image Super-Resolution
di: Liu, Wenyang, et al.
Pubblicazione: (2025)
di: Liu, Wenyang, et al.
Pubblicazione: (2025)
From Semantics, Scene to Instance-awareness: Distilling Foundation Model for Grounded Open-vocabulary Situation Recognition
di: Cai, Chen, et al.
Pubblicazione: (2025)
di: Cai, Chen, et al.
Pubblicazione: (2025)
Open World Object Detection: A Survey
di: Li, Yiming, et al.
Pubblicazione: (2024)
di: Li, Yiming, et al.
Pubblicazione: (2024)
TDS-CLIP: Temporal Difference Side Network for Efficient VideoAction Recognition
di: Wang, Bin, et al.
Pubblicazione: (2024)
di: Wang, Bin, et al.
Pubblicazione: (2024)
A Structure-aware and Motion-adaptive Framework for 3D Human Pose Estimation with Mamba
di: Lu, Ye, et al.
Pubblicazione: (2025)
di: Lu, Ye, et al.
Pubblicazione: (2025)
Body-Hand Modality Expertized Networks with Cross-attention for Fine-grained Skeleton Action Recognition
di: Cho, Seungyeon, et al.
Pubblicazione: (2025)
di: Cho, Seungyeon, et al.
Pubblicazione: (2025)
ByteNet: Rethinking Multimedia File Fragment Classification through Visual Perspectives
di: Liu, Wenyang, et al.
Pubblicazione: (2024)
di: Liu, Wenyang, et al.
Pubblicazione: (2024)
Cross-Modal Dual-Causal Learning for Long-Term Action Recognition
di: Shaowu, Xu, et al.
Pubblicazione: (2025)
di: Shaowu, Xu, et al.
Pubblicazione: (2025)
Video sentence grounding with temporally global textual knowledge
di: Chen, Cai, et al.
Pubblicazione: (2024)
di: Chen, Cai, et al.
Pubblicazione: (2024)
EraW-Net: Enhance-Refine-Align W-Net for Scene-Associated Driver Attention Estimation
di: Zhou, Jun, et al.
Pubblicazione: (2024)
di: Zhou, Jun, et al.
Pubblicazione: (2024)
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
di: Wang, Yabing, et al.
Pubblicazione: (2023)
di: Wang, Yabing, et al.
Pubblicazione: (2023)
Multi-modality action recognition based on dual feature shift in vehicle cabin monitoring
di: Lin, Dan, et al.
Pubblicazione: (2024)
di: Lin, Dan, et al.
Pubblicazione: (2024)
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
OccluTrack: Rethinking Awareness of Occlusion for Enhancing Multiple Pedestrian Tracking
di: Gao, Jianjun, et al.
Pubblicazione: (2023)
di: Gao, Jianjun, et al.
Pubblicazione: (2023)
CM-Diff: A Single Generative Network for Bidirectional Cross-Modality Translation Diffusion Model Between Infrared and Visible Images
di: Hu, Bin, et al.
Pubblicazione: (2025)
di: Hu, Bin, et al.
Pubblicazione: (2025)
Rethinking Efficient Mixture-of-Experts for Remote Sensing Modality-Missing Classification
di: Gao, Qinghao, et al.
Pubblicazione: (2025)
di: Gao, Qinghao, et al.
Pubblicazione: (2025)
BHaRNet: Reliability-Aware Body-Hand Modality Expertized Networks for Fine-grained Skeleton Action Recognition
di: Cho, Seungyeon, et al.
Pubblicazione: (2026)
di: Cho, Seungyeon, et al.
Pubblicazione: (2026)
TAMT: Temporal-Aware Model Tuning for Cross-Domain Few-Shot Action Recognition
di: Wang, Yilong, et al.
Pubblicazione: (2024)
di: Wang, Yilong, et al.
Pubblicazione: (2024)
BriMA: Bridged Modality Adaptation for Multi-Modal Continual Action Quality Assessment
di: Zhou, Kanglei, et al.
Pubblicazione: (2026)
di: Zhou, Kanglei, et al.
Pubblicazione: (2026)
Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition
di: Do, Jeonghyeok, et al.
Pubblicazione: (2024)
di: Do, Jeonghyeok, et al.
Pubblicazione: (2024)
Curriculum-Based Strategies for Efficient Cross-Domain Action Recognition
di: Kim, Emily, et al.
Pubblicazione: (2026)
di: Kim, Emily, et al.
Pubblicazione: (2026)
Explore Human Parsing Modality for Action Recognition
di: Liu, Jinfu, et al.
Pubblicazione: (2024)
di: Liu, Jinfu, et al.
Pubblicazione: (2024)
Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
MAVR-Net: Robust Multi-View Learning for MAV Action Recognition with Cross-View Attention
di: Zhang, Nengbo, et al.
Pubblicazione: (2025)
di: Zhang, Nengbo, et al.
Pubblicazione: (2025)
Semantic-Enhanced Cross-Modal Place Recognition for Robust Robot Localization
di: Lin, Yujia, et al.
Pubblicazione: (2025)
di: Lin, Yujia, et al.
Pubblicazione: (2025)
Category-Adaptive Cross-Modal Semantic Refinement and Transfer for Open-Vocabulary Multi-Label Recognition
di: Liu, Haijing, et al.
Pubblicazione: (2024)
di: Liu, Haijing, et al.
Pubblicazione: (2024)
CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition
di: Zheng, Jinzhi, et al.
Pubblicazione: (2024)
di: Zheng, Jinzhi, et al.
Pubblicazione: (2024)
High-Performance Inference Graph Convolutional Networks for Skeleton-Based Action Recognition
di: Wang, Junyi, et al.
Pubblicazione: (2023)
di: Wang, Junyi, et al.
Pubblicazione: (2023)
SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition
di: Huang, Shunyu, et al.
Pubblicazione: (2026)
di: Huang, Shunyu, et al.
Pubblicazione: (2026)
Cross-Modality Gait Recognition: Bridging LiDAR and Camera Modalities for Human Identification
di: Wang, Rui, et al.
Pubblicazione: (2024)
di: Wang, Rui, et al.
Pubblicazione: (2024)
MMGait: Towards Multi-Modal Gait Recognition
di: Wang, Chenye, et al.
Pubblicazione: (2026)
di: Wang, Chenye, et al.
Pubblicazione: (2026)
CM-Bench: A Comprehensive Cross-Modal Feature Matching Benchmark Bridging Visible and Infrared Images
di: Sun, Liangzheng, et al.
Pubblicazione: (2026)
di: Sun, Liangzheng, et al.
Pubblicazione: (2026)
GESH-Net: Graph-Enhanced Spherical Harmonic Convolutional Networks for Cortical Surface Registration
di: Zhang, Ruoyu, et al.
Pubblicazione: (2024)
di: Zhang, Ruoyu, et al.
Pubblicazione: (2024)
Continual Cross-Modal Generalization
di: Xia, Yan, et al.
Pubblicazione: (2025)
di: Xia, Yan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MultiFuser: Multimodal Fusion Transformer for Enhanced Driver Action Recognition
di: Wang, Ruoyu, et al.
Pubblicazione: (2024) -
Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition
di: Liu, Tianyi, et al.
Pubblicazione: (2026) -
SSH-Net: A Self-Supervised and Hybrid Network for Noisy Image Watermark Removal
di: Liu, Wenyang, et al.
Pubblicazione: (2025) -
DAOS: A Multimodal In-cabin Behavior Monitoring with Driver Action-Object Synergy Dataset
di: Li, Yiming, et al.
Pubblicazione: (2026) -
CL-HOI: Cross-Level Human-Object Interaction Distillation from Vision Large Language Models
di: Gao, Jianjun, et al.
Pubblicazione: (2024)