Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Xiao, Yang, Minglei, Yang, Bin, Huang, Wenke, Wang, Zheng, Xu, Xin, Ye, Mang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dual-level Modality Debiasing Learning for Unsupervised Visible-Infrared Person Re-Identification
di: Li, Jiaze, et al.
Pubblicazione: (2025)
di: Li, Jiaze, et al.
Pubblicazione: (2025)
Mix-Modality Person Re-Identification: A New and Practical Paradigm
di: Liu, Wei, et al.
Pubblicazione: (2024)
di: Liu, Wei, et al.
Pubblicazione: (2024)
LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized Knowledge in Multimodal Large Language Models
di: Liang, Jian, et al.
Pubblicazione: (2025)
di: Liang, Jian, et al.
Pubblicazione: (2025)
Exploring Temporal Event Cues for Dense Video Captioning in Cyclic Co-learning
di: Xie, Zhuyang, et al.
Pubblicazione: (2024)
di: Xie, Zhuyang, et al.
Pubblicazione: (2024)
Event-based Video Person Re-identification via Cross-Modality and Temporal Collaboration
di: Li, Renkai, et al.
Pubblicazione: (2025)
di: Li, Renkai, et al.
Pubblicazione: (2025)
Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues
di: Girmaji, Rohit, et al.
Pubblicazione: (2025)
di: Girmaji, Rohit, et al.
Pubblicazione: (2025)
FedBPrompt: Federated Domain Generalization Person Re-Identification via Body Distribution Aware Visual Prompts
di: Xu, Xin, et al.
Pubblicazione: (2026)
di: Xu, Xin, et al.
Pubblicazione: (2026)
Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model
di: Li, Peiyan, et al.
Pubblicazione: (2026)
di: Li, Peiyan, et al.
Pubblicazione: (2026)
Context-Guided Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
Towards Anytime Retrieval: A Benchmark for Anytime Person Re-Identification
di: Li, Xulin, et al.
Pubblicazione: (2025)
di: Li, Xulin, et al.
Pubblicazione: (2025)
Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
di: Guo, Xiangyu, et al.
Pubblicazione: (2025)
di: Guo, Xiangyu, et al.
Pubblicazione: (2025)
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding
di: Guo, Yanan, et al.
Pubblicazione: (2025)
di: Guo, Yanan, et al.
Pubblicazione: (2025)
SpatioTemporal Difference Network for Video Depth Super-Resolution
di: Wang, Zhengxue, et al.
Pubblicazione: (2025)
di: Wang, Zhengxue, et al.
Pubblicazione: (2025)
Video-Language Alignment via Spatio-Temporal Graph Transformer
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
UBATrack: Spatio-Temporal State Space Model for General Multi-Modal Tracking
di: Liang, Qihua, et al.
Pubblicazione: (2026)
di: Liang, Qihua, et al.
Pubblicazione: (2026)
VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion
di: Tang, Linfeng, et al.
Pubblicazione: (2025)
di: Tang, Linfeng, et al.
Pubblicazione: (2025)
Leveraging Consistent Spatio-Temporal Correspondence for Robust Visual Odometry
di: Zhang, Zhaoxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhaoxing, et al.
Pubblicazione: (2024)
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
di: Zhuang, Weijun, et al.
Pubblicazione: (2026)
di: Zhuang, Weijun, et al.
Pubblicazione: (2026)
Student Classroom Behavior Detection based on Spatio-Temporal Network and Multi-Model Fusion
di: Yang, Fan, et al.
Pubblicazione: (2023)
di: Yang, Fan, et al.
Pubblicazione: (2023)
Spatio-Temporal Attention and Gaussian Processes for Personalized Video Gaze Estimation
di: Jindal, Swati, et al.
Pubblicazione: (2024)
di: Jindal, Swati, et al.
Pubblicazione: (2024)
Towards Long-Form Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2026)
di: Gu, Xin, et al.
Pubblicazione: (2026)
MSC: Multi-Scale Spatio-Temporal Causal Attention for Autoregressive Video Diffusion
di: Xu, Xunnong, et al.
Pubblicazione: (2024)
di: Xu, Xunnong, et al.
Pubblicazione: (2024)
Resolving Spatio-Temporal Entanglement in Video Prediction via Multi-Modal Attention
di: Gupta, Shreyam, et al.
Pubblicazione: (2025)
di: Gupta, Shreyam, et al.
Pubblicazione: (2025)
Robust Pedestrian Detection with Uncertain Modality
di: Bie, Qian, et al.
Pubblicazione: (2026)
di: Bie, Qian, et al.
Pubblicazione: (2026)
Unleashing the Potential of Tracklets for Unsupervised Video Person Re-Identification
di: Meng, Nanxing, et al.
Pubblicazione: (2024)
di: Meng, Nanxing, et al.
Pubblicazione: (2024)
Deep Common Feature Mining for Efficient Video Semantic Segmentation
di: Zheng, Yaoyan, et al.
Pubblicazione: (2024)
di: Zheng, Yaoyan, et al.
Pubblicazione: (2024)
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
di: Rong, Xuankun, et al.
Pubblicazione: (2025)
di: Rong, Xuankun, et al.
Pubblicazione: (2025)
DirectEdit: Step-Level Accurate Inversion for Flow-Based Image Editing
di: Yang, Desong, et al.
Pubblicazione: (2026)
di: Yang, Desong, et al.
Pubblicazione: (2026)
Temporal Prototyping and Hierarchical Alignment for Unsupervised Video-based Visible-Infrared Person Re-Identification
di: Li, Zhiyong, et al.
Pubblicazione: (2026)
di: Li, Zhiyong, et al.
Pubblicazione: (2026)
SA-Person: Text-Based Person Retrieval with Scene-aware Re-ranking
di: Xu, Yingjia, et al.
Pubblicazione: (2025)
di: Xu, Yingjia, et al.
Pubblicazione: (2025)
DeMo: Decoupled Feature-Based Mixture of Experts for Multi-Modal Object Re-Identification
di: Wang, Yuhao, et al.
Pubblicazione: (2024)
di: Wang, Yuhao, et al.
Pubblicazione: (2024)
Compact Attention: Exploiting Structured Spatio-Temporal Sparsity for Fast Video Generation
di: Li, Qirui, et al.
Pubblicazione: (2025)
di: Li, Qirui, et al.
Pubblicazione: (2025)
Delving into Dynamic Scene Cue-Consistency for Robust 3D Multi-Object Tracking
di: Zhang, Haonan, et al.
Pubblicazione: (2025)
di: Zhang, Haonan, et al.
Pubblicazione: (2025)
CMCC-ReID: Cross-Modality Clothing-Change Person Re-Identification
di: Xu, Haoxuan, et al.
Pubblicazione: (2026)
di: Xu, Haoxuan, et al.
Pubblicazione: (2026)
Spatio-temporal Graph Learning on Adaptive Mined Key Frames for High-performance Multi-Object Tracking
di: Wang, Futian, et al.
Pubblicazione: (2025)
di: Wang, Futian, et al.
Pubblicazione: (2025)
Vectorized Video Representation with Easy Editing via Hierarchical Spatio-Temporally Consistent Proxy Embedding
di: Chen, Ye, et al.
Pubblicazione: (2025)
di: Chen, Ye, et al.
Pubblicazione: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
di: Huang, Jiehui, et al.
Pubblicazione: (2025)
di: Huang, Jiehui, et al.
Pubblicazione: (2025)
SpatioTemporal Learning for Human Pose Estimation in Sparsely-Labeled Videos
di: Jiao, Yingying, et al.
Pubblicazione: (2025)
di: Jiao, Yingying, et al.
Pubblicazione: (2025)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
di: Yao, Jiali, et al.
Pubblicazione: (2025)
di: Yao, Jiali, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Dual-level Modality Debiasing Learning for Unsupervised Visible-Infrared Person Re-Identification
di: Li, Jiaze, et al.
Pubblicazione: (2025) -
Mix-Modality Person Re-Identification: A New and Practical Paradigm
di: Liu, Wei, et al.
Pubblicazione: (2024) -
LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized Knowledge in Multimodal Large Language Models
di: Liang, Jian, et al.
Pubblicazione: (2025) -
Exploring Temporal Event Cues for Dense Video Captioning in Cyclic Co-learning
di: Xie, Zhuyang, et al.
Pubblicazione: (2024) -
Event-based Video Person Re-identification via Cross-Modality and Temporal Collaboration
di: Li, Renkai, et al.
Pubblicazione: (2025)