Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhuang, Weijun, Huang, Yuqing, Meng, Weikang, Li, Xin, Liu, Ming, Hong, Xiaopeng, Wang, Yaowei, Zuo, Wangmeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
di: Zhuang, Weijun, et al.
Pubblicazione: (2025)
di: Zhuang, Weijun, et al.
Pubblicazione: (2025)
Drift-Resilient Temporal Priors for Visual Tracking
di: Huang, Yuqing, et al.
Pubblicazione: (2026)
di: Huang, Yuqing, et al.
Pubblicazione: (2026)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver
di: Chen, Yuqing, et al.
Pubblicazione: (2026)
di: Chen, Yuqing, et al.
Pubblicazione: (2026)
Multi-modal Crowd Counting via a Broker Modality
di: Meng, Haoliang, et al.
Pubblicazione: (2024)
di: Meng, Haoliang, et al.
Pubblicazione: (2024)
Language-Guided Graph Representation Learning for Video Summarization
di: Li, Wenrui, et al.
Pubblicazione: (2025)
di: Li, Wenrui, et al.
Pubblicazione: (2025)
Reshaping the Online Data Buffering and Organizing Mechanism for Continual Test-Time Adaptation
di: Zhu, Zhilin, et al.
Pubblicazione: (2024)
di: Zhu, Zhilin, et al.
Pubblicazione: (2024)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
di: Gao, Shida, et al.
Pubblicazione: (2025)
di: Gao, Shida, et al.
Pubblicazione: (2025)
Context-Guided Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
GLAD: Towards Better Reconstruction with Global and Local Adaptive Diffusion Models for Unsupervised Anomaly Detection
di: Yao, Hang, et al.
Pubblicazione: (2024)
di: Yao, Hang, et al.
Pubblicazione: (2024)
MaskControl: Spatio-Temporal Control for Masked Motion Synthesis
di: Pinyoanuntapong, Ekkasit, et al.
Pubblicazione: (2024)
di: Pinyoanuntapong, Ekkasit, et al.
Pubblicazione: (2024)
Lie Flow: Video Dynamic Fields Modeling and Predicting with Lie Algebra as Geometric Physics Principle
di: Qiao, Weidong, et al.
Pubblicazione: (2026)
di: Qiao, Weidong, et al.
Pubblicazione: (2026)
Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction
di: Chen, Jun, et al.
Pubblicazione: (2022)
di: Chen, Jun, et al.
Pubblicazione: (2022)
All-in-One Video Restoration under Smoothly Evolving Unknown Weather Degradations
di: Li, Wenrui, et al.
Pubblicazione: (2026)
di: Li, Wenrui, et al.
Pubblicazione: (2026)
Towards Long-Form Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2026)
di: Gu, Xin, et al.
Pubblicazione: (2026)
Beyond Boxes: Mask-Guided Spatio-Temporal Feature Aggregation for Video Object Detection
di: Hashmi, Khurram Azeem, et al.
Pubblicazione: (2024)
di: Hashmi, Khurram Azeem, et al.
Pubblicazione: (2024)
Penny-Wise and Pound-Foolish in Deepfake Detection
di: Wang, Yabin, et al.
Pubblicazione: (2024)
di: Wang, Yabin, et al.
Pubblicazione: (2024)
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
di: Lin, Xinying, et al.
Pubblicazione: (2026)
di: Lin, Xinying, et al.
Pubblicazione: (2026)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
MAL: Cluster-Masked and Multi-Task Pretraining for Enhanced xLSTM Vision Performance
di: Huang, Wenjun, et al.
Pubblicazione: (2024)
di: Huang, Wenjun, et al.
Pubblicazione: (2024)
STGV: Spatio-Temporal Hash Encoding for Gaussian-based Video Representation
di: Lin, Jierun, et al.
Pubblicazione: (2026)
di: Lin, Jierun, et al.
Pubblicazione: (2026)
Video-Language Alignment via Spatio-Temporal Graph Transformer
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
MR-GDINO: Efficient Open-World Continual Object Detection
di: Dong, Bowen, et al.
Pubblicazione: (2024)
di: Dong, Bowen, et al.
Pubblicazione: (2024)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
di: Yao, Jiali, et al.
Pubblicazione: (2025)
di: Yao, Jiali, et al.
Pubblicazione: (2025)
RTracker: Recoverable Tracking via PN Tree Structured Memory
di: Huang, Yuqing, et al.
Pubblicazione: (2024)
di: Huang, Yuqing, et al.
Pubblicazione: (2024)
Soften the Mask: Adaptive Temporal Soft Mask for Efficient Dynamic Facial Expression Recognition
di: Li, Meng-zhu, et al.
Pubblicazione: (2025)
di: Li, Meng-zhu, et al.
Pubblicazione: (2025)
Spatio-Temporal Correlation Guided Geometric Partitioning for Versatile Video Coding
di: Meng, Xuewei, et al.
Pubblicazione: (2026)
di: Meng, Xuewei, et al.
Pubblicazione: (2026)
LPT++: Efficient Training on Mixture of Long-tailed Experts
di: Dong, Bowen, et al.
Pubblicazione: (2024)
di: Dong, Bowen, et al.
Pubblicazione: (2024)
Efficient Vision-Language Pre-training by Cluster Masking
di: Wei, Zihao, et al.
Pubblicazione: (2024)
di: Wei, Zihao, et al.
Pubblicazione: (2024)
Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2025)
di: Li, Wenrui, et al.
Pubblicazione: (2025)
RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming
di: Chu, Jisheng, et al.
Pubblicazione: (2026)
di: Chu, Jisheng, et al.
Pubblicazione: (2026)
Few-Shot Video Object Segmentation in X-Ray Angiography Using Local Matching and Spatio-Temporal Consistency Loss
di: Xi, Lin, et al.
Pubblicazione: (2026)
di: Xi, Lin, et al.
Pubblicazione: (2026)
SelfHVD: Self-Supervised Handheld Video Deblurring
di: Xu, Honglei, et al.
Pubblicazione: (2025)
di: Xu, Honglei, et al.
Pubblicazione: (2025)
LoViC: Efficient Long Video Generation with Context Compression
di: Jiang, Jiaxiu, et al.
Pubblicazione: (2025)
di: Jiang, Jiaxiu, et al.
Pubblicazione: (2025)
Generative Inbetweening through Frame-wise Conditions-Driven Video Generation
di: Zhu, Tianyi, et al.
Pubblicazione: (2024)
di: Zhu, Tianyi, et al.
Pubblicazione: (2024)
GLaVE-Cap: Global-Local Aligned Video Captioning with Vision Expert Integration
di: Xu, Wan, et al.
Pubblicazione: (2025)
di: Xu, Wan, et al.
Pubblicazione: (2025)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
di: Zhuang, Weijun, et al.
Pubblicazione: (2025) -
Drift-Resilient Temporal Priors for Visual Tracking
di: Huang, Yuqing, et al.
Pubblicazione: (2026) -
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
di: Zhou, Zikun, et al.
Pubblicazione: (2024) -
GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver
di: Chen, Yuqing, et al.
Pubblicazione: (2026) -
Multi-modal Crowd Counting via a Broker Modality
di: Meng, Haoliang, et al.
Pubblicazione: (2024)