Saved in:
| Main Authors: | Zhuang, Weijun, Huang, Yuqing, Meng, Weikang, Li, Xin, Liu, Ming, Hong, Xiaopeng, Wang, Yaowei, Zuo, Wangmeng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2603.22953 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
by: Zhuang, Weijun, et al.
Published: (2025)
by: Zhuang, Weijun, et al.
Published: (2025)
Drift-Resilient Temporal Priors for Visual Tracking
by: Huang, Yuqing, et al.
Published: (2026)
by: Huang, Yuqing, et al.
Published: (2026)
Multi-modal Crowd Counting via a Broker Modality
by: Meng, Haoliang, et al.
Published: (2024)
by: Meng, Haoliang, et al.
Published: (2024)
GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver
by: Chen, Yuqing, et al.
Published: (2026)
by: Chen, Yuqing, et al.
Published: (2026)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
by: Zhou, Zikun, et al.
Published: (2024)
by: Zhou, Zikun, et al.
Published: (2024)
Language-Guided Graph Representation Learning for Video Summarization
by: Li, Wenrui, et al.
Published: (2025)
by: Li, Wenrui, et al.
Published: (2025)
Reshaping the Online Data Buffering and Organizing Mechanism for Continual Test-Time Adaptation
by: Zhu, Zhilin, et al.
Published: (2024)
by: Zhu, Zhilin, et al.
Published: (2024)
GLAD: Towards Better Reconstruction with Global and Local Adaptive Diffusion Models for Unsupervised Anomaly Detection
by: Yao, Hang, et al.
Published: (2024)
by: Yao, Hang, et al.
Published: (2024)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
by: Gao, Shida, et al.
Published: (2025)
by: Gao, Shida, et al.
Published: (2025)
Context-Guided Spatio-Temporal Video Grounding
by: Gu, Xin, et al.
Published: (2024)
by: Gu, Xin, et al.
Published: (2024)
All-in-One Video Restoration under Smoothly Evolving Unknown Weather Degradations
by: Li, Wenrui, et al.
Published: (2026)
by: Li, Wenrui, et al.
Published: (2026)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
by: Xu, Wenhao, et al.
Published: (2025)
by: Xu, Wenhao, et al.
Published: (2025)
Lie Flow: Video Dynamic Fields Modeling and Predicting with Lie Algebra as Geometric Physics Principle
by: Qiao, Weidong, et al.
Published: (2026)
by: Qiao, Weidong, et al.
Published: (2026)
Penny-Wise and Pound-Foolish in Deepfake Detection
by: Wang, Yabin, et al.
Published: (2024)
by: Wang, Yabin, et al.
Published: (2024)
MaskControl: Spatio-Temporal Control for Masked Motion Synthesis
by: Pinyoanuntapong, Ekkasit, et al.
Published: (2024)
by: Pinyoanuntapong, Ekkasit, et al.
Published: (2024)
Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction
by: Chen, Jun, et al.
Published: (2022)
by: Chen, Jun, et al.
Published: (2022)
Towards Long-Form Spatio-Temporal Video Grounding
by: Gu, Xin, et al.
Published: (2026)
by: Gu, Xin, et al.
Published: (2026)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
by: Li, Wenrui, et al.
Published: (2024)
by: Li, Wenrui, et al.
Published: (2024)
RTracker: Recoverable Tracking via PN Tree Structured Memory
by: Huang, Yuqing, et al.
Published: (2024)
by: Huang, Yuqing, et al.
Published: (2024)
Beyond Boxes: Mask-Guided Spatio-Temporal Feature Aggregation for Video Object Detection
by: Hashmi, Khurram Azeem, et al.
Published: (2024)
by: Hashmi, Khurram Azeem, et al.
Published: (2024)
MR-GDINO: Efficient Open-World Continual Object Detection
by: Dong, Bowen, et al.
Published: (2024)
by: Dong, Bowen, et al.
Published: (2024)
LPT++: Efficient Training on Mixture of Long-tailed Experts
by: Dong, Bowen, et al.
Published: (2024)
by: Dong, Bowen, et al.
Published: (2024)
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation
by: Hong, Jihwan, et al.
Published: (2026)
by: Hong, Jihwan, et al.
Published: (2026)
Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning
by: Li, Wenrui, et al.
Published: (2025)
by: Li, Wenrui, et al.
Published: (2025)
RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming
by: Chu, Jisheng, et al.
Published: (2026)
by: Chu, Jisheng, et al.
Published: (2026)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
by: Lin, Xinying, et al.
Published: (2026)
by: Lin, Xinying, et al.
Published: (2026)
MAL: Cluster-Masked and Multi-Task Pretraining for Enhanced xLSTM Vision Performance
by: Huang, Wenjun, et al.
Published: (2024)
by: Huang, Wenjun, et al.
Published: (2024)
STGV: Spatio-Temporal Hash Encoding for Gaussian-based Video Representation
by: Lin, Jierun, et al.
Published: (2026)
by: Lin, Jierun, et al.
Published: (2026)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
by: Wasim, Syed Talal, et al.
Published: (2023)
by: Wasim, Syed Talal, et al.
Published: (2023)
SelfHVD: Self-Supervised Handheld Video Deblurring
by: Xu, Honglei, et al.
Published: (2025)
by: Xu, Honglei, et al.
Published: (2025)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
by: Yao, Jiali, et al.
Published: (2025)
by: Yao, Jiali, et al.
Published: (2025)
Interactive Tracking: A Human-in-the-Loop Paradigm with Memory-Augmented Adaptation
by: Huang, Yuqing, et al.
Published: (2026)
by: Huang, Yuqing, et al.
Published: (2026)
Video-Language Alignment via Spatio-Temporal Graph Transformer
by: Zhang, Shi-Xue, et al.
Published: (2024)
by: Zhang, Shi-Xue, et al.
Published: (2024)
Soften the Mask: Adaptive Temporal Soft Mask for Efficient Dynamic Facial Expression Recognition
by: Li, Meng-zhu, et al.
Published: (2025)
by: Li, Meng-zhu, et al.
Published: (2025)
GLaVE-Cap: Global-Local Aligned Video Captioning with Vision Expert Integration
by: Xu, Wan, et al.
Published: (2025)
by: Xu, Wan, et al.
Published: (2025)
Generative Inbetweening through Frame-wise Conditions-Driven Video Generation
by: Zhu, Tianyi, et al.
Published: (2024)
by: Zhu, Tianyi, et al.
Published: (2024)
Spatio-Temporal Correlation Guided Geometric Partitioning for Versatile Video Coding
by: Meng, Xuewei, et al.
Published: (2026)
by: Meng, Xuewei, et al.
Published: (2026)
LoViC: Efficient Long Video Generation with Context Compression
by: Jiang, Jiaxiu, et al.
Published: (2025)
by: Jiang, Jiaxiu, et al.
Published: (2025)
UniM$^2$AE: Multi-modal Masked Autoencoders with Unified 3D Representation for 3D Perception in Autonomous Driving
by: Zou, Jian, et al.
Published: (2023)
by: Zou, Jian, et al.
Published: (2023)
ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors
by: Yu, Haodong, et al.
Published: (2026)
by: Yu, Haodong, et al.
Published: (2026)
Similar Items
-
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
by: Zhuang, Weijun, et al.
Published: (2025) -
Drift-Resilient Temporal Priors for Visual Tracking
by: Huang, Yuqing, et al.
Published: (2026) -
Multi-modal Crowd Counting via a Broker Modality
by: Meng, Haoliang, et al.
Published: (2024) -
GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver
by: Chen, Yuqing, et al.
Published: (2026) -
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
by: Zhou, Zikun, et al.
Published: (2024)