Guardado en:
| Autores principales: | Tu, Xuezhen, Wu, Jingyu, Kang, Fangyu, Nong, Qingpeng, Zhang, Kaijin, Niu, Chaoyue, Wu, Fan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2604.08014 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Context-Guided Spatio-Temporal Video Grounding
por: Gu, Xin, et al.
Publicado: (2024)
por: Gu, Xin, et al.
Publicado: (2024)
Towards Long-Form Spatio-Temporal Video Grounding
por: Gu, Xin, et al.
Publicado: (2026)
por: Gu, Xin, et al.
Publicado: (2026)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
por: Gu, Xin, et al.
Publicado: (2025)
por: Gu, Xin, et al.
Publicado: (2025)
IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning
por: Qiu, Tianheng, et al.
Publicado: (2025)
por: Qiu, Tianheng, et al.
Publicado: (2025)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
por: Yao, Jiali, et al.
Publicado: (2025)
por: Yao, Jiali, et al.
Publicado: (2025)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
por: Fei, Hao, et al.
Publicado: (2024)
por: Fei, Hao, et al.
Publicado: (2024)
OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
por: Gao, Hong, et al.
Publicado: (2025)
por: Gao, Hong, et al.
Publicado: (2025)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
por: Wang, Jiankang, et al.
Publicado: (2025)
por: Wang, Jiankang, et al.
Publicado: (2025)
UBATrack: Spatio-Temporal State Space Model for General Multi-Modal Tracking
por: Liang, Qihua, et al.
Publicado: (2026)
por: Liang, Qihua, et al.
Publicado: (2026)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
por: Wasim, Syed Talal, et al.
Publicado: (2023)
por: Wasim, Syed Talal, et al.
Publicado: (2023)
Video-Language Alignment via Spatio-Temporal Graph Transformer
por: Zhang, Shi-Xue, et al.
Publicado: (2024)
por: Zhang, Shi-Xue, et al.
Publicado: (2024)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
por: Ahmad, Ghazi Shazan, et al.
Publicado: (2025)
por: Ahmad, Ghazi Shazan, et al.
Publicado: (2025)
SpatioTemporal Learning for Human Pose Estimation in Sparsely-Labeled Videos
por: Jiao, Yingying, et al.
Publicado: (2025)
por: Jiao, Yingying, et al.
Publicado: (2025)
SegDebias: Test-Time Bias Mitigation for ViT-Based CLIP via Segmentation
por: Wu, Fangyu, et al.
Publicado: (2025)
por: Wu, Fangyu, et al.
Publicado: (2025)
STDR: Spatio-Temporal Decoupling for Real-Time Dynamic Scene Rendering
por: Li, Zehao, et al.
Publicado: (2025)
por: Li, Zehao, et al.
Publicado: (2025)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
por: Zhang, Mingfang, et al.
Publicado: (2026)
por: Zhang, Mingfang, et al.
Publicado: (2026)
Rethinking the Spatio-Temporal Alignment of End-to-End 3D Perception
por: Li, Xiaoyu, et al.
Publicado: (2025)
por: Li, Xiaoyu, et al.
Publicado: (2025)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
por: Gao, Shida, et al.
Publicado: (2025)
por: Gao, Shida, et al.
Publicado: (2025)
Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization
por: Wang, Tianyu, et al.
Publicado: (2026)
por: Wang, Tianyu, et al.
Publicado: (2026)
VideoMamba: Spatio-Temporal Selective State Space Model
por: Park, Jinyoung, et al.
Publicado: (2024)
por: Park, Jinyoung, et al.
Publicado: (2024)
Static and Dynamic Graph Alignment Network for Temporal Video Grounding
por: Hu, Zhanjie, et al.
Publicado: (2026)
por: Hu, Zhanjie, et al.
Publicado: (2026)
Infinite-ID: Identity-preserved Personalization via ID-semantics Decoupling Paradigm
por: Wu, Yi, et al.
Publicado: (2024)
por: Wu, Yi, et al.
Publicado: (2024)
APVR: Hour-Level Long Video Understanding with Adaptive Pivot Visual Information Retrieval
por: Gao, Hong, et al.
Publicado: (2025)
por: Gao, Hong, et al.
Publicado: (2025)
Multimodal Spatio-temporal Graph Learning for Alignment-free RGBT Video Object Detection
por: Wang, Qishun, et al.
Publicado: (2025)
por: Wang, Qishun, et al.
Publicado: (2025)
Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding
por: Gu, Xin, et al.
Publicado: (2025)
por: Gu, Xin, et al.
Publicado: (2025)
DeRA: Decoupled Representation Alignment for Video Tokenization
por: Guo, Pengbo, et al.
Publicado: (2025)
por: Guo, Pengbo, et al.
Publicado: (2025)
NCSTR: Node-Centric Decoupled Spatio-Temporal Reasoning for Video-based Human Pose Estimation
por: Huynh, Quang Dang, et al.
Publicado: (2026)
por: Huynh, Quang Dang, et al.
Publicado: (2026)
Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
por: Yang, Zaiquan, et al.
Publicado: (2025)
por: Yang, Zaiquan, et al.
Publicado: (2025)
Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding
por: Kumar, Akash, et al.
Publicado: (2025)
por: Kumar, Akash, et al.
Publicado: (2025)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
SpatioTemporal Difference Network for Video Depth Super-Resolution
por: Wang, Zhengxue, et al.
Publicado: (2025)
por: Wang, Zhengxue, et al.
Publicado: (2025)
Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach
por: Zhang, Zhilin, et al.
Publicado: (2024)
por: Zhang, Zhilin, et al.
Publicado: (2024)
STAF: 3D Human Mesh Recovery from Video with Spatio-Temporal Alignment Fusion
por: Yao, Wei, et al.
Publicado: (2024)
por: Yao, Wei, et al.
Publicado: (2024)
TRACE: Temporal Grounding Video LLM via Causal Event Modeling
por: Guo, Yongxin, et al.
Publicado: (2024)
por: Guo, Yongxin, et al.
Publicado: (2024)
Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory
por: Zhu, Zhengtong, et al.
Publicado: (2026)
por: Zhu, Zhengtong, et al.
Publicado: (2026)
Feature Alignment Determines Fusion Strategy: A Comparative Study of Cross-Attention and Concatenation in Multimodal Learning
por: Zhou, Zhiqiang, et al.
Publicado: (2026)
por: Zhou, Zhiqiang, et al.
Publicado: (2026)
Adaptive Routing of Text-to-Image Generation Requests Between Large Cloud Model and Light-Weight Edge Model
por: Xin, Zewei, et al.
Publicado: (2024)
por: Xin, Zewei, et al.
Publicado: (2024)
Decoupled Spatio-Temporal Consistency Learning for Self-Supervised Tracking
por: Zheng, Yaozong, et al.
Publicado: (2025)
por: Zheng, Yaozong, et al.
Publicado: (2025)
ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
por: Xu, Qi'ao, et al.
Publicado: (2025)
por: Xu, Qi'ao, et al.
Publicado: (2025)
Ejemplares similares
-
Context-Guided Spatio-Temporal Video Grounding
por: Gu, Xin, et al.
Publicado: (2024) -
Towards Long-Form Spatio-Temporal Video Grounding
por: Gu, Xin, et al.
Publicado: (2026) -
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
por: Gu, Xin, et al.
Publicado: (2025) -
IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning
por: Qiu, Tianheng, et al.
Publicado: (2025) -
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
por: Yao, Jiali, et al.
Publicado: (2025)