STPro: Spatial and Temporal Progressive Learning for Weakly Supervised Spatio-Temporal Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Garg, Aaryan, Kumar, Akash, Rawat, Yogesh S |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding
di: Kumar, Akash, et al.
Pubblicazione: (2025)
di: Kumar, Akash, et al.
Pubblicazione: (2025)
VISTA: Video Interaction Spatio-Temporal Analysis Benchmark
di: Aparcedo, Alejandro, et al.
Pubblicazione: (2026)
di: Aparcedo, Alejandro, et al.
Pubblicazione: (2026)
A Large-Scale Analysis on Contextual Self-Supervised Video Representation Learning
di: Kumar, Akash, et al.
Pubblicazione: (2025)
di: Kumar, Akash, et al.
Pubblicazione: (2025)
ProDiG: Progressive Diffusion-Guided Gaussian Splatting for Aerial to Ground Reconstruction
di: Mitra, Sirshapan, et al.
Pubblicazione: (2026)
di: Mitra, Sirshapan, et al.
Pubblicazione: (2026)
Weakly-Supervised Temporal Action Localization by Progressive Complementary Learning
di: Du, Jia-Run, et al.
Pubblicazione: (2022)
di: Du, Jia-Run, et al.
Pubblicazione: (2022)
Stable Mean Teacher for Semi-supervised Video Action Detection
di: Kumar, Akash, et al.
Pubblicazione: (2024)
di: Kumar, Akash, et al.
Pubblicazione: (2024)
OmViD: Omni-supervised active learning for video action detection
di: Rana, Aayush, et al.
Pubblicazione: (2025)
di: Rana, Aayush, et al.
Pubblicazione: (2025)
Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
Weakly Supervised Video Anomaly Detection and Localization with Spatio-Temporal Prompts
di: Wu, Peng, et al.
Pubblicazione: (2024)
di: Wu, Peng, et al.
Pubblicazione: (2024)
Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing
di: Kumar, Yogesh
Pubblicazione: (2025)
di: Kumar, Yogesh
Pubblicazione: (2025)
Decoupled Spatio-Temporal Consistency Learning for Self-Supervised Tracking
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
Context-Guided Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
TubeRMC: Tube-conditioned Reconstruction with Mutual Constraints for Weakly-supervised Spatio-Temporal Video Grounding
di: Li, Jinxuan, et al.
Pubblicazione: (2025)
di: Li, Jinxuan, et al.
Pubblicazione: (2025)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
di: Ahmad, Ghazi Shazan, et al.
Pubblicazione: (2025)
di: Ahmad, Ghazi Shazan, et al.
Pubblicazione: (2025)
Towards Long-Form Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2026)
di: Gu, Xin, et al.
Pubblicazione: (2026)
Semi-supervised Active Learning for Video Action Detection
di: Singh, Ayush, et al.
Pubblicazione: (2023)
di: Singh, Ayush, et al.
Pubblicazione: (2023)
TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision
di: Gupta, Ayush, et al.
Pubblicazione: (2025)
di: Gupta, Ayush, et al.
Pubblicazione: (2025)
CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates
di: Grover, Shresth, et al.
Pubblicazione: (2025)
di: Grover, Shresth, et al.
Pubblicazione: (2025)
RobustGait: Robustness Analysis for Appearance Based Gait Recognition
di: Sayera, Reeshoon, et al.
Pubblicazione: (2025)
di: Sayera, Reeshoon, et al.
Pubblicazione: (2025)
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
di: Guo, Chaohong, et al.
Pubblicazione: (2026)
di: Guo, Chaohong, et al.
Pubblicazione: (2026)
Exploring the Temporal Consistency for Point-Level Weakly-Supervised Temporal Action Localization
di: Ma, Yunchuan, et al.
Pubblicazione: (2026)
di: Ma, Yunchuan, et al.
Pubblicazione: (2026)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
Weakly Supervised Multimodal Temporal Forgery Localization via Multitask Learning
di: Xu, Wenbo, et al.
Pubblicazione: (2025)
di: Xu, Wenbo, et al.
Pubblicazione: (2025)
What, when, and where? -- Self-Supervised Spatio-Temporal Grounding in Untrimmed Multi-Action Videos from Narrated Instructions
di: Chen, Brian, et al.
Pubblicazione: (2023)
di: Chen, Brian, et al.
Pubblicazione: (2023)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
di: Yao, Jiali, et al.
Pubblicazione: (2025)
di: Yao, Jiali, et al.
Pubblicazione: (2025)
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
di: Tu, Xuezhen, et al.
Pubblicazione: (2026)
di: Tu, Xuezhen, et al.
Pubblicazione: (2026)
Equivariant Spatio-Temporal Self-Supervision for LiDAR Object Detection
di: Hegde, Deepti, et al.
Pubblicazione: (2024)
di: Hegde, Deepti, et al.
Pubblicazione: (2024)
Contrast-Unity for Partially-Supervised Temporal Sentence Grounding
di: Wang, Haicheng, et al.
Pubblicazione: (2025)
di: Wang, Haicheng, et al.
Pubblicazione: (2025)
Improving Weakly Supervised Temporal Action Localization by Exploiting Multi-resolution Information in Temporal Domain
di: Su, Rui, et al.
Pubblicazione: (2025)
di: Su, Rui, et al.
Pubblicazione: (2025)
EtC: Temporal Boundary Expand then Clarify for Weakly Supervised Video Grounding with Multimodal Large Language Model
di: Li, Guozhang, et al.
Pubblicazione: (2023)
di: Li, Guozhang, et al.
Pubblicazione: (2023)
Agentic Spatio-Temporal Grounding via Collaborative Reasoning
di: Zhao, Heng, et al.
Pubblicazione: (2026)
di: Zhao, Heng, et al.
Pubblicazione: (2026)
Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
di: Yang, Zaiquan, et al.
Pubblicazione: (2025)
di: Yang, Zaiquan, et al.
Pubblicazione: (2025)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
di: Gao, Shida, et al.
Pubblicazione: (2025)
di: Gao, Shida, et al.
Pubblicazione: (2025)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
Colors See Colors Ignore: Clothes Changing ReID with Color Disentanglement
di: Pathak, Priyank, et al.
Pubblicazione: (2025)
di: Pathak, Priyank, et al.
Pubblicazione: (2025)
DIFFER: Disentangling Identity Features via Semantic Cues for Clothes-Changing Person Re-ID
di: Liang, Xin, et al.
Pubblicazione: (2025)
di: Liang, Xin, et al.
Pubblicazione: (2025)
DisenQ: Disentangling Q-Former for Activity-Biometrics
di: Azad, Shehreen, et al.
Pubblicazione: (2025)
di: Azad, Shehreen, et al.
Pubblicazione: (2025)
Coarse Attribute Prediction with Task Agnostic Distillation for Real World Clothes Changing ReID
di: Pathak, Priyank, et al.
Pubblicazione: (2025)
di: Pathak, Priyank, et al.
Pubblicazione: (2025)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
di: Zhang, Mingfang, et al.
Pubblicazione: (2026)
di: Zhang, Mingfang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding
di: Kumar, Akash, et al.
Pubblicazione: (2025) -
VISTA: Video Interaction Spatio-Temporal Analysis Benchmark
di: Aparcedo, Alejandro, et al.
Pubblicazione: (2026) -
A Large-Scale Analysis on Contextual Self-Supervised Video Representation Learning
di: Kumar, Akash, et al.
Pubblicazione: (2025) -
ProDiG: Progressive Diffusion-Guided Gaussian Splatting for Aerial to Ground Reconstruction
di: Mitra, Sirshapan, et al.
Pubblicazione: (2026) -
Weakly-Supervised Temporal Action Localization by Progressive Complementary Learning
di: Du, Jia-Run, et al.
Pubblicazione: (2022)