Moment Quantization for Video Temporal Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Xiaolong, Wang, Le, Zhou, Sanping, Shi, Liushuai, Xia, Kun, Liu, Mengnan, Wang, Yabing, Hua, Gang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Diversifying Query: Region-Guided Transformer for Temporal Sentence Grounding
di: Sun, Xiaolong, et al.
Pubblicazione: (2024)
di: Sun, Xiaolong, et al.
Pubblicazione: (2024)
Boosting Semi-Supervised Temporal Action Localization by Learning from Non-Target Classes
di: Xia, Kun, et al.
Pubblicazione: (2024)
di: Xia, Kun, et al.
Pubblicazione: (2024)
RSRNav: Reasoning Spatial Relationship for Image-Goal Navigation
di: Qin, Zheng, et al.
Pubblicazione: (2025)
di: Qin, Zheng, et al.
Pubblicazione: (2025)
LayoutRAG: Retrieval-Augmented Model for Content-agnostic Conditional Layout Generation
di: Wu, Yuxuan, et al.
Pubblicazione: (2025)
di: Wu, Yuxuan, et al.
Pubblicazione: (2025)
Referencing Where to Focus: Improving VisualGrounding with Referential Query
di: Wang, Yabing, et al.
Pubblicazione: (2024)
di: Wang, Yabing, et al.
Pubblicazione: (2024)
UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
di: Liu, Zeyang, et al.
Pubblicazione: (2025)
di: Liu, Zeyang, et al.
Pubblicazione: (2025)
Embracing Aleatoric Uncertainty: Generating Diverse 3D Human Motion
di: Qin, Zheng, et al.
Pubblicazione: (2025)
di: Qin, Zheng, et al.
Pubblicazione: (2025)
Action Hints: Semantic Typicality and Context Uniqueness for Generalizable Skeleton-based Video Anomaly Detection
di: Tang, Canhui, et al.
Pubblicazione: (2025)
di: Tang, Canhui, et al.
Pubblicazione: (2025)
Recurrent Aligned Network for Generalized Pedestrian Trajectory Prediction
di: Dong, Yonghao, et al.
Pubblicazione: (2024)
di: Dong, Yonghao, et al.
Pubblicazione: (2024)
From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2025)
di: Wang, Yabing, et al.
Pubblicazione: (2025)
PMT: Progressive Mean Teacher via Exploring Temporal Consistency for Semi-Supervised Medical Image Segmentation
di: Gao, Ning, et al.
Pubblicazione: (2024)
di: Gao, Ning, et al.
Pubblicazione: (2024)
PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning
di: Li, Yizhe, et al.
Pubblicazione: (2025)
di: Li, Yizhe, et al.
Pubblicazione: (2025)
Towards Generalizable Multi-Object Tracking
di: Qin, Zheng, et al.
Pubblicazione: (2024)
di: Qin, Zheng, et al.
Pubblicazione: (2024)
Length Matters: Length-Aware Transformer for Temporal Sentence Grounding
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
SAMPO:Scale-wise Autoregression with Motion PrOmpt for generative world models
di: Wang, Sen, et al.
Pubblicazione: (2025)
di: Wang, Sen, et al.
Pubblicazione: (2025)
FlowRAM: Grounding Flow Matching Policy with Region-Aware Mamba Framework for Robotic Manipulation
di: Wang, Sen, et al.
Pubblicazione: (2025)
di: Wang, Sen, et al.
Pubblicazione: (2025)
Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2024)
di: Wang, Yabing, et al.
Pubblicazione: (2024)
DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation
di: Tian, Jingyi, et al.
Pubblicazione: (2025)
di: Tian, Jingyi, et al.
Pubblicazione: (2025)
Versatile Multimodal Controls for Expressive Talking Human Animation
di: Qin, Zheng, et al.
Pubblicazione: (2025)
di: Qin, Zheng, et al.
Pubblicazione: (2025)
TSPO: Temporal Sampling Policy Optimization for Long-form Video Language Understanding
di: Tang, Canhui, et al.
Pubblicazione: (2025)
di: Tang, Canhui, et al.
Pubblicazione: (2025)
Diversified Augmentation with Domain Adaptation for Debiased Video Temporal Grounding
di: Ren, Junlong, et al.
Pubblicazione: (2025)
di: Ren, Junlong, et al.
Pubblicazione: (2025)
Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding
di: Hu, Jingjing, et al.
Pubblicazione: (2024)
di: Hu, Jingjing, et al.
Pubblicazione: (2024)
Advancing Pre-trained Teacher: Towards Robust Feature Discrepancy for Anomaly Detection
di: Tang, Canhui, et al.
Pubblicazione: (2024)
di: Tang, Canhui, et al.
Pubblicazione: (2024)
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
di: Zhuang, Weijun, et al.
Pubblicazione: (2025)
di: Zhuang, Weijun, et al.
Pubblicazione: (2025)
Number it: Temporal Grounding Videos like Flipping Manga
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
di: Liu, Xiaolin, et al.
Pubblicazione: (2026)
di: Liu, Xiaolin, et al.
Pubblicazione: (2026)
State Space Prompting via Gathering and Spreading Spatio-Temporal Information for Video Understanding
di: Zhou, Jiahuan, et al.
Pubblicazione: (2025)
di: Zhou, Jiahuan, et al.
Pubblicazione: (2025)
BAM-DETR: Boundary-Aligned Moment Detection Transformer for Temporal Sentence Grounding in Videos
di: Lee, Pilhyeon, et al.
Pubblicazione: (2023)
di: Lee, Pilhyeon, et al.
Pubblicazione: (2023)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
di: Wang, Haibo, et al.
Pubblicazione: (2024)
di: Wang, Haibo, et al.
Pubblicazione: (2024)
Enhancing Mamba Decoder with Bidirectional Interaction in Multi-Task Dense Prediction
di: Cao, Mang, et al.
Pubblicazione: (2025)
di: Cao, Mang, et al.
Pubblicazione: (2025)
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding
di: Jung, Minjoon, et al.
Pubblicazione: (2026)
di: Jung, Minjoon, et al.
Pubblicazione: (2026)
RGBD Objects in the Wild: Scaling Real-World 3D Object Learning from RGB-D Videos
di: Xia, Hongchi, et al.
Pubblicazione: (2024)
di: Xia, Hongchi, et al.
Pubblicazione: (2024)
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
di: Zheng, Zelin, et al.
Pubblicazione: (2026)
A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos
di: He, Allen, et al.
Pubblicazione: (2026)
di: He, Allen, et al.
Pubblicazione: (2026)
Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding
di: Zheng, Minghang, et al.
Pubblicazione: (2025)
di: Zheng, Minghang, et al.
Pubblicazione: (2025)
AutoTVG: A New Vision-language Pre-training Paradigm for Temporal Video Grounding
di: Zhang, Xing, et al.
Pubblicazione: (2024)
di: Zhang, Xing, et al.
Pubblicazione: (2024)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
TDViT: Temporal Dilated Video Transformer for Dense Video Tasks
di: Sun, Guanxiong, et al.
Pubblicazione: (2024)
di: Sun, Guanxiong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Diversifying Query: Region-Guided Transformer for Temporal Sentence Grounding
di: Sun, Xiaolong, et al.
Pubblicazione: (2024) -
Boosting Semi-Supervised Temporal Action Localization by Learning from Non-Target Classes
di: Xia, Kun, et al.
Pubblicazione: (2024) -
RSRNav: Reasoning Spatial Relationship for Image-Goal Navigation
di: Qin, Zheng, et al.
Pubblicazione: (2025) -
LayoutRAG: Retrieval-Augmented Model for Content-agnostic Conditional Layout Generation
di: Wu, Yuxuan, et al.
Pubblicazione: (2025) -
Referencing Where to Focus: Improving VisualGrounding with Referential Query
di: Wang, Yabing, et al.
Pubblicazione: (2024)