Diversifying Query: Region-Guided Transformer for Temporal Sentence Grounding
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Xiaolong, Shi, Liushuai, Wang, Le, Zhou, Sanping, Xia, Kun, Wang, Yabing, Hua, Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Moment Quantization for Video Temporal Grounding
por: Sun, Xiaolong, et al.
Publicado: (2025)
por: Sun, Xiaolong, et al.
Publicado: (2025)
Boosting Semi-Supervised Temporal Action Localization by Learning from Non-Target Classes
por: Xia, Kun, et al.
Publicado: (2024)
por: Xia, Kun, et al.
Publicado: (2024)
Referencing Where to Focus: Improving VisualGrounding with Referential Query
por: Wang, Yabing, et al.
Publicado: (2024)
por: Wang, Yabing, et al.
Publicado: (2024)
Length Matters: Length-Aware Transformer for Temporal Sentence Grounding
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
RSRNav: Reasoning Spatial Relationship for Image-Goal Navigation
por: Qin, Zheng, et al.
Publicado: (2025)
por: Qin, Zheng, et al.
Publicado: (2025)
UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
por: Liu, Zeyang, et al.
Publicado: (2025)
por: Liu, Zeyang, et al.
Publicado: (2025)
Embracing Aleatoric Uncertainty: Generating Diverse 3D Human Motion
por: Qin, Zheng, et al.
Publicado: (2025)
por: Qin, Zheng, et al.
Publicado: (2025)
Diversified Augmentation with Domain Adaptation for Debiased Video Temporal Grounding
por: Ren, Junlong, et al.
Publicado: (2025)
por: Ren, Junlong, et al.
Publicado: (2025)
Recurrent Aligned Network for Generalized Pedestrian Trajectory Prediction
por: Dong, Yonghao, et al.
Publicado: (2024)
por: Dong, Yonghao, et al.
Publicado: (2024)
FlowRAM: Grounding Flow Matching Policy with Region-Aware Mamba Framework for Robotic Manipulation
por: Wang, Sen, et al.
Publicado: (2025)
por: Wang, Sen, et al.
Publicado: (2025)
From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval
por: Wang, Yabing, et al.
Publicado: (2025)
por: Wang, Yabing, et al.
Publicado: (2025)
PMT: Progressive Mean Teacher via Exploring Temporal Consistency for Semi-Supervised Medical Image Segmentation
por: Gao, Ning, et al.
Publicado: (2024)
por: Gao, Ning, et al.
Publicado: (2024)
Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining
por: Dong, Lu, et al.
Publicado: (2025)
por: Dong, Lu, et al.
Publicado: (2025)
Towards Generalizable Multi-Object Tracking
por: Qin, Zheng, et al.
Publicado: (2024)
por: Qin, Zheng, et al.
Publicado: (2024)
LayoutRAG: Retrieval-Augmented Model for Content-agnostic Conditional Layout Generation
por: Wu, Yuxuan, et al.
Publicado: (2025)
por: Wu, Yuxuan, et al.
Publicado: (2025)
Action Hints: Semantic Typicality and Context Uniqueness for Generalizable Skeleton-based Video Anomaly Detection
por: Tang, Canhui, et al.
Publicado: (2025)
por: Tang, Canhui, et al.
Publicado: (2025)
Contrast-Unity for Partially-Supervised Temporal Sentence Grounding
por: Wang, Haicheng, et al.
Publicado: (2025)
por: Wang, Haicheng, et al.
Publicado: (2025)
Hierarchical Local-Global Transformer for Temporal Sentence Grounding
por: Fang, Xiang, et al.
Publicado: (2022)
por: Fang, Xiang, et al.
Publicado: (2022)
Sim-DETR: Unlock DETR for Temporal Sentence Grounding
por: Tang, Jiajin, et al.
Publicado: (2025)
por: Tang, Jiajin, et al.
Publicado: (2025)
SAMPO:Scale-wise Autoregression with Motion PrOmpt for generative world models
por: Wang, Sen, et al.
Publicado: (2025)
por: Wang, Sen, et al.
Publicado: (2025)
Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
por: Wang, Yabing, et al.
Publicado: (2024)
por: Wang, Yabing, et al.
Publicado: (2024)
DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation
por: Tian, Jingyi, et al.
Publicado: (2025)
por: Tian, Jingyi, et al.
Publicado: (2025)
Versatile Multimodal Controls for Expressive Talking Human Animation
por: Qin, Zheng, et al.
Publicado: (2025)
por: Qin, Zheng, et al.
Publicado: (2025)
Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding
por: Moon, WonJun, et al.
Publicado: (2023)
por: Moon, WonJun, et al.
Publicado: (2023)
Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network
por: Fang, Xiang, et al.
Publicado: (2024)
por: Fang, Xiang, et al.
Publicado: (2024)
PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning
por: Li, Yizhe, et al.
Publicado: (2025)
por: Li, Yizhe, et al.
Publicado: (2025)
HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos
por: Han, Tingting, et al.
Publicado: (2026)
por: Han, Tingting, et al.
Publicado: (2026)
Boosting Temporal Sentence Grounding via Causal Inference
por: Tang, Kefan, et al.
Publicado: (2025)
por: Tang, Kefan, et al.
Publicado: (2025)
REGNav: Room Expert Guided Image-Goal Navigation
por: Li, Pengna, et al.
Publicado: (2025)
por: Li, Pengna, et al.
Publicado: (2025)
A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos
por: He, Allen, et al.
Publicado: (2026)
por: He, Allen, et al.
Publicado: (2026)
Efficient Temporal Sentence Grounding in Videos with Multi-Teacher Knowledge Distillation
por: Liang, Renjie, et al.
Publicado: (2023)
por: Liang, Renjie, et al.
Publicado: (2023)
Bias-Conflict Sample Synthesis and Adversarial Removal Debias Strategy for Temporal Sentence Grounding in Video
por: Qi, Zhaobo, et al.
Publicado: (2024)
por: Qi, Zhaobo, et al.
Publicado: (2024)
BAM-DETR: Boundary-Aligned Moment Detection Transformer for Temporal Sentence Grounding in Videos
por: Lee, Pilhyeon, et al.
Publicado: (2023)
por: Lee, Pilhyeon, et al.
Publicado: (2023)
Advancing Pre-trained Teacher: Towards Robust Feature Discrepancy for Anomaly Detection
por: Tang, Canhui, et al.
Publicado: (2024)
por: Tang, Canhui, et al.
Publicado: (2024)
Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering
por: Li, Kun, et al.
Publicado: (2026)
por: Li, Kun, et al.
Publicado: (2026)
Autoregressive Queries for Adaptive Tracking with Spatio-TemporalTransformers
por: Xie, Jinxia, et al.
Publicado: (2024)
por: Xie, Jinxia, et al.
Publicado: (2024)
Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding
por: Kang, Minseok, et al.
Publicado: (2025)
por: Kang, Minseok, et al.
Publicado: (2025)
Let Me Finish My Sentence: Video Temporal Grounding with Holistic Text Understanding
por: Woo, Jongbhin, et al.
Publicado: (2024)
por: Woo, Jongbhin, et al.
Publicado: (2024)
Multi-Sentence Grounding for Long-term Instructional Video
por: Li, Zeqian, et al.
Publicado: (2023)
por: Li, Zeqian, et al.
Publicado: (2023)
Ejemplares similares
-
Moment Quantization for Video Temporal Grounding
por: Sun, Xiaolong, et al.
Publicado: (2025) -
Boosting Semi-Supervised Temporal Action Localization by Learning from Non-Target Classes
por: Xia, Kun, et al.
Publicado: (2024) -
Referencing Where to Focus: Improving VisualGrounding with Referential Query
por: Wang, Yabing, et al.
Publicado: (2024) -
Length Matters: Length-Aware Transformer for Temporal Sentence Grounding
por: Wang, Yifan, et al.
Publicado: (2025) -
RSRNav: Reasoning Spatial Relationship for Image-Goal Navigation
por: Qin, Zheng, et al.
Publicado: (2025)