Augmenting Moment Retrieval: Zero-Dependency Two-Stage Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wei, Zhengxuan, Tang, Jiajin, Yang, Sibei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Closed-Loop Transfer for Weakly-supervised Affordance Grounding
di: Tang, Jiajin, et al.
Pubblicazione: (2025)
di: Tang, Jiajin, et al.
Pubblicazione: (2025)
Sim-DETR: Unlock DETR for Temporal Sentence Grounding
di: Tang, Jiajin, et al.
Pubblicazione: (2025)
di: Tang, Jiajin, et al.
Pubblicazione: (2025)
Rethinking Query-based Transformer for Continual Image Segmentation
di: Zhu, Yuchen, et al.
Pubblicazione: (2025)
di: Zhu, Yuchen, et al.
Pubblicazione: (2025)
Why LVLMs Are More Prone to Hallucinations in Longer Responses: The Role of Context
di: Zheng, Ge, et al.
Pubblicazione: (2025)
di: Zheng, Ge, et al.
Pubblicazione: (2025)
Part2Object: Hierarchical Unsupervised 3D Instance Segmentation
di: Shi, Cheng, et al.
Pubblicazione: (2024)
di: Shi, Cheng, et al.
Pubblicazione: (2024)
Chart Deep Research in LVLMs via Parallel Relative Policy Optimization
di: Tang, Jiajin, et al.
Pubblicazione: (2026)
di: Tang, Jiajin, et al.
Pubblicazione: (2026)
From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2025)
di: Wang, Yabing, et al.
Pubblicazione: (2025)
MAC: A Benchmark for Multiple Attributes Compositional Zero-Shot Learning
di: Xu, Shuo, et al.
Pubblicazione: (2024)
di: Xu, Shuo, et al.
Pubblicazione: (2024)
Point to Span: Zero-Shot Moment Retrieval for Navigating Unseen Hour-Long Videos
di: Jeon, Mingyu, et al.
Pubblicazione: (2025)
di: Jeon, Mingyu, et al.
Pubblicazione: (2025)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
Free on the Fly: Enhancing Flexibility in Test-Time Adaptation with Online EM
di: Dai, Qiyuan, et al.
Pubblicazione: (2025)
di: Dai, Qiyuan, et al.
Pubblicazione: (2025)
The devil is in the object boundary: towards annotation-free instance segmentation using Foundation Models
di: Shi, Cheng, et al.
Pubblicazione: (2024)
di: Shi, Cheng, et al.
Pubblicazione: (2024)
Curriculum Point Prompting for Weakly-Supervised Referring Image Segmentation
di: Dai, Qiyuan, et al.
Pubblicazione: (2024)
di: Dai, Qiyuan, et al.
Pubblicazione: (2024)
The Devil is in the Spurious Correlations: Boosting Moment Retrieval with Dynamic Learning
di: Zhou, Xinyang, et al.
Pubblicazione: (2025)
di: Zhou, Xinyang, et al.
Pubblicazione: (2025)
MomentMix Augmentation with Length-Aware DETR for Temporally Robust Moment Retrieval
di: Park, Seojeong, et al.
Pubblicazione: (2024)
di: Park, Seojeong, et al.
Pubblicazione: (2024)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
di: Zhang, Ruifei, et al.
Pubblicazione: (2025)
di: Zhang, Ruifei, et al.
Pubblicazione: (2025)
CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection
di: Dong, Xin, et al.
Pubblicazione: (2026)
di: Dong, Xin, et al.
Pubblicazione: (2026)
Reason-before-Retrieve: One-Stage Reflective Chain-of-Thoughts for Training-Free Zero-Shot Composed Image Retrieval
di: Tang, Yuanmin, et al.
Pubblicazione: (2024)
di: Tang, Yuanmin, et al.
Pubblicazione: (2024)
GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval
di: Jeon, Mingyu, et al.
Pubblicazione: (2026)
di: Jeon, Mingyu, et al.
Pubblicazione: (2026)
Background-aware Moment Detection for Video Moment Retrieval
di: Jung, Minjoon, et al.
Pubblicazione: (2023)
di: Jung, Minjoon, et al.
Pubblicazione: (2023)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
di: Xu, Yifang, et al.
Pubblicazione: (2025)
di: Xu, Yifang, et al.
Pubblicazione: (2025)
Adaptive Part Learning for Fine-Grained Generalized Category Discovery: A Plug-and-Play Enhancement
di: Dai, Qiyuan, et al.
Pubblicazione: (2025)
di: Dai, Qiyuan, et al.
Pubblicazione: (2025)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
di: Ding, Yiming, et al.
Pubblicazione: (2026)
di: Ding, Yiming, et al.
Pubblicazione: (2026)
Vision Function Layer in Multimodal LLMs
di: Shi, Cheng, et al.
Pubblicazione: (2025)
di: Shi, Cheng, et al.
Pubblicazione: (2025)
Vision Transformers Need More Than Registers
di: Shi, Cheng, et al.
Pubblicazione: (2026)
di: Shi, Cheng, et al.
Pubblicazione: (2026)
WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs
di: Zhang, Yulin, et al.
Pubblicazione: (2026)
di: Zhang, Yulin, et al.
Pubblicazione: (2026)
Plain-Det: A Plain Multi-Dataset Object Detector
di: Shi, Cheng, et al.
Pubblicazione: (2024)
di: Shi, Cheng, et al.
Pubblicazione: (2024)
Adaptive Evidential Learning for Temporal-Semantic Robustness in Moment Retrieval
di: Huang, Haojian, et al.
Pubblicazione: (2025)
di: Huang, Haojian, et al.
Pubblicazione: (2025)
Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing
di: Chen, Xi, et al.
Pubblicazione: (2026)
di: Chen, Xi, et al.
Pubblicazione: (2026)
GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval
di: Zhang, Shihang, et al.
Pubblicazione: (2026)
di: Zhang, Shihang, et al.
Pubblicazione: (2026)
Anatomy-Aware Conditional Image-Text Retrieval
di: Zheng, Meng, et al.
Pubblicazione: (2025)
di: Zheng, Meng, et al.
Pubblicazione: (2025)
SETR: A Two-Stage Semantic-Enhanced Framework for Zero-Shot Composed Image Retrieval
di: Xiao, Yuqi, et al.
Pubblicazione: (2025)
di: Xiao, Yuqi, et al.
Pubblicazione: (2025)
Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video
di: Zhang, Yulin, et al.
Pubblicazione: (2025)
di: Zhang, Yulin, et al.
Pubblicazione: (2025)
TLAC: Two-stage LMM Augmented CLIP for Zero-Shot Classification
di: Munir, Ans, et al.
Pubblicazione: (2025)
di: Munir, Ans, et al.
Pubblicazione: (2025)
Object-Centric Framework for Video Moment Retrieval
di: Li, Zongyao, et al.
Pubblicazione: (2025)
di: Li, Zongyao, et al.
Pubblicazione: (2025)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
di: Liu, Weijia, et al.
Pubblicazione: (2025)
di: Liu, Weijia, et al.
Pubblicazione: (2025)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Closed-Loop Transfer for Weakly-supervised Affordance Grounding
di: Tang, Jiajin, et al.
Pubblicazione: (2025) -
Sim-DETR: Unlock DETR for Temporal Sentence Grounding
di: Tang, Jiajin, et al.
Pubblicazione: (2025) -
Rethinking Query-based Transformer for Continual Image Segmentation
di: Zhu, Yuchen, et al.
Pubblicazione: (2025) -
Why LVLMs Are More Prone to Hallucinations in Longer Responses: The Role of Context
di: Zheng, Ge, et al.
Pubblicazione: (2025) -
Part2Object: Hierarchical Unsupervised 3D Instance Segmentation
di: Shi, Cheng, et al.
Pubblicazione: (2024)