Point to Span: Zero-Shot Moment Retrieval for Navigating Unseen Hour-Long Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jeon, Mingyu, Yang, Jisoo, Han, Sungjin, Hwang, Jinkwon, Yoon, Sunjae, Kim, Jonghee, Kim, Junyeoung |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval
par: Jeon, Mingyu, et autres
Publié: (2026)
par: Jeon, Mingyu, et autres
Publié: (2026)
See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval
par: Jeon, Mingyu, et autres
Publié: (2026)
par: Jeon, Mingyu, et autres
Publié: (2026)
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
par: Yoon, Sunjae, et autres
Publié: (2022)
par: Yoon, Sunjae, et autres
Publié: (2022)
SCANet: Scene Complexity Aware Network for Weakly-Supervised Video Moment Retrieval
par: Yoon, Sunjae, et autres
Publié: (2023)
par: Yoon, Sunjae, et autres
Publié: (2023)
Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
par: Jung, Woojun, et autres
Publié: (2025)
par: Jung, Woojun, et autres
Publié: (2025)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
par: Luo, Dezhao, et autres
Publié: (2024)
par: Luo, Dezhao, et autres
Publié: (2024)
Dream to Generalize: Zero-Shot Model-Based Reinforcement Learning for Unseen Visual Distractions
par: Ha, Jeongsoo, et autres
Publié: (2025)
par: Ha, Jeongsoo, et autres
Publié: (2025)
Background-aware Moment Detection for Video Moment Retrieval
par: Jung, Minjoon, et autres
Publié: (2023)
par: Jung, Minjoon, et autres
Publié: (2023)
FRAG: Frequency Adapting Group for Diffusion Video Editing
par: Yoon, Sunjae, et autres
Publié: (2024)
par: Yoon, Sunjae, et autres
Publié: (2024)
MVMR: A New Framework for Evaluating Faithfulness of Video Moment Retrieval against Multiple Distractors
par: Yang, Nakyeong, et autres
Publié: (2023)
par: Yang, Nakyeong, et autres
Publié: (2023)
LOC-ZSON: Language-driven Object-Centric Zero-Shot Object Retrieval and Navigation
par: Guan, Tianrui, et autres
Publié: (2024)
par: Guan, Tianrui, et autres
Publié: (2024)
Is it safe to cross? Interpretable Risk Assessment with GPT-4V for Safety-Aware Street Crossing
par: Hwang, Hochul, et autres
Publié: (2024)
par: Hwang, Hochul, et autres
Publié: (2024)
Zero-Shot Video Deraining with Video Diffusion Models
par: Varanka, Tuomas, et autres
Publié: (2025)
par: Varanka, Tuomas, et autres
Publié: (2025)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
par: Jeon, MinJu, et autres
Publié: (2025)
par: Jeon, MinJu, et autres
Publié: (2025)
Visualizing the loss landscape of Self-supervised Vision Transformer
par: Lee, Youngwan, et autres
Publié: (2024)
par: Lee, Youngwan, et autres
Publié: (2024)
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
par: Yeo, Woongyeong, et autres
Publié: (2025)
par: Yeo, Woongyeong, et autres
Publié: (2025)
Watch Video, Catch Keyword: Context-aware Keyword Attention for Moment Retrieval and Highlight Detection
par: Um, Sung Jin, et autres
Publié: (2025)
par: Um, Sung Jin, et autres
Publié: (2025)
Zero-Shot Long-Form Video Understanding through Screenplay
par: Wu, Yongliang, et autres
Publié: (2024)
par: Wu, Yongliang, et autres
Publié: (2024)
SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
par: Yu, An, et autres
Publié: (2025)
par: Yu, An, et autres
Publié: (2025)
RA-SGG: Retrieval-Augmented Scene Graph Generation Framework via Multi-Prototype Learning
par: Yoon, Kanghoon, et autres
Publié: (2024)
par: Yoon, Kanghoon, et autres
Publié: (2024)
Zero-Shot Vision-and-Language Navigation with Collision Mitigation in Continuous Environment
par: Jeong, Seongjun, et autres
Publié: (2024)
par: Jeong, Seongjun, et autres
Publié: (2024)
Zero-Shot Scene Change Detection
par: Cho, Kyusik, et autres
Publié: (2024)
par: Cho, Kyusik, et autres
Publié: (2024)
Language-Grounded Multi-Domain Image Translation via Semantic Difference Guidance
par: Ryu, Jongwon, et autres
Publié: (2026)
par: Ryu, Jongwon, et autres
Publié: (2026)
SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis
par: Kim, Junho, et autres
Publié: (2024)
par: Kim, Junho, et autres
Publié: (2024)
TrajRAG: Retrieving Geometric-Semantic Experience for Zero-Shot Object Navigation
par: Wang, Yiyao, et autres
Publié: (2026)
par: Wang, Yiyao, et autres
Publié: (2026)
Generalized Zero-Shot Learning for Point Cloud Segmentation with Evidence-Based Dynamic Calibration
par: Kim, Hyeonseok, et autres
Publié: (2025)
par: Kim, Hyeonseok, et autres
Publié: (2025)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
Augmenting Moment Retrieval: Zero-Dependency Two-Stage Learning
par: Wei, Zhengxuan, et autres
Publié: (2025)
par: Wei, Zhengxuan, et autres
Publié: (2025)
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
par: Wang, Chendong, et autres
Publié: (2025)
par: Wang, Chendong, et autres
Publié: (2025)
Zero-Shot Industrial Anomaly Segmentation with Image-Aware Prompt Generation
par: Park, SoYoung, et autres
Publié: (2025)
par: Park, SoYoung, et autres
Publié: (2025)
Large-Scale Text-to-Image Model with Inpainting is a Zero-Shot Subject-Driven Image Generator
par: Shin, Chaehun, et autres
Publié: (2024)
par: Shin, Chaehun, et autres
Publié: (2024)
DNI: Dilutional Noise Initialization for Diffusion Video Editing
par: Yoon, Sunjae, et autres
Publié: (2024)
par: Yoon, Sunjae, et autres
Publié: (2024)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
par: Flanagan, Kevin, et autres
Publié: (2025)
par: Flanagan, Kevin, et autres
Publié: (2025)
SiNGER: A Clearer Voice Distills Vision Transformers Further
par: Yu, Geunhyeok, et autres
Publié: (2025)
par: Yu, Geunhyeok, et autres
Publié: (2025)
Spectral Prompt Tuning:Unveiling Unseen Classes for Zero-Shot Semantic Segmentation
par: Xu, Wenhao, et autres
Publié: (2023)
par: Xu, Wenhao, et autres
Publié: (2023)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
par: Liu, Weijia, et autres
Publié: (2025)
par: Liu, Weijia, et autres
Publié: (2025)
Super-class guided Transformer for Zero-Shot Attribute Classification
par: Kim, Sehyung, et autres
Publié: (2025)
par: Kim, Sehyung, et autres
Publié: (2025)
Decoupling Endpoint and Semantic Transition Learning for Zero-Shot Composed Image Retrieval
par: Liu, Mingyu, et autres
Publié: (2026)
par: Liu, Mingyu, et autres
Publié: (2026)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
par: Cai, Weitong, et autres
Publié: (2024)
par: Cai, Weitong, et autres
Publié: (2024)
Documents similaires
-
GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval
par: Jeon, Mingyu, et autres
Publié: (2026) -
See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval
par: Jeon, Mingyu, et autres
Publié: (2026) -
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
par: Yoon, Sunjae, et autres
Publié: (2022) -
SCANet: Scene Complexity Aware Network for Weakly-Supervised Video Moment Retrieval
par: Yoon, Sunjae, et autres
Publié: (2023) -
Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
par: Jung, Woojun, et autres
Publié: (2025)