Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fang, Xiang, Fang, Wanlong, Liu, Daizong, Qu, Xiaoye, Dong, Jianfeng, Zhou, Pan, Li, Renfu, Xu, Zichuan, Chen, Lixing, Zheng, Panpan, Cheng, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rethinking Video-Language Model from the Language Input Perspective
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2022)
par: Fang, Xiang, et autres
Publié: (2022)
Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval
par: Lin, Junan, et autres
Publié: (2025)
par: Lin, Junan, et autres
Publié: (2025)
Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network
par: Fang, Xiang, et autres
Publié: (2024)
par: Fang, Xiang, et autres
Publié: (2024)
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Hierarchical Local-Global Transformer for Temporal Sentence Grounding
par: Fang, Xiang, et autres
Publié: (2022)
par: Fang, Xiang, et autres
Publié: (2022)
CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
VideoSSR: Video Self-Supervised Reinforcement Learning
par: He, Zefeng, et autres
Publié: (2025)
par: He, Zefeng, et autres
Publié: (2025)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
par: He, Zefeng, et autres
Publié: (2025)
par: He, Zefeng, et autres
Publié: (2025)
PRVR: Partially Relevant Video Retrieval
par: Chen, Xianke, et autres
Publié: (2022)
par: Chen, Xianke, et autres
Publié: (2022)
A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends
par: Liu, Daizong, et autres
Publié: (2024)
par: Liu, Daizong, et autres
Publié: (2024)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation
par: Qu, Xiaoye, et autres
Publié: (2024)
par: Qu, Xiaoye, et autres
Publié: (2024)
Mitigating Multilingual Hallucination in Large Vision-Language Models
par: Qu, Xiaoye, et autres
Publié: (2024)
par: Qu, Xiaoye, et autres
Publié: (2024)
Dual Learning with Dynamic Knowledge Distillation and Soft Alignment for Partially Relevant Video Retrieval
par: Dong, Jianfeng, et autres
Publié: (2025)
par: Dong, Jianfeng, et autres
Publié: (2025)
Spotlight on Token Perception for Multimodal Reinforcement Learning
par: Huang, Siyuan, et autres
Publié: (2025)
par: Huang, Siyuan, et autres
Publié: (2025)
Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition
par: Fang, Wanlong, et autres
Publié: (2026)
par: Fang, Wanlong, et autres
Publié: (2026)
Event-aware Video Corpus Moment Retrieval
par: Hou, Danyang, et autres
Publié: (2024)
par: Hou, Danyang, et autres
Publié: (2024)
To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance
par: Fang, Wanlong, et autres
Publié: (2025)
par: Fang, Wanlong, et autres
Publié: (2025)
Sketchy Moment Matching: Toward Fast and Provable Data Selection for Finetuning
par: Dong, Yijun, et autres
Publié: (2024)
par: Dong, Yijun, et autres
Publié: (2024)
Living in the Moment: Can Large Language Models Grasp Co-Temporal Reasoning?
par: Su, Zhaochen, et autres
Publié: (2024)
par: Su, Zhaochen, et autres
Publié: (2024)
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
par: Huang, Siyuan, et autres
Publié: (2026)
par: Huang, Siyuan, et autres
Publié: (2026)
CLIP-MoE: Towards Building Mixture of Experts for CLIP with Diversified Multiplet Upcycling
par: Zhang, Jihai, et autres
Publié: (2024)
par: Zhang, Jihai, et autres
Publié: (2024)
Background-aware Moment Detection for Video Moment Retrieval
par: Jung, Minjoon, et autres
Publié: (2023)
par: Jung, Minjoon, et autres
Publié: (2023)
Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval
par: Chen, Xianke, et autres
Publié: (2026)
par: Chen, Xianke, et autres
Publié: (2026)
Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering
par: Song, Peipei, et autres
Publié: (2025)
par: Song, Peipei, et autres
Publié: (2025)
From Head to Tail: Towards Balanced Representation in Large Vision-Language Models through Adaptive Data Calibration
par: Song, Mingyang, et autres
Publié: (2025)
par: Song, Mingyang, et autres
Publié: (2025)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
Improving Video Corpus Moment Retrieval with Partial Relevance Enhancement
par: Hou, Danyang, et autres
Publié: (2024)
par: Hou, Danyang, et autres
Publié: (2024)
Mixing Time of Open Quantum Systems via Hypocoercivity
par: Fang, Di, et autres
Publié: (2024)
par: Fang, Di, et autres
Publié: (2024)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
par: Flanagan, Kevin, et autres
Publié: (2025)
par: Flanagan, Kevin, et autres
Publié: (2025)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
par: Liu, Weijia, et autres
Publié: (2025)
par: Liu, Weijia, et autres
Publié: (2025)
Known Meets Unknown: Mitigating Overconfidence in Open Set Recognition
par: Zhao, Dongdong, et autres
Publié: (2025)
par: Zhao, Dongdong, et autres
Publié: (2025)
SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information
par: Sun, Jiashuo, et autres
Publié: (2024)
par: Sun, Jiashuo, et autres
Publié: (2024)
Object-Centric Framework for Video Moment Retrieval
par: Li, Zongyao, et autres
Publié: (2025)
par: Li, Zongyao, et autres
Publié: (2025)
Documents similaires
-
Rethinking Video-Language Model from the Language Input Perspective
par: Fang, Xiang, et autres
Publié: (2026) -
Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective
par: Fang, Xiang, et autres
Publié: (2026) -
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2022) -
Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval
par: Lin, Junan, et autres
Publié: (2025) -
Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding
par: Fang, Xiang, et autres
Publié: (2026)