Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yu, Tao, Yang, Yujia, Jin, Haopeng, Gong, Junhao, Chen, Xinlong, Zhou, Yuxuan, Zhang, Shanbin, Yang, Jiabing, Wang, Xinming, Yi, Hongzhu, Nie, Ping, Zou, Kai, Zhang, Zhang, Huang, Yan, Wang, Liang, Yeshani, Tao, Ruiwen, Ma, Jin, Liang, Haijin, Luo, Jinwen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search
von: Yu, Tao, et al.
Veröffentlicht: (2026)
von: Yu, Tao, et al.
Veröffentlicht: (2026)
Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models
von: Yang, Yujia, et al.
Veröffentlicht: (2026)
von: Yang, Yujia, et al.
Veröffentlicht: (2026)
VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026)
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026)
BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions
von: Yu, Tao, et al.
Veröffentlicht: (2025)
von: Yu, Tao, et al.
Veröffentlicht: (2025)
HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding
von: Jin, Haopeng, et al.
Veröffentlicht: (2026)
von: Jin, Haopeng, et al.
Veröffentlicht: (2026)
Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search
von: Yu, Tao, et al.
Veröffentlicht: (2026)
von: Yu, Tao, et al.
Veröffentlicht: (2026)
PaperX: A Unified Framework for Multimodal Academic Presentation Generation with Scholar DAG
von: Yu, Tao, et al.
Veröffentlicht: (2026)
von: Yu, Tao, et al.
Veröffentlicht: (2026)
Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows
von: Yu, Tao, et al.
Veröffentlicht: (2026)
von: Yu, Tao, et al.
Veröffentlicht: (2026)
Background-aware Moment Detection for Video Moment Retrieval
von: Jung, Minjoon, et al.
Veröffentlicht: (2023)
von: Jung, Minjoon, et al.
Veröffentlicht: (2023)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
von: Cai, Weitong, et al.
Veröffentlicht: (2024)
von: Cai, Weitong, et al.
Veröffentlicht: (2024)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
von: Luo, Dezhao, et al.
Veröffentlicht: (2024)
von: Luo, Dezhao, et al.
Veröffentlicht: (2024)
MoCha-LD: Temporal-Chunked Latent Diffusion with Motion-Aware Consistency Regularization for Long Video Generation
von: Jin, Haopeng
Veröffentlicht: (2026)
von: Jin, Haopeng
Veröffentlicht: (2026)
FreqFormer: Hierarchical Frequency-Domain Attention with Adaptive Spectral Routing for Long-Sequence Video Diffusion Transformers
von: Jin, Haopeng
Veröffentlicht: (2026)
von: Jin, Haopeng
Veröffentlicht: (2026)
TVR-Ranking: A Dataset for Ranked Video Moment Retrieval with Imprecise Queries
von: Liang, Renjie, et al.
Veröffentlicht: (2024)
von: Liang, Renjie, et al.
Veröffentlicht: (2024)
Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO
von: Cheng, Junhao, et al.
Veröffentlicht: (2025)
von: Cheng, Junhao, et al.
Veröffentlicht: (2025)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
von: Xie, Zequn, et al.
Veröffentlicht: (2026)
von: Xie, Zequn, et al.
Veröffentlicht: (2026)
Event-aware Video Corpus Moment Retrieval
von: Hou, Danyang, et al.
Veröffentlicht: (2024)
von: Hou, Danyang, et al.
Veröffentlicht: (2024)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
von: Wang, Zhepeng, et al.
Veröffentlicht: (2025)
von: Wang, Zhepeng, et al.
Veröffentlicht: (2025)
HVD: Human Vision-Driven Video Representation Learning for Text-Video Retrieval
von: Xie, Zequn, et al.
Veröffentlicht: (2026)
von: Xie, Zequn, et al.
Veröffentlicht: (2026)
Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering
von: Song, Peipei, et al.
Veröffentlicht: (2025)
von: Song, Peipei, et al.
Veröffentlicht: (2025)
ReCoVR: Closing the Loop in Interactive Composed Video Retrieval
von: Zhang, Bingqing, et al.
Veröffentlicht: (2026)
von: Zhang, Bingqing, et al.
Veröffentlicht: (2026)
RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026)
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
von: Yuan, Huaying, et al.
Veröffentlicht: (2025)
von: Yuan, Huaying, et al.
Veröffentlicht: (2025)
FastMTP: Accelerating LLM Inference with Enhanced Multi-Token Prediction
von: Cai, Yuxuan, et al.
Veröffentlicht: (2025)
von: Cai, Yuxuan, et al.
Veröffentlicht: (2025)
Improving Video Corpus Moment Retrieval with Partial Relevance Enhancement
von: Hou, Danyang, et al.
Veröffentlicht: (2024)
von: Hou, Danyang, et al.
Veröffentlicht: (2024)
Team of One: Cracking Complex Video QA with Model Synergy
von: Xie, Jun, et al.
Veröffentlicht: (2025)
von: Xie, Jun, et al.
Veröffentlicht: (2025)
HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding
von: Shi, Mengqi, et al.
Veröffentlicht: (2026)
von: Shi, Mengqi, et al.
Veröffentlicht: (2026)
AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
von: Xue, Zhucun, et al.
Veröffentlicht: (2025)
von: Xue, Zhucun, et al.
Veröffentlicht: (2025)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
von: Chen, Houlun, et al.
Veröffentlicht: (2024)
von: Chen, Houlun, et al.
Veröffentlicht: (2024)
EC-Flow: Enabling Versatile Robotic Manipulation from Action-Unlabeled Videos via Embodiment-Centric Flow
von: Chen, Yixiang, et al.
Veröffentlicht: (2025)
von: Chen, Yixiang, et al.
Veröffentlicht: (2025)
EasyMimic: A Low-Cost Framework for Robot Imitation Learning from Human Videos
von: Zhang, Tao, et al.
Veröffentlicht: (2026)
von: Zhang, Tao, et al.
Veröffentlicht: (2026)
Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval
von: Zhang, Bolin, et al.
Veröffentlicht: (2026)
von: Zhang, Bolin, et al.
Veröffentlicht: (2026)
GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval
von: Zhang, Shihang, et al.
Veröffentlicht: (2026)
von: Zhang, Shihang, et al.
Veröffentlicht: (2026)
Video Semantic Communication with Major Object Extraction and Contextual Video Encoding
von: Li, Haopeng, et al.
Veröffentlicht: (2024)
von: Li, Haopeng, et al.
Veröffentlicht: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
von: Xu, Yifang, et al.
Veröffentlicht: (2025)
von: Xu, Yifang, et al.
Veröffentlicht: (2025)
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
von: Wang, Yueqian, et al.
Veröffentlicht: (2024)
von: Wang, Yueqian, et al.
Veröffentlicht: (2024)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
von: Liu, Weijia, et al.
Veröffentlicht: (2025)
von: Liu, Weijia, et al.
Veröffentlicht: (2025)
MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding
von: Dai, Ming, et al.
Veröffentlicht: (2025)
von: Dai, Ming, et al.
Veröffentlicht: (2025)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
von: Liang, Lili, et al.
Veröffentlicht: (2024)
von: Liang, Lili, et al.
Veröffentlicht: (2024)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
von: Jin, Xiaojie, et al.
Veröffentlicht: (2023)
von: Jin, Xiaojie, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search
von: Yu, Tao, et al.
Veröffentlicht: (2026) -
Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models
von: Yang, Yujia, et al.
Veröffentlicht: (2026) -
VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026) -
BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions
von: Yu, Tao, et al.
Veröffentlicht: (2025) -
HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding
von: Jin, Haopeng, et al.
Veröffentlicht: (2026)