MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Cai, Weitong, Huang, Jiabo, Gong, Shaogang, Jin, Hailin, Liu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
Neuro-Symbolic Spatial Reasoning in Segmentation
di: Lin, Jiayi, et al.
Pubblicazione: (2025)
di: Lin, Jiayi, et al.
Pubblicazione: (2025)
InvSeg: Test-Time Prompt Inversion for Semantic Segmentation
di: Lin, Jiayi, et al.
Pubblicazione: (2024)
di: Lin, Jiayi, et al.
Pubblicazione: (2024)
Grounding Video Reasoning in Physical Signals
di: Osmanli, Alibay, et al.
Pubblicazione: (2026)
di: Osmanli, Alibay, et al.
Pubblicazione: (2026)
SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
di: Yu, An, et al.
Pubblicazione: (2025)
di: Yu, An, et al.
Pubblicazione: (2025)
Background-aware Moment Detection for Video Moment Retrieval
di: Jung, Minjoon, et al.
Pubblicazione: (2023)
di: Jung, Minjoon, et al.
Pubblicazione: (2023)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
di: Liu, Weijia, et al.
Pubblicazione: (2025)
di: Liu, Weijia, et al.
Pubblicazione: (2025)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
Object-Centric Framework for Video Moment Retrieval
di: Li, Zongyao, et al.
Pubblicazione: (2025)
di: Li, Zongyao, et al.
Pubblicazione: (2025)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
di: Tzachor, Issar, et al.
Pubblicazione: (2026)
di: Tzachor, Issar, et al.
Pubblicazione: (2026)
CoS: Chain-of-Shot Prompting for Long Video Understanding
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
di: Sun, Shitong, et al.
Pubblicazione: (2026)
di: Sun, Shitong, et al.
Pubblicazione: (2026)
ViSMaP: Unsupervised Hour-long Video Summarisation by Meta-Prompting
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
Training-free Zero-shot Composed Image Retrieval with Local Concept Reranking
di: Sun, Shitong, et al.
Pubblicazione: (2023)
di: Sun, Shitong, et al.
Pubblicazione: (2023)
Vid-Morp: Video Moment Retrieval Pretraining from Unlabeled Videos in the Wild
di: Bao, Peijun, et al.
Pubblicazione: (2024)
di: Bao, Peijun, et al.
Pubblicazione: (2024)
Efficient Motion-Aware Video MLLM
di: Zhao, Zijia, et al.
Pubblicazione: (2025)
di: Zhao, Zijia, et al.
Pubblicazione: (2025)
Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization
di: Yu, Tao, et al.
Pubblicazione: (2026)
di: Yu, Tao, et al.
Pubblicazione: (2026)
Beyond Caption-Based Queries for Video Moment Retrieval
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2022)
di: Fang, Xiang, et al.
Pubblicazione: (2022)
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
di: Yin, Yufei, et al.
Pubblicazione: (2026)
di: Yin, Yufei, et al.
Pubblicazione: (2026)
Context-Enhanced Video Moment Retrieval with Large Language Models
di: Liu, Weijia, et al.
Pubblicazione: (2024)
di: Liu, Weijia, et al.
Pubblicazione: (2024)
Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering
di: Song, Peipei, et al.
Pubblicazione: (2025)
di: Song, Peipei, et al.
Pubblicazione: (2025)
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
di: Yoon, Sunjae, et al.
Pubblicazione: (2022)
di: Yoon, Sunjae, et al.
Pubblicazione: (2022)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Leveraging Modality Tags for Enhanced Cross-Modal Video Retrieval
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
di: Fragomeni, Adriano, et al.
Pubblicazione: (2025)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2024)
di: Chen, Houlun, et al.
Pubblicazione: (2024)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
di: Cheng, Zixu, et al.
Pubblicazione: (2026)
di: Cheng, Zixu, et al.
Pubblicazione: (2026)
Event-aware Video Corpus Moment Retrieval
di: Hou, Danyang, et al.
Pubblicazione: (2024)
di: Hou, Danyang, et al.
Pubblicazione: (2024)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Elysium: Exploring Object-level Perception in Videos via MLLM
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
Modality-Fair Preference Optimization for Trustworthy MLLM Alignment
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
The Evolution of Video Anomaly Detection: A Unified Framework from DNN to MLLM
di: Gao, Shibo, et al.
Pubblicazione: (2025)
di: Gao, Shibo, et al.
Pubblicazione: (2025)
MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding
di: Dai, Ming, et al.
Pubblicazione: (2025)
di: Dai, Ming, et al.
Pubblicazione: (2025)
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
Narrating the Video: Boosting Text-Video Retrieval via Comprehensive Utilization of Frame-Level Captions
di: Hur, Chan, et al.
Pubblicazione: (2025)
di: Hur, Chan, et al.
Pubblicazione: (2025)
Point to Span: Zero-Shot Moment Retrieval for Navigating Unseen Hour-Long Videos
di: Jeon, Mingyu, et al.
Pubblicazione: (2025)
di: Jeon, Mingyu, et al.
Pubblicazione: (2025)
Few-Shot Image Generation by Conditional Relaxing Diffusion Inversion
di: Cao, Yu, et al.
Pubblicazione: (2024)
di: Cao, Yu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels
di: Cai, Weitong, et al.
Pubblicazione: (2024) -
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
di: Luo, Dezhao, et al.
Pubblicazione: (2024) -
Neuro-Symbolic Spatial Reasoning in Segmentation
di: Lin, Jiayi, et al.
Pubblicazione: (2025) -
InvSeg: Test-Time Prompt Inversion for Semantic Segmentation
di: Lin, Jiayi, et al.
Pubblicazione: (2024) -
Grounding Video Reasoning in Physical Signals
di: Osmanli, Alibay, et al.
Pubblicazione: (2026)