SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, An, Lu, Weiheng, Li, Jian, Zhang, Zhenfei, Shen, Yunhang, Ye, Felix X. -F., Chang, Ming-Ching |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs
di: Yu, An, et al.
Pubblicazione: (2026)
di: Yu, An, et al.
Pubblicazione: (2026)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
di: Lu, Weiheng, et al.
Pubblicazione: (2024)
di: Lu, Weiheng, et al.
Pubblicazione: (2024)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
A New Benchmark and Model for Challenging Image Manipulation Detection
di: Zhang, Zhenfei, et al.
Pubblicazione: (2023)
di: Zhang, Zhenfei, et al.
Pubblicazione: (2023)
GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval
di: Jeon, Mingyu, et al.
Pubblicazione: (2026)
di: Jeon, Mingyu, et al.
Pubblicazione: (2026)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
di: Gao, Timin, et al.
Pubblicazione: (2024)
di: Gao, Timin, et al.
Pubblicazione: (2024)
Moodifier: MLLM-Enhanced Emotion-Driven Image Editing
di: Ye, Jiarong, et al.
Pubblicazione: (2025)
di: Ye, Jiarong, et al.
Pubblicazione: (2025)
Efficient Motion-Aware Video MLLM
di: Zhao, Zijia, et al.
Pubblicazione: (2025)
di: Zhao, Zijia, et al.
Pubblicazione: (2025)
SCANet: Scene Complexity Aware Network for Weakly-Supervised Video Moment Retrieval
di: Yoon, Sunjae, et al.
Pubblicazione: (2023)
di: Yoon, Sunjae, et al.
Pubblicazione: (2023)
Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval
di: Lin, Junan, et al.
Pubblicazione: (2025)
di: Lin, Junan, et al.
Pubblicazione: (2025)
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
di: Yang, Qize, et al.
Pubblicazione: (2025)
di: Yang, Qize, et al.
Pubblicazione: (2025)
Event-aware Video Corpus Moment Retrieval
di: Hou, Danyang, et al.
Pubblicazione: (2024)
di: Hou, Danyang, et al.
Pubblicazione: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
di: Xu, Yifang, et al.
Pubblicazione: (2025)
di: Xu, Yifang, et al.
Pubblicazione: (2025)
Point to Span: Zero-Shot Moment Retrieval for Navigating Unseen Hour-Long Videos
di: Jeon, Mingyu, et al.
Pubblicazione: (2025)
di: Jeon, Mingyu, et al.
Pubblicazione: (2025)
MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding
di: Dai, Ming, et al.
Pubblicazione: (2025)
di: Dai, Ming, et al.
Pubblicazione: (2025)
Background-aware Moment Detection for Video Moment Retrieval
di: Jung, Minjoon, et al.
Pubblicazione: (2023)
di: Jung, Minjoon, et al.
Pubblicazione: (2023)
Context-Enhanced Video Moment Retrieval with Large Language Models
di: Liu, Weijia, et al.
Pubblicazione: (2024)
di: Liu, Weijia, et al.
Pubblicazione: (2024)
MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval
di: Tu, Rong-Cheng, et al.
Pubblicazione: (2025)
di: Tu, Rong-Cheng, et al.
Pubblicazione: (2025)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
Improving Video Corpus Moment Retrieval with Partial Relevance Enhancement
di: Hou, Danyang, et al.
Pubblicazione: (2024)
di: Hou, Danyang, et al.
Pubblicazione: (2024)
VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
di: Tzachor, Issar, et al.
Pubblicazione: (2026)
di: Tzachor, Issar, et al.
Pubblicazione: (2026)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
di: Liu, Weijia, et al.
Pubblicazione: (2025)
di: Liu, Weijia, et al.
Pubblicazione: (2025)
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
di: Yoon, Sunjae, et al.
Pubblicazione: (2022)
di: Yoon, Sunjae, et al.
Pubblicazione: (2022)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
Moment and Highlight Detection via MLLM Frame Segmentation
di: Jiwanta, I Putu Andika Bagas, et al.
Pubblicazione: (2025)
di: Jiwanta, I Putu Andika Bagas, et al.
Pubblicazione: (2025)
GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval
di: Zhang, Shihang, et al.
Pubblicazione: (2026)
di: Zhang, Shihang, et al.
Pubblicazione: (2026)
Object-Centric Framework for Video Moment Retrieval
di: Li, Zongyao, et al.
Pubblicazione: (2025)
di: Li, Zongyao, et al.
Pubblicazione: (2025)
Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning
di: Yu, RunLin, et al.
Pubblicazione: (2024)
di: Yu, RunLin, et al.
Pubblicazione: (2024)
No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection
di: Dai, Zunkai, et al.
Pubblicazione: (2026)
di: Dai, Zunkai, et al.
Pubblicazione: (2026)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
di: Ding, Yiming, et al.
Pubblicazione: (2026)
di: Ding, Yiming, et al.
Pubblicazione: (2026)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
Zero-Shot Long-Form Video Understanding through Screenplay
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
di: Liu, Yunze, et al.
Pubblicazione: (2026)
di: Liu, Yunze, et al.
Pubblicazione: (2026)
Beyond Caption-Based Queries for Video Moment Retrieval
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
di: Pujol-Perich, David, et al.
Pubblicazione: (2026)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
MomentMix Augmentation with Length-Aware DETR for Temporally Robust Moment Retrieval
di: Park, Seojeong, et al.
Pubblicazione: (2024)
di: Park, Seojeong, et al.
Pubblicazione: (2024)
Leveraging MLLM Embeddings and Attribute Smoothing for Compositional Zero-Shot Learning
di: Yan, Xudong, et al.
Pubblicazione: (2024)
di: Yan, Xudong, et al.
Pubblicazione: (2024)
Who Can We Trust? Scope-Aware Video Moment Retrieval with Multi-Agent Conflict
di: Wu, Chaochen, et al.
Pubblicazione: (2025)
di: Wu, Chaochen, et al.
Pubblicazione: (2025)
RatSeizure: A Benchmark and Saliency-Context Transformer for Rat Seizure Localization
di: Tsai, Ting Yu, et al.
Pubblicazione: (2026)
di: Tsai, Ting Yu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs
di: Yu, An, et al.
Pubblicazione: (2026) -
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
di: Lu, Weiheng, et al.
Pubblicazione: (2024) -
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
di: Cai, Weitong, et al.
Pubblicazione: (2024) -
A New Benchmark and Model for Challenging Image Manipulation Detection
di: Zhang, Zhenfei, et al.
Pubblicazione: (2023) -
GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval
di: Jeon, Mingyu, et al.
Pubblicazione: (2026)