Moment and Highlight Detection via MLLM Frame Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiwanta, I Putu Andika Bagas, Purwarianti, Ayu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models
por: Irawan, Patrick Amadeus, et al.
Publicado: (2024)
por: Irawan, Patrick Amadeus, et al.
Publicado: (2024)
Saliency-Guided DETR for Moment Retrieval and Highlight Detection
por: Gordeev, Aleksandr, et al.
Publicado: (2024)
por: Gordeev, Aleksandr, et al.
Publicado: (2024)
DiffusionVMR: Diffusion Model for Joint Video Moment Retrieval and Highlight Detection
por: Zhao, Henghao, et al.
Publicado: (2023)
por: Zhao, Henghao, et al.
Publicado: (2023)
Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection
por: Xu, Yifang, et al.
Publicado: (2025)
por: Xu, Yifang, et al.
Publicado: (2025)
CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection
por: Dong, Xin, et al.
Publicado: (2026)
por: Dong, Xin, et al.
Publicado: (2026)
GPTSee: Enhancing Moment Retrieval and Highlight Detection via Description-Based Similarity Features
por: Sun, Yunzhuo, et al.
Publicado: (2024)
por: Sun, Yunzhuo, et al.
Publicado: (2024)
See, Rank, and Filter: Important Word-Aware Clip Filtering via Scene Understanding for Moment Retrieval and Highlight Detection
por: Lee, YuEun, et al.
Publicado: (2025)
por: Lee, YuEun, et al.
Publicado: (2025)
TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
ShotVL: Human-Centric Highlight Frame Retrieval via Language Queries
por: Xue, Wangyu, et al.
Publicado: (2024)
por: Xue, Wangyu, et al.
Publicado: (2024)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
por: Cai, Weitong, et al.
Publicado: (2024)
por: Cai, Weitong, et al.
Publicado: (2024)
MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning
por: Ma, Hongxu, et al.
Publicado: (2025)
por: Ma, Hongxu, et al.
Publicado: (2025)
Survey on AI-Generated Media Detection: From Non-MLLM to MLLM
por: Zou, Yueying, et al.
Publicado: (2025)
por: Zou, Yueying, et al.
Publicado: (2025)
Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
por: Nishimura, Taichi, et al.
Publicado: (2024)
por: Nishimura, Taichi, et al.
Publicado: (2024)
Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token
por: Zhang, Anqi, et al.
Publicado: (2026)
por: Zhang, Anqi, et al.
Publicado: (2026)
HighlightMe: Detecting Highlights from Human-Centric Videos
por: Bhattacharya, Uttaran, et al.
Publicado: (2021)
por: Bhattacharya, Uttaran, et al.
Publicado: (2021)
Permutation-Aware Action Segmentation via Unsupervised Frame-to-Segment Alignment
por: Tran, Quoc-Huy, et al.
Publicado: (2023)
por: Tran, Quoc-Huy, et al.
Publicado: (2023)
Watch Video, Catch Keyword: Context-aware Keyword Attention for Moment Retrieval and Highlight Detection
por: Um, Sung Jin, et al.
Publicado: (2025)
por: Um, Sung Jin, et al.
Publicado: (2025)
Task-Driven Exploration: Decoupling and Inter-Task Feedback for Joint Moment Retrieval and Highlight Detection
por: Yang, Jin, et al.
Publicado: (2024)
por: Yang, Jin, et al.
Publicado: (2024)
SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
por: Yu, An, et al.
Publicado: (2025)
por: Yu, An, et al.
Publicado: (2025)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
por: Xu, Runsen, et al.
Publicado: (2025)
por: Xu, Runsen, et al.
Publicado: (2025)
VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval
por: Paul, Dhiman, et al.
Publicado: (2024)
por: Paul, Dhiman, et al.
Publicado: (2024)
Background-aware Moment Detection for Video Moment Retrieval
por: Jung, Minjoon, et al.
Publicado: (2023)
por: Jung, Minjoon, et al.
Publicado: (2023)
LD-DETR: Loop Decoder DEtection TRansformer for Video Moment Retrieval and Highlight Detection
por: Zhao, Pengcheng, et al.
Publicado: (2025)
por: Zhao, Pengcheng, et al.
Publicado: (2025)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
por: Xu, Jingwei, et al.
Publicado: (2024)
por: Xu, Jingwei, et al.
Publicado: (2024)
Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation
por: Gaur, Manu, et al.
Publicado: (2024)
por: Gaur, Manu, et al.
Publicado: (2024)
Videogenic: Identifying Highlight Moments in Videos with Professional Photographs as a Prior
por: Lin, David Chuan-En, et al.
Publicado: (2022)
por: Lin, David Chuan-En, et al.
Publicado: (2022)
VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection
por: Han, Hui, et al.
Publicado: (2026)
por: Han, Hui, et al.
Publicado: (2026)
Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
por: Liu, Jiazhen, et al.
Publicado: (2025)
por: Liu, Jiazhen, et al.
Publicado: (2025)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
por: Huang, Jiaxin, et al.
Publicado: (2025)
por: Huang, Jiaxin, et al.
Publicado: (2025)
ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning
por: Zhu, Wenjie, et al.
Publicado: (2025)
por: Zhu, Wenjie, et al.
Publicado: (2025)
POEM: Precise Object-level Editing via MLLM control
por: Schouten, Marco, et al.
Publicado: (2025)
por: Schouten, Marco, et al.
Publicado: (2025)
Interaction-Consistent Object Removal via MLLM-Based Reasoning
por: Huang, Ching-Kai, et al.
Publicado: (2026)
por: Huang, Ching-Kai, et al.
Publicado: (2026)
Elysium: Exploring Object-level Perception in Videos via MLLM
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
The Evolution of Video Anomaly Detection: A Unified Framework from DNN to MLLM
por: Gao, Shibo, et al.
Publicado: (2025)
por: Gao, Shibo, et al.
Publicado: (2025)
BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation
por: Wen, Haiquan, et al.
Publicado: (2025)
por: Wen, Haiquan, et al.
Publicado: (2025)
MLLM-Enhanced Face Forgery Detection: A Vision-Language Fusion Solution
por: Peng, Siran, et al.
Publicado: (2025)
por: Peng, Siran, et al.
Publicado: (2025)
Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
por: Xuan, Shiyu, et al.
Publicado: (2026)
por: Xuan, Shiyu, et al.
Publicado: (2026)
REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting
por: Shi, Changyue, et al.
Publicado: (2025)
por: Shi, Changyue, et al.
Publicado: (2025)
LiFR-Seg: Anytime High-Frame-Rate Segmentation via Event-Guided Propagation
por: Wu, Xiaoshan, et al.
Publicado: (2026)
por: Wu, Xiaoshan, et al.
Publicado: (2026)
Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment
por: Zhao, Pengfei, et al.
Publicado: (2025)
por: Zhao, Pengfei, et al.
Publicado: (2025)
Ejemplares similares
-
Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models
por: Irawan, Patrick Amadeus, et al.
Publicado: (2024) -
Saliency-Guided DETR for Moment Retrieval and Highlight Detection
por: Gordeev, Aleksandr, et al.
Publicado: (2024) -
DiffusionVMR: Diffusion Model for Joint Video Moment Retrieval and Highlight Detection
por: Zhao, Henghao, et al.
Publicado: (2023) -
Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection
por: Xu, Yifang, et al.
Publicado: (2025) -
CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection
por: Dong, Xin, et al.
Publicado: (2026)