MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Dai, Ming, Yang, Sen, Duan, Boqiang, Yang, Wankou, Wang, Jingdong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens
por: Feng, Ze, et al.
Publicado: (2025)
por: Feng, Ze, et al.
Publicado: (2025)
Object-Centric Framework for Video Moment Retrieval
por: Li, Zongyao, et al.
Publicado: (2025)
por: Li, Zongyao, et al.
Publicado: (2025)
Precise GPS-Denied UAV Self-Positioning via Context-Enhanced Cross-View Geo-Localization
por: Xu, Yuanze, et al.
Publicado: (2025)
por: Xu, Yuanze, et al.
Publicado: (2025)
Improving Generalized Visual Grounding with Instance-aware Joint Learning
por: Dai, Ming, et al.
Publicado: (2025)
por: Dai, Ming, et al.
Publicado: (2025)
SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories
por: Zhu, Muzhi, et al.
Publicado: (2025)
por: Zhu, Muzhi, et al.
Publicado: (2025)
DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy
por: Dai, Ming, et al.
Publicado: (2025)
por: Dai, Ming, et al.
Publicado: (2025)
Background-aware Moment Detection for Video Moment Retrieval
por: Jung, Minjoon, et al.
Publicado: (2023)
por: Jung, Minjoon, et al.
Publicado: (2023)
Every Pixel Has its Moments: Ultra-High-Resolution Unpaired Image-to-Image Translation via Dense Normalization
por: Ho, Ming-Yang, et al.
Publicado: (2024)
por: Ho, Ming-Yang, et al.
Publicado: (2024)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
por: Flanagan, Kevin, et al.
Publicado: (2025)
por: Flanagan, Kevin, et al.
Publicado: (2025)
When One Moment Isn't Enough: Multi-Moment Retrieval with Cross-Moment Interactions
por: Cao, Zhuo, et al.
Publicado: (2025)
por: Cao, Zhuo, et al.
Publicado: (2025)
Moment Quantization for Video Temporal Grounding
por: Sun, Xiaolong, et al.
Publicado: (2025)
por: Sun, Xiaolong, et al.
Publicado: (2025)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
por: Cai, Weitong, et al.
Publicado: (2024)
por: Cai, Weitong, et al.
Publicado: (2024)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
por: Luo, Dezhao, et al.
Publicado: (2024)
por: Luo, Dezhao, et al.
Publicado: (2024)
Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling
por: Feng, Ze, et al.
Publicado: (2025)
por: Feng, Ze, et al.
Publicado: (2025)
Moment Sampling in Video LLMs for Long-Form Video QA
por: Chasmai, Mustafa, et al.
Publicado: (2025)
por: Chasmai, Mustafa, et al.
Publicado: (2025)
Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering
por: Song, Peipei, et al.
Publicado: (2025)
por: Song, Peipei, et al.
Publicado: (2025)
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
por: Zhuang, Weijun, et al.
Publicado: (2025)
por: Zhuang, Weijun, et al.
Publicado: (2025)
Object-level Geometric Structure Preserving for Natural Image Stitching
por: Cai, Wenxiao, et al.
Publicado: (2024)
por: Cai, Wenxiao, et al.
Publicado: (2024)
Text-Video Multi-Grained Integration for Video Moment Montage
por: Yin, Zhihui, et al.
Publicado: (2024)
por: Yin, Zhihui, et al.
Publicado: (2024)
Context-Enhanced Video Moment Retrieval with Large Language Models
por: Liu, Weijia, et al.
Publicado: (2024)
por: Liu, Weijia, et al.
Publicado: (2024)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
por: Chen, Houlun, et al.
Publicado: (2024)
por: Chen, Houlun, et al.
Publicado: (2024)
Aligning Moments in Time using Video Queries
por: Kumar, Yogesh, et al.
Publicado: (2025)
por: Kumar, Yogesh, et al.
Publicado: (2025)
SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
por: Yu, An, et al.
Publicado: (2025)
por: Yu, An, et al.
Publicado: (2025)
PRISM: Perceptual Recognition for Identifying Standout Moments in Human-Centric Keyframe Extraction
por: Cakmak, Mert Can, et al.
Publicado: (2025)
por: Cakmak, Mert Can, et al.
Publicado: (2025)
SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion
por: Dai, Ming, et al.
Publicado: (2024)
por: Dai, Ming, et al.
Publicado: (2024)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
por: Lu, Weiheng, et al.
Publicado: (2024)
por: Lu, Weiheng, et al.
Publicado: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
por: Xu, Yifang, et al.
Publicado: (2025)
por: Xu, Yifang, et al.
Publicado: (2025)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
por: Liu, Xiaolin, et al.
Publicado: (2026)
por: Liu, Xiaolin, et al.
Publicado: (2026)
Localizing Moments of Actions in Untrimmed Videos of Infants with Autism Spectrum Disorder
por: Helvaci, Halil Ismail, et al.
Publicado: (2024)
por: Helvaci, Halil Ismail, et al.
Publicado: (2024)
Detecting Precise Hand Touch Moments in Egocentric Video
por: Nguyen, Huy Anh, et al.
Publicado: (2026)
por: Nguyen, Huy Anh, et al.
Publicado: (2026)
Beyond Caption-Based Queries for Video Moment Retrieval
por: Pujol-Perich, David, et al.
Publicado: (2026)
por: Pujol-Perich, David, et al.
Publicado: (2026)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
por: Liu, Weijia, et al.
Publicado: (2025)
por: Liu, Weijia, et al.
Publicado: (2025)
Drone Referring Localization: An Efficient Heterogeneous Spatial Feature Interaction Method For UAV Self-Localization
por: Dai, Ming, et al.
Publicado: (2022)
por: Dai, Ming, et al.
Publicado: (2022)
Point to Span: Zero-Shot Moment Retrieval for Navigating Unseen Hour-Long Videos
por: Jeon, Mingyu, et al.
Publicado: (2025)
por: Jeon, Mingyu, et al.
Publicado: (2025)
Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints
por: Dai, Ming, et al.
Publicado: (2025)
por: Dai, Ming, et al.
Publicado: (2025)
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
por: Yoon, Sunjae, et al.
Publicado: (2022)
por: Yoon, Sunjae, et al.
Publicado: (2022)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
por: Ding, Yiming, et al.
Publicado: (2026)
por: Ding, Yiming, et al.
Publicado: (2026)
Vid-Morp: Video Moment Retrieval Pretraining from Unlabeled Videos in the Wild
por: Bao, Peijun, et al.
Publicado: (2024)
por: Bao, Peijun, et al.
Publicado: (2024)
SemanticMoments: Training-Free Motion Similarity via Third Moment Features
por: Huberman, Saar, et al.
Publicado: (2026)
por: Huberman, Saar, et al.
Publicado: (2026)
Ejemplares similares
-
EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens
por: Feng, Ze, et al.
Publicado: (2025) -
Object-Centric Framework for Video Moment Retrieval
por: Li, Zongyao, et al.
Publicado: (2025) -
Precise GPS-Denied UAV Self-Positioning via Context-Enhanced Cross-View Geo-Localization
por: Xu, Yuanze, et al.
Publicado: (2025) -
Improving Generalized Visual Grounding with Instance-aware Joint Learning
por: Dai, Ming, et al.
Publicado: (2025) -
SegAgent: Exploring Pixel Understanding Capabilities in MLLMs by Imitating Human Annotator Trajectories
por: Zhu, Muzhi, et al.
Publicado: (2025)