Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Bolin, Yang, Chao, Jiang, Bin, Komamizu, Takahiro, Ide, Ichiro |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Action Selection Learning for Multi-label Multi-view Action Recognition
por: Nguyen, Trung Thanh, et al.
Publicado: (2024)
por: Nguyen, Trung Thanh, et al.
Publicado: (2024)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
por: Ding, Yiming, et al.
Publicado: (2026)
por: Ding, Yiming, et al.
Publicado: (2026)
Context-Enhanced Video Moment Retrieval with Large Language Models
por: Liu, Weijia, et al.
Publicado: (2024)
por: Liu, Weijia, et al.
Publicado: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
por: Xu, Yifang, et al.
Publicado: (2025)
por: Xu, Yifang, et al.
Publicado: (2025)
Interactive Multi-Turn Retrieval for Health Videos
por: Wu, Chengzheng, et al.
Publicado: (2026)
por: Wu, Chengzheng, et al.
Publicado: (2026)
One-Stage Open-Vocabulary Temporal Action Detection Leveraging Temporal Multi-scale and Action Label Features
por: Nguyen, Trung Thanh, et al.
Publicado: (2024)
por: Nguyen, Trung Thanh, et al.
Publicado: (2024)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2022)
por: Fang, Xiang, et al.
Publicado: (2022)
MultiTSF: Transformer-based Sensor Fusion for Human-Centric Multi-view and Multi-modal Action Recognition
por: Nguyen, Trung Thanh, et al.
Publicado: (2025)
por: Nguyen, Trung Thanh, et al.
Publicado: (2025)
MultiSensor-Home: A Wide-area Multi-modal Multi-view Dataset for Action Recognition and Transformer-based Sensor Fusion
por: Nguyen, Trung Thanh, et al.
Publicado: (2025)
por: Nguyen, Trung Thanh, et al.
Publicado: (2025)
An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval
por: Kandhare, Mahesh, et al.
Publicado: (2024)
por: Kandhare, Mahesh, et al.
Publicado: (2024)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
por: Chen, Liyang, et al.
Publicado: (2025)
por: Chen, Liyang, et al.
Publicado: (2025)
Q-Adapter: Visual Query Adapter for Extracting Textually-related Features in Video Captioning
por: Chen, Junan, et al.
Publicado: (2025)
por: Chen, Junan, et al.
Publicado: (2025)
Semi-supervised Semantic Segmentation with Multi-Constraint Consistency Learning
por: Yin, Jianjian, et al.
Publicado: (2025)
por: Yin, Jianjian, et al.
Publicado: (2025)
Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
por: Nishimura, Taichi, et al.
Publicado: (2024)
por: Nishimura, Taichi, et al.
Publicado: (2024)
View-aware Cross-modal Distillation for Multi-view Action Recognition
por: Nguyen, Trung Thanh, et al.
Publicado: (2025)
por: Nguyen, Trung Thanh, et al.
Publicado: (2025)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
por: Hu, Xiaowan, et al.
Publicado: (2024)
por: Hu, Xiaowan, et al.
Publicado: (2024)
Wills Aligner: Multi-Subject Collaborative Brain Visual Decoding
por: Bao, Guangyin, et al.
Publicado: (2024)
por: Bao, Guangyin, et al.
Publicado: (2024)
Generalized Jersey Number Recognition Using Multi-task Learning With Orientation-guided Weight Refinement
por: Lin, Yung-Hui, et al.
Publicado: (2024)
por: Lin, Yung-Hui, et al.
Publicado: (2024)
Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval
por: Lin, Junan, et al.
Publicado: (2025)
por: Lin, Junan, et al.
Publicado: (2025)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
por: Yao, Linli, et al.
Publicado: (2023)
por: Yao, Linli, et al.
Publicado: (2023)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
por: Zhang, Long, et al.
Publicado: (2025)
por: Zhang, Long, et al.
Publicado: (2025)
TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
Tracking Small Birds by Detection Candidate Region Filtering and Detection History-aware Association
por: Liu, Tingwei, et al.
Publicado: (2024)
por: Liu, Tingwei, et al.
Publicado: (2024)
PRVR: Partially Relevant Video Retrieval
por: Chen, Xianke, et al.
Publicado: (2022)
por: Chen, Xianke, et al.
Publicado: (2022)
Contrastive Pre-Training with Multi-View Fusion for No-Reference Point Cloud Quality Assessment
por: Shan, Ziyu, et al.
Publicado: (2024)
por: Shan, Ziyu, et al.
Publicado: (2024)
Multi-scale Bottleneck Transformer for Weakly Supervised Multimodal Violence Detection
por: Sun, Shengyang, et al.
Publicado: (2024)
por: Sun, Shengyang, et al.
Publicado: (2024)
Static and Dynamic Graph Alignment Network for Temporal Video Grounding
por: Hu, Zhanjie, et al.
Publicado: (2026)
por: Hu, Zhanjie, et al.
Publicado: (2026)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
por: Chow, Wei, et al.
Publicado: (2024)
por: Chow, Wei, et al.
Publicado: (2024)
Multi-task Prompt Words Learning for Social Media Content Generation
por: Xue, Haochen, et al.
Publicado: (2024)
por: Xue, Haochen, et al.
Publicado: (2024)
Weakly-supervised Localization of Manipulated Image Regions Using Multi-resolution Learned Features
por: Wang, Ziyong, et al.
Publicado: (2025)
por: Wang, Ziyong, et al.
Publicado: (2025)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
por: Zhang, Beiyuan, et al.
Publicado: (2024)
por: Zhang, Beiyuan, et al.
Publicado: (2024)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
por: Zhang, Deyu, et al.
Publicado: (2025)
por: Zhang, Deyu, et al.
Publicado: (2025)
WVSC: Wireless Video Semantic Communication with Multi-frame Compensation
por: Xie, Bingyan, et al.
Publicado: (2025)
por: Xie, Bingyan, et al.
Publicado: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
por: Zhang, Zhenxing, et al.
Publicado: (2024)
por: Zhang, Zhenxing, et al.
Publicado: (2024)
MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
por: Shi, Haoyuan, et al.
Publicado: (2026)
por: Shi, Haoyuan, et al.
Publicado: (2026)
Knowledge-enhanced Multi-perspective Video Representation Learning for Scene Recognition
por: Yu, Xuzheng, et al.
Publicado: (2024)
por: Yu, Xuzheng, et al.
Publicado: (2024)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
por: Yang, Rui, et al.
Publicado: (2024)
por: Yang, Rui, et al.
Publicado: (2024)
Multi-task Just Recognizable Difference for Video Coding for Machines: Database, Model, and Coding Application
por: Liu, Junqi, et al.
Publicado: (2026)
por: Liu, Junqi, et al.
Publicado: (2026)
MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
Ejemplares similares
-
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2026) -
Action Selection Learning for Multi-label Multi-view Action Recognition
por: Nguyen, Trung Thanh, et al.
Publicado: (2024) -
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
por: Ding, Yiming, et al.
Publicado: (2026) -
Context-Enhanced Video Moment Retrieval with Large Language Models
por: Liu, Weijia, et al.
Publicado: (2024) -
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
por: Xu, Yifang, et al.
Publicado: (2025)