Learning Segment Similarity and Alignment in Large-Scale Content Based Video Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Chen, Huang, Kaiming, He, Sifeng, Yang, Xudong, Zhang, Wei, Zhang, Xiaobo, Cheng, Yuan, Yang, Lei, Wang, Qing, Xu, Furong, Pan, Tan, Chu, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Think before You Leap: Content-Aware Low-Cost Edge-Assisted Video Semantic Segmentation
par: Yan, Mingxuan, et autres
Publié: (2024)
par: Yan, Mingxuan, et autres
Publié: (2024)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
par: Zhang, Long, et autres
Publié: (2025)
par: Zhang, Long, et autres
Publié: (2025)
Integrated Semantic and Temporal Alignment for Interactive Video Retrieval
par: Luu, Thanh-Danh, et autres
Publié: (2025)
par: Luu, Thanh-Danh, et autres
Publié: (2025)
Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval
par: Jiang, Xin, et autres
Publié: (2025)
par: Jiang, Xin, et autres
Publié: (2025)
Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models
par: Tan, Rui Yang, et autres
Publié: (2026)
par: Tan, Rui Yang, et autres
Publié: (2026)
Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval
par: Wu, Jiaxin, et autres
Publié: (2025)
par: Wu, Jiaxin, et autres
Publié: (2025)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
par: Jiang, Chen, et autres
Publié: (2023)
par: Jiang, Chen, et autres
Publié: (2023)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
par: Yan, Xin, et autres
Publié: (2024)
par: Yan, Xin, et autres
Publié: (2024)
Failures to Surface Harmful Contents in Video Large Language Models
par: Cao, Yuxin, et autres
Publié: (2025)
par: Cao, Yuxin, et autres
Publié: (2025)
SNP-S3: Shared Network Pre-training and Significant Semantic Strengthening for Various Video-Text Tasks
par: Dong, Xingning, et autres
Publié: (2024)
par: Dong, Xingning, et autres
Publié: (2024)
Adaptive Offloading and Enhancement for Low-Light Video Analytics on Mobile Devices
par: He, Yuanyi, et autres
Publié: (2024)
par: He, Yuanyi, et autres
Publié: (2024)
Joint Optimization of Buffer Delay and HARQ for Video Communications
par: Cheng, Baoping, et autres
Publié: (2024)
par: Cheng, Baoping, et autres
Publié: (2024)
Divide and Conquer: Multimodal Video Deepfake Detection via Cross-Modal Fusion and Localization
par: Li, Qingcao, et autres
Publié: (2026)
par: Li, Qingcao, et autres
Publié: (2026)
SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses
par: Tan, Chaolei, et autres
Publié: (2024)
par: Tan, Chaolei, et autres
Publié: (2024)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
par: Tong, Xinyi, et autres
Publié: (2025)
par: Tong, Xinyi, et autres
Publié: (2025)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
par: Yang, Rui, et autres
Publié: (2024)
par: Yang, Rui, et autres
Publié: (2024)
Knowledge-enhanced Multi-perspective Video Representation Learning for Scene Recognition
par: Yu, Xuzheng, et autres
Publié: (2024)
par: Yu, Xuzheng, et autres
Publié: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation
par: Zhao, Yuan, et autres
Publié: (2026)
par: Zhao, Yuan, et autres
Publié: (2026)
FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries
par: You, Qijie, et autres
Publié: (2026)
par: You, Qijie, et autres
Publié: (2026)
Multimodal LLM-based Query Paraphrasing for Video Search
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models
par: Guo, Zile, et autres
Publié: (2026)
par: Guo, Zile, et autres
Publié: (2026)
A H.265/HEVC Fine-Grained ROI Video Encryption Algorithm Based on Coding Unit and Prompt Segmentation
par: Zhang, Xiang, et autres
Publié: (2026)
par: Zhang, Xiang, et autres
Publié: (2026)
U-Sticker: A Large-Scale Multi-Domain User Sticker Dataset for Retrieval and Personalization
par: Chee, Heng Er Metilda, et autres
Publié: (2025)
par: Chee, Heng Er Metilda, et autres
Publié: (2025)
Start from Video-Music Retrieval: An Inter-Intra Modal Loss for Cross Modal Retrieval
par: Chen, Zeyu, et autres
Publié: (2024)
par: Chen, Zeyu, et autres
Publié: (2024)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2025)
par: Xiao, Jian, et autres
Publié: (2025)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2022)
par: Fang, Xiang, et autres
Publié: (2022)
Task Presentation and Human Perception in Interactive Video Retrieval
par: Willis, Nina, et autres
Publié: (2024)
par: Willis, Nina, et autres
Publié: (2024)
PixelatedScatter: Arbitrary-level Visual Abstraction for Large-scale Multiclass Scatterplots
par: Guo, Ziheng, et autres
Publié: (2025)
par: Guo, Ziheng, et autres
Publié: (2025)
High-level Codes and Fine-grained Weights for Online Multi-modal Hashing Retrieval
par: Zhan, Yu-Wei, et autres
Publié: (2024)
par: Zhan, Yu-Wei, et autres
Publié: (2024)
Towards Open-Vocabulary Video Semantic Segmentation
par: Li, Xinhao, et autres
Publié: (2024)
par: Li, Xinhao, et autres
Publié: (2024)
Building and Evaluating a Realistic Virtual World for Large Scale Urban Exploration from 360° Videos
par: Takenawa, Mizuki, et autres
Publié: (2025)
par: Takenawa, Mizuki, et autres
Publié: (2025)
FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding
par: He, Xusheng, et autres
Publié: (2025)
par: He, Xusheng, et autres
Publié: (2025)
TimeLogic Challenge @ CVPR 2026: Strong MLLMs Meet Evidence-Seeking Agents for Temporal-Logic Video Question Answering
par: Xu, Zhaoyang, et autres
Publié: (2026)
par: Xu, Zhaoyang, et autres
Publié: (2026)
Enhancing DETRs Variants through Improved Content Query and Similar Query Aggregation
par: Zhang, Yingying, et autres
Publié: (2024)
par: Zhang, Yingying, et autres
Publié: (2024)
Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval
par: Zhang, Bolin, et autres
Publié: (2026)
par: Zhang, Bolin, et autres
Publié: (2026)
Generalizing Video DeepFake Detection by Self-generated Audio-Visual Pseudo-Fakes
par: Wei, Zihe, et autres
Publié: (2026)
par: Wei, Zihe, et autres
Publié: (2026)
T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
par: Li, Yili, et autres
Publié: (2025)
par: Li, Yili, et autres
Publié: (2025)
Documents similaires
-
Think before You Leap: Content-Aware Low-Cost Edge-Assisted Video Semantic Segmentation
par: Yan, Mingxuan, et autres
Publié: (2024) -
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
par: Zhang, Long, et autres
Publié: (2025) -
Integrated Semantic and Temporal Alignment for Interactive Video Retrieval
par: Luu, Thanh-Danh, et autres
Publié: (2025) -
Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval
par: Jiang, Xin, et autres
Publié: (2025) -
Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models
par: Tan, Rui Yang, et autres
Publié: (2026)