Towards Efficient and Effective Text-to-Video Retrieval with Coarse-to-Fine Visual Representation Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tian, Kaibin, Cheng, Yanhua, Liu, Yi, Hou, Xinglin, Chen, Quan, Li, Han |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
Repeating Words for Video-Language Retrieval with Coarse-to-Fine Objectives
von: Zhao, Haoyu, et al.
Veröffentlicht: (2025)
von: Zhao, Haoyu, et al.
Veröffentlicht: (2025)
FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression
von: Zhu, Yuke, et al.
Veröffentlicht: (2024)
von: Zhu, Yuke, et al.
Veröffentlicht: (2024)
SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
Beyond Coarse-Grained Matching in Video-Text Retrieval
von: Chen, Aozhu, et al.
Veröffentlicht: (2024)
von: Chen, Aozhu, et al.
Veröffentlicht: (2024)
Coarse-To-Fine Tensor Trains for Compact Visual Representations
von: Loeschcke, Sebastian, et al.
Veröffentlicht: (2024)
von: Loeschcke, Sebastian, et al.
Veröffentlicht: (2024)
Test-Time Temporal Sampling for Efficient MLLM Video Understanding
von: Wang, Kaibin, et al.
Veröffentlicht: (2025)
von: Wang, Kaibin, et al.
Veröffentlicht: (2025)
Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval
von: Jeong, Boseung, et al.
Veröffentlicht: (2025)
von: Jeong, Boseung, et al.
Veröffentlicht: (2025)
Learning Coarse-to-Fine Osteoarthritis Representations under Noisy Hierarchical Labels
von: Zhang, Tongxu
Veröffentlicht: (2026)
von: Zhang, Tongxu
Veröffentlicht: (2026)
Adversarial Video Promotion Against Text-to-Video Retrieval
von: Tian, Qiwei, et al.
Veröffentlicht: (2025)
von: Tian, Qiwei, et al.
Veröffentlicht: (2025)
EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval
von: Chen, Yuhan, et al.
Veröffentlicht: (2026)
von: Chen, Yuhan, et al.
Veröffentlicht: (2026)
Multi-entity Video Transformers for Fine-Grained Video Representation Learning
von: Walmer, Matthew, et al.
Veröffentlicht: (2023)
von: Walmer, Matthew, et al.
Veröffentlicht: (2023)
CoVA: Text-Guided Composed Video Retrieval for Audio-Visual Content
von: Han, Gyuwon, et al.
Veröffentlicht: (2026)
von: Han, Gyuwon, et al.
Veröffentlicht: (2026)
Text-Guided Coarse-to-Fine Fusion Network for Robust Remote Sensing Visual Question Answering
von: Zhao, Zhicheng, et al.
Veröffentlicht: (2024)
von: Zhao, Zhicheng, et al.
Veröffentlicht: (2024)
CFSum: A Transformer-Based Multi-Modal Video Summarization Framework With Coarse-Fine Fusion
von: Guo, Yaowei, et al.
Veröffentlicht: (2025)
von: Guo, Yaowei, et al.
Veröffentlicht: (2025)
RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated Adapter
von: Cao, Meng, et al.
Veröffentlicht: (2024)
von: Cao, Meng, et al.
Veröffentlicht: (2024)
Text-Animator: Controllable Visual Text Video Generation
von: Liu, Lin, et al.
Veröffentlicht: (2024)
von: Liu, Lin, et al.
Veröffentlicht: (2024)
T2VIndexer: A Generative Video Indexer for Efficient Text-Video Retrieval
von: Li, Yili, et al.
Veröffentlicht: (2024)
von: Li, Yili, et al.
Veröffentlicht: (2024)
Ambiguity-Restrained Text-Video Representation Learning for Partially Relevant Video Retrieval
von: Cho, CH, et al.
Veröffentlicht: (2025)
von: Cho, CH, et al.
Veröffentlicht: (2025)
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
von: Tan, Zhiyu, et al.
Veröffentlicht: (2025)
von: Tan, Zhiyu, et al.
Veröffentlicht: (2025)
Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
von: Wang, Yuji, et al.
Veröffentlicht: (2025)
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
von: Shen, Leqi, et al.
Veröffentlicht: (2024)
von: Shen, Leqi, et al.
Veröffentlicht: (2024)
Fine-Grained Spatiotemporal Motion Alignment for Contrastive Video Representation Learning
von: Zhu, Minghao, et al.
Veröffentlicht: (2023)
von: Zhu, Minghao, et al.
Veröffentlicht: (2023)
Vision-TTT: Efficient and Expressive Visual Representation Learning with Test-Time Training
von: Kong, Quan, et al.
Veröffentlicht: (2026)
von: Kong, Quan, et al.
Veröffentlicht: (2026)
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
von: Li, Yunheng, et al.
Veröffentlicht: (2025)
von: Li, Yunheng, et al.
Veröffentlicht: (2025)
Generative Recall, Dense Reranking: Learning Multi-View Semantic IDs for Efficient Text-to-Video Retrieval
von: Zhao, Zecheng, et al.
Veröffentlicht: (2026)
von: Zhao, Zecheng, et al.
Veröffentlicht: (2026)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
von: Shen, Xiaoqian, et al.
Veröffentlicht: (2025)
von: Shen, Xiaoqian, et al.
Veröffentlicht: (2025)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
von: Liu, Weijia, et al.
Veröffentlicht: (2025)
von: Liu, Weijia, et al.
Veröffentlicht: (2025)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
von: Ma, Zehong, et al.
Veröffentlicht: (2025)
von: Ma, Zehong, et al.
Veröffentlicht: (2025)
M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering
von: Li, Yanshu, et al.
Veröffentlicht: (2025)
von: Li, Yanshu, et al.
Veröffentlicht: (2025)
Learning Accurate Template Matching with Differentiable Coarse-to-Fine Correspondence Refinement
von: Gao, Zhirui, et al.
Veröffentlicht: (2023)
von: Gao, Zhirui, et al.
Veröffentlicht: (2023)
Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark
von: Yang, Shuyu, et al.
Veröffentlicht: (2025)
von: Yang, Shuyu, et al.
Veröffentlicht: (2025)
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
von: Shen, Leqi, et al.
Veröffentlicht: (2025)
von: Shen, Leqi, et al.
Veröffentlicht: (2025)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
von: Zhang, Deyu, et al.
Veröffentlicht: (2025)
von: Zhang, Deyu, et al.
Veröffentlicht: (2025)
HVD: Human Vision-Driven Video Representation Learning for Text-Video Retrieval
von: Xie, Zequn, et al.
Veröffentlicht: (2026)
von: Xie, Zequn, et al.
Veröffentlicht: (2026)
Fine-Tuning Video-Text Contrastive Model for Primate Behavior Retrieval from Unlabeled Raw Videos
von: Santo, Giulio Cesare Mastrocinque, et al.
Veröffentlicht: (2025)
von: Santo, Giulio Cesare Mastrocinque, et al.
Veröffentlicht: (2025)
DCP-CLIP:A Coarse-to-Fine Framework for Open-Vocabulary Semantic Segmentation with Dual Interaction
von: Wang, Jing, et al.
Veröffentlicht: (2026)
von: Wang, Jing, et al.
Veröffentlicht: (2026)
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
von: Shen, Yiqing, et al.
Veröffentlicht: (2025)
von: Shen, Yiqing, et al.
Veröffentlicht: (2025)
Dyn-Adapter: Towards Disentangled Representation for Efficient Visual Recognition
von: Zhang, Yurong, et al.
Veröffentlicht: (2024)
von: Zhang, Yurong, et al.
Veröffentlicht: (2024)
InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation
von: Rao, Zhefan, et al.
Veröffentlicht: (2026)
von: Rao, Zhefan, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
von: Liu, Haowei, et al.
Veröffentlicht: (2024) -
Repeating Words for Video-Language Retrieval with Coarse-to-Fine Objectives
von: Zhao, Haoyu, et al.
Veröffentlicht: (2025) -
FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression
von: Zhu, Yuke, et al.
Veröffentlicht: (2024) -
SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026) -
Beyond Coarse-Grained Matching in Video-Text Retrieval
von: Chen, Aozhu, et al.
Veröffentlicht: (2024)