SHE-Net: Syntax-Hierarchy-Enhanced Text-Video Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Xuzheng, Jiang, Chen, Dong, Xingning, Gan, Tian, Yang, Ming, Guo, Qingpei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
M2-RAAP: A Multi-Modal Recipe for Advancing Adaptation-based Pre-training towards Effective and Efficient Zero-shot Video-text Retrieval
par: Dong, Xingning, et autres
Publié: (2024)
par: Dong, Xingning, et autres
Publié: (2024)
Video-ColBERT: Contextualized Late Interaction for Text-to-Video Retrieval
par: Reddy, Arun, et autres
Publié: (2025)
par: Reddy, Arun, et autres
Publié: (2025)
RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval
par: Skow, Tyler, et autres
Publié: (2026)
par: Skow, Tyler, et autres
Publié: (2026)
MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval
par: Huang, Jinghao, et autres
Publié: (2025)
par: Huang, Jinghao, et autres
Publié: (2025)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026)
par: Li, Minghan, et autres
Publié: (2026)
Video Editing for Video Retrieval
par: Zhu, Bin, et autres
Publié: (2024)
par: Zhu, Bin, et autres
Publié: (2024)
Multi-event Video-Text Retrieval
par: Zhang, Gengyuan, et autres
Publié: (2023)
par: Zhang, Gengyuan, et autres
Publié: (2023)
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2024)
par: Xiao, Jian, et autres
Publié: (2024)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2025)
par: Xiao, Jian, et autres
Publié: (2025)
Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval
par: Sun, Zengbao, et autres
Publié: (2024)
par: Sun, Zengbao, et autres
Publié: (2024)
LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts
par: Cai, Qifeng, et autres
Publié: (2025)
par: Cai, Qifeng, et autres
Publié: (2025)
Adapting MLLMs for Nuanced Video Retrieval
par: Bagad, Piyush, et autres
Publié: (2025)
par: Bagad, Piyush, et autres
Publié: (2025)
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
A Resource-Efficient Training Framework for Remote Sensing Text--Image Retrieval
par: Zhang, Weihang, et autres
Publié: (2025)
par: Zhang, Weihang, et autres
Publié: (2025)
Enhancing Subsequent Video Retrieval via Vision-Language Models (VLMs)
par: Duan, Yicheng, et autres
Publié: (2025)
par: Duan, Yicheng, et autres
Publié: (2025)
LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos
par: Yu, Rongyi, et autres
Publié: (2026)
par: Yu, Rongyi, et autres
Publié: (2026)
Event-aware Video Corpus Moment Retrieval
par: Hou, Danyang, et autres
Publié: (2024)
par: Hou, Danyang, et autres
Publié: (2024)
Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
AutothinkRAG: Complexity-Aware Control of Retrieval-Augmented Reasoning for Image-Text Interaction
par: Yang, Jiashu, et autres
Publié: (2026)
par: Yang, Jiashu, et autres
Publié: (2026)
TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval
par: Sun, Xinyu, et autres
Publié: (2026)
par: Sun, Xinyu, et autres
Publié: (2026)
Interactive Multi-Turn Retrieval for Health Videos
par: Wu, Chengzheng, et autres
Publié: (2026)
par: Wu, Chengzheng, et autres
Publié: (2026)
ADaFuSE: Adaptive Diffusion-generated Image and Text Fusion for Interactive Text-to-Image Retrieval
par: Zhang, Zhuocheng, et autres
Publié: (2026)
par: Zhang, Zhuocheng, et autres
Publié: (2026)
AlbumFill: Album-Guided Reasoning and Retrieval for Personalized Image Completion
par: Tsai, Yu-Ju, et autres
Publié: (2026)
par: Tsai, Yu-Ju, et autres
Publié: (2026)
BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment
par: Mounis, Mohamed Darwish, et autres
Publié: (2026)
par: Mounis, Mohamed Darwish, et autres
Publié: (2026)
Improving Video Corpus Moment Retrieval with Partial Relevance Enhancement
par: Hou, Danyang, et autres
Publié: (2024)
par: Hou, Danyang, et autres
Publié: (2024)
Hierarchy-of-Visual-Words: a Learning-based Approach for Trademark Image Retrieval
par: Lourenço, Vítor N., et autres
Publié: (2019)
par: Lourenço, Vítor N., et autres
Publié: (2019)
HVD: Human Vision-Driven Video Representation Learning for Text-Video Retrieval
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
FIGROTD: A Friendly-to-Handle Dataset for Image Guided Retrieval with Optional Text
par: Le, Hoang-Bao, et autres
Publié: (2025)
par: Le, Hoang-Bao, et autres
Publié: (2025)
Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach
par: Bai, Zechen, et autres
Publié: (2024)
par: Bai, Zechen, et autres
Publié: (2024)
MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation
par: Chakraborty, Debashish, et autres
Publié: (2026)
par: Chakraborty, Debashish, et autres
Publié: (2026)
SNP-S3: Shared Network Pre-training and Significant Semantic Strengthening for Various Video-Text Tasks
par: Dong, Xingning, et autres
Publié: (2024)
par: Dong, Xingning, et autres
Publié: (2024)
Automatic Funny Scene Extraction from Long-form Cinematic Videos
par: Paul, Sibendu, et autres
Publié: (2026)
par: Paul, Sibendu, et autres
Publié: (2026)
An Empirical Study of Excitation and Aggregation Design Adaptions in CLIP4Clip for Video-Text Retrieval
par: Jing, Xiaolun, et autres
Publié: (2024)
par: Jing, Xiaolun, et autres
Publié: (2024)
Towards Text-Image Interleaved Retrieval
par: Zhang, Xin, et autres
Publié: (2025)
par: Zhang, Xin, et autres
Publié: (2025)
Personalized Video Summarization using Text-Based Queries and Conditional Modeling
par: Huang, Jia-Hong
Publié: (2024)
par: Huang, Jia-Hong
Publié: (2024)
Snap and Diagnose: An Advanced Multimodal Retrieval System for Identifying Plant Diseases in the Wild
par: Wei, Tianqi, et autres
Publié: (2024)
par: Wei, Tianqi, et autres
Publié: (2024)
An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval
par: Byun, Jaeseok, et autres
Publié: (2024)
par: Byun, Jaeseok, et autres
Publié: (2024)
Global-to-Local or Local-to-Global? Enhancing Image Retrieval with Efficient Local Search and Effective Global Re-ranking
par: Aiger, Dror, et autres
Publié: (2025)
par: Aiger, Dror, et autres
Publié: (2025)
A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback
par: Khaertdinov, Bulat, et autres
Publié: (2025)
par: Khaertdinov, Bulat, et autres
Publié: (2025)
Documents similaires
-
M2-RAAP: A Multi-Modal Recipe for Advancing Adaptation-based Pre-training towards Effective and Efficient Zero-shot Video-text Retrieval
par: Dong, Xingning, et autres
Publié: (2024) -
Video-ColBERT: Contextualized Late Interaction for Text-to-Video Retrieval
par: Reddy, Arun, et autres
Publié: (2025) -
RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval
par: Skow, Tyler, et autres
Publié: (2026) -
MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval
par: Huang, Jinghao, et autres
Publié: (2025) -
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026)