MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Jinghao, Chen, Yaxiong, Liu, Ganchao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval
di: Sun, Zengbao, et al.
Pubblicazione: (2024)
di: Sun, Zengbao, et al.
Pubblicazione: (2024)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2022)
di: Fang, Xiang, et al.
Pubblicazione: (2022)
Modality-Balanced Learning for Multimedia Recommendation
di: Zhang, Jinghao, et al.
Pubblicazione: (2024)
di: Zhang, Jinghao, et al.
Pubblicazione: (2024)
Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search
di: Zhang, Jiahao, et al.
Pubblicazione: (2026)
di: Zhang, Jiahao, et al.
Pubblicazione: (2026)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2025)
di: Xiao, Jian, et al.
Pubblicazione: (2025)
Multi-event Video-Text Retrieval
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval
di: Skow, Tyler, et al.
Pubblicazione: (2026)
di: Skow, Tyler, et al.
Pubblicazione: (2026)
SHE-Net: Syntax-Hierarchy-Enhanced Text-Video Retrieval
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
Object-Aware Query Perturbation for Cross-Modal Image-Text Retrieval
di: Sogi, Naoya, et al.
Pubblicazione: (2024)
di: Sogi, Naoya, et al.
Pubblicazione: (2024)
Scale Up Composed Image Retrieval Learning via Modification Text Generation
di: Zhou, Yinan, et al.
Pubblicazione: (2025)
di: Zhou, Yinan, et al.
Pubblicazione: (2025)
Video-ColBERT: Contextualized Late Interaction for Text-to-Video Retrieval
di: Reddy, Arun, et al.
Pubblicazione: (2025)
di: Reddy, Arun, et al.
Pubblicazione: (2025)
GMM-Based Comprehensive Feature Extraction and Relative Distance Preservation For Few-Shot Cross-Modal Retrieval
di: Sun, Chengsong, et al.
Pubblicazione: (2025)
di: Sun, Chengsong, et al.
Pubblicazione: (2025)
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels
di: Han, Haochen, et al.
Pubblicazione: (2024)
di: Han, Haochen, et al.
Pubblicazione: (2024)
PromptHash: Affinity-Prompted Collaborative Cross-Modal Learning for Adaptive Hashing Retrieval
di: Zou, Qiang, et al.
Pubblicazione: (2025)
di: Zou, Qiang, et al.
Pubblicazione: (2025)
ADaFuSE: Adaptive Diffusion-generated Image and Text Fusion for Interactive Text-to-Image Retrieval
di: Zhang, Zhuocheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhuocheng, et al.
Pubblicazione: (2026)
Reversed in Time: A Novel Temporal-Emphasized Benchmark for Cross-Modal Video-Text Retrieval
di: Du, Yang, et al.
Pubblicazione: (2024)
di: Du, Yang, et al.
Pubblicazione: (2024)
REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark
di: Wasserman, Navve, et al.
Pubblicazione: (2025)
di: Wasserman, Navve, et al.
Pubblicazione: (2025)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
di: Li, Minghan, et al.
Pubblicazione: (2026)
di: Li, Minghan, et al.
Pubblicazione: (2026)
Automatic Creative Selection with Cross-Modal Matching
di: Kim, Alex, et al.
Pubblicazione: (2024)
di: Kim, Alex, et al.
Pubblicazione: (2024)
Video Editing for Video Retrieval
di: Zhu, Bin, et al.
Pubblicazione: (2024)
di: Zhu, Bin, et al.
Pubblicazione: (2024)
Towards Identity-Aware Cross-Modal Retrieval: a Dataset and a Baseline
di: Messina, Nicola, et al.
Pubblicazione: (2024)
di: Messina, Nicola, et al.
Pubblicazione: (2024)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2024)
di: Xiao, Jian, et al.
Pubblicazione: (2024)
Personalized Video Summarization using Text-Based Queries and Conditional Modeling
di: Huang, Jia-Hong
Pubblicazione: (2024)
di: Huang, Jia-Hong
Pubblicazione: (2024)
Rethinking Sparse Lexical Representations for Image Retrieval in the Age of Rising Multi-Modal Large Language Models
di: Nakata, Kengo, et al.
Pubblicazione: (2024)
di: Nakata, Kengo, et al.
Pubblicazione: (2024)
Joint-Dataset Learning and Cross-Consistent Regularization for Text-to-Motion Retrieval
di: Messina, Nicola, et al.
Pubblicazione: (2024)
di: Messina, Nicola, et al.
Pubblicazione: (2024)
Interactive Multi-Turn Retrieval for Health Videos
di: Wu, Chengzheng, et al.
Pubblicazione: (2026)
di: Wu, Chengzheng, et al.
Pubblicazione: (2026)
Entity Image and Mixed-Modal Image Retrieval Datasets
di: Blaga, Cristian-Ioan, et al.
Pubblicazione: (2025)
di: Blaga, Cristian-Ioan, et al.
Pubblicazione: (2025)
Optimizing Multi-Modal Models for Image-Based Shape Retrieval: The Role of Pre-Alignment and Hard Contrastive Learning
di: Kühn, Paul Julius, et al.
Pubblicazione: (2026)
di: Kühn, Paul Julius, et al.
Pubblicazione: (2026)
Cross-Modal Retrieval with Cauchy-Schwarz Divergence
di: Zhang, Jiahao, et al.
Pubblicazione: (2025)
di: Zhang, Jiahao, et al.
Pubblicazione: (2025)
Adapting MLLMs for Nuanced Video Retrieval
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
di: Bagad, Piyush, et al.
Pubblicazione: (2025)
LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos
di: Yu, Rongyi, et al.
Pubblicazione: (2026)
di: Yu, Rongyi, et al.
Pubblicazione: (2026)
Generalized Contrastive Learning for Multi-Modal Retrieval and Ranking
di: Zhu, Tianyu, et al.
Pubblicazione: (2024)
di: Zhu, Tianyu, et al.
Pubblicazione: (2024)
Modality and Task Adaptation for Enhanced Zero-shot Composed Image Retrieval
di: Li, Haiwen, et al.
Pubblicazione: (2024)
di: Li, Haiwen, et al.
Pubblicazione: (2024)
A Resource-Efficient Training Framework for Remote Sensing Text--Image Retrieval
di: Zhang, Weihang, et al.
Pubblicazione: (2025)
di: Zhang, Weihang, et al.
Pubblicazione: (2025)
Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
Event-aware Video Corpus Moment Retrieval
di: Hou, Danyang, et al.
Pubblicazione: (2024)
di: Hou, Danyang, et al.
Pubblicazione: (2024)
Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval
di: Alomari, Hani, et al.
Pubblicazione: (2025)
di: Alomari, Hani, et al.
Pubblicazione: (2025)
MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation
di: Chakraborty, Debashish, et al.
Pubblicazione: (2026)
di: Chakraborty, Debashish, et al.
Pubblicazione: (2026)
Attributes Grouping and Mining Hashing for Fine-Grained Image Retrieval
di: Lu, Xin, et al.
Pubblicazione: (2023)
di: Lu, Xin, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval
di: Sun, Zengbao, et al.
Pubblicazione: (2024) -
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024) -
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2022) -
Modality-Balanced Learning for Multimedia Recommendation
di: Zhang, Jinghao, et al.
Pubblicazione: (2024) -
Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search
di: Zhang, Jiahao, et al.
Pubblicazione: (2026)