Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Jian, Song, Zijie, Hu, Jialong, Cheng, Hao, Li, Jia, Hu, Zhenzhen, Hong, Richang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2024)
par: Xiao, Jian, et autres
Publié: (2024)
Learning Partially-Decorrelated Common Spaces for Ad-hoc Video Search
par: Hu, Fan, et autres
Publié: (2025)
par: Hu, Fan, et autres
Publié: (2025)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2022)
par: Fang, Xiang, et autres
Publié: (2022)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026)
par: Li, Minghan, et autres
Publié: (2026)
Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval
par: Wu, Jiaxin, et autres
Publié: (2025)
par: Wu, Jiaxin, et autres
Publié: (2025)
An Empirical Study of Excitation and Aggregation Design Adaptions in CLIP4Clip for Video-Text Retrieval
par: Jing, Xiaolun, et autres
Publié: (2024)
par: Jing, Xiaolun, et autres
Publié: (2024)
I$^3$-MRec: Invariant Learning with Information Bottleneck for Incomplete Modality Recommendation
par: Chen, Huilin, et autres
Publié: (2025)
par: Chen, Huilin, et autres
Publié: (2025)
VCR: Video representation for Contextual Retrieval
par: Nir, Oron, et autres
Publié: (2024)
par: Nir, Oron, et autres
Publié: (2024)
Uni-Retrieval: A Multi-Style Retrieval Framework for STEM's Education
par: Jia, Yanhao, et autres
Publié: (2025)
par: Jia, Yanhao, et autres
Publié: (2025)
Interactive Multi-Turn Retrieval for Health Videos
par: Wu, Chengzheng, et autres
Publié: (2026)
par: Wu, Chengzheng, et autres
Publié: (2026)
Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval
par: Ning, Hailong, et autres
Publié: (2025)
par: Ning, Hailong, et autres
Publié: (2025)
Joint-Dataset Learning and Cross-Consistent Regularization for Text-to-Motion Retrieval
par: Messina, Nicola, et autres
Publié: (2024)
par: Messina, Nicola, et autres
Publié: (2024)
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
VKIE: The Application of Key Information Extraction on Video Text
par: An, Siyu, et autres
Publié: (2023)
par: An, Siyu, et autres
Publié: (2023)
Balancing Semantic Relevance and Engagement in Related Video Recommendations
par: Jaspal, Amit, et autres
Publié: (2025)
par: Jaspal, Amit, et autres
Publié: (2025)
Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis
par: Pegia, Maria-Eirini, et autres
Publié: (2026)
par: Pegia, Maria-Eirini, et autres
Publié: (2026)
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
Toward Automatic Relevance Judgment using Vision--Language Models for Image--Text Retrieval Evaluation
par: Yang, Jheng-Hong, et autres
Publié: (2024)
par: Yang, Jheng-Hong, et autres
Publié: (2024)
RAG-VisualRec: An Open Resource for Vision- and Text-Enhanced Retrieval-Augmented Generation in Recommendation
par: Tourani, Ali, et autres
Publié: (2025)
par: Tourani, Ali, et autres
Publié: (2025)
VisTopics: A Visual Semantic Unsupervised Approach to Topic Modeling of Video and Image Data
par: Lokmanoglu, Ayse D, et autres
Publié: (2025)
par: Lokmanoglu, Ayse D, et autres
Publié: (2025)
Towards Holistic Language-video Representation: the language model-enhanced MSR-Video to Text Dataset
par: Yang, Yuchen, et autres
Publié: (2024)
par: Yang, Yuchen, et autres
Publié: (2024)
Beyond Static Collision Handling: Adaptive Semantic ID Learning for Multimodal Recommendation at Industrial Scale
par: Pan, Yongsen, et autres
Publié: (2026)
par: Pan, Yongsen, et autres
Publié: (2026)
From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
par: Lian, Niu, et autres
Publié: (2026)
par: Lian, Niu, et autres
Publié: (2026)
UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
par: Jiang, Haoyu, et autres
Publié: (2024)
par: Jiang, Haoyu, et autres
Publié: (2024)
Performance Evaluation in Multimedia Retrieval
par: Sauter, Loris, et autres
Publié: (2024)
par: Sauter, Loris, et autres
Publié: (2024)
Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
Don't Lose Yourself: Boosting Multimodal Recommendation via Reducing Node-neighbor Discrepancy in Graph Convolutional Network
par: Chen, Zheyu, et autres
Publié: (2024)
par: Chen, Zheyu, et autres
Publié: (2024)
Multimodal Pre-training Framework for Sequential Recommendation via Contrastive Learning
par: Zhang, Lingzi, et autres
Publié: (2023)
par: Zhang, Lingzi, et autres
Publié: (2023)
Multimodal Learned Sparse Retrieval for Image Suggestion
par: Nguyen, Thong, et autres
Publié: (2024)
par: Nguyen, Thong, et autres
Publié: (2024)
Any2Any: Incomplete Multimodal Retrieval with Conformal Prediction
par: Li, Po-han, et autres
Publié: (2024)
par: Li, Po-han, et autres
Publié: (2024)
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
par: Kong, Fanheng, et autres
Publié: (2025)
par: Kong, Fanheng, et autres
Publié: (2025)
Self-distilled Dynamic Fusion Network for Language-based Fashion Retrieval
par: Wu, Yiming, et autres
Publié: (2024)
par: Wu, Yiming, et autres
Publié: (2024)
Improving the Consistency in Cross-Lingual Cross-Modal Retrieval with 1-to-K Contrastive Learning
par: Nie, Zhijie, et autres
Publié: (2024)
par: Nie, Zhijie, et autres
Publié: (2024)
CLOSP: A Unified Semantic Space for SAR, MSI, and Text in Remote Sensing
par: Cambrin, Daniele Rege, et autres
Publié: (2025)
par: Cambrin, Daniele Rege, et autres
Publié: (2025)
HistLLM: A Unified Framework for LLM-Based Multimodal Recommendation with User History Encoding and Compression
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
par: Song, Zijie, et autres
Publié: (2023)
par: Song, Zijie, et autres
Publié: (2023)
Enabling Collaborative Parametric Knowledge Calibration for Retrieval-Augmented Vision Question Answering
par: Deng, Jiaqi, et autres
Publié: (2025)
par: Deng, Jiaqi, et autres
Publié: (2025)
Towards Identity-Aware Cross-Modal Retrieval: a Dataset and a Baseline
par: Messina, Nicola, et autres
Publié: (2024)
par: Messina, Nicola, et autres
Publié: (2024)
From Swath to Full-Disc: Advancing Precipitation Retrieval with Multimodal Knowledge Expansion
par: Wang, Zheng, et autres
Publié: (2025)
par: Wang, Zheng, et autres
Publié: (2025)
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels
par: Han, Haochen, et autres
Publié: (2024)
par: Han, Haochen, et autres
Publié: (2024)
Documents similaires
-
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
par: Xiao, Jian, et autres
Publié: (2024) -
Learning Partially-Decorrelated Common Spaces for Ad-hoc Video Search
par: Hu, Fan, et autres
Publié: (2025) -
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2022) -
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026) -
Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval
par: Wu, Jiaxin, et autres
Publié: (2025)