Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Chen, Liu, Hong, Yu, Xuzheng, Wang, Qing, Cheng, Yuan, Xu, Jia, Liu, Zhongyi, Guo, Qingpei, Chu, Wei, Yang, Ming, Qi, Yuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SNP-S3: Shared Network Pre-training and Significant Semantic Strengthening for Various Video-Text Tasks
di: Dong, Xingning, et al.
Pubblicazione: (2024)
di: Dong, Xingning, et al.
Pubblicazione: (2024)
Knowledge-enhanced Multi-perspective Video Representation Learning for Scene Recognition
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2025)
di: Xiao, Jian, et al.
Pubblicazione: (2025)
PRVR: Partially Relevant Video Retrieval
di: Chen, Xianke, et al.
Pubblicazione: (2022)
di: Chen, Xianke, et al.
Pubblicazione: (2022)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
di: Zhang, Long, et al.
Pubblicazione: (2025)
di: Zhang, Long, et al.
Pubblicazione: (2025)
T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
di: Li, Yili, et al.
Pubblicazione: (2025)
di: Li, Yili, et al.
Pubblicazione: (2025)
DMC$^3$: Dual-Modal Counterfactual Contrastive Construction for Egocentric Video Question Answering
di: Zou, Jiayi, et al.
Pubblicazione: (2025)
di: Zou, Jiayi, et al.
Pubblicazione: (2025)
Deep Contrastive Multi-view Clustering under Semantic Feature Guidance
di: Liu, Siwen, et al.
Pubblicazione: (2024)
di: Liu, Siwen, et al.
Pubblicazione: (2024)
Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2024)
di: Xiao, Jian, et al.
Pubblicazione: (2024)
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
di: Li, Jun, et al.
Pubblicazione: (2025)
di: Li, Jun, et al.
Pubblicazione: (2025)
TCAN: Text-oriented Cross Attention Network for Multimodal Sentiment Analysis
di: Quan, Weize, et al.
Pubblicazione: (2024)
di: Quan, Weize, et al.
Pubblicazione: (2024)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
di: Huang, Hailang, et al.
Pubblicazione: (2024)
di: Huang, Hailang, et al.
Pubblicazione: (2024)
Context-Enhanced Video Moment Retrieval with Large Language Models
di: Liu, Weijia, et al.
Pubblicazione: (2024)
di: Liu, Weijia, et al.
Pubblicazione: (2024)
Contrast then Memorize: Semantic Neighbor Retrieval-Enhanced Inductive Multimodal Knowledge Graph Completion
di: Zhao, Yu, et al.
Pubblicazione: (2024)
di: Zhao, Yu, et al.
Pubblicazione: (2024)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Identity-Preserving Text-to-Video Generation by Frequency Decomposition
di: Yuan, Shenghai, et al.
Pubblicazione: (2024)
di: Yuan, Shenghai, et al.
Pubblicazione: (2024)
Learning Segment Similarity and Alignment in Large-Scale Content Based Video Retrieval
di: Jiang, Chen, et al.
Pubblicazione: (2023)
di: Jiang, Chen, et al.
Pubblicazione: (2023)
Beyond Coarse-Grained Matching in Video-Text Retrieval
di: Chen, Aozhu, et al.
Pubblicazione: (2024)
di: Chen, Aozhu, et al.
Pubblicazione: (2024)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
Neighbor-aware Instance Refining with Noisy Labels for Cross-Modal Retrieval
di: Liu, Yizhi, et al.
Pubblicazione: (2025)
di: Liu, Yizhi, et al.
Pubblicazione: (2025)
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
di: Li, Jun, et al.
Pubblicazione: (2026)
di: Li, Jun, et al.
Pubblicazione: (2026)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
di: Zhang, Deyu, et al.
Pubblicazione: (2025)
di: Zhang, Deyu, et al.
Pubblicazione: (2025)
An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval
di: Kandhare, Mahesh, et al.
Pubblicazione: (2024)
di: Kandhare, Mahesh, et al.
Pubblicazione: (2024)
SHE-Net: Syntax-Hierarchy-Enhanced Text-Video Retrieval
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
di: Yu, Xuzheng, et al.
Pubblicazione: (2024)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
di: Nishimura, Taichi, et al.
Pubblicazione: (2023)
di: Nishimura, Taichi, et al.
Pubblicazione: (2023)
MSCT: Differential Cross-Modal Attention for Deepfake Detection
di: Wei, Fangda, et al.
Pubblicazione: (2026)
di: Wei, Fangda, et al.
Pubblicazione: (2026)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
di: Xie, Zequn, et al.
Pubblicazione: (2026)
di: Xie, Zequn, et al.
Pubblicazione: (2026)
Riemann-based Multi-scale Attention Reasoning Network for Text-3D Retrieval
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
di: Cai, Lingling, et al.
Pubblicazione: (2024)
di: Cai, Lingling, et al.
Pubblicazione: (2024)
DualComp: End-to-End Learning of a Unified Dual-Modality Lossless Compressor
di: Zhao, Yan, et al.
Pubblicazione: (2025)
di: Zhao, Yan, et al.
Pubblicazione: (2025)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2022)
di: Fang, Xiang, et al.
Pubblicazione: (2022)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition
di: Yu, Yangchen, et al.
Pubblicazione: (2026)
di: Yu, Yangchen, et al.
Pubblicazione: (2026)
An Empirical Study of Excitation and Aggregation Design Adaptions in CLIP4Clip for Video-Text Retrieval
di: Jing, Xiaolun, et al.
Pubblicazione: (2024)
di: Jing, Xiaolun, et al.
Pubblicazione: (2024)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
di: Zhang, Rui, et al.
Pubblicazione: (2024)
di: Zhang, Rui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SNP-S3: Shared Network Pre-training and Significant Semantic Strengthening for Various Video-Text Tasks
di: Dong, Xingning, et al.
Pubblicazione: (2024) -
Knowledge-enhanced Multi-perspective Video Representation Learning for Scene Recognition
di: Yu, Xuzheng, et al.
Pubblicazione: (2024) -
Rebalancing Contrastive Alignment with Bottlenecked Semantic Increments in Text-Video Retrieval
di: Xiao, Jian, et al.
Pubblicazione: (2025) -
PRVR: Partially Relevant Video Retrieval
di: Chen, Xianke, et al.
Pubblicazione: (2022) -
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
di: Zhang, Long, et al.
Pubblicazione: (2025)