Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Haowei, Shi, Yaya, Xu, Haiyang, Yuan, Chunfeng, Ye, Qinghao, Li, Chenliang, Yan, Ming, Zhang, Ji, Huang, Fei, Li, Bing, Hu, Weiming |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
von: Hu, Anwen, et al.
Veröffentlicht: (2023)
von: Hu, Anwen, et al.
Veröffentlicht: (2023)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
EA-VTR: Event-Aware Video-Text Retrieval
von: Ma, Zongyang, et al.
Veröffentlicht: (2024)
von: Ma, Zongyang, et al.
Veröffentlicht: (2024)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
von: Lu, Yifan, et al.
Veröffentlicht: (2023)
von: Lu, Yifan, et al.
Veröffentlicht: (2023)
PC-Agent: A Hierarchical Multi-Agent Collaboration Framework for Complex Task Automation on PC
von: Liu, Haowei, et al.
Veröffentlicht: (2025)
von: Liu, Haowei, et al.
Veröffentlicht: (2025)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
von: Ye, Wei, et al.
Veröffentlicht: (2024)
von: Ye, Wei, et al.
Veröffentlicht: (2024)
How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
von: Chen, Yuxin, et al.
Veröffentlicht: (2024)
von: Chen, Yuxin, et al.
Veröffentlicht: (2024)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
von: Ye, Qinghao, et al.
Veröffentlicht: (2023)
von: Ye, Qinghao, et al.
Veröffentlicht: (2023)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
von: Yang, Yuxin, et al.
Veröffentlicht: (2026)
von: Yang, Yuxin, et al.
Veröffentlicht: (2026)
DriveLaW:Unifying Planning and Video Generation in a Latent Driving World
von: Xia, Tianze, et al.
Veröffentlicht: (2025)
von: Xia, Tianze, et al.
Veröffentlicht: (2025)
NFT1000: A Cross-Modal Dataset for Non-Fungible Token Retrieval
von: Wang, Shuxun, et al.
Veröffentlicht: (2024)
von: Wang, Shuxun, et al.
Veröffentlicht: (2024)
Towards Efficient and Effective Text-to-Video Retrieval with Coarse-to-Fine Visual Representation Learning
von: Tian, Kaibin, et al.
Veröffentlicht: (2024)
von: Tian, Kaibin, et al.
Veröffentlicht: (2024)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
von: Ye, Jiabo, et al.
Veröffentlicht: (2024)
von: Ye, Jiabo, et al.
Veröffentlicht: (2024)
PromptIQA: Boosting the Performance and Generalization for No-Reference Image Quality Assessment via Prompts
von: Chen, Zewen, et al.
Veröffentlicht: (2024)
von: Chen, Zewen, et al.
Veröffentlicht: (2024)
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
von: Lou, Haowei, et al.
Veröffentlicht: (2024)
von: Lou, Haowei, et al.
Veröffentlicht: (2024)
DetailFusion: A Dual-branch Framework with Detail Enhancement for Composed Image Retrieval
von: Yang, Yuxin, et al.
Veröffentlicht: (2025)
von: Yang, Yuxin, et al.
Veröffentlicht: (2025)
MM-StoryAgent: Immersive Narrated Storybook Video Generation with a Multi-Agent Paradigm across Text, Image and Audio
von: Xu, Xuenan, et al.
Veröffentlicht: (2025)
von: Xu, Xuenan, et al.
Veröffentlicht: (2025)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
The Illusion of Forgetting: Attack Unlearned Diffusion via Initial Latent Variable Optimization
von: Li, Manyi, et al.
Veröffentlicht: (2026)
von: Li, Manyi, et al.
Veröffentlicht: (2026)
SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
von: Lu, Yifan, et al.
Veröffentlicht: (2025)
von: Lu, Yifan, et al.
Veröffentlicht: (2025)
LaMPE: Length-aware Multi-grained Positional Encoding for Adaptive Long-context Scaling Without Training
von: Zhang, Sikui, et al.
Veröffentlicht: (2025)
von: Zhang, Sikui, et al.
Veröffentlicht: (2025)
CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning
von: Lu, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Lu, Zhiyuan, et al.
Veröffentlicht: (2026)
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
von: Hu, Anwen, et al.
Veröffentlicht: (2024)
von: Hu, Anwen, et al.
Veröffentlicht: (2024)
GMC-IQA: Exploiting Global-correlation and Mean-opinion Consistency for No-reference Image Quality Assessment
von: Chen, Zewen, et al.
Veröffentlicht: (2024)
von: Chen, Zewen, et al.
Veröffentlicht: (2024)
GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling
von: Liu, Pinxin, et al.
Veröffentlicht: (2025)
von: Liu, Pinxin, et al.
Veröffentlicht: (2025)
Generative Video Compression with One-Dimensional Latent Representation
von: Zheng, Zihan, et al.
Veröffentlicht: (2026)
von: Zheng, Zihan, et al.
Veröffentlicht: (2026)
SimInversion: A Simple Framework for Inversion-Based Text-to-Image Editing
von: Qian, Qi, et al.
Veröffentlicht: (2024)
von: Qian, Qi, et al.
Veröffentlicht: (2024)
FecTek: Enhancing Term Weight in Lexicon-Based Retrieval with Feature Context and Term-level Knowledge
von: Wang, Zunran, et al.
Veröffentlicht: (2024)
von: Wang, Zunran, et al.
Veröffentlicht: (2024)
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
von: Shen, Yiqing, et al.
Veröffentlicht: (2025)
von: Shen, Yiqing, et al.
Veröffentlicht: (2025)
Cross-lingual Matryoshka Representation Learning across Speech and Text
von: Sy, Yaya, et al.
Veröffentlicht: (2026)
von: Sy, Yaya, et al.
Veröffentlicht: (2026)
mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA
von: Zhang, Tao, et al.
Veröffentlicht: (2024)
von: Zhang, Tao, et al.
Veröffentlicht: (2024)
Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation
von: Wanyan, Yuyang, et al.
Veröffentlicht: (2025)
von: Wanyan, Yuyang, et al.
Veröffentlicht: (2025)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
Comment on “Traditional Chinese Medicine: An Effective Adjuvant Treatment of Periodontitis”
von: Shuang Pang, et al.
Veröffentlicht: (2026)
von: Shuang Pang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
von: Liu, Haowei, et al.
Veröffentlicht: (2024) -
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
von: Liu, Haowei, et al.
Veröffentlicht: (2024) -
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
von: Hu, Anwen, et al.
Veröffentlicht: (2023) -
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023) -
EA-VTR: Event-Aware Video-Text Retrieval
von: Ma, Zongyang, et al.
Veröffentlicht: (2024)