Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Qian, Su, Lixin, Zhao, Jiashu, Xia, Long, Cai, Hengyi, Cheng, Suqi, Tang, Hengzhu, Wang, Junfeng, Yin, Dawei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-Branch Collaborative Learning Network for Video Quality Assessment in Industrial Video Search
by: Tang, Hengzhu, et al.
Published: (2025)
by: Tang, Hengzhu, et al.
Published: (2025)
Variational Multi-Modal Hypergraph Attention Network for Multi-Modal Relation Extraction
by: Li, Qian, et al.
Published: (2024)
by: Li, Qian, et al.
Published: (2024)
Leveraging Generative Models for Real-Time Query-Driven Text Summarization in Large-Scale Web Search
by: Xiong, Zeyu, et al.
Published: (2025)
by: Xiong, Zeyu, et al.
Published: (2025)
FltLM: An Intergrated Long-Context Large Language Model for Effective Context Filtering and Understanding
by: Deng, Jingyang, et al.
Published: (2024)
by: Deng, Jingyang, et al.
Published: (2024)
GraphGPT: Graph Instruction Tuning for Large Language Models
by: Tang, Jiabin, et al.
Published: (2023)
by: Tang, Jiabin, et al.
Published: (2023)
Cross-model Control: Improving Multiple Large Language Models in One-time Training
by: Wu, Jiayi, et al.
Published: (2024)
by: Wu, Jiayi, et al.
Published: (2024)
GenCRF: Generative Clustering and Reformulation Framework for Enhanced Intent-Driven Information Retrieval
by: Seo, Wonduk, et al.
Published: (2024)
by: Seo, Wonduk, et al.
Published: (2024)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
by: Zhao, Zixu, et al.
Published: (2025)
by: Zhao, Zixu, et al.
Published: (2025)
VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos
by: Ren, Xubin, et al.
Published: (2025)
by: Ren, Xubin, et al.
Published: (2025)
Towards Verifiable Text Generation with Evolving Memory and Self-Reflection
by: Sun, Hao, et al.
Published: (2023)
by: Sun, Hao, et al.
Published: (2023)
TURA: Tool-Augmented Unified Retrieval Agent for AI Search
by: Zhao, Zhejun, et al.
Published: (2025)
by: Zhao, Zhejun, et al.
Published: (2025)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
by: Zhou, Junjie, et al.
Published: (2024)
by: Zhou, Junjie, et al.
Published: (2024)
Representation Learning with Large Language Models for Recommendation
by: Ren, Xubin, et al.
Published: (2023)
by: Ren, Xubin, et al.
Published: (2023)
Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning
by: Wei, Wenda, et al.
Published: (2025)
by: Wei, Wenda, et al.
Published: (2025)
Towards Completeness-Oriented Tool Retrieval for Large Language Models
by: Qu, Changle, et al.
Published: (2024)
by: Qu, Changle, et al.
Published: (2024)
XL$^2$Bench: A Benchmark for Extremely Long Context Understanding with Long-range Dependencies
by: Ni, Xuanfan, et al.
Published: (2024)
by: Ni, Xuanfan, et al.
Published: (2024)
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
by: Zhang, Zefeng, et al.
Published: (2025)
by: Zhang, Zefeng, et al.
Published: (2025)
Adversarial Video Promotion Against Text-to-Video Retrieval
by: Tian, Qiwei, et al.
Published: (2025)
by: Tian, Qiwei, et al.
Published: (2025)
Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
by: Ko, Dohwan, et al.
Published: (2025)
by: Ko, Dohwan, et al.
Published: (2025)
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
by: Liu, Fan, et al.
Published: (2024)
by: Liu, Fan, et al.
Published: (2024)
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
by: Qu, Changle, et al.
Published: (2026)
by: Qu, Changle, et al.
Published: (2026)
How to Utilize Complementary Vision-Text Information for 2D Structure Understanding
by: Dong, Jiancheng, et al.
Published: (2026)
by: Dong, Jiancheng, et al.
Published: (2026)
Towards AI Search Paradigm
by: Li, Yuchen, et al.
Published: (2025)
by: Li, Yuchen, et al.
Published: (2025)
PA-RAG: RAG Alignment via Multi-Perspective Preference Optimization
by: Wu, Jiayi, et al.
Published: (2024)
by: Wu, Jiayi, et al.
Published: (2024)
Hypergraph Multi-modal Large Language Model: Exploiting EEG and Eye-tracking Modalities to Evaluate Heterogeneous Responses for Video Understanding
by: Wu, Minghui, et al.
Published: (2024)
by: Wu, Minghui, et al.
Published: (2024)
Exploring Preference-Guided Diffusion Model for Cross-Domain Recommendation
by: Li, Xiaodong, et al.
Published: (2025)
by: Li, Xiaodong, et al.
Published: (2025)
TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planning
by: Ni, Hang, et al.
Published: (2025)
by: Ni, Hang, et al.
Published: (2025)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
by: Jiang, Chen, et al.
Published: (2023)
by: Jiang, Chen, et al.
Published: (2023)
MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval
by: Huang, Jinghao, et al.
Published: (2025)
by: Huang, Jinghao, et al.
Published: (2025)
AVC-DPO: Aligned Video Captioning via Direct Preference Optimization
by: Tang, Jiyang, et al.
Published: (2025)
by: Tang, Jiyang, et al.
Published: (2025)
AutothinkRAG: Complexity-Aware Control of Retrieval-Augmented Reasoning for Image-Text Interaction
by: Yang, Jiashu, et al.
Published: (2026)
by: Yang, Jiashu, et al.
Published: (2026)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
by: Cai, Weitong, et al.
Published: (2024)
by: Cai, Weitong, et al.
Published: (2024)
LLMRec: Large Language Models with Graph Augmentation for Recommendation
by: Wei, Wei, et al.
Published: (2023)
by: Wei, Wei, et al.
Published: (2023)
Powerful and Flexible: Personalized Text-to-Image Generation via Reinforcement Learning
by: Wei, Fanyue, et al.
Published: (2024)
by: Wei, Fanyue, et al.
Published: (2024)
AdaSwitch: Balancing Exploration and Guidance in Knowledge Distillation via Adaptive Switching
by: Peng, Jingyu, et al.
Published: (2025)
by: Peng, Jingyu, et al.
Published: (2025)
Multi-Granularity and Multi-modal Feature Interaction Approach for Text Video Retrieval
by: Li, Wenjun, et al.
Published: (2024)
by: Li, Wenjun, et al.
Published: (2024)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
by: Fang, Xiang, et al.
Published: (2022)
by: Fang, Xiang, et al.
Published: (2022)
StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
by: Wang, Shaokun, et al.
Published: (2026)
by: Wang, Shaokun, et al.
Published: (2026)
Decoupled Cross-Modal Alignment Network for Text-RGBT Person Retrieval and A High-Quality Benchmark
by: Deng, Yifei, et al.
Published: (2025)
by: Deng, Yifei, et al.
Published: (2025)
RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated Adapter
by: Cao, Meng, et al.
Published: (2024)
by: Cao, Meng, et al.
Published: (2024)
Similar Items
-
Multi-Branch Collaborative Learning Network for Video Quality Assessment in Industrial Video Search
by: Tang, Hengzhu, et al.
Published: (2025) -
Variational Multi-Modal Hypergraph Attention Network for Multi-Modal Relation Extraction
by: Li, Qian, et al.
Published: (2024) -
Leveraging Generative Models for Real-Time Query-Driven Text Summarization in Large-Scale Web Search
by: Xiong, Zeyu, et al.
Published: (2025) -
FltLM: An Intergrated Long-Context Large Language Model for Effective Context Filtering and Understanding
by: Deng, Jingyang, et al.
Published: (2024) -
GraphGPT: Graph Instruction Tuning for Large Language Models
by: Tang, Jiabin, et al.
Published: (2023)