Enregistré dans:
| Auteurs principaux: | Wang, Zhenyu, Li, Wenjia, Zhu, Pengyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.14332 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-Branch Collaborative Learning Network for Video Quality Assessment in Industrial Video Search
par: Tang, Hengzhu, et autres
Publié: (2025)
par: Tang, Hengzhu, et autres
Publié: (2025)
Music Recommendation Based on Facial Emotion Recognition
par: B, Rajesh, et autres
Publié: (2024)
par: B, Rajesh, et autres
Publié: (2024)
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
par: Meng, GuangHao, et autres
Publié: (2025)
par: Meng, GuangHao, et autres
Publié: (2025)
I2CR: Intra- and Inter-modal Collaborative Reflections for Multimodal Entity Linking
par: Liu, Ziyan, et autres
Publié: (2025)
par: Liu, Ziyan, et autres
Publié: (2025)
Rethinking Detection Based Table Structure Recognition for Visually Rich Document Images
par: Xiao, Bin, et autres
Publié: (2023)
par: Xiao, Bin, et autres
Publié: (2023)
MTMD: A Multi-Task Multi-Domain Framework for Unified Ad Lightweight Ranking at Pinterest
par: Yang, Xiao, et autres
Publié: (2025)
par: Yang, Xiao, et autres
Publié: (2025)
DUET: A Tuning-Free Device-Cloud Collaborative Parameters Generation Framework for Efficient Device Model Generalization
par: Lv, Zheqi, et autres
Publié: (2022)
par: Lv, Zheqi, et autres
Publié: (2022)
UNION: A Lightweight Target Representation for Efficient Zero-Shot Image-Guided Retrieval with Optional Textual Queries
par: Le, Hoang-Bao, et autres
Publié: (2025)
par: Le, Hoang-Bao, et autres
Publié: (2025)
YOLO-Vehicle-Pro: A Cloud-Edge Collaborative Framework for Object Detection in Autonomous Driving under Adverse Weather Conditions
par: Li, Xiguang, et autres
Publié: (2024)
par: Li, Xiguang, et autres
Publié: (2024)
CoLLM: A Large Language Model for Composed Image Retrieval
par: Huynh, Chuong, et autres
Publié: (2025)
par: Huynh, Chuong, et autres
Publié: (2025)
FF-PNet: A Pyramid Network Based on Feature and Field for Brain Image Registration
par: Zhang, Ying, et autres
Publié: (2025)
par: Zhang, Ying, et autres
Publié: (2025)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
par: Zhu, Yingjian, et autres
Publié: (2026)
par: Zhu, Yingjian, et autres
Publié: (2026)
Zero-Shot Hashing Based on Reconstruction With Part Alignment
par: Jiang, Yan, et autres
Publié: (2025)
par: Jiang, Yan, et autres
Publié: (2025)
Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations
par: De Nadai, Marco, et autres
Publié: (2025)
par: De Nadai, Marco, et autres
Publié: (2025)
Enabling Collaborative Parametric Knowledge Calibration for Retrieval-Augmented Vision Question Answering
par: Deng, Jiaqi, et autres
Publié: (2025)
par: Deng, Jiaqi, et autres
Publié: (2025)
Leveraging Foundation Models for Content-Based Image Retrieval in Radiology
par: Denner, Stefan, et autres
Publié: (2024)
par: Denner, Stefan, et autres
Publié: (2024)
UniNote: A Unified Embedding Model for Multimodal Representation and Ranking
par: Zhao, Jinghan, et autres
Publié: (2026)
par: Zhao, Jinghan, et autres
Publié: (2026)
Large Language Models Meet Extreme Multi-label Classification: Scaling and Multi-modal Framework
par: Ortego, Diego, et autres
Publié: (2025)
par: Ortego, Diego, et autres
Publié: (2025)
Personalized Video Summarization using Text-Based Queries and Conditional Modeling
par: Huang, Jia-Hong
Publié: (2024)
par: Huang, Jia-Hong
Publié: (2024)
Rethinking Sparse Lexical Representations for Image Retrieval in the Age of Rising Multi-Modal Large Language Models
par: Nakata, Kengo, et autres
Publié: (2024)
par: Nakata, Kengo, et autres
Publié: (2024)
Iterative Optimal Attention and Local Model for Single Image Rain Streak Removal
par: Li, Xiangyu, et autres
Publié: (2025)
par: Li, Xiangyu, et autres
Publié: (2025)
TrajSV: A Trajectory-based Model for Sports Video Representations and Applications
par: Wang, Zheng, et autres
Publié: (2025)
par: Wang, Zheng, et autres
Publié: (2025)
MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark
par: Osmulski, Radek, et autres
Publié: (2025)
par: Osmulski, Radek, et autres
Publié: (2025)
EndoFinder: Online Image Retrieval for Explainable Colorectal Polyp Diagnosis
par: Yang, Ruijie, et autres
Publié: (2024)
par: Yang, Ruijie, et autres
Publié: (2024)
A Flexible and Scalable Framework for Video Moment Search
par: Zhang, Chongzhi, et autres
Publié: (2025)
par: Zhang, Chongzhi, et autres
Publié: (2025)
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
par: Molina, Adrià, et autres
Publié: (2024)
par: Molina, Adrià, et autres
Publié: (2024)
GMM-Based Comprehensive Feature Extraction and Relative Distance Preservation For Few-Shot Cross-Modal Retrieval
par: Sun, Chengsong, et autres
Publié: (2025)
par: Sun, Chengsong, et autres
Publié: (2025)
SAIL-Embedding Technical Report: Omni-modal Embedding Foundation Model
par: Lin, Lin, et autres
Publié: (2025)
par: Lin, Lin, et autres
Publié: (2025)
SignRAG: A Retrieval-Augmented System for Scalable Zero-Shot Road Sign Recognition
par: Zhu, Minghao, et autres
Publié: (2025)
par: Zhu, Minghao, et autres
Publié: (2025)
E5-V: Universal Embeddings with Multimodal Large Language Models
par: Jiang, Ting, et autres
Publié: (2024)
par: Jiang, Ting, et autres
Publié: (2024)
Diff-VPS: Video Polyp Segmentation via a Multi-task Diffusion Network with Adversarial Temporal Reasoning
par: Lu, Yingling, et autres
Publié: (2024)
par: Lu, Yingling, et autres
Publié: (2024)
Optimizing Multi-Modal Models for Image-Based Shape Retrieval: The Role of Pre-Alignment and Hard Contrastive Learning
par: Kühn, Paul Julius, et autres
Publié: (2026)
par: Kühn, Paul Julius, et autres
Publié: (2026)
MealRec: Multi-granularity Sequential Modeling via Hierarchical Diffusion Models for Micro-Video Recommendation
par: Dong, Xinxin, et autres
Publié: (2026)
par: Dong, Xinxin, et autres
Publié: (2026)
NextAds: Towards Next-generation Personalized Video Advertising
par: Xu, Yiyan, et autres
Publié: (2026)
par: Xu, Yiyan, et autres
Publié: (2026)
Are They the Same Picture? Adapting Concept Bottleneck Models for Human-AI Collaboration in Image Retrieval
par: Balloli, Vaibhav, et autres
Publié: (2024)
par: Balloli, Vaibhav, et autres
Publié: (2024)
A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task
par: Deng, Jiaqi, et autres
Publié: (2025)
par: Deng, Jiaqi, et autres
Publié: (2025)
Large Language Model Informed Patent Image Retrieval
par: Lo, Hao-Cheng, et autres
Publié: (2024)
par: Lo, Hao-Cheng, et autres
Publié: (2024)
Knowledge Discovery in Optical Music Recognition: Enhancing Information Retrieval with Instance Segmentation
par: Shatri, Elona, et autres
Publié: (2024)
par: Shatri, Elona, et autres
Publié: (2024)
Automating Iconclass: LLMs and RAG for Large-Scale Classification of Religious Woodcuts
par: Thomas, Drew B.
Publié: (2025)
par: Thomas, Drew B.
Publié: (2025)
Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
Documents similaires
-
Multi-Branch Collaborative Learning Network for Video Quality Assessment in Industrial Video Search
par: Tang, Hengzhu, et autres
Publié: (2025) -
Music Recommendation Based on Facial Emotion Recognition
par: B, Rajesh, et autres
Publié: (2024) -
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
par: Meng, GuangHao, et autres
Publié: (2025) -
I2CR: Intra- and Inter-modal Collaborative Reflections for Multimodal Entity Linking
par: Liu, Ziyan, et autres
Publié: (2025) -
Rethinking Detection Based Table Structure Recognition for Visually Rich Document Images
par: Xiao, Bin, et autres
Publié: (2023)