How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Yuxin, Ma, Zongyang, Zhang, Ziqi, Qi, Zhongang, Yuan, Chunfeng, Li, Bing, Pu, Junfu, Shan, Ying, Qi, Xiaojuan, Hu, Weiming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EA-VTR: Event-Aware Video-Text Retrieval
di: Ma, Zongyang, et al.
Pubblicazione: (2024)
di: Ma, Zongyang, et al.
Pubblicazione: (2024)
mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA
di: Zhang, Tao, et al.
Pubblicazione: (2024)
di: Zhang, Tao, et al.
Pubblicazione: (2024)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
DetailFusion: A Dual-branch Framework with Detail Enhancement for Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2025)
di: Yang, Yuxin, et al.
Pubblicazione: (2025)
MMhops-R1: Multimodal Multi-hop Reasoning
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
di: Lu, Yifan, et al.
Pubblicazione: (2025)
di: Lu, Yifan, et al.
Pubblicazione: (2025)
Taming Rectified Flow for Inversion and Editing
di: Wang, Jiangshan, et al.
Pubblicazione: (2024)
di: Wang, Jiangshan, et al.
Pubblicazione: (2024)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
di: Pu, Junfu, et al.
Pubblicazione: (2026)
di: Pu, Junfu, et al.
Pubblicazione: (2026)
Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation
di: Li, Zhiheng, et al.
Pubblicazione: (2026)
di: Li, Zhiheng, et al.
Pubblicazione: (2026)
E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding
di: Liu, Ye, et al.
Pubblicazione: (2024)
di: Liu, Ye, et al.
Pubblicazione: (2024)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses
di: Tan, Chaolei, et al.
Pubblicazione: (2024)
di: Tan, Chaolei, et al.
Pubblicazione: (2024)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
di: Lu, Yifan, et al.
Pubblicazione: (2023)
di: Lu, Yifan, et al.
Pubblicazione: (2023)
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings
di: Li, Zhiheng, et al.
Pubblicazione: (2026)
di: Li, Zhiheng, et al.
Pubblicazione: (2026)
StyleAdapter: A Unified Stylized Image Generation Model
di: Wang, Zhouxia, et al.
Pubblicazione: (2023)
di: Wang, Zhouxia, et al.
Pubblicazione: (2023)
PromptIQA: Boosting the Performance and Generalization for No-Reference Image Quality Assessment via Prompts
di: Chen, Zewen, et al.
Pubblicazione: (2024)
di: Chen, Zewen, et al.
Pubblicazione: (2024)
Mono2Stereo: A Benchmark and Empirical Study for Stereo Conversion
di: Yu, Songsong, et al.
Pubblicazione: (2025)
di: Yu, Songsong, et al.
Pubblicazione: (2025)
NFT1000: A Cross-Modal Dataset for Non-Fungible Token Retrieval
di: Wang, Shuxun, et al.
Pubblicazione: (2024)
di: Wang, Shuxun, et al.
Pubblicazione: (2024)
SphereDiffusion: Spherical Geometry-Aware Distortion Resilient Diffusion Model
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation
di: Zheng, Guangcong, et al.
Pubblicazione: (2023)
di: Zheng, Guangcong, et al.
Pubblicazione: (2023)
SGAT4PASS: Spherical Geometry-Aware Transformer for PAnoramic Semantic Segmentation
di: Li, Xuewei, et al.
Pubblicazione: (2023)
di: Li, Xuewei, et al.
Pubblicazione: (2023)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
Learning from Neighbors: Category Extrapolation for Long-Tail Learning
di: Zhao, Shizhen, et al.
Pubblicazione: (2024)
di: Zhao, Shizhen, et al.
Pubblicazione: (2024)
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
di: Pu, Junfu, et al.
Pubblicazione: (2025)
di: Pu, Junfu, et al.
Pubblicazione: (2025)
PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLM
di: Yang, Tao, et al.
Pubblicazione: (2024)
di: Yang, Tao, et al.
Pubblicazione: (2024)
DOGR: Towards Versatile Visual Document Grounding and Referring
di: Zhou, Yinan, et al.
Pubblicazione: (2024)
di: Zhou, Yinan, et al.
Pubblicazione: (2024)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
di: Zhou, Shengchao, et al.
Pubblicazione: (2025)
di: Zhou, Shengchao, et al.
Pubblicazione: (2025)
An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval
di: Byun, Jaeseok, et al.
Pubblicazione: (2024)
di: Byun, Jaeseok, et al.
Pubblicazione: (2024)
Cross-Subject Domain Adaptation for Classifying Working Memory Load with Multi-Frame EEG Images
di: Chen, Junfu, et al.
Pubblicazione: (2021)
di: Chen, Junfu, et al.
Pubblicazione: (2021)
Strongly Positive Semi-Definite Tensors and Strongly SOS Tensors
di: Qi, Liqun, et al.
Pubblicazione: (2025)
di: Qi, Liqun, et al.
Pubblicazione: (2025)
Eigenvalues of Dual Hermitian Matrices with Application in Formation Control
di: Qi, Liqun, et al.
Pubblicazione: (2024)
di: Qi, Liqun, et al.
Pubblicazione: (2024)
Biquadratic Tensors: Eigenvalues and Structured Tensors
di: Qi, Liqun, et al.
Pubblicazione: (2025)
di: Qi, Liqun, et al.
Pubblicazione: (2025)
Nonnegative Biquadratic Tensors
di: Cui, Chunfeng, et al.
Pubblicazione: (2025)
di: Cui, Chunfeng, et al.
Pubblicazione: (2025)
Make It Efficient: Dynamic Sparse Attention for Autoregressive Image Generation
di: Xiang, Xunzhi, et al.
Pubblicazione: (2025)
di: Xiang, Xunzhi, et al.
Pubblicazione: (2025)
UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation
di: Zhong, Siru, et al.
Pubblicazione: (2024)
di: Zhong, Siru, et al.
Pubblicazione: (2024)
DynamiCtrl: Rethinking the Basic Structure and the Role of Text for High-quality Human Image Animation
di: Zhao, Haoyu, et al.
Pubblicazione: (2025)
di: Zhao, Haoyu, et al.
Pubblicazione: (2025)
Debiasing Text-to-Image Diffusion Models
di: He, Ruifei, et al.
Pubblicazione: (2024)
di: He, Ruifei, et al.
Pubblicazione: (2024)
Passage Retrieval of Polish Texts Using OKAPI BM25 and an Ensemble of Cross Encoders
di: Pokrywka, Jakub
Pubblicazione: (2024)
di: Pokrywka, Jakub
Pubblicazione: (2024)
Documenti analoghi
-
EA-VTR: Event-Aware Video-Text Retrieval
di: Ma, Zongyang, et al.
Pubblicazione: (2024) -
mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA
di: Zhang, Tao, et al.
Pubblicazione: (2024) -
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2026) -
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025) -
DetailFusion: A Dual-branch Framework with Detail Enhancement for Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2025)