MVAM: Multi-View Attention Method for Fine-grained Image-Text Matching
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Wanqing, Cheng, Rui, Guo, Jiafeng, Cheng, Xueqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visual Transformation Telling
di: Cui, Wanqing, et al.
Pubblicazione: (2023)
di: Cui, Wanqing, et al.
Pubblicazione: (2023)
Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching
di: Chen, Wenjing
Pubblicazione: (2024)
di: Chen, Wenjing
Pubblicazione: (2024)
FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
MORE: Multi-mOdal REtrieval Augmented Generative Commonsense Reasoning
di: Cui, Wanqing, et al.
Pubblicazione: (2024)
di: Cui, Wanqing, et al.
Pubblicazione: (2024)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
Attention Grounded Enhancement for Visual Document Retrieval
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?
di: Cheng, Xueqi, et al.
Pubblicazione: (2026)
di: Cheng, Xueqi, et al.
Pubblicazione: (2026)
Image Over Text: Transforming Formula Recognition Evaluation with Character Detection Matching
di: Wang, Bin, et al.
Pubblicazione: (2024)
di: Wang, Bin, et al.
Pubblicazione: (2024)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
di: Cheng, Sheng, et al.
Pubblicazione: (2024)
di: Cheng, Sheng, et al.
Pubblicazione: (2024)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
di: Wang, Zhecan, et al.
Pubblicazione: (2023)
di: Wang, Zhecan, et al.
Pubblicazione: (2023)
Classifier Guidance Enhances Diffusion-based Adversarial Purification by Preserving Predictive Information
di: Zhang, Mingkun, et al.
Pubblicazione: (2024)
di: Zhang, Mingkun, et al.
Pubblicazione: (2024)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
di: Liang, Shuo, et al.
Pubblicazione: (2025)
di: Liang, Shuo, et al.
Pubblicazione: (2025)
Improving Brain-to-Image Reconstruction via Fine-Grained Text Bridging
di: Xia, Runze, et al.
Pubblicazione: (2025)
di: Xia, Runze, et al.
Pubblicazione: (2025)
Fine-grained Text to Image Synthesis
di: Ouyang, Xu, et al.
Pubblicazione: (2024)
di: Ouyang, Xu, et al.
Pubblicazione: (2024)
Beyond Image-Text Matching: Verb Understanding in Multimodal Transformers Using Guided Masking
di: Beňová, Ivana, et al.
Pubblicazione: (2024)
di: Beňová, Ivana, et al.
Pubblicazione: (2024)
Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
di: Ma, Zehong, et al.
Pubblicazione: (2025)
di: Ma, Zehong, et al.
Pubblicazione: (2025)
GLEAM: Learning to Match and Explain in Cross-View Geo-Localization
di: Lu, Xudong, et al.
Pubblicazione: (2025)
di: Lu, Xudong, et al.
Pubblicazione: (2025)
Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2025)
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2025)
CausalDiff: Causality-Inspired Disentanglement via Diffusion Model for Adversarial Defense
di: Zhang, Mingkun, et al.
Pubblicazione: (2024)
di: Zhang, Mingkun, et al.
Pubblicazione: (2024)
Match & Choose: Model Selection Framework for Fine-tuning Text-to-Image Diffusion Models
di: Lewandowski, Basile, et al.
Pubblicazione: (2025)
di: Lewandowski, Basile, et al.
Pubblicazione: (2025)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
di: Yu, Tianyu, et al.
Pubblicazione: (2023)
di: Yu, Tianyu, et al.
Pubblicazione: (2023)
VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models
di: Cheng, Ming, et al.
Pubblicazione: (2025)
di: Cheng, Ming, et al.
Pubblicazione: (2025)
Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
Towards Generative Class Prompt Learning for Fine-grained Visual Recognition
di: Chattopadhyay, Soumitri, et al.
Pubblicazione: (2024)
di: Chattopadhyay, Soumitri, et al.
Pubblicazione: (2024)
Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction
di: Fonseca, Rui, et al.
Pubblicazione: (2025)
di: Fonseca, Rui, et al.
Pubblicazione: (2025)
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
di: Guo, Zirun, et al.
Pubblicazione: (2025)
di: Guo, Zirun, et al.
Pubblicazione: (2025)
Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks
di: Li, Qian, et al.
Pubblicazione: (2024)
di: Li, Qian, et al.
Pubblicazione: (2024)
Advanced Multimodal Deep Learning Architecture for Image-Text Matching
di: Wang, Jinyin, et al.
Pubblicazione: (2024)
di: Wang, Jinyin, et al.
Pubblicazione: (2024)
ComCLIP: Training-Free Compositional Image and Text Matching
di: Jiang, Kenan, et al.
Pubblicazione: (2022)
di: Jiang, Kenan, et al.
Pubblicazione: (2022)
CLIPure: Purification in Latent Space via CLIP for Adversarially Robust Zero-Shot Classification
di: Zhang, Mingkun, et al.
Pubblicazione: (2025)
di: Zhang, Mingkun, et al.
Pubblicazione: (2025)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
di: Jing, Liqiang, et al.
Pubblicazione: (2024)
di: Jing, Liqiang, et al.
Pubblicazione: (2024)
Multi-Modal 3D Mesh Reconstruction from Images and Text
di: Reka, Melvin, et al.
Pubblicazione: (2025)
di: Reka, Melvin, et al.
Pubblicazione: (2025)
Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention
di: Nguyen, Nhi Ngoc-Yen, et al.
Pubblicazione: (2026)
di: Nguyen, Nhi Ngoc-Yen, et al.
Pubblicazione: (2026)
Enhancing Geo-localization for Crowdsourced Flood Imagery via LLM-Guided Attention
di: Xu, Fengyi, et al.
Pubblicazione: (2025)
di: Xu, Fengyi, et al.
Pubblicazione: (2025)
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
di: Tao, Xingjian, et al.
Pubblicazione: (2026)
di: Tao, Xingjian, et al.
Pubblicazione: (2026)
HA-FGOVD: Highlighting Fine-grained Attributes via Explicit Linear Composition for Open-Vocabulary Object Detection
di: Ma, Yuqi, et al.
Pubblicazione: (2024)
di: Ma, Yuqi, et al.
Pubblicazione: (2024)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024)
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Visual Transformation Telling
di: Cui, Wanqing, et al.
Pubblicazione: (2023) -
Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching
di: Chen, Wenjing
Pubblicazione: (2024) -
FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction
di: Hua, Hang, et al.
Pubblicazione: (2024) -
MORE: Multi-mOdal REtrieval Augmented Generative Commonsense Reasoning
di: Cui, Wanqing, et al.
Pubblicazione: (2024) -
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)