MATE: Meet At The Embedding -- Connecting Images with Long Texts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jang, Young Kyun, Kang, Junmo, Lee, Yong Jae, Kim, Donghyun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality
par: Oh, Youngtaek, et autres
Publié: (2024)
par: Oh, Youngtaek, et autres
Publié: (2024)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
par: Yu, Zhuoran, et autres
Publié: (2025)
par: Yu, Zhuoran, et autres
Publié: (2025)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
par: Shen, Li-Cheng, et autres
Publié: (2025)
par: Shen, Li-Cheng, et autres
Publié: (2025)
Talk in Pieces, See in Whole: Disentangling and Hierarchical Aggregating Representations for Language-based Object Detection
par: An, Sojung, et autres
Publié: (2025)
par: An, Sojung, et autres
Publié: (2025)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
par: Kim, Mingyeong, et autres
Publié: (2026)
par: Kim, Mingyeong, et autres
Publié: (2026)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
par: Lee, Dong-Jae, et autres
Publié: (2026)
par: Lee, Dong-Jae, et autres
Publié: (2026)
Draw Your Mind: Personalized Generation via Condition-Level Modeling in Text-to-Image Diffusion Models
par: Kim, Hyungjin, et autres
Publié: (2025)
par: Kim, Hyungjin, et autres
Publié: (2025)
Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image Retrieval
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing
par: Han, Gyojin, et autres
Publié: (2026)
par: Han, Gyojin, et autres
Publié: (2026)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
AH-OCDA: Amplitude-based Curriculum Learning and Hopfield Segmentation Model for Open Compound Domain Adaptation
par: Choi, Jaehyun, et autres
Publié: (2024)
par: Choi, Jaehyun, et autres
Publié: (2024)
Interfacing Foundation Models' Embeddings
par: Zou, Xueyan, et autres
Publié: (2023)
par: Zou, Xueyan, et autres
Publié: (2023)
Your Embedding Model is SMARTer Than You Think
par: Zhang, Jianrui, et autres
Publié: (2026)
par: Zhang, Jianrui, et autres
Publié: (2026)
Vision Learners Meet Web Image-Text Pairs
par: Zhao, Bingchen, et autres
Publié: (2023)
par: Zhao, Bingchen, et autres
Publié: (2023)
Test-Time Mixup Augmentation for Data and Class-Specific Uncertainty Estimation in Deep Learning Image Classification
par: Lee, Hansang, et autres
Publié: (2022)
par: Lee, Hansang, et autres
Publié: (2022)
Beta Sampling is All You Need: Efficient Image Generation Strategy for Diffusion Models using Stepwise Spectral Analysis
par: Lee, Haeil, et autres
Publié: (2024)
par: Lee, Haeil, et autres
Publié: (2024)
MERLIN: Multimodal Embedding Refinement via LLM-based Iterative Navigation for Text-Video Retrieval-Rerank Pipeline
par: Han, Donghoon, et autres
Publié: (2024)
par: Han, Donghoon, et autres
Publié: (2024)
DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization
par: Lee, Dongyeun, et autres
Publié: (2025)
par: Lee, Dongyeun, et autres
Publié: (2025)
Geometrical Properties of Text Token Embeddings for Strong Semantic Binding in Text-to-Image Generation
par: Seo, Hoigi, et autres
Publié: (2025)
par: Seo, Hoigi, et autres
Publié: (2025)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
par: Kang, Choongwon, et autres
Publié: (2026)
par: Kang, Choongwon, et autres
Publié: (2026)
The Effects of Mixed Sample Data Augmentation are Class Dependent
par: Lee, Haeil, et autres
Publié: (2023)
par: Lee, Haeil, et autres
Publié: (2023)
DragText: Rethinking Text Embedding in Point-based Image Editing
par: Choi, Gayoon, et autres
Publié: (2024)
par: Choi, Gayoon, et autres
Publié: (2024)
AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions
par: Jang, Jihyoung, et autres
Publié: (2026)
par: Jang, Jihyoung, et autres
Publié: (2026)
Frequency-Aware Token Reduction for Efficient Vision Transformer
par: Lee, Dong-Jae, et autres
Publié: (2025)
par: Lee, Dong-Jae, et autres
Publié: (2025)
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
par: Kim, Taewhan, et autres
Publié: (2024)
par: Kim, Taewhan, et autres
Publié: (2024)
Pygmalion Effect in Vision: Image-to-Clay Translation for Reflective Geometry Reconstruction
par: Lee, Gayoung, et autres
Publié: (2025)
par: Lee, Gayoung, et autres
Publié: (2025)
Text-guided Image Restoration and Semantic Enhancement for Text-to-Image Person Retrieval
par: Liu, Delong, et autres
Publié: (2023)
par: Liu, Delong, et autres
Publié: (2023)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
Large Language Models can Share Images, Too!
par: Lee, Young-Jun, et autres
Publié: (2023)
par: Lee, Young-Jun, et autres
Publié: (2023)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
par: Jiang, Dongzhi, et autres
Publié: (2024)
par: Jiang, Dongzhi, et autres
Publié: (2024)
Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
par: Yamabe, Shojiro, et autres
Publié: (2025)
par: Yamabe, Shojiro, et autres
Publié: (2025)
FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model
par: Lee, Yebin, et autres
Publié: (2024)
par: Lee, Yebin, et autres
Publié: (2024)
Text Change Detection in Multilingual Documents Using Image Comparison
par: Park, Doyoung, et autres
Publié: (2024)
par: Park, Doyoung, et autres
Publié: (2024)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
Text-only Synthesis for Image Captioning
par: Zhou, Qing, et autres
Publié: (2024)
par: Zhou, Qing, et autres
Publié: (2024)
Inspecting Explainability of Transformer Models with Additional Statistical Information
par: Nguyen, Hoang C., et autres
Publié: (2023)
par: Nguyen, Hoang C., et autres
Publié: (2023)
Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding
par: Min, Kyungmin, et autres
Publié: (2024)
par: Min, Kyungmin, et autres
Publié: (2024)
MULTI: Multimodal Understanding Leaderboard with Text and Images
par: Zhu, Zichen, et autres
Publié: (2024)
par: Zhu, Zichen, et autres
Publié: (2024)
Documents similaires
-
Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval
par: Jang, Young Kyun, et autres
Publié: (2024) -
Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality
par: Oh, Youngtaek, et autres
Publié: (2024) -
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
par: Yu, Zhuoran, et autres
Publié: (2025) -
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
par: Shen, Li-Cheng, et autres
Publié: (2025) -
Talk in Pieces, See in Whole: Disentangling and Hierarchical Aggregating Representations for Language-based Object Detection
par: An, Sojung, et autres
Publié: (2025)