Removing Distributional Discrepancies in Captions Improves Image-Text Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yuheng, Liu, Haotian, Cai, Mu, Li, Yijun, Shechtman, Eli, Lin, Zhe, Lee, Yong Jae, Singh, Krishna Kumar |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
par: Mo, Sicheng, et autres
Publié: (2025)
par: Mo, Sicheng, et autres
Publié: (2025)
Relational Visual Similarity
par: Nguyen, Thao, et autres
Publié: (2025)
par: Nguyen, Thao, et autres
Publié: (2025)
X-Fusion: Introducing New Modality to Frozen Large Language Models
par: Mo, Sicheng, et autres
Publié: (2025)
par: Mo, Sicheng, et autres
Publié: (2025)
Improved Baselines with Visual Instruction Tuning
par: Liu, Haotian, et autres
Publié: (2023)
par: Liu, Haotian, et autres
Publié: (2023)
Yo'LLaVA: Your Personalized Language and Vision Assistant
par: Nguyen, Thao, et autres
Publié: (2024)
par: Nguyen, Thao, et autres
Publié: (2024)
Edit One for All: Interactive Batch Image Editing
par: Nguyen, Thao, et autres
Publié: (2024)
par: Nguyen, Thao, et autres
Publié: (2024)
Learning an Image Editing Model without Image Editing Pairs
par: Kumari, Nupur, et autres
Publié: (2025)
par: Kumari, Nupur, et autres
Publié: (2025)
Improved Distribution Matching Distillation for Fast Image Synthesis
par: Yin, Tianwei, et autres
Publié: (2024)
par: Yin, Tianwei, et autres
Publié: (2024)
Continual Learning for Image Captioning through Improved Image-Text Alignment
par: Taetz, Bertram, et autres
Publié: (2025)
par: Taetz, Bertram, et autres
Publié: (2025)
Self-Evaluation Unlocks Any-Step Text-to-Image Generation
par: Yu, Xin, et autres
Publié: (2025)
par: Yu, Xin, et autres
Publié: (2025)
Towards Universal Fake Image Detectors that Generalize Across Generative Models
par: Ojha, Utkarsh, et autres
Publié: (2023)
par: Ojha, Utkarsh, et autres
Publié: (2023)
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing
par: Rajan, Anirudh Sundara, et autres
Publié: (2026)
par: Rajan, Anirudh Sundara, et autres
Publié: (2026)
Separate-and-Enhance: Compositional Finetuning for Text2Image Diffusion Models
par: Bao, Zhipeng, et autres
Publié: (2023)
par: Bao, Zhipeng, et autres
Publié: (2023)
YoChameleon: Personalized Vision and Language Generation
par: Nguyen, Thao, et autres
Publié: (2025)
par: Nguyen, Thao, et autres
Publié: (2025)
Customizing Text-to-Image Diffusion with Object Viewpoint Control
par: Kumari, Nupur, et autres
Publié: (2024)
par: Kumari, Nupur, et autres
Publié: (2024)
MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
par: Xue, Haotian, et autres
Publié: (2025)
par: Xue, Haotian, et autres
Publié: (2025)
SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
par: Zhang, Lin, et autres
Publié: (2025)
par: Zhang, Lin, et autres
Publié: (2025)
Improving Text Generation on Images with Synthetic Captions
par: Koh, Jun Young, et autres
Publié: (2024)
par: Koh, Jun Young, et autres
Publié: (2024)
Editable Image Elements for Controllable Synthesis
par: Mu, Jiteng, et autres
Publié: (2024)
par: Mu, Jiteng, et autres
Publié: (2024)
Improved Baselines with Representation Autoencoders
par: Singh, Jaskirat, et autres
Publié: (2026)
par: Singh, Jaskirat, et autres
Publié: (2026)
What matters for Representation Alignment: Global Information or Spatial Structure?
par: Singh, Jaskirat, et autres
Publié: (2025)
par: Singh, Jaskirat, et autres
Publié: (2025)
Benchmarking and Improving Detail Image Caption
par: Dong, Hongyuan, et autres
Publié: (2024)
par: Dong, Hongyuan, et autres
Publié: (2024)
Panoptic Captioning: An Equivalence Bridge for Image and Text
par: Lin, Kun-Yu, et autres
Publié: (2025)
par: Lin, Kun-Yu, et autres
Publié: (2025)
LayerFusion: Harmonized Multi-Layer Text-to-Image Generation with Generative Priors
par: Dalva, Yusuf, et autres
Publié: (2024)
par: Dalva, Yusuf, et autres
Publié: (2024)
Painting with Words: Elevating Detailed Image Captioning with Benchmark and Alignment Learning
par: Ye, Qinghao, et autres
Publié: (2025)
par: Ye, Qinghao, et autres
Publié: (2025)
Text-only Synthesis for Image Captioning
par: Zhou, Qing, et autres
Publié: (2024)
par: Zhou, Qing, et autres
Publié: (2024)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
par: Liu, Luping, et autres
Publié: (2024)
par: Liu, Luping, et autres
Publié: (2024)
Generative Portrait Shadow Removal
par: Yoon, Jae Shin, et autres
Publié: (2024)
par: Yoon, Jae Shin, et autres
Publié: (2024)
UniSER: A Foundation Model for Unified Soft Effects Removal
par: Zhang, Jingdong, et autres
Publié: (2025)
par: Zhang, Jingdong, et autres
Publié: (2025)
Image Neural Field Diffusion Models
par: Chen, Yinbo, et autres
Publié: (2024)
par: Chen, Yinbo, et autres
Publié: (2024)
PopAlign: Population-Level Alignment for Fair Text-to-Image Generation
par: Li, Shufan, et autres
Publié: (2024)
par: Li, Shufan, et autres
Publié: (2024)
Vinoground: Scrutinizing LMMs over Dense Temporal Reasoning with Short Videos
par: Zhang, Jianrui, et autres
Publié: (2024)
par: Zhang, Jianrui, et autres
Publié: (2024)
Mining Fine-Grained Image-Text Alignment for Zero-Shot Captioning via Text-Only Training
par: Qiu, Longtian, et autres
Publié: (2024)
par: Qiu, Longtian, et autres
Publié: (2024)
Transformers in Medicine: Improving Vision-Language Alignment for Medical Image Captioning
par: Suresh, Yogesh Thakku, et autres
Publié: (2025)
par: Suresh, Yogesh Thakku, et autres
Publié: (2025)
Learning to Rank Caption Chains for Video-Text Alignment
par: Blume, Ansel, et autres
Publié: (2026)
par: Blume, Ansel, et autres
Publié: (2026)
Contrast-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment
par: Lv, Song-Lin, et autres
Publié: (2025)
par: Lv, Song-Lin, et autres
Publié: (2025)
Cross-Modal Self-Supervised Learning with Effective Contrastive Units for LiDAR Point Clouds
par: Cai, Mu, et autres
Publié: (2024)
par: Cai, Mu, et autres
Publié: (2024)
One-step Diffusion with Distribution Matching Distillation
par: Yin, Tianwei, et autres
Publié: (2023)
par: Yin, Tianwei, et autres
Publié: (2023)
MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation
par: Kan, Shichao, et autres
Publié: (2026)
par: Kan, Shichao, et autres
Publié: (2026)
Documents similaires
-
Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaboration
par: Mo, Sicheng, et autres
Publié: (2025) -
Relational Visual Similarity
par: Nguyen, Thao, et autres
Publié: (2025) -
X-Fusion: Introducing New Modality to Frozen Large Language Models
par: Mo, Sicheng, et autres
Publié: (2025) -
Improved Baselines with Visual Instruction Tuning
par: Liu, Haotian, et autres
Publié: (2023) -
Yo'LLaVA: Your Personalized Language and Vision Assistant
par: Nguyen, Thao, et autres
Publié: (2024)