TextMatch: Enhancing Image-Text Consistency Through Multimodal Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Yucong, Cheng, Mingyue, Ouyang, Jie, Tao, Xiaoyu, Liu, Qi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation
por: Lu, Xiaoxin, et al.
Publicado: (2025)
por: Lu, Xiaoxin, et al.
Publicado: (2025)
Towards Deconfounded Image-Text Matching with Causal Inference
por: Li, Wenhui, et al.
Publicado: (2024)
por: Li, Wenhui, et al.
Publicado: (2024)
Enhancing Multimodal Understanding with CLIP-Based Image-to-Text Transformation
por: Che, Chang, et al.
Publicado: (2024)
por: Che, Chang, et al.
Publicado: (2024)
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
por: Jiang, Dongzhi, et al.
Publicado: (2024)
por: Jiang, Dongzhi, et al.
Publicado: (2024)
TSVC:Tripartite Learning with Semantic Variation Consistency for Robust Image-Text Retrieval
por: Lyu, Shuai, et al.
Publicado: (2025)
por: Lyu, Shuai, et al.
Publicado: (2025)
A Dual-way Enhanced Framework from Text Matching Point of View for Multimodal Entity Linking
por: Song, Shezheng, et al.
Publicado: (2023)
por: Song, Shezheng, et al.
Publicado: (2023)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
por: Yu, Ya-Qi, et al.
Publicado: (2024)
por: Yu, Ya-Qi, et al.
Publicado: (2024)
Uncovering the Text Embedding in Text-to-Image Diffusion Models
por: Yu, Hu, et al.
Publicado: (2024)
por: Yu, Hu, et al.
Publicado: (2024)
15M Multimodal Facial Image-Text Dataset
por: Dai, Dawei, et al.
Publicado: (2024)
por: Dai, Dawei, et al.
Publicado: (2024)
Clustering-based Image-Text Graph Matching for Domain Generalization
por: Park, Nokyung, et al.
Publicado: (2023)
por: Park, Nokyung, et al.
Publicado: (2023)
TextDiffuser-RL: Efficient and Robust Text Layout Optimization for High-Fidelity Text-to-Image Synthesis
por: Rahman, Kazi Mahathir, et al.
Publicado: (2025)
por: Rahman, Kazi Mahathir, et al.
Publicado: (2025)
MULTI: Multimodal Understanding Leaderboard with Text and Images
por: Zhu, Zichen, et al.
Publicado: (2024)
por: Zhu, Zichen, et al.
Publicado: (2024)
MUMU: Bootstrapping Multimodal Image Generation from Text-to-Image Data
por: Berman, William, et al.
Publicado: (2024)
por: Berman, William, et al.
Publicado: (2024)
Policy Optimized Text-to-Image Pipeline Design
por: Gadot, Uri, et al.
Publicado: (2025)
por: Gadot, Uri, et al.
Publicado: (2025)
Dynamic Prompt Optimizing for Text-to-Image Generation
por: Mo, Wenyi, et al.
Publicado: (2024)
por: Mo, Wenyi, et al.
Publicado: (2024)
Refining Text-to-Image Generation: Towards Accurate Training-Free Glyph-Enhanced Image Generation
por: Lakhanpal, Sanyam, et al.
Publicado: (2024)
por: Lakhanpal, Sanyam, et al.
Publicado: (2024)
MASTER: Multimodal Segmentation with Text Prompts
por: Liu, Fuyang, et al.
Publicado: (2025)
por: Liu, Fuyang, et al.
Publicado: (2025)
SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
por: Zhou, Sashuai, et al.
Publicado: (2026)
por: Zhou, Sashuai, et al.
Publicado: (2026)
ID-Aligner: Enhancing Identity-Preserving Text-to-Image Generation with Reward Feedback Learning
por: Chen, Weifeng, et al.
Publicado: (2024)
por: Chen, Weifeng, et al.
Publicado: (2024)
ComCLIP: Training-Free Compositional Image and Text Matching
por: Jiang, Kenan, et al.
Publicado: (2022)
por: Jiang, Kenan, et al.
Publicado: (2022)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
por: Lv, Zheqi, et al.
Publicado: (2025)
por: Lv, Zheqi, et al.
Publicado: (2025)
Batch-Instructed Gradient for Prompt Evolution:Systematic Prompt Optimization for Enhanced Text-to-Image Synthesis
por: Yang, Xinrui, et al.
Publicado: (2024)
por: Yang, Xinrui, et al.
Publicado: (2024)
Face-MakeUp: Multimodal Facial Prompts for Text-to-Image Generation
por: Dai, Dawei, et al.
Publicado: (2025)
por: Dai, Dawei, et al.
Publicado: (2025)
Narrowing Information Bottleneck Theory for Multimodal Image-Text Representations Interpretability
por: Zhu, Zhiyu, et al.
Publicado: (2025)
por: Zhu, Zhiyu, et al.
Publicado: (2025)
Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models
por: Peng, Xingkai, et al.
Publicado: (2025)
por: Peng, Xingkai, et al.
Publicado: (2025)
Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs
por: Xian, Jia Jun Cheng, et al.
Publicado: (2025)
por: Xian, Jia Jun Cheng, et al.
Publicado: (2025)
Edge Approximation Text Detector
por: Yang, Chuang, et al.
Publicado: (2025)
por: Yang, Chuang, et al.
Publicado: (2025)
Text-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMs
por: Lin, Chenchen, et al.
Publicado: (2026)
por: Lin, Chenchen, et al.
Publicado: (2026)
Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image
por: Zhao, Yu, et al.
Publicado: (2024)
por: Zhao, Yu, et al.
Publicado: (2024)
FAIntbench: A Holistic and Precise Benchmark for Bias Evaluation in Text-to-Image Models
por: Luo, Hanjun, et al.
Publicado: (2024)
por: Luo, Hanjun, et al.
Publicado: (2024)
One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt
por: Liu, Tao, et al.
Publicado: (2025)
por: Liu, Tao, et al.
Publicado: (2025)
A Comprehensive Survey on Concept Erasure in Text-to-Image Diffusion Models
por: Kim, Changhoon, et al.
Publicado: (2025)
por: Kim, Changhoon, et al.
Publicado: (2025)
IE-Bench: Advancing the Measurement of Text-Driven Image Editing for Human Perception Alignment
por: Sun, Shangkun, et al.
Publicado: (2025)
por: Sun, Shangkun, et al.
Publicado: (2025)
StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization
por: Gaur, Gopalji, et al.
Publicado: (2025)
por: Gaur, Gopalji, et al.
Publicado: (2025)
Efficient Text-driven Motion Generation via Latent Consistency Training
por: Hu, Mengxian, et al.
Publicado: (2024)
por: Hu, Mengxian, et al.
Publicado: (2024)
Enhancing Weakly Supervised Multimodal Video Anomaly Detection through Text Guidance
por: Sun, Shengyang, et al.
Publicado: (2026)
por: Sun, Shengyang, et al.
Publicado: (2026)
GEA: Generation-Enhanced Alignment for Text-to-Image Person Retrieval
por: Zou, Hao, et al.
Publicado: (2025)
por: Zou, Hao, et al.
Publicado: (2025)
Efficient Exploration of Image Classifier Failures with Bayesian Optimization and Text-to-Image Models
por: LeCoz, Adrien, et al.
Publicado: (2024)
por: LeCoz, Adrien, et al.
Publicado: (2024)
COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts
por: Wang, Bingli, et al.
Publicado: (2026)
por: Wang, Bingli, et al.
Publicado: (2026)
Ejemplares similares
-
Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation
por: Lu, Xiaoxin, et al.
Publicado: (2025) -
Towards Deconfounded Image-Text Matching with Causal Inference
por: Li, Wenhui, et al.
Publicado: (2024) -
Enhancing Multimodal Understanding with CLIP-Based Image-to-Text Transformation
por: Che, Chang, et al.
Publicado: (2024) -
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
por: Zhang, Yu, et al.
Publicado: (2025) -
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
por: Jiang, Dongzhi, et al.
Publicado: (2024)