Teaching Text-to-Image Models to Communicate in Dialog
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Xiaowen, Feng, Jiazhan, Wang, Yuxuan, Lai, Yuxuan, Shen, Xingyu, Zhao, Dongyan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
von: Wang, Yueqian, et al.
Veröffentlicht: (2024)
von: Wang, Yueqian, et al.
Veröffentlicht: (2024)
Aesthetic Assessment of Chinese Handwritings Based on Vision Language Models
von: Zheng, Chen, et al.
Veröffentlicht: (2026)
von: Zheng, Chen, et al.
Veröffentlicht: (2026)
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
von: Fu, Xingyu, et al.
Veröffentlicht: (2024)
von: Fu, Xingyu, et al.
Veröffentlicht: (2024)
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
von: Zhou, Guanyu, et al.
Veröffentlicht: (2026)
von: Zhou, Guanyu, et al.
Veröffentlicht: (2026)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2024)
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2024)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
von: Wang, Yueqian, et al.
Veröffentlicht: (2024)
von: Wang, Yueqian, et al.
Veröffentlicht: (2024)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
von: Song, Dingjie, et al.
Veröffentlicht: (2024)
von: Song, Dingjie, et al.
Veröffentlicht: (2024)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
von: Zhong, Weihong, et al.
Veröffentlicht: (2024)
von: Zhong, Weihong, et al.
Veröffentlicht: (2024)
Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams
von: Cui, Yiming, et al.
Veröffentlicht: (2025)
von: Cui, Yiming, et al.
Veröffentlicht: (2025)
Text-guided Image Restoration and Semantic Enhancement for Text-to-Image Person Retrieval
von: Liu, Delong, et al.
Veröffentlicht: (2023)
von: Liu, Delong, et al.
Veröffentlicht: (2023)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
von: Shangguan, Ziyao, et al.
Veröffentlicht: (2024)
von: Shangguan, Ziyao, et al.
Veröffentlicht: (2024)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
von: Zhang, Huixuan, et al.
Veröffentlicht: (2025)
von: Zhang, Huixuan, et al.
Veröffentlicht: (2025)
MULTI: Multimodal Understanding Leaderboard with Text and Images
von: Zhu, Zichen, et al.
Veröffentlicht: (2024)
von: Zhu, Zichen, et al.
Veröffentlicht: (2024)
Probing and Inducing Combinational Creativity in Vision-Language Models
von: Peng, Yongqian, et al.
Veröffentlicht: (2025)
von: Peng, Yongqian, et al.
Veröffentlicht: (2025)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
von: Xie, Yuxuan, et al.
Veröffentlicht: (2024)
von: Xie, Yuxuan, et al.
Veröffentlicht: (2024)
GRIT: Teaching MLLMs to Think with Images
von: Fan, Yue, et al.
Veröffentlicht: (2025)
von: Fan, Yue, et al.
Veröffentlicht: (2025)
Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
von: Yamabe, Shojiro, et al.
Veröffentlicht: (2025)
von: Yamabe, Shojiro, et al.
Veröffentlicht: (2025)
LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?
von: Wang, Yuchi, et al.
Veröffentlicht: (2024)
von: Wang, Yuchi, et al.
Veröffentlicht: (2024)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
von: Zhang, Leixin, et al.
Veröffentlicht: (2024)
von: Zhang, Leixin, et al.
Veröffentlicht: (2024)
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
von: Chen, Wenting, et al.
Veröffentlicht: (2023)
von: Chen, Wenting, et al.
Veröffentlicht: (2023)
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
von: Wang, Yueqian, et al.
Veröffentlicht: (2024)
von: Wang, Yueqian, et al.
Veröffentlicht: (2024)
Medical Image Synthesis via Fine-Grained Image-Text Alignment and Anatomy-Pathology Prompting
von: Chen, Wenting, et al.
Veröffentlicht: (2024)
von: Chen, Wenting, et al.
Veröffentlicht: (2024)
Multi-Modal Language Models as Text-to-Image Model Evaluators
von: Chen, Jiahui, et al.
Veröffentlicht: (2025)
von: Chen, Jiahui, et al.
Veröffentlicht: (2025)
MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing
von: Cheng, Liwei, et al.
Veröffentlicht: (2026)
von: Cheng, Liwei, et al.
Veröffentlicht: (2026)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
von: Feng, Weixi, et al.
Veröffentlicht: (2024)
von: Feng, Weixi, et al.
Veröffentlicht: (2024)
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
von: Li, Zhang, et al.
Veröffentlicht: (2023)
von: Li, Zhang, et al.
Veröffentlicht: (2023)
v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound
von: Shi, Zhengpeng, et al.
Veröffentlicht: (2025)
von: Shi, Zhengpeng, et al.
Veröffentlicht: (2025)
Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education
von: Wang, Junling, et al.
Veröffentlicht: (2026)
von: Wang, Junling, et al.
Veröffentlicht: (2026)
Text-only Synthesis for Image Captioning
von: Zhou, Qing, et al.
Veröffentlicht: (2024)
von: Zhou, Qing, et al.
Veröffentlicht: (2024)
Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering
von: Wang, Haibo, et al.
Veröffentlicht: (2024)
von: Wang, Haibo, et al.
Veröffentlicht: (2024)
Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs
von: Mishra, Sandeep, et al.
Veröffentlicht: (2026)
von: Mishra, Sandeep, et al.
Veröffentlicht: (2026)
CRCE: Coreference-Retention Concept Erasure in Text-to-Image Diffusion Models
von: Xue, Yuyang, et al.
Veröffentlicht: (2025)
von: Xue, Yuyang, et al.
Veröffentlicht: (2025)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
von: Zhou, Shijie, et al.
Veröffentlicht: (2025)
von: Zhou, Shijie, et al.
Veröffentlicht: (2025)
TempViz: On the Evaluation of Temporal Knowledge in Text-to-Image Models
von: Holtermann, Carolin, et al.
Veröffentlicht: (2026)
von: Holtermann, Carolin, et al.
Veröffentlicht: (2026)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
von: Li, Xiujun, et al.
Veröffentlicht: (2023)
von: Li, Xiujun, et al.
Veröffentlicht: (2023)
Multimodal Foundation Models Exploit Text to Make Medical Image Predictions
von: Buckley, Thomas, et al.
Veröffentlicht: (2023)
von: Buckley, Thomas, et al.
Veröffentlicht: (2023)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
von: Shen, Li-Cheng, et al.
Veröffentlicht: (2025)
von: Shen, Li-Cheng, et al.
Veröffentlicht: (2025)
AV-Dialog: Spoken Dialogue Models with Audio-Visual Input
von: Chen, Tuochao, et al.
Veröffentlicht: (2025)
von: Chen, Tuochao, et al.
Veröffentlicht: (2025)
ComCLIP: Training-Free Compositional Image and Text Matching
von: Jiang, Kenan, et al.
Veröffentlicht: (2022)
von: Jiang, Kenan, et al.
Veröffentlicht: (2022)
Ähnliche Einträge
-
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
von: Wang, Yueqian, et al.
Veröffentlicht: (2024) -
Aesthetic Assessment of Chinese Handwritings Based on Vision Language Models
von: Zheng, Chen, et al.
Veröffentlicht: (2026) -
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
von: Fu, Xingyu, et al.
Veröffentlicht: (2024) -
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
von: Zhou, Guanyu, et al.
Veröffentlicht: (2026) -
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2024)