Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Meng, Chutian, Ma, Fan, Miao, Jiaxu, Zhang, Chi, Yang, Yi, Zhuang, Yueting |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization
por: Meng, Chutian, et al.
Publicado: (2026)
por: Meng, Chutian, et al.
Publicado: (2026)
Safety of Multimodal Large Language Models on Images and Texts
por: Liu, Xin, et al.
Publicado: (2024)
por: Liu, Xin, et al.
Publicado: (2024)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
por: Sun, Tao, et al.
Publicado: (2025)
por: Sun, Tao, et al.
Publicado: (2025)
Implicit Bias Injection Attacks against Text-to-Image Diffusion Models
por: Huang, Huayang, et al.
Publicado: (2025)
por: Huang, Huayang, et al.
Publicado: (2025)
Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model
por: Zhang, Wenqi, et al.
Publicado: (2024)
por: Zhang, Wenqi, et al.
Publicado: (2024)
Rhetorical Text-to-Image Generation via Two-layer Diffusion Policy Optimization
por: Zhang, Yuxi, et al.
Publicado: (2025)
por: Zhang, Yuxi, et al.
Publicado: (2025)
Large Language Models for Multimodal Deformable Image Registration
por: Ma, Mingrui, et al.
Publicado: (2024)
por: Ma, Mingrui, et al.
Publicado: (2024)
VIP: Versatile Image Outpainting Empowered by Multimodal Large Language Model
por: Yang, Jinze, et al.
Publicado: (2024)
por: Yang, Jinze, et al.
Publicado: (2024)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
por: Fu, Pei, et al.
Publicado: (2025)
por: Fu, Pei, et al.
Publicado: (2025)
Evaluating Text-to-Image Generative Models: An Empirical Study on Human Image Synthesis
por: Chen, Muxi, et al.
Publicado: (2024)
por: Chen, Muxi, et al.
Publicado: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
Regeneration Based Training-free Attribution of Fake Images Generated by Text-to-Image Generative Models
por: Li, Meiling, et al.
Publicado: (2024)
por: Li, Meiling, et al.
Publicado: (2024)
Guiding Instruction-based Image Editing via Multimodal Large Language Models
por: Fu, Tsu-Jui, et al.
Publicado: (2023)
por: Fu, Tsu-Jui, et al.
Publicado: (2023)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
por: Zhang, Leixin, et al.
Publicado: (2024)
por: Zhang, Leixin, et al.
Publicado: (2024)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
Multimodal Large Language Models as Image Classifiers
por: Kisel, Nikita, et al.
Publicado: (2026)
por: Kisel, Nikita, et al.
Publicado: (2026)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
por: Wang, Alex Jinpeng, et al.
Publicado: (2025)
por: Wang, Alex Jinpeng, et al.
Publicado: (2025)
A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models
por: Shuai, Xincheng, et al.
Publicado: (2024)
por: Shuai, Xincheng, et al.
Publicado: (2024)
A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
por: Wu, Tianhe, et al.
Publicado: (2024)
por: Wu, Tianhe, et al.
Publicado: (2024)
MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis
por: Zhou, Dewei, et al.
Publicado: (2024)
por: Zhou, Dewei, et al.
Publicado: (2024)
Analysis of Image-and-Text Uncertainty Propagation in Multimodal Large Language Models with Cardiac MR-Based Applications
por: Tang, Yucheng, et al.
Publicado: (2025)
por: Tang, Yucheng, et al.
Publicado: (2025)
Language-Image Alignment with Fixed Text Encoders
por: Yang, Jingfeng, et al.
Publicado: (2025)
por: Yang, Jingfeng, et al.
Publicado: (2025)
Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models
por: Guo, Jiayi, et al.
Publicado: (2026)
por: Guo, Jiayi, et al.
Publicado: (2026)
Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Origin Identification for Text-Guided Image-to-Image Diffusion Models
por: Wang, Wenhao, et al.
Publicado: (2025)
por: Wang, Wenhao, et al.
Publicado: (2025)
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
por: Yang, Hongji, et al.
Publicado: (2025)
por: Yang, Hongji, et al.
Publicado: (2025)
Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment
por: Xie, Xing, et al.
Publicado: (2025)
por: Xie, Xing, et al.
Publicado: (2025)
AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks
por: Li, You, et al.
Publicado: (2024)
por: Li, You, et al.
Publicado: (2024)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
por: Villegas, Danae Sánchez, et al.
Publicado: (2025)
por: Villegas, Danae Sánchez, et al.
Publicado: (2025)
Neuromorphic Imaging and Classification with Graph Learning
por: Zhang, Pei, et al.
Publicado: (2023)
por: Zhang, Pei, et al.
Publicado: (2023)
Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning
por: Liu, Shih-Wen, et al.
Publicado: (2025)
por: Liu, Shih-Wen, et al.
Publicado: (2025)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
por: Cui, Tianyu, et al.
Publicado: (2025)
por: Cui, Tianyu, et al.
Publicado: (2025)
Evaluating the Generation of Spatial Relations in Text and Image Generative Models
por: Sim, Shang Hong, et al.
Publicado: (2024)
por: Sim, Shang Hong, et al.
Publicado: (2024)
Generating Multimodal Images with GAN: Integrating Text, Image, and Style
por: Tan, Chaoyi, et al.
Publicado: (2025)
por: Tan, Chaoyi, et al.
Publicado: (2025)
TF-TI2I: Training-Free Text-and-Image-to-Image Generation via Multi-Modal Implicit-Context Learning in Text-to-Image Models
por: Hsiao, Teng-Fang, et al.
Publicado: (2025)
por: Hsiao, Teng-Fang, et al.
Publicado: (2025)
ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models
por: Zhang, Jianyi, et al.
Publicado: (2024)
por: Zhang, Jianyi, et al.
Publicado: (2024)
EmoGen: Emotional Image Content Generation with Text-to-Image Diffusion Models
por: Yang, Jingyuan, et al.
Publicado: (2024)
por: Yang, Jingyuan, et al.
Publicado: (2024)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
por: Pan, Kaihang, et al.
Publicado: (2025)
por: Pan, Kaihang, et al.
Publicado: (2025)
ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation
por: Chern, Ethan, et al.
Publicado: (2024)
por: Chern, Ethan, et al.
Publicado: (2024)
TarPro: Targeted Protection against Malicious Image Editing
por: Shen, Kaixin, et al.
Publicado: (2025)
por: Shen, Kaixin, et al.
Publicado: (2025)
Ejemplares similares
-
LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization
por: Meng, Chutian, et al.
Publicado: (2026) -
Safety of Multimodal Large Language Models on Images and Texts
por: Liu, Xin, et al.
Publicado: (2024) -
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
por: Sun, Tao, et al.
Publicado: (2025) -
Implicit Bias Injection Attacks against Text-to-Image Diffusion Models
por: Huang, Huayang, et al.
Publicado: (2025) -
Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model
por: Zhang, Wenqi, et al.
Publicado: (2024)