Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Xun, Huang, Shaohan, Wei, Furu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
di: Wu, Yi, et al.
Pubblicazione: (2025)
di: Wu, Yi, et al.
Pubblicazione: (2025)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025)
di: Wu, Qiong, et al.
Pubblicazione: (2025)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
di: Huang, Yuhang, et al.
Pubblicazione: (2024)
di: Huang, Yuhang, et al.
Pubblicazione: (2024)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
di: He, Xin, et al.
Pubblicazione: (2024)
di: He, Xin, et al.
Pubblicazione: (2024)
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
di: Imajuku, Yuki, et al.
Pubblicazione: (2024)
di: Imajuku, Yuki, et al.
Pubblicazione: (2024)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
di: Huang, Yuesheng, et al.
Pubblicazione: (2025)
di: Huang, Yuesheng, et al.
Pubblicazione: (2025)
Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation
di: Wu, Yi, et al.
Pubblicazione: (2025)
di: Wu, Yi, et al.
Pubblicazione: (2025)
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025)
di: Liu, Jingping, et al.
Pubblicazione: (2025)
A Novel FACS-Aligned Anatomical Text Description Paradigm for Fine-Grained Facial Behavior Synthesis
di: Wang, Jiahe, et al.
Pubblicazione: (2026)
di: Wang, Jiahe, et al.
Pubblicazione: (2026)
OS-HGAdapter: Open Semantic Hypergraph Adapter for Large Language Models Assisted Entropy-Enhanced Image-Text Alignment
di: Chen, Rongjun, et al.
Pubblicazione: (2025)
di: Chen, Rongjun, et al.
Pubblicazione: (2025)
G-Refine: A General Quality Refiner for Text-to-Image Generation
di: Li, Chunyi, et al.
Pubblicazione: (2024)
di: Li, Chunyi, et al.
Pubblicazione: (2024)
CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model
di: Luo, Yuxuan, et al.
Pubblicazione: (2025)
di: Luo, Yuxuan, et al.
Pubblicazione: (2025)
Towards Training-free Multimodal Hate Localisation with Large Language Models
di: Sun, Yueming, et al.
Pubblicazione: (2026)
di: Sun, Yueming, et al.
Pubblicazione: (2026)
ComAlign: Compositional Alignment in Vision-Language Models
di: Abdollah, Ali, et al.
Pubblicazione: (2024)
di: Abdollah, Ali, et al.
Pubblicazione: (2024)
MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation
di: Xu, Shuolin, et al.
Pubblicazione: (2025)
di: Xu, Shuolin, et al.
Pubblicazione: (2025)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
Bridging Compressed Image Latents and Multimodal Large Language Models
di: Kao, Chia-Hao, et al.
Pubblicazione: (2024)
di: Kao, Chia-Hao, et al.
Pubblicazione: (2024)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
di: Hao, Jing, et al.
Pubblicazione: (2025)
di: Hao, Jing, et al.
Pubblicazione: (2025)
Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation
di: Zhu, Lingsi, et al.
Pubblicazione: (2026)
di: Zhu, Lingsi, et al.
Pubblicazione: (2026)
FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models
di: Li, Yixuan, et al.
Pubblicazione: (2024)
di: Li, Yixuan, et al.
Pubblicazione: (2024)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
di: Chow, Wei, et al.
Pubblicazione: (2024)
di: Chow, Wei, et al.
Pubblicazione: (2024)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
di: Ma, Xueqi, et al.
Pubblicazione: (2025)
di: Ma, Xueqi, et al.
Pubblicazione: (2025)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
LAPIG: Language Guided Projector Image Generation with Surface Adaptation and Stylization
di: Deng, Yuchen, et al.
Pubblicazione: (2025)
di: Deng, Yuchen, et al.
Pubblicazione: (2025)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
di: Yang, Shuyu, et al.
Pubblicazione: (2024)
di: Yang, Shuyu, et al.
Pubblicazione: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
di: Xu, Yifang, et al.
Pubblicazione: (2025)
di: Xu, Yifang, et al.
Pubblicazione: (2025)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
di: Pan, Xichen, et al.
Pubblicazione: (2023)
di: Pan, Xichen, et al.
Pubblicazione: (2023)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
Scene Graph Generation with Role-Playing Large Language Models
di: Chen, Guikun, et al.
Pubblicazione: (2024)
di: Chen, Guikun, et al.
Pubblicazione: (2024)
PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
di: Xu, Jingning, et al.
Pubblicazione: (2026)
di: Xu, Jingning, et al.
Pubblicazione: (2026)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
di: Chen, Junyu, et al.
Pubblicazione: (2025)
di: Chen, Junyu, et al.
Pubblicazione: (2025)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades
di: Taghipour, Ashkan, et al.
Pubblicazione: (2026)
di: Taghipour, Ashkan, et al.
Pubblicazione: (2026)
Scene-Text Grounding for Text-Based Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
Universally Unfiltered and Unseen:Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards
di: Yan, Song, et al.
Pubblicazione: (2025)
di: Yan, Song, et al.
Pubblicazione: (2025)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
di: Wu, Yi, et al.
Pubblicazione: (2025) -
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
di: Zhu, Xingyu, et al.
Pubblicazione: (2026) -
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025) -
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
di: Huang, Yuhang, et al.
Pubblicazione: (2024) -
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
di: He, Xin, et al.
Pubblicazione: (2024)