Mirror in the Model: Ad Banner Image Generation via Reflective Multi-LLM and Multi-modal Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Zhao, Chen, Bowen, Shimose, Yotaro, Moriyama, Sota, Wang, Heng, Takamatsu, Shingo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BannerAgency: Advertising Banner Design with Multimodal LLM Agents
por: Wang, Heng, et al.
Publicado: (2025)
por: Wang, Heng, et al.
Publicado: (2025)
DesignLab: Designing Slides Through Iterative Detection and Correction
por: Yun, Jooyeol, et al.
Publicado: (2025)
por: Yun, Jooyeol, et al.
Publicado: (2025)
Visual Prompt Discovery via Semantic Exploration
por: Kim, Jaechang, et al.
Publicado: (2026)
por: Kim, Jaechang, et al.
Publicado: (2026)
OMS: On-the-fly, Multi-Objective, Self-Reflective Ad Keyword Generation via LLM Agent
por: Chen, Bowen, et al.
Publicado: (2025)
por: Chen, Bowen, et al.
Publicado: (2025)
MOD-CL: Multi-label Object Detection with Constrained Loss
por: Moriyama, Sota, et al.
Publicado: (2024)
por: Moriyama, Sota, et al.
Publicado: (2024)
Content-Aware Ad Banner Layout Generation with Two-Stage Chain-of-Thought in Vision Language Models
por: Yoshitake, Kei, et al.
Publicado: (2025)
por: Yoshitake, Kei, et al.
Publicado: (2025)
MMGen: Unified Multi-modal Image Generation and Understanding in One Go
por: Wang, Jiepeng, et al.
Publicado: (2025)
por: Wang, Jiepeng, et al.
Publicado: (2025)
WebGen-V Bench: Structured Representation for Enhancing Visual Design in LLM-based Web Generation and Evaluation
por: Wang, Kuang-Da, et al.
Publicado: (2025)
por: Wang, Kuang-Da, et al.
Publicado: (2025)
Talk Structurally, Act Hierarchically: A Collaborative Framework for LLM Multi-Agent Systems
por: Wang, Zhao, et al.
Publicado: (2025)
por: Wang, Zhao, et al.
Publicado: (2025)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
por: Wang, Puyi, et al.
Publicado: (2024)
por: Wang, Puyi, et al.
Publicado: (2024)
Efficient Large Multi-modal Models via Visual Context Compression
por: Chen, Jieneng, et al.
Publicado: (2024)
por: Chen, Jieneng, et al.
Publicado: (2024)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
por: Tian, Changyao, et al.
Publicado: (2024)
por: Tian, Changyao, et al.
Publicado: (2024)
OTTER: Open-Tagging via Text-Image Representation for Multi-modal Understanding
por: Ouyang, Jieer, et al.
Publicado: (2025)
por: Ouyang, Jieer, et al.
Publicado: (2025)
Image Anything: Towards Reasoning-coherent and Training-free Multi-modal Image Generation
por: Lyu, Yuanhuiyi, et al.
Publicado: (2024)
por: Lyu, Yuanhuiyi, et al.
Publicado: (2024)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Gaussian Splatting in Mirrors: Reflection-Aware Rendering via Virtual Camera Optimization
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
MirrorGaussian: Reflecting 3D Gaussians for Reconstructing Mirror Reflections
por: Liu, Jiayue, et al.
Publicado: (2024)
por: Liu, Jiayue, et al.
Publicado: (2024)
Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM
por: Zhang, Huaxin, et al.
Publicado: (2024)
por: Zhang, Huaxin, et al.
Publicado: (2024)
Multi-modal Auto-regressive Modeling via Visual Words
por: Peng, Tianshuo, et al.
Publicado: (2024)
por: Peng, Tianshuo, et al.
Publicado: (2024)
Multi-modal Crowd Counting via Modal Emulation
por: Wang, Chenhao, et al.
Publicado: (2024)
por: Wang, Chenhao, et al.
Publicado: (2024)
Q-Ground: Image Quality Grounding with Large Multi-modality Models
por: Chen, Chaofeng, et al.
Publicado: (2024)
por: Chen, Chaofeng, et al.
Publicado: (2024)
Liquid: Language Models are Scalable and Unified Multi-modal Generators
por: Wu, Junfeng, et al.
Publicado: (2024)
por: Wu, Junfeng, et al.
Publicado: (2024)
Deep Unfolding Multi-modal Image Fusion Network via Attribution Analysis
por: Bai, Haowen, et al.
Publicado: (2025)
por: Bai, Haowen, et al.
Publicado: (2025)
CoMA: Compositional Human Motion Generation with Multi-modal Agents
por: Sun, Shanlin, et al.
Publicado: (2024)
por: Sun, Shanlin, et al.
Publicado: (2024)
Talk2Image: A Multi-Agent System for Multi-Turn Image Generation and Editing
por: Ma, Shichao, et al.
Publicado: (2025)
por: Ma, Shichao, et al.
Publicado: (2025)
PhotoFramer: Multi-modal Image Composition Instruction
por: You, Zhiyuan, et al.
Publicado: (2025)
por: You, Zhiyuan, et al.
Publicado: (2025)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
por: Huang, Junming, et al.
Publicado: (2026)
por: Huang, Junming, et al.
Publicado: (2026)
RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection
por: Wang, Tianyu, et al.
Publicado: (2026)
por: Wang, Tianyu, et al.
Publicado: (2026)
Empowering Segmentation Ability to Multi-modal Large Language Models
por: Yang, Yuqi, et al.
Publicado: (2024)
por: Yang, Yuqi, et al.
Publicado: (2024)
Context-Aware Autoregressive Models for Multi-Conditional Image Generation
por: Chen, Yixiao, et al.
Publicado: (2025)
por: Chen, Yixiao, et al.
Publicado: (2025)
GenPilot: A Multi-Agent System for Test-Time Prompt Optimization in Image Generation
por: Ye, Wen, et al.
Publicado: (2025)
por: Ye, Wen, et al.
Publicado: (2025)
Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections
por: Dhiman, Ankit, et al.
Publicado: (2024)
por: Dhiman, Ankit, et al.
Publicado: (2024)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025)
por: Li, Zeqian, et al.
Publicado: (2025)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
por: Liao, Wenhui, et al.
Publicado: (2024)
por: Liao, Wenhui, et al.
Publicado: (2024)
IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes
por: Liang, Yujia, et al.
Publicado: (2025)
por: Liang, Yujia, et al.
Publicado: (2025)
DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation
por: Huang, Minbin, et al.
Publicado: (2024)
por: Huang, Minbin, et al.
Publicado: (2024)
Cross-modality Guidance-aided Multi-modal Learning with Dual Attention for MRI Brain Tumor Grading
por: Xu, Dunyuan, et al.
Publicado: (2024)
por: Xu, Dunyuan, et al.
Publicado: (2024)
A Multi-Agent Framework with Structured Reasoning and Reflective Refinement for Multimodal Empathetic Response Generation
por: Wang, Liping, et al.
Publicado: (2026)
por: Wang, Liping, et al.
Publicado: (2026)
Multi-modal Learning with Missing Modality via Shared-Specific Feature Modelling
por: Wang, Hu, et al.
Publicado: (2023)
por: Wang, Hu, et al.
Publicado: (2023)
Ejemplares similares
-
BannerAgency: Advertising Banner Design with Multimodal LLM Agents
por: Wang, Heng, et al.
Publicado: (2025) -
DesignLab: Designing Slides Through Iterative Detection and Correction
por: Yun, Jooyeol, et al.
Publicado: (2025) -
Visual Prompt Discovery via Semantic Exploration
por: Kim, Jaechang, et al.
Publicado: (2026) -
OMS: On-the-fly, Multi-Objective, Self-Reflective Ad Keyword Generation via LLM Agent
por: Chen, Bowen, et al.
Publicado: (2025) -
MOD-CL: Multi-label Object Detection with Constrained Loss
por: Moriyama, Sota, et al.
Publicado: (2024)