Content-Aware Ad Banner Layout Generation with Two-Stage Chain-of-Thought in Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yoshitake, Kei, Hosono, Kento, Kobayashi, Ken, Nakata, Kazuhide |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
di: Liu, Xiwei, et al.
Pubblicazione: (2026)
di: Liu, Xiwei, et al.
Pubblicazione: (2026)
Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization
di: Kawaharazuka, Kento, et al.
Pubblicazione: (2024)
di: Kawaharazuka, Kento, et al.
Pubblicazione: (2024)
TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models
di: Fhima, Jonathan, et al.
Pubblicazione: (2024)
di: Fhima, Jonathan, et al.
Pubblicazione: (2024)
Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization
di: Kawaharazuka, Kento, et al.
Pubblicazione: (2024)
di: Kawaharazuka, Kento, et al.
Pubblicazione: (2024)
LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models
di: Sun, Fan-Yun, et al.
Pubblicazione: (2024)
di: Sun, Fan-Yun, et al.
Pubblicazione: (2024)
Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
di: Du, Yifan, et al.
Pubblicazione: (2025)
di: Du, Yifan, et al.
Pubblicazione: (2025)
Retrieval-Augmented Layout Transformer for Content-Aware Layout Generation
di: Horita, Daichi, et al.
Pubblicazione: (2023)
di: Horita, Daichi, et al.
Pubblicazione: (2023)
Mirror in the Model: Ad Banner Image Generation via Reflective Multi-LLM and Multi-modal Agents
di: Wang, Zhao, et al.
Pubblicazione: (2025)
di: Wang, Zhao, et al.
Pubblicazione: (2025)
Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine
di: Wu, Yuan, et al.
Pubblicazione: (2026)
di: Wu, Yuan, et al.
Pubblicazione: (2026)
CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models
di: Cheng, Zihui, et al.
Pubblicazione: (2024)
di: Cheng, Zihui, et al.
Pubblicazione: (2024)
BannerAgency: Advertising Banner Design with Multimodal LLM Agents
di: Wang, Heng, et al.
Pubblicazione: (2025)
di: Wang, Heng, et al.
Pubblicazione: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
di: Chen, Wutao, et al.
Pubblicazione: (2026)
di: Chen, Wutao, et al.
Pubblicazione: (2026)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
di: Chen, Yan, et al.
Pubblicazione: (2025)
di: Chen, Yan, et al.
Pubblicazione: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
LayoutFlow: Flow Matching for Layout Generation
di: Guerreiro, Julian Jorge Andrade, et al.
Pubblicazione: (2024)
di: Guerreiro, Julian Jorge Andrade, et al.
Pubblicazione: (2024)
A Two-Stage System for Layout-Controlled Image Generation using Large Language Models and Diffusion Models
di: Koch, Jan-Hendrik, et al.
Pubblicazione: (2025)
di: Koch, Jan-Hendrik, et al.
Pubblicazione: (2025)
ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Controllable Navigation Instruction Generation with Chain of Thought Prompting
di: Kong, Xianghao, et al.
Pubblicazione: (2024)
di: Kong, Xianghao, et al.
Pubblicazione: (2024)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
VASCAR: Content-Aware Layout Generation via Visual-Aware Self-Correction
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
Sketch-to-Layout: Sketch-Guided Multimodal Layout Generation
di: Brioschi, Riccardo, et al.
Pubblicazione: (2025)
di: Brioschi, Riccardo, et al.
Pubblicazione: (2025)
PosterLlama: Bridging Design Ability of Langauge Model to Contents-Aware Layout Generation
di: Seol, Jaejung, et al.
Pubblicazione: (2024)
di: Seol, Jaejung, et al.
Pubblicazione: (2024)
LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
di: Fan, Zezhong, et al.
Pubblicazione: (2025)
di: Fan, Zezhong, et al.
Pubblicazione: (2025)
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
di: Tian, Xinyu, et al.
Pubblicazione: (2025)
di: Tian, Xinyu, et al.
Pubblicazione: (2025)
LayoutRAG: Retrieval-Augmented Model for Content-agnostic Conditional Layout Generation
di: Wu, Yuxuan, et al.
Pubblicazione: (2025)
di: Wu, Yuxuan, et al.
Pubblicazione: (2025)
ToLo: A Two-Stage, Training-Free Layout-To-Image Generation Framework For High-Overlap Layouts
di: Huang, Linhao, et al.
Pubblicazione: (2025)
di: Huang, Linhao, et al.
Pubblicazione: (2025)
OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
di: Zhang, Zhenguo, et al.
Pubblicazione: (2025)
di: Zhang, Zhenguo, et al.
Pubblicazione: (2025)
SDIGLM: Leveraging Large Language Models and Multi-Modal Chain of Thought for Structural Damage Identification
di: Zhang, Yunkai, et al.
Pubblicazione: (2025)
di: Zhang, Yunkai, et al.
Pubblicazione: (2025)
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
di: Liu, Chaohu, et al.
Pubblicazione: (2025)
di: Liu, Chaohu, et al.
Pubblicazione: (2025)
A Semantic Decoupling-Based Two-Stage Rainy-Day Attack for Revealing Weather Robustness Deficiencies in Vision-Language Models
di: Hu, Chengyin, et al.
Pubblicazione: (2026)
di: Hu, Chengyin, et al.
Pubblicazione: (2026)
Chain-of-Anomaly Thoughts with Large Vision-Language Models
di: Domingos, Pedro, et al.
Pubblicazione: (2025)
di: Domingos, Pedro, et al.
Pubblicazione: (2025)
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
di: Deng, Linger, et al.
Pubblicazione: (2024)
di: Deng, Linger, et al.
Pubblicazione: (2024)
Uncertainty-Aware Evaluation for Vision-Language Models
di: Kostumov, Vasily, et al.
Pubblicazione: (2024)
di: Kostumov, Vasily, et al.
Pubblicazione: (2024)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2025)
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2025)
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
di: Liu, Bo, et al.
Pubblicazione: (2025)
di: Liu, Bo, et al.
Pubblicazione: (2025)
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026)
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026)
Hierarchy-Aware Fine-Tuning of Vision-Language Models
di: Li, Jiayu, et al.
Pubblicazione: (2025)
di: Li, Jiayu, et al.
Pubblicazione: (2025)
Reinforcing Structured Chain-of-Thought for Video Understanding
di: Wang, Peiyao, et al.
Pubblicazione: (2026)
di: Wang, Peiyao, et al.
Pubblicazione: (2026)
Think Before You Act: A Two-Stage Framework for Mitigating Gender Bias Towards Vision-Language Tasks
di: Zhang, Yunqi, et al.
Pubblicazione: (2024)
di: Zhang, Yunqi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
di: Liu, Xiwei, et al.
Pubblicazione: (2026) -
Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization
di: Kawaharazuka, Kento, et al.
Pubblicazione: (2024) -
TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models
di: Fhima, Jonathan, et al.
Pubblicazione: (2024) -
Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization
di: Kawaharazuka, Kento, et al.
Pubblicazione: (2024) -
LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models
di: Sun, Fan-Yun, et al.
Pubblicazione: (2024)