OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Bingnan, Wang, Chen-Yu, Xu, Haiyang, Zhang, Xiang, Armand, Ethan, Srivastava, Divyansh, Shan, Xiaojun, Chen, Zeyuan, Xie, Jianwen, Tu, Zhuowen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
by: Srivastava, Divyansh, et al.
Published: (2025)
by: Srivastava, Divyansh, et al.
Published: (2025)
CyCLeGen: Cycle-Consistent Layout Prediction and Image Generation in Vision Foundation Models
by: Shan, Xiaojun, et al.
Published: (2026)
by: Shan, Xiaojun, et al.
Published: (2026)
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
by: Chen, Zeyuan, et al.
Published: (2025)
by: Chen, Zeyuan, et al.
Published: (2025)
YOLO-Count: Differentiable Object Counting for Text-to-Image Generation
by: Zeng, Guanning, et al.
Published: (2025)
by: Zeng, Guanning, et al.
Published: (2025)
VideoNSA: Native Sparse Attention Scales Video Understanding
by: Song, Enxin, et al.
Published: (2025)
by: Song, Enxin, et al.
Published: (2025)
DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion
by: Zhao, Qingcheng, et al.
Published: (2025)
by: Zhao, Qingcheng, et al.
Published: (2025)
OmniControlNet: Dual-stage Integration for Conditional Image Generation
by: Wang, Yilin, et al.
Published: (2024)
by: Wang, Yilin, et al.
Published: (2024)
Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
by: Wang, Haowen, et al.
Published: (2025)
by: Wang, Haowen, et al.
Published: (2025)
Bayesian Diffusion Models for 3D Shape Reconstruction
by: Xu, Haiyang, et al.
Published: (2024)
by: Xu, Haiyang, et al.
Published: (2024)
Gaussian Swaying: Surface-Based Framework for Aerodynamic Simulation with 3D Gaussians
by: Yan, Hongru, et al.
Published: (2025)
by: Yan, Hongru, et al.
Published: (2025)
Soft Tail-dropping for Adaptive Visual Tokenization
by: Chen, Zeyuan, et al.
Published: (2026)
by: Chen, Zeyuan, et al.
Published: (2026)
PixARMesh: Autoregressive Mesh-Native Single-View Scene Reconstruction
by: Zhang, Xiang, et al.
Published: (2026)
by: Zhang, Xiang, et al.
Published: (2026)
C3Editor: Achieving Controllable Consistency in 2D Model for 3D Editing
by: Tao, Zeng, et al.
Published: (2025)
by: Tao, Zeng, et al.
Published: (2025)
SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization
by: Yuan, Jiarui, et al.
Published: (2026)
by: Yuan, Jiarui, et al.
Published: (2026)
ToLo: A Two-Stage, Training-Free Layout-To-Image Generation Framework For High-Overlap Layouts
by: Huang, Linhao, et al.
Published: (2025)
by: Huang, Linhao, et al.
Published: (2025)
SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model
by: Chang, Yifan, et al.
Published: (2025)
by: Chang, Yifan, et al.
Published: (2025)
Vision Transformer for Transient Noise Classification
by: Srivastava, Divyansh, et al.
Published: (2025)
by: Srivastava, Divyansh, et al.
Published: (2025)
SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation
by: Tu, Ruisen, et al.
Published: (2026)
by: Tu, Ruisen, et al.
Published: (2026)
Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation
by: Ma, Ao, et al.
Published: (2025)
by: Ma, Ao, et al.
Published: (2025)
CoLay: Controllable Layout Generation through Multi-conditional Latent Diffusion
by: Cheng, Chin-Yi, et al.
Published: (2024)
by: Cheng, Chin-Yi, et al.
Published: (2024)
UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
by: Liu, Zeyang, et al.
Published: (2025)
by: Liu, Zeyang, et al.
Published: (2025)
MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models
by: Jang, Han, et al.
Published: (2026)
by: Jang, Han, et al.
Published: (2026)
LayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer
by: Yu, Ning, et al.
Published: (2022)
by: Yu, Ning, et al.
Published: (2022)
PhysEditBench: A Protocol-Conditioned Benchmark for Dense Physical-Map Prediction with Image Editors
by: Yang, Jiaxin, et al.
Published: (2026)
by: Yang, Jiaxin, et al.
Published: (2026)
LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation
by: Li, Sha, et al.
Published: (2025)
by: Li, Sha, et al.
Published: (2025)
RanLayNet: A Dataset for Document Layout Detection used for Domain Adaptation and Generalization
by: Anand, Avinash, et al.
Published: (2024)
by: Anand, Avinash, et al.
Published: (2024)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
by: Cho, Jaemin, et al.
Published: (2023)
by: Cho, Jaemin, et al.
Published: (2023)
GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
by: Li, Hongxiang, et al.
Published: (2025)
by: Li, Hongxiang, et al.
Published: (2025)
Restoration by Generation with Constrained Priors
by: Ding, Zheng, et al.
Published: (2023)
by: Ding, Zheng, et al.
Published: (2023)
Salient Concept-Aware Generative Data Augmentation
by: Zhao, Tianchen, et al.
Published: (2025)
by: Zhao, Tianchen, et al.
Published: (2025)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
by: Wang, Xinran, et al.
Published: (2026)
by: Wang, Xinran, et al.
Published: (2026)
Habibi: Laying the Open-Source Foundation of Unified-Dialectal Arabic Speech Synthesis
by: Chen, Yushen, et al.
Published: (2026)
by: Chen, Yushen, et al.
Published: (2026)
7Bench: a Comprehensive Benchmark for Layout-guided Text-to-image Models
by: Izzo, Elena, et al.
Published: (2025)
by: Izzo, Elena, et al.
Published: (2025)
MRG-Bench: Evaluating and Exploring the Requirements of Context for Repository-Level Code Generation
by: Li, Haiyang
Published: (2025)
by: Li, Haiyang
Published: (2025)
Evaluating, Understanding, and Improving Constrained Text Generation for Large Language Models
by: Chen, Xiang, et al.
Published: (2023)
by: Chen, Xiang, et al.
Published: (2023)
SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval
by: Li, Ningyuan, et al.
Published: (2026)
by: Li, Ningyuan, et al.
Published: (2026)
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
by: Zhang, Tao, et al.
Published: (2025)
by: Zhang, Tao, et al.
Published: (2025)
WikiTableEdit: A Benchmark for Table Editing by Natural Language Instruction
by: Li, Zheng, et al.
Published: (2024)
by: Li, Zheng, et al.
Published: (2024)
MALeR: Improving Compositional Fidelity in Layout-Guided Generation
by: Saxena, Shivank, et al.
Published: (2025)
by: Saxena, Shivank, et al.
Published: (2025)
LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation
by: Zheng, Guangcong, et al.
Published: (2023)
by: Zheng, Guangcong, et al.
Published: (2023)
Similar Items
-
Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
by: Srivastava, Divyansh, et al.
Published: (2025) -
CyCLeGen: Cycle-Consistent Layout Prediction and Image Generation in Vision Foundation Models
by: Shan, Xiaojun, et al.
Published: (2026) -
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
by: Chen, Zeyuan, et al.
Published: (2025) -
YOLO-Count: Differentiable Object Counting for Text-to-Image Generation
by: Zeng, Guanning, et al.
Published: (2025) -
VideoNSA: Native Sparse Attention Scales Video Understanding
by: Song, Enxin, et al.
Published: (2025)