From Pixels to Policies: Reinforcing Spatial Reasoning in Language Models for Content-Aware Layout Design
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Sha, Petrangeli, Stefano, Shen, Yu, Chen, Xiang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation
par: Li, Sha, et autres
Publié: (2025)
par: Li, Sha, et autres
Publié: (2025)
Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models
par: Raji, Fadlullah, et autres
Publié: (2026)
par: Raji, Fadlullah, et autres
Publié: (2026)
From Words to Worlds: Transforming One-line Prompt into Immersive Multi-modal Digital Stories with Communicative LLM Agent
par: Sohn, Samuel S., et autres
Publié: (2024)
par: Sohn, Samuel S., et autres
Publié: (2024)
3D-PreMise: Can Large Language Models Generate 3D Shapes with Sharp Features and Parametric Control?
par: Yuan, Zeqing, et autres
Publié: (2024)
par: Yuan, Zeqing, et autres
Publié: (2024)
Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation
par: He, Lanshan, et autres
Publié: (2026)
par: He, Lanshan, et autres
Publié: (2026)
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
par: Veysi, Marjan, et autres
Publié: (2026)
par: Veysi, Marjan, et autres
Publié: (2026)
Narrative-to-Scene Generation: An LLM-Driven Pipeline for 2D Game Environments
par: Chen, Yi-Chun, et autres
Publié: (2025)
par: Chen, Yi-Chun, et autres
Publié: (2025)
DecoMind: A Generative AI System for Personalized Interior Design Layouts
par: Alshehri, Reema, et autres
Publié: (2025)
par: Alshehri, Reema, et autres
Publié: (2025)
Harnessing Adaptive Topology Representations for Zero-Shot Graph Question Answering
par: Wei, Yanbin, et autres
Publié: (2025)
par: Wei, Yanbin, et autres
Publié: (2025)
SuperPADL: Scaling Language-Directed Physics-Based Control with Progressive Supervised Distillation
par: Juravsky, Jordan, et autres
Publié: (2024)
par: Juravsky, Jordan, et autres
Publié: (2024)
PixelMan: Consistent Object Editing with Diffusion Models via Pixel Manipulation and Generation
par: Jiang, Liyao, et autres
Publié: (2024)
par: Jiang, Liyao, et autres
Publié: (2024)
Towards Understanding Graphical Perception in Large Multimodal Models
par: Zhang, Kai, et autres
Publié: (2025)
par: Zhang, Kai, et autres
Publié: (2025)
Modern Information Technologies in Scientific Research and Educational Activities
par: Malakhov, Kyrylo, et autres
Publié: (2024)
par: Malakhov, Kyrylo, et autres
Publié: (2024)
Layout-Corrector: Alleviating Layout Sticking Phenomenon in Discrete Diffusion Model
par: Iwai, Shoma, et autres
Publié: (2024)
par: Iwai, Shoma, et autres
Publié: (2024)
Grounding Language in Multi-Perspective Referential Communication
par: Tang, Zineng, et autres
Publié: (2024)
par: Tang, Zineng, et autres
Publié: (2024)
A Platform for Interactive AI Character Experiences
par: Wampfler, Rafael, et autres
Publié: (2026)
par: Wampfler, Rafael, et autres
Publié: (2026)
Co-Layout: LLM-driven Co-optimization for Interior Layout
par: Xiang, Chucheng, et autres
Publié: (2025)
par: Xiang, Chucheng, et autres
Publié: (2025)
DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs
par: Wei, Yanbin, et autres
Publié: (2026)
par: Wei, Yanbin, et autres
Publié: (2026)
LAYOUTDREAMER: Physics-guided Layout for Text-to-3D Compositional Scene Generation
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
StyleMotif: Multi-Modal Motion Stylization using Style-Content Cross Fusion
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
Causal Reasoning Elicits Controllable 3D Scene Generation
par: Chen, Shen, et autres
Publié: (2025)
par: Chen, Shen, et autres
Publié: (2025)
JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
par: Song, Lin, et autres
Publié: (2026)
par: Song, Lin, et autres
Publié: (2026)
Image Generation Models: A Technical History
par: Shirvani, Rouzbeh
Publié: (2026)
par: Shirvani, Rouzbeh
Publié: (2026)
DreamCraft: Text-Guided Generation of Functional 3D Environments in Minecraft
par: Earle, Sam, et autres
Publié: (2024)
par: Earle, Sam, et autres
Publié: (2024)
VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
par: Kelly, Chris, et autres
Publié: (2024)
par: Kelly, Chris, et autres
Publié: (2024)
A Solver-Aided Hierarchical Language for LLM-Driven CAD Design
par: Jones, Benjamin T., et autres
Publié: (2025)
par: Jones, Benjamin T., et autres
Publié: (2025)
CAD-GPT: Synthesising CAD Construction Sequence with Spatial Reasoning-Enhanced Multimodal LLMs
par: Wang, Siyu, et autres
Publié: (2024)
par: Wang, Siyu, et autres
Publié: (2024)
PediatricsMQA: a Multi-modal Pediatrics Question Answering Benchmark
par: Bahaj, Adil, et autres
Publié: (2025)
par: Bahaj, Adil, et autres
Publié: (2025)
Agentic Design of Compositional Machines
par: Zhang, Wenqian, et autres
Publié: (2025)
par: Zhang, Wenqian, et autres
Publié: (2025)
Multi-LoRA Composition for Image Generation
par: Zhong, Ming, et autres
Publié: (2024)
par: Zhong, Ming, et autres
Publié: (2024)
MAPWise: Evaluating Vision-Language Models for Advanced Map Queries
par: Mukhopadhyay, Srija, et autres
Publié: (2024)
par: Mukhopadhyay, Srija, et autres
Publié: (2024)
CADgpt: Harnessing Natural Language Processing for 3D Modelling to Enhance Computer-Aided Design Workflows
par: Kapsalis, Timo
Publié: (2024)
par: Kapsalis, Timo
Publié: (2024)
NeuSDFusion: A Spatial-Aware Generative Model for 3D Shape Completion, Reconstruction, and Generation
par: Cui, Ruikai, et autres
Publié: (2024)
par: Cui, Ruikai, et autres
Publié: (2024)
Text-guided Controllable Mesh Refinement for Interactive 3D Modeling
par: Chen, Yun-Chun, et autres
Publié: (2024)
par: Chen, Yun-Chun, et autres
Publié: (2024)
SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models
par: Ray, Arijit, et autres
Publié: (2024)
par: Ray, Arijit, et autres
Publié: (2024)
SpringTime: Learning Simulatable Models of Cloth with Spatially-varying Constitutive Properties
par: Chen, Guanxiong, et autres
Publié: (2025)
par: Chen, Guanxiong, et autres
Publié: (2025)
Generating Traffic Scenarios via In-Context Learning to Learn Better Motion Planner
par: Aiersilan, Aizierjiang
Publié: (2024)
par: Aiersilan, Aizierjiang
Publié: (2024)
Empowering Children to Create AI-Enabled Augmented Reality Experiences
par: Zhang, Lei, et autres
Publié: (2025)
par: Zhang, Lei, et autres
Publié: (2025)
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
par: S, Sridhar, et autres
Publié: (2025)
par: S, Sridhar, et autres
Publié: (2025)
Stylus: Automatic Adapter Selection for Diffusion Models
par: Luo, Michael, et autres
Publié: (2024)
par: Luo, Michael, et autres
Publié: (2024)
Documents similaires
-
LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation
par: Li, Sha, et autres
Publié: (2025) -
Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models
par: Raji, Fadlullah, et autres
Publié: (2026) -
From Words to Worlds: Transforming One-line Prompt into Immersive Multi-modal Digital Stories with Communicative LLM Agent
par: Sohn, Samuel S., et autres
Publié: (2024) -
3D-PreMise: Can Large Language Models Generate 3D Shapes with Sharp Features and Parametric Control?
par: Yuan, Zeqing, et autres
Publié: (2024) -
Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation
par: He, Lanshan, et autres
Publié: (2026)