Salvato in:
| Autori principali: | Li, Sha, Petrangeli, Stefano, Shen, Yu, Chen, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.13912 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation
di: Li, Sha, et al.
Pubblicazione: (2025)
di: Li, Sha, et al.
Pubblicazione: (2025)
Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models
di: Raji, Fadlullah, et al.
Pubblicazione: (2026)
di: Raji, Fadlullah, et al.
Pubblicazione: (2026)
From Words to Worlds: Transforming One-line Prompt into Immersive Multi-modal Digital Stories with Communicative LLM Agent
di: Sohn, Samuel S., et al.
Pubblicazione: (2024)
di: Sohn, Samuel S., et al.
Pubblicazione: (2024)
3D-PreMise: Can Large Language Models Generate 3D Shapes with Sharp Features and Parametric Control?
di: Yuan, Zeqing, et al.
Pubblicazione: (2024)
di: Yuan, Zeqing, et al.
Pubblicazione: (2024)
Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation
di: He, Lanshan, et al.
Pubblicazione: (2026)
di: He, Lanshan, et al.
Pubblicazione: (2026)
Narrative-to-Scene Generation: An LLM-Driven Pipeline for 2D Game Environments
di: Chen, Yi-Chun, et al.
Pubblicazione: (2025)
di: Chen, Yi-Chun, et al.
Pubblicazione: (2025)
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
di: Veysi, Marjan, et al.
Pubblicazione: (2026)
di: Veysi, Marjan, et al.
Pubblicazione: (2026)
Harnessing Adaptive Topology Representations for Zero-Shot Graph Question Answering
di: Wei, Yanbin, et al.
Pubblicazione: (2025)
di: Wei, Yanbin, et al.
Pubblicazione: (2025)
SuperPADL: Scaling Language-Directed Physics-Based Control with Progressive Supervised Distillation
di: Juravsky, Jordan, et al.
Pubblicazione: (2024)
di: Juravsky, Jordan, et al.
Pubblicazione: (2024)
DecoMind: A Generative AI System for Personalized Interior Design Layouts
di: Alshehri, Reema, et al.
Pubblicazione: (2025)
di: Alshehri, Reema, et al.
Pubblicazione: (2025)
PixelMan: Consistent Object Editing with Diffusion Models via Pixel Manipulation and Generation
di: Jiang, Liyao, et al.
Pubblicazione: (2024)
di: Jiang, Liyao, et al.
Pubblicazione: (2024)
Towards Understanding Graphical Perception in Large Multimodal Models
di: Zhang, Kai, et al.
Pubblicazione: (2025)
di: Zhang, Kai, et al.
Pubblicazione: (2025)
Layout-Corrector: Alleviating Layout Sticking Phenomenon in Discrete Diffusion Model
di: Iwai, Shoma, et al.
Pubblicazione: (2024)
di: Iwai, Shoma, et al.
Pubblicazione: (2024)
Grounding Language in Multi-Perspective Referential Communication
di: Tang, Zineng, et al.
Pubblicazione: (2024)
di: Tang, Zineng, et al.
Pubblicazione: (2024)
Modern Information Technologies in Scientific Research and Educational Activities
di: Malakhov, Kyrylo, et al.
Pubblicazione: (2024)
di: Malakhov, Kyrylo, et al.
Pubblicazione: (2024)
DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs
di: Wei, Yanbin, et al.
Pubblicazione: (2026)
di: Wei, Yanbin, et al.
Pubblicazione: (2026)
A Platform for Interactive AI Character Experiences
di: Wampfler, Rafael, et al.
Pubblicazione: (2026)
di: Wampfler, Rafael, et al.
Pubblicazione: (2026)
StyleMotif: Multi-Modal Motion Stylization using Style-Content Cross Fusion
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
di: Song, Lin, et al.
Pubblicazione: (2026)
di: Song, Lin, et al.
Pubblicazione: (2026)
Co-Layout: LLM-driven Co-optimization for Interior Layout
di: Xiang, Chucheng, et al.
Pubblicazione: (2025)
di: Xiang, Chucheng, et al.
Pubblicazione: (2025)
A Solver-Aided Hierarchical Language for LLM-Driven CAD Design
di: Jones, Benjamin T., et al.
Pubblicazione: (2025)
di: Jones, Benjamin T., et al.
Pubblicazione: (2025)
VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
di: Kelly, Chris, et al.
Pubblicazione: (2024)
di: Kelly, Chris, et al.
Pubblicazione: (2024)
Multi-LoRA Composition for Image Generation
di: Zhong, Ming, et al.
Pubblicazione: (2024)
di: Zhong, Ming, et al.
Pubblicazione: (2024)
Image Generation Models: A Technical History
di: Shirvani, Rouzbeh
Pubblicazione: (2026)
di: Shirvani, Rouzbeh
Pubblicazione: (2026)
Agentic Design of Compositional Machines
di: Zhang, Wenqian, et al.
Pubblicazione: (2025)
di: Zhang, Wenqian, et al.
Pubblicazione: (2025)
LAYOUTDREAMER: Physics-guided Layout for Text-to-3D Compositional Scene Generation
di: Zhou, Yang, et al.
Pubblicazione: (2025)
di: Zhou, Yang, et al.
Pubblicazione: (2025)
DreamCraft: Text-Guided Generation of Functional 3D Environments in Minecraft
di: Earle, Sam, et al.
Pubblicazione: (2024)
di: Earle, Sam, et al.
Pubblicazione: (2024)
MAPWise: Evaluating Vision-Language Models for Advanced Map Queries
di: Mukhopadhyay, Srija, et al.
Pubblicazione: (2024)
di: Mukhopadhyay, Srija, et al.
Pubblicazione: (2024)
PediatricsMQA: a Multi-modal Pediatrics Question Answering Benchmark
di: Bahaj, Adil, et al.
Pubblicazione: (2025)
di: Bahaj, Adil, et al.
Pubblicazione: (2025)
CAD-GPT: Synthesising CAD Construction Sequence with Spatial Reasoning-Enhanced Multimodal LLMs
di: Wang, Siyu, et al.
Pubblicazione: (2024)
di: Wang, Siyu, et al.
Pubblicazione: (2024)
Text-guided Controllable Mesh Refinement for Interactive 3D Modeling
di: Chen, Yun-Chun, et al.
Pubblicazione: (2024)
di: Chen, Yun-Chun, et al.
Pubblicazione: (2024)
Causal Reasoning Elicits Controllable 3D Scene Generation
di: Chen, Shen, et al.
Pubblicazione: (2025)
di: Chen, Shen, et al.
Pubblicazione: (2025)
Stylus: Automatic Adapter Selection for Diffusion Models
di: Luo, Michael, et al.
Pubblicazione: (2024)
di: Luo, Michael, et al.
Pubblicazione: (2024)
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
di: S, Sridhar, et al.
Pubblicazione: (2025)
di: S, Sridhar, et al.
Pubblicazione: (2025)
NeuSDFusion: A Spatial-Aware Generative Model for 3D Shape Completion, Reconstruction, and Generation
di: Cui, Ruikai, et al.
Pubblicazione: (2024)
di: Cui, Ruikai, et al.
Pubblicazione: (2024)
Gesture2Text: A Generalizable Decoder for Word-Gesture Keyboards in XR Through Trajectory Coarse Discretization and Pre-training
di: Shen, Junxiao, et al.
Pubblicazione: (2024)
di: Shen, Junxiao, et al.
Pubblicazione: (2024)
Generating Traffic Scenarios via In-Context Learning to Learn Better Motion Planner
di: Aiersilan, Aizierjiang
Pubblicazione: (2024)
di: Aiersilan, Aizierjiang
Pubblicazione: (2024)
Empowering Children to Create AI-Enabled Augmented Reality Experiences
di: Zhang, Lei, et al.
Pubblicazione: (2025)
di: Zhang, Lei, et al.
Pubblicazione: (2025)
LLM Gesticulator: Leveraging Large Language Models for Scalable and Controllable Co-Speech Gesture Synthesis
di: Pang, Haozhou, et al.
Pubblicazione: (2024)
di: Pang, Haozhou, et al.
Pubblicazione: (2024)
SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models
di: Ray, Arijit, et al.
Pubblicazione: (2024)
di: Ray, Arijit, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation
di: Li, Sha, et al.
Pubblicazione: (2025) -
Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models
di: Raji, Fadlullah, et al.
Pubblicazione: (2026) -
From Words to Worlds: Transforming One-line Prompt into Immersive Multi-modal Digital Stories with Communicative LLM Agent
di: Sohn, Samuel S., et al.
Pubblicazione: (2024) -
3D-PreMise: Can Large Language Models Generate 3D Shapes with Sharp Features and Parametric Control?
di: Yuan, Zeqing, et al.
Pubblicazione: (2024) -
Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation
di: He, Lanshan, et al.
Pubblicazione: (2026)